זחלני AI באתר שלכם: מי לוקח, מי מחזיר, ומה עושים עם זה
בקצרה: בוטים כבר מייצרים יותר תעבורת HTML מבני אדם, וזחלני AI כמו GPTBot ו-ClaudeBot לוקחים הרבה ומחזירים מעט. במאמר: הנתונים של Cloudflare ושלוש אסטרטגיות אפשריות: חסימה סלקטיבית, שמירה על נראוּת (GEO), או תמחור.
במאמר "בוטים טובים, בוטים רעים" סקרנו את עולם הבוטים הקלאסי. מאז נכנס לזירה שחקן חדש לגמרי: אם תפתחו היום את הלוגים של האתר שלכם, תמצאו שם את GPTBot של OpenAI, את ClaudeBot של Anthropic, את Meta-ExternalAgent, את Bytespider של ByteDance ועוד. לפי נתונים שפרסם מנכ"ל Cloudflare ביוני 2026, בוטים מייצרים כיום 57.5% מתעבורת ה-HTML ברשת שלה, לראשונה בהיסטוריה יותר מבני אדם. חלק גדל והולך מהתעבורה הזו מגיע מזחלני AI, והם לא מתנהגים כמו הבוטים שהכרנו.
הבעיה: הם לוקחים הרבה ומחזירים מעט
Cloudflare מפרסמת מדד בשם Crawl-to-Refer Ratio: כמה עמודים הבוט זוחל על כל גולש אנושי אחד שהפלטפורמה שלו מפנה בחזרה לאתר. הנתונים מדברים בעד עצמם. לפי ניתוח נתוני Cloudflare Radar לרבעון הראשון של 2026:
| פלטפורמה / בוט | יחס זחילה להפניה (בקירוב) | מטרה עיקרית |
|---|---|---|
| Anthropic (ClaudeBot) | עשרות אלפי עמודים על כל הפניה אחת (כ-20,000 עד 24,000:1) | אימון מודלים |
| OpenAI (GPTBot) | כ-1,200 עד 1,300:1 | אימון וחיפוש |
| Perplexity | עשרות עד מאות:1 | חיפוש AI |
| Google (חיפוש קלאסי) | יחס חד ספרתי:1 | אינדוקס שמייצר הפניות |
לפי הניתוח של Cloudflare, כ-80% מכלל זחילת ה-AI בשנה האחרונה נועדה לאימון מודלים, קטגוריה שאין לה שום מנגנון מובנה שמחזיר לכם גולשים. רק בין 2% ל-3% מהזחילה היא "פעולת משתמש" אמיתית (מישהו שאל שאלה והבוט הלך לבדוק), אבל דווקא הקטגוריה הזו צומחת הכי מהר.
אז מה עושים? שלוש אסטרטגיות
1. חסימה סלקטיבית (המומלץ לרוב האתרים): לא כל הבוטים שווים. אפשר לחסום בוטי אימון טהורים (ClaudeBot, GPTBot, CCBot, Meta-ExternalAgent) ולהשאיר פתוחים בוטי חיפוש והפניה כמו OAI-SearchBot ו-ChatGPT-User, כי הם דווקא מחזירים תנועה. שימו לב שגם ל-Anthropic יש כיום בוט חיפוש נפרד (Claude-SearchBot). את החסימה הבסיסית עושים בקובץ robots.txt, אבל בוטים שמתעלמים ממנו נחסמים באמת רק ברמת ה-WAF.
2. להישאר גלויים (GEO): יש היגיון עסקי גם בכיוון ההפוך: מי שנחסם לגמרי לא יופיע בתשובות של ChatGPT או Claude כשלקוח פוטנציאלי שואל "מי מומלץ בתחום X בישראל". התחום החדש הזה נקרא Generative Engine Optimization, וכלי שכדאי להכיר במסגרתו הוא קובץ llms.txt: סטנדרט מתהווה שמצביע למנועי AI על התוכן הסמכותי באתר, במקביל לקובץ robots.txt שקובע לאן מותר להם להיכנס.
3. חסימה כברירת מחדל ותמחור: מאז ש-Cloudflare הפכה את חסימת זחלני ה-AI לברירת מחדל לדומיינים חדשים (יולי 2025), הלקוחות שלה חסמו מאות מיליארדי בקשות גירוד, ולמעלה משני מיליון אתרים אסרו לחלוטין על שימוש בתוכן שלהם לאימון AI. במקביל מתפתחים בשוק מנגנוני תשלום לפי זחילה (Pay per Crawl).
ואל תשכחו את העלות השקטה: זחילת AI אגרסיבית היא גם עומס אמיתי על השרת CPU, תעבורה ו‑IO שאתם משלמים עליהם. באתרים עם הרבה תוכן ראינו בתעשייה מקרים שבהם בוטי AI מייצרים יותר בקשות מכל הגולשים האנושיים יחד. ניטור התעבורה וחוקי WAF מותאמים כמו אלה שאנחנו מנהלים בשירותי Cloudflare CDN·WAF של SPD הם כבר לא מותרות.
שורה תחתונה: אין תשובה אחת נכונה יש החלטה עסקית. אתר תוכן שחי מפרסום ירצה לחסום אימון ולאפשר חיפוש; עסק שרוצה להופיע בתשובות של מנועי AI אולי יעדיף להישאר פתוח. מה שלא לגיטימי זה לא להחליט בכלל ולתת לברירת המחדל להחליט בשבילכם.
קריאה נוספת בבלוג SPD: בוטים טובים – בוטים רעים · חומת אש (WAF) – הגנה מתקדמת לאתר · שימוש ב‑CDN – טעינה מהירה מכל מקום
רוצים שנעבור על זה יחד? צוותי SPD זמינים 24/7 ניטור, הגנה ותמיכה על תשתית ישראלית. דברו איתנו: 03‑6221258 · spd.co.il/contact
מקורות: Cloudflare The crawl-to-click gap · Cloudflare Radar Crawl-to-Refer Ratio · ניתוח robots.txt על נתוני Cloudflare, Q1 2026


