
מחקר: 178 מתוך 8,000 אתרים חוסמים סורקי חיפוש AI ש-robots.txt מתיר להם
בדיקה בצד השרת של 8,000 אתרים בדירוג בינוני מצאה 178 אתרים שמתירים ל-OAI-SearchBot ול-PerplexityBot ב-robots.txt, אך דוחים את בקשותיהם בפועל. רק 3 מהם מציינים בשם את הסורק שהם חוסמים.
מפתח שעוסק בכלי נראות ב-AI בדק את הצד השרתי של סוגיית סורקי ה-AI ב-8,000 אתרים בדירוג בינוני ומצא 178 אתרים שמתירים סורקי חיפוש של AI ב-robots.txt ובכל זאת דוחים את בקשותיהם. הדוח פורסם ב-dev.to ב-26 בספטמבר.
מה נבדק
המדגם נלקח באקראי מדירוגי Tranco בין 20,000 ל-500,000, לפי הרשימה מ-6 בספטמבר. כל הבקשות נשלחו ב-26 בספטמבר. תחילה נטענו דף הבית ו-/robots.txt של כל אתר עם user agent של Chrome. אחר כך אתרים שהגישו את הדף ל-Chrome והתירו OAI-SearchBot או PerplexityBot ב-robots.txt (קובץ חסר נחשב להתרה) התבקשו שוב, עם מחרוזות ה-user agent המלאות של הסורקים, וגם עם GPTBot ו-ClaudeBot.
אתרים שדחו סורק מותר בקוד 401, 403, 429 או 503 עברו סבב שלישי: שוב Chrome, שוב אותו סורק, סורק מומצא בשם ControlBot, ובקשות שהציגו את עצמן כ-Googlebot וכ-Bingbot. אתר נכלל בספירה הסופית רק אם Chrome קיבל תשובה, הסורק נדחה פעמיים, ControlBot לא נדחה, וגם הבקשות בשם Googlebot ו-Bingbot נענו.
מה התוצאות
מתוך 8,000 האתרים, 5,548 הגישו את דף הבית ל-Chrome, ומתוכם 5,274 התירו OAI-SearchBot או PerplexityBot ב-robots.txt. 312 דחו אחד משני הסורקים בשתי הפעמים; 33 מהם דחו גם את ControlBot, ו-101 השיבו בסירוב או בתשובה מוזרה לבקשה בשם Googlebot או Bingbot. נותרו 178 אתרים שדחו רק את סורק החיפוש של AI, כלומר 3.4% מתוך 5,274.
מבין 178 האתרים, 116 חוסמים את OAI-SearchBot, 132 חוסמים את PerplexityBot ו-70 חוסמים את שניהם. מתוך 248 דחיות, 237 היו HTTP 403 ו-11 היו 429. השיעור יציב לאורך הדירוג: 3.3% בדירוג 20,000-100,000, 3.3% ב-100,000-250,000 ו-3.5% ב-250,000-500,000. 85 אתרים יושבים מאחורי Cloudflare, 92 מאחורי שרתים אחרים ואחד מאחורי Vercel. 141 דחו גם את GPTBot וגם את ClaudeBot כבר בסבב הראשון.
למה זה חשוב
בבדיקה שקוראת רק את robots.txt כל 178 האתרים נראים פתוחים, ורק ל-3 יש קבוצה ב-robots.txt שמציינת בשם את הסורק שהם חוסמים. מכיוון שרובם חוסמים גם את סורקי האימון של AI, נראה שההחלטה מתקבלת בצד השרת ולא בקובץ.
המחבר מפרט את המגבלות: כל הבקשות הגיעו מכתובת IP אחת ביום אחד, ורק לדף הבית, ולכן כלל שבודק את טווח הרשת האמיתי של הסורק לא יתגלה כך, וייתכן שחלק מ-178 האתרים משרתים את הסורק האמיתי כרגיל. בדיקה קודמת על 5,000 האתרים המובילים מצאה 56 מתוך 2,429, כלומר 2.3%, שהתנהגו אותו דבר.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.