
دراسة: 178 من أصل 8,000 موقعًا تمنع زواحف بحث AI رغم السماح بها في robots.txt
اختبار من جهة الخادم على 8,000 موقع متوسطة الترتيب وجد 178 موقعًا تسمح لزاحفَي بحث ChatGPT وPerplexity في robots.txt لكنها ترفض طلباتهما فعليًا، وثلاثة مواقع فقط تذكر اسم الزاحف المحظور في الملف.
أجرى مطوّر يعمل على أدوات الظهور في AI اختبارًا من جهة الخادم على 8,000 موقع متوسط الترتيب، فوجد 178 موقعًا تسمح لزواحف بحث AI في ملف robots.txt لكنها ترفض طلباتها رغم ذلك. نُشر التقرير على dev.to في 26 سبتمبر.
ما الذي اختُبر
اختيرت العينة عشوائيًا من ترتيب Tranco بين المرتبتين 20,000 و500,000، وفق قائمة السادس من سبتمبر. نُفّذت جميع الطلبات في 26 سبتمبر. في البداية حُمّلت الصفحة الرئيسية وملف /robots.txt لكل موقع بمعرّف مستخدم Chrome. ثم طُلبت الصفحة الرئيسية مرة أخرى من المواقع التي استجابت لـ Chrome وسمحت في robots.txt بزاحف OAI-SearchBot أو PerplexityBot (غياب الملف يُعدّ سماحًا)، وهذه المرة بسلاسل user-agent الكاملة للزواحف، مع GPTBot وClaudeBot أيضًا.
المواقع التي رفضت زاحفًا مسموحًا بالرمز 401 أو 403 أو 429 أو 503 انتقلت إلى جولة ثالثة: Chrome مجددًا، والزاحف نفسه، وزاحف وهمي باسم ControlBot، وطلبات تنتحل صفة Googlebot وBingbot. ولم يدخل الموقع العدّ النهائي إلا إذا استُجيب لـ Chrome، ورُفض الزاحف مرتين، ولم يُرفض ControlBot، واستُجيب لطلبي Googlebot وBingbot.
النتائج
من بين 8,000 موقع، قدّم 5,548 الصفحة الرئيسية لـ Chrome، وسمح 5,274 منها بزاحف OAI-SearchBot أو PerplexityBot في robots.txt. ورفض 312 موقعًا أحد الزاحفين في المحاولتين؛ ومن هؤلاء رفض 33 موقعًا ControlBot أيضًا، وأعطى 101 موقع رفضًا أو إجابة غريبة لطلب Googlebot أو Bingbot. وهكذا بقي 178 موقعًا رفضت زاحف البحث فقط، أي 3.4% من 5,274.
من بين المواقع الـ178، يحجب 116 زاحف OAI-SearchBot، و132 يحجب PerplexityBot، و70 يحجب الاثنين. ومن أصل 248 رفضًا كانت 237 بالرمز HTTP 403 و11 بالرمز 429. والنسبة ثابتة عبر نطاق الترتيب: 3.3% في نطاق 20,000-100,000، و3.3% في نطاق 100,000-250,000، و3.5% في نطاق 250,000-500,000. ويعمل 85 موقعًا خلف Cloudflare، و92 موقعًا خلف خوادم أخرى، وموقع واحد خلف Vercel. كما رفض 141 منها GPTBot وClaudeBot معًا في الجولة الأولى.
لماذا يهم ذلك
بالنسبة لأي فحص يقرأ robots.txt وحده، تبدو المواقع الـ178 كلها مفتوحة، وثلاثة مواقع فقط لديها مجموعة في robots.txt تذكر اسم الزاحف الذي ترفضه. ولأن معظمها يحجب زواحف تدريب AI أيضًا، يبدو القرار متخذًا على مستوى الخادم لا في الملف.
يعدد الكاتب القيود: جاءت كل الطلبات من عنوان IP واحد وفي يوم واحد وللصفحة الرئيسية فقط، لذا لا تظهر بهذه الطريقة قاعدة تتحقق من نطاق الشبكة الحقيقي للزاحف، وربما يستجيب بعض المواقع الـ178 للزاحف الحقيقي بشكل طبيعي. ووجد اختبار سابق على أكثر 5,000 موقع أن 56 من 2,429، أي 2.3%، تسلك السلوك نفسه.
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.