Վերադառնալ
Ուսումնասիրություն. 178 կայք արգելափակում է robots.txt-ով թույլատրված AI որոնիչ սկաներներին
SiTech AI Team2 წთ. საკითხავი

Ուսումնասիրություն. 178 կայք արգելափակում է robots.txt-ով թույլատրված AI որոնիչ սկաներներին

8,000 միջին վարկանիշի կայքի սերվերային ստուգումը 178 կայք է գտել, որոնք robots.txt-ում թույլ են տալիս ChatGPT-ի որոնիչ բոտին կամ PerplexityBot-ին, սակայն մերժում են նրանց հարցումները սերվերում։ Դրանցից միայն 3-ն է նշում արգելափակված բոտի անունը ֆայլում։

AI-տեսանելիության գործիքներ մշակող ծրագրավորողը 8,000 միջին վարկանիշի կայքերում փորձարկել է AI սկաներների հարցումները սերվերի կողմից և գտել 178 կայք, որոնք robots.txt-ում թույլ են տալիս AI որոնիչ սկաներներին, բայց հարցումները մերժում են։ Զեկույցը dev.to-ում հրապարակվել է սեպտեմբերի 26-ին։

Ինչ է փորձարկվել

Նմուշը պատահականորեն ընտրվել է Tranco-ի 20,000-ից 500,000 դիրքերի միջակայքից՝ սեպտեմբերի 6-ի ցանկով։ Բոլոր հարցումները կատարվել են սեպտեմբերի 26-ին։ Սկզբում Chrome user agent-ով բեռնվել են յուրաքանչյուր կայքի գլխավոր էջը և /robots.txt-ը։ Այնուհետև այն կայքերից, որոնք պատասխանել են Chrome-ին և robots.txt-ով թույլ են տալիս OAI-SearchBot-ին կամ PerplexityBot-ին (robots.txt-ի բացակայությունը համարվում է թույլտվություն), գլխավոր էջը կրկին պահանջվել է՝ այս անգամ սկաներների ամբողջական user-agent տողերով, ինչպես նաև GPTBot-ով ու ClaudeBot-ով։

Կայքերը, որոնք թույլատրված սկաներին մերժել են 401, 403, 429 կամ 503 կոդով, անցել են երրորդ փուլ. կրկին Chrome, նույն սկաները, հորինված ControlBot, և հարցումներ Googlebot-ի ու Bingbot-ի անունից։ Վերջնական հաշվարկում ընդգրկվել է միայն այն կայքը, որտեղ Chrome-ը սպասարկվել է, որոնիչ սկաները երկու անգամ մերժվել է, ControlBot-ը չի մերժվել, և Googlebot-ի ու Bingbot-ի հարցումներն էլ ընդունվել են։

Արդյունքները

8,000 կայքերից 5,548-ը Chrome-ին տվել են գլխավոր էջը, իսկ դրանցից 5,274-ը robots.txt-ով թույլ են տալիս OAI-SearchBot-ին կամ PerplexityBot-ին։ 312 կայք երկու փորձերում էլ մերժել է այդ սկաներներից մեկին. դրանցից 33-ը մերժել է նաև ControlBot-ին, իսկ 101-ը մերժում կամ տարօրինակ պատասխան է տվել Googlebot-ի կամ Bingbot-ի հարցմանը։ Մնացել է 178 կայք, որոնք մերժում են միայն AI որոնիչ սկաներին՝ 5,274-ի 3,4%-ը։

178 կայքից 116-ը արգելափակում է OAI-SearchBot-ին, 132-ը՝ PerplexityBot-ին, 70-ը՝ երկուսին էլ։ 248 մերժումից 237-ը HTTP 403 էր, 11-ը՝ 429։ Ցուցանիշը դիրքերի ողջ տիրույթում գրեթե չի փոխվում՝ 3,3% 20,000-100,000 միջակայքում, 3,3% 100,000-250,000-ում և 3,5% 250,000-500,000-ում։ 85 կայք գտնվում է Cloudflare-ի հետևում, 92-ը՝ այլ սերվերների, 1-ը՝ Vercel-ի։ 141-ը առաջին իսկ փուլում մերժել է և՛ GPTBot-ին, և՛ ClaudeBot-ին։

Ինչու է սա կարևոր

Միայն robots.txt-ը կարդացող ստուգման համար այս 178 կայքերից բոլորը բաց են երևում, և միայն 3-ն ունի robots.txt-ի խումբ, որտեղ անունով նշված է արգելափակվող սկաները։ Քանի որ նրանց մեծ մասը արգելափակում է նաև AI-ի ուսուցման սկաներներին, թվում է, թե որոշումը կայացվում է սերվերի, ոչ թե ֆայլի մակարդակում։

Հեղինակը նշում է սահմանափակումները. բոլոր հարցումները եկել են մեկ IP հասցեից, մեկ օրում և միայն գլխավոր էջի համար, ուստի սկաների իրական ցանցային տիրույթը ստուգող կանոնը այս մեթոդով չի երևա, և 178 կայքերից մի մասը կարող է իրական սկաներին սովորական սպասարկել։ Ավելի վաղ թեստը՝ թոփ 5,000 կայքերում, հայտնաբերել է 2,429-ից 56-ը (2,3%)՝ նույն վարքագծով։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։