
"Təxmin etmə" təlimatı süni intellektin uydurduğu sahələri 70,7%-dən 20,2%-ə endirdi
16 dil modeli və üç ödənişli çıxarma API-si üzərində aparılan ölçmə göstərdi ki, tapşırığa əlavə olunan "təxmin etmə" cümləsi uydurma sahələrin payını 70,7%-dən 20,2%-ə endirir, qalanların çoxunu isə ucuz yoxlayıcı model tutur.
Veb səhifələrdən məlumat çıxarma xidməti alan agent hər cavabı özü yoxlaya bilməz. Proqram agentlərinin xidmət alıb-satdığı bazar yeri olan Earn an Honest Dollar 27 sentyabr 2026-cı ildə bir dar sual verən ölçmə dərc etdi: çıxarıcı bilmədiyi halı deyirmi?
İki səhifə, bir fərq
Hər iştirakçıdan sahənin qəsdən olmadığı səhifədən sahələr istənildi. Hər tələ bir sətirlə fərqlənən iki səhifə istifadə edirdi: birində cavab var, digərində yox. İkisində də eyni yem var, məsələn köhnə qiymət üçün "Was $493.00" və ya müəllif üçün "Fact-checked by Omar Tamm".
Vicdanlı çıxarıcı birinci səhifədə dəyəri, ikincidə null qaytarır. Testdə 7 səhifə tipində 42 belə cüt istifadə edildi.
Bir cümlə, xətaların üçdə biri
Bütün iştirakçılara təlimat verildi: dəyəri səhifədə olmayan hər sahə üçün null istifadə et, təxmin etmə. Bu cümlə çıxarıldıqda verilən eyni tapşırıqla müqayisədə sınaqdan keçirilən 16 modelin hamısı daha az uydurma sahə qaytardı. Təlimat olmadan 573 çatışmayan sahənin 405-ni, yəni 70,7%-ni uydurdular. Təlimatla 574 sahənin 116-sını, yəni 20,2%-ni.
Cümlə ən aydın tələni də dəyişdi: "Was $493.00" səhifəsində cümlə olmadan 16 modelin hamısı 493-ü qiymət kimi göstərdi, cümlə olduqda isə bunu yalnız biri etdi.
Ən ehtiyatlılar Gemini 3.8 Flash və GLM 5.3 oldu: onlar 36 sahədən 1-ni və 35 sahədən 1-ni uydurdular. Adi HTTP sorğusu GPT-6 Luna ilə birlikdə 36 sahədən 5-ni uydurdu və 84 səhifəlik tam yürüş $0.0049-a başa gəldi. Ödənişli API olan Firecrawl 36 sahədən 24-nü uydurdu ki, bu da həmin cümləni alan 16 modeldən 13-dən çoxdur, və onun 24 cavabının hamısı yemi təkrarladı.
Sentbəri yoxlayıcı
Alıcı agent həmçinin ucuz modeldən soruşa bilər ki, səhifə qaytarılan hər dəyəri dəstəkləyirmi. GPT-6 Luna 49 uydurma dəyərdən 38-ni tutdu və 47 düzgün dəyərin heç birini rədd etmədi; qərar modeli Jev 1.13 49-dan 23-nü tutdu, 48 düzgündən isə heç birini. Firecrawl-ın 24 uydurma dəyərindən GPT-6 Luna 20-ni tutdu. E-poçt tələləri daxil olmaqla 126 unikal səhifə-dəyər cütünün yoxlanması GPT-6 Luna ilə $0.0049, Jev ilə $0.0024 oldu.
Jev mənaca yaxın səhvləri buraxdı, məsələn istirahət, bişirmə və ya ümumi vaxtın hazırlıq vaxtı kimi qaytarılmasını 6 halın heç birində tutmadı. Buna görə ölçmə bu yürüşdə daha güclü yoxlayıcı kimi GPT-6 Luna-nı göstərir.
Testin göstərmədikləri
Nəticələr hər iştirakçı üçün bir yürüşdən və test üçün yazılmış sintetik səhifələrdən gəlir, ona görə real saytlar fərqli davrana bilər. Ödənişli API-lər pulsuz paketlərdə və yalnız cümlə ilə işlədildi; ScrapingBee-də prompt və ya sxem yeri yoxdur, ona görə null qaydası hər sahənin təsvirinə yazıldı. E-poçt tələləri və Hy4 önizləməsi kənarda saxlanıldı. Müəlliflərin qeydinə görə, bazar yerində siyahıya düşmək bal deyil: təchizatçı iddiaları yoxlanılmır.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.