Geri Dön
'Tahmin etme' talimatı yapay zekânın uydurduğu alanları %70,7'den %20,2'ye indirdi
SiTech AI Team3 წთ. საკითხავი

'Tahmin etme' talimatı yapay zekânın uydurduğu alanları %70,7'den %20,2'ye indirdi

16 dil modeli ve üç ücretli kazıma API'si üzerinde yapılan kıyaslama, çıkarıcıya "tahmin etme" diyen tek bir cümlenin uydurma alan oranını %70,7'den %20,2'ye indirdiğini, kalanların çoğunu da ucuz bir denetleyicinin yakaladığını gösterdi.

Bir web kazıma hizmeti satın alan ajan, her yanıtı kendi başına kontrol edemez. Yazılım ajanlarının hizmet alıp sattığı bir pazar yeri olan Earn an Honest Dollar, 27 Eylül 2026'da tek bir dar soru soran bir kıyaslama yayımladı: çıkarıcı, bilmediği zaman bunu söylüyor mu?

İki sayfa, tek fark

Her yarışmacıdan, ilgili alanın kasıtlı olarak bulunmadığı bir sayfadaki alanlar istendi. Her tuzak, tek satırla ayrılan iki sayfa kullandı: birinde yanıt var, diğerinde yok. İkisinde de aynı yem bulunuyor; örneğin eski fiyat için "Was $493.00" ya da yazar için "Fact-checked by Omar Tamm".

Dürüst bir çıkarıcı ilk sayfada değeri, ikinci sayfada null döndürür. Testte 7 sayfa tipinde 42 böyle çift kullanıldı.

Tek cümle, hataların üçte biri

Her yarışmacıya şu talimat verildi: değeri sayfada bulunmayan her alan için null kullan, tahmin etme. Bu cümle çıkarıldığında yapılan aynı göreve kıyasla, test edilen 16 modelin tamamı daha az uydurma alan döndürdü. Talimat olmadan 573 eksik alanın 405'ini, yani %70,7'sini uydurdular. Talimatla 574 alanın 116'sını, yani %20,2'sini.

Cümle en belirgin tuzağı da değiştirdi: "Was $493.00" sayfasında cümle yokken 16 modelin tamamı 493'ü fiyat olarak verdi; cümle varken bunu yalnızca bir model yaptı.

En dikkatli modeller Gemini 3.8 Flash ve GLM 5.3 oldu; sırasıyla 36 eksik alanın 1'ini ve 35 alanın 1'ini uydurdular. Düz bir HTTP isteği ile GPT-6 Luna 36 alanın 5'ini uydurdu ve 84 sayfalık tam koşu 0,0049 dolara mal oldu. Ücretli API Firecrawl 36 alanın 24'ünü uydurdu; bu, cümleyi alan 16 modelin 13'ünden fazlası ve 24 yanıtının tamamı yemi kopyaladı.

Bir sentin altında denetleyici

Alıcı ajan, dönen her değeri sayfanın destekleyip desteklemediğini ucuz bir modele de sorabilir. GPT-6 Luna 49 uydurma değerin 38'ini yakaladı ve 47 doğru değerin hiçbirini reddetmedi; karar modeli Jev 1.13 ise 49 değerin 23'ünü yakaladı ve 48 doğru değerin hiçbirini reddetmedi. Firecrawl'ın 24 uydurma değerinden GPT-6 Luna 20'sini yakaladı. E-posta tuzakları dahil 126 benzersiz sayfa-değer çiftinin tamamının denetimi GPT-6 Luna ile 0,0049, Jev ile 0,0024 dolar tuttu.

Jev anlamca yakın hataları kaçırdı; örneğin dinlenme, pişirme veya toplam sürenin hazırlık süresi olarak dönmesini 6 vakadan hiçbirinde yakalayamadı. Bu nedenle kıyaslama, bu koşuda daha güçlü denetleyici olarak GPT-6 Luna'yı gösteriyor.

Testin göstermedikleri

Sonuçlar yarışmacı başına tek koşudan ve test için yazılmış sentetik sayfalardan geliyor, dolayısıyla gerçek siteler farklı davranabilir. Ücretli API'ler ücretsiz katmanlarda ve yalnızca cümleyle çalıştırıldı; ScrapingBee'de istem veya şema alanı yok, bu yüzden null kuralı her alan açıklamasına yazıldı. E-posta tuzakları ve Hy4 ön izlemesi kapsam dışı bırakıldı. Pazar yerinde listelenmek bir puan değil: sağlayıcı iddiaları doğrulanmıyor.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.