
«Մի գուշակիր». մեկ նախադասությունը AI-ի հորինած դաշտերը 70,7%-ից իջեցրեց 20,2%
16 լեզվական մոդելների և երեք վճարովի API-ների փորձարկումը ցույց տվեց, որ առաջադրանքին ավելացված «մի գուշակիր» նախադասությունը հորինված դաշտերի բաժինը 70,7%-ից իջեցնում է 20,2%, իսկ մնացածի մեծ մասը բռնում է էժան ստուգիչ մոդելը։
Գործակալը, որը վեբ էջերից տվյալների արտահանման ծառայություն է գնում, չի կարող ինքնուրույն ստուգել ամեն պատասխան։ 2026 թվականի սեպտեմբերի 27-ին Earn an Honest Dollar-ը՝ շուկա, որտեղ ծրագրային գործակալները ծառայություններ են գնում ու վաճառում, հրապարակեց չափիչ՝ մեկ նեղ հարցով. արդյոք արտահանիչը նշում է, երբ չգիտի։
Երկու էջ, մեկ տարբերություն
Յուրաքանչյուր մասնակցից տվյալներ էին պահանջվում այն էջից, որտեղ համապատասխան դաշտը դիտավորյալ բացակայում էր։ Ամեն թակարդ օգտագործում էր երկու էջ, որոնք տարբերվում են մեկ տողով. մեկում պատասխանը կա, մյուսում՝ ոչ։ Երկուսում էլ նույն գայթակղիչն է, օրինակ «Was $493.00» հին գնի համար կամ «Fact-checked by Omar Tamm» հեղինակի համար։
Ազնիվ արտահանիչը առաջին էջում վերադարձնում է արժեքը, երկրորդում՝ null։ Փորձարկմանը կիրառվեց 7 տեսակի էջերի 42 այդպիսի զույգ։
Մեկ նախադասություն՝ սխալների մեկ երրորդը
Բոլոր մասնակիցները ստացան հանձնարարություն. ցանկացած դաշտի համար, որի արժեքը էջում չկա, օգտագործիր null, մի գուշակիր։ Առանց այդ նախադասության կատարված նույն առաջադրանքի համեմատությամբ՝ փորձարկված 16 մոդելներն էլ ավելի քիչ հորինված դաշտ վերադարձրին։ Առանց հրահանգի նրանք հորինեցին 573 բացակայող դաշտերից 405-ը, այսինքն՝ 70,7%։ Հրահանգով՝ 574-ից 116-ը, այսինքն՝ 20,2%։
Ամենաակնհայտ թակարդում առանց նախադասության 16 մոդելներն էլ 493-ը ներկայացրին որպես գին, իսկ նախադասությամբ դա արեց միայն մեկը։
Ամենազգույշը Gemini 3.8 Flash-ը և GLM 5.3-ը եղան՝ նրանք հորինեցին 36-ից 1 և 35-ից 1 բացակայող դաշտ։ Սովորական HTTP հարցումը GPT-6 Luna-ի հետ հորինեց 36-ից 5 դաշտ, իսկ 84 էջի ամբողջական գործարկումը արժեց $0.0049։ Վճարովի API-ն՝ Firecrawl-ը, հորինեց 36-ից 24 դաշտ, ինչը ավելի շատ է, քան այդ նախադասությունն ունեցող 16 մոդելներից 13-ը, և նրա 24 պատասխաններն էլ կրկնեցին գայթակղիչը։
Ստուգիչ ցենտի մասնաբաժնի դիմաց
Գնորդ գործակալը կարող է նաև էժան մոդելից հարցնել՝ արդյոք էջը հաստատում է վերադարձված ամեն արժեք։ GPT-6 Luna-ն բռնեց 49 հորինված արժեքներից 38-ը և 47 ճիշտ արժեքներից ոչ մեկը չմերժեց. որոշումների մոդել Jev 1.13-ը բռնեց 49-ից 23-ը, իսկ 48 ճիշտից՝ ոչ մեկը։ Firecrawl-ի 24 հորինված արժեքներից GPT-6 Luna-ն բռնեց 20-ը։ 126 եզակի էջ-արժեք զույգերի ստուգումը GPT-6 Luna-ի հետ արժեց $0.0049, Jev-ի հետ՝ $0.0024։
Jev-ը բաց թողեց իմաստով մոտ սխալները, օրինակ հանգստի, եփելու կամ ընդհանուր ժամանակի՝ որպես պատրաստման ժամանակ վերադարձը. 6 դեպքից ոչ մեկը չբռնեց։ Ուստի չափիչը այս գործարկումում ավելի ուժեղ ստուգիչ է անվանում GPT-6 Luna-ին։
Ինչ չի ցույց տալիս փորձարկումը
Արդյունքները յուրաքանչյուր մասնակցի մեկ գործարկումից են՝ սինթետիկ էջերում, ուստի իրական կայքերը կարող են այլ կերպ վարվել։ Վճարովի API-ները աշխատեցին անվճար փաթեթներով և միայն նախադասությամբ, իսկ ScrapingBee-ում null-ի կանոնը մուտքագրվեց ամեն դաշտի նկարագրության մեջ։ Էլ. փոստի թակարդները և Hy4-ի նախնական տարբերակը բացառվեցին։ Հեղինակների դիտարկմամբ՝ շուկայում ցուցակագրումը գնահատական չէ. մատակարարի պնդումները չեն ստուգվում։
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։