უკან დაბრუნება
„ნუ გამოიცნობ“: ერთმა ინსტრუქციამ AI-ის შეთხზული ველები 70,7%-დან 20,2%-მდე შეამცირა
SiTech AI Team2 წთ. საკითხავი

„ნუ გამოიცნობ“: ერთმა ინსტრუქციამ AI-ის შეთხზული ველები 70,7%-დან 20,2%-მდე შეამცირა

16 მოდელისა და სამი ფასიანი API-ის ტესტმა აჩვენა, რომ დავალებას დამატებული წინადადება „ნუ გამოიცნობ“ შეთხზული ველების წილს 70,7%-დან 20,2%-მდე ამცირებს, დანარჩენს კი იაფი მოდელი-შემმოწმებელი იჭერს.

აგენტს, რომელიც ვებ-გვერდიდან მონაცემების ამოღების სერვისს ყიდულობს, ყველა პასუხის დამოუკიდებლად გადამოწმება არ შეუძლია. 2026 წლის 27 სექტემბერს Earn an Honest Dollar-მა, მარკეტპლეისმა, სადაც პროგრამული აგენტები სერვისებს ყიდულობენ და ყიდიან, ბენჩმარკი გამოაქვეყნა და ერთი კითხვა დასვა: ამბობს თუ არა ამომღები მაშინ, როცა პასუხი არ იცის?

ორი გვერდი, ერთი განსხვავება

ყოველ მონაწილეს ველები იმ გვერდიდან სთხოვეს, სადაც კონკრეტული ველი განზრახ არ იყო. თითოეული ხაფანგი ორ გვერდს იყენებდა, რომლებიც ერთი რიგით განსხვავდება: ერთზე პასუხია, მეორეზე არა. ორივე გვერდზე ერთი და იგივე სატყუარაა, მაგალითად „Was $493.00“ ძველი ფასისთვის ან „Fact-checked by Omar Tamm“ ავტორისთვის.

კეთილსინდისიერი ამომღები პირველ გვერდზე მნიშვნელობას აბრუნებს, მეორეზე კი null-ს. ტესტში 7 ტიპის გვერდზე 42 ასეთი წყვილი გამოიყენეს.

ერთი წინადადება, შეცდომების მესამედი

ყველა მონაწილემ მიიღო ინსტრუქცია: ნებისმიერი ველისთვის, რომლის მნიშვნელობაც გვერდზე არ არის, გამოიყენე null, ნუ გამოიცნობ. იმავე დავალებასთან შედარებით, სადაც ეს წინადადება ამოღებული იყო, 16-ივე შემოწმებულმა მოდელმა ნაკლები შეთხზული ველი დააბრუნა. ინსტრუქციის გარეშე მათ 573 დაკარგული ველიდან 405 შეთხზეს, ანუ 70,7%. ინსტრუქციით, 574-დან 116, ანუ 20,2%.

ამ ერთმა წინადადებამ ყველაზე აშკარა ხაფანგზეც შეცვალა ქცევა: გვერდზე „Was $493.00“ ინსტრუქციის გარეშე 16-ივე მოდელმა ფასად 493 დაასახელა, ინსტრუქციით კი მხოლოდ ერთმა.

ყველაზე ფრთხილი Gemini 3.8 Flash და GLM 5.3 აღმოჩნდა, მათ 36-დან 1 და 35-დან 1 დაკარგული ველი შეთხზეს. ჩვეულებრივი HTTP მოთხოვნა GPT-6 Luna-სთან ერთად 36-დან 5 ველი შეთხზა, 84 გვერდის სრული გაშვება კი $0,0049 დაჯდა. ფასიანმა API-მ Firecrawl-მა 36-დან 24 ველი მოიგონა, რაც იმ 16 მოდელიდან 13-ზე მეტია, რომლებსაც ეს წინადადება ჰქონდათ, და მისი 24-ივე პასუხი სატყუარას იმეორებდა.

იაფი შემოწმება

მყიდველ აგენტს ასევე შეუძლია იაფ მოდელს ჰკითხოს, ეყრდნობა თუ არა გვერდი დაბრუნებულ მნიშვნელობას. GPT-6 Luna-მ 49 შეთხზული მნიშვნელობიდან 38 დაიჭირა და 47 სწორიდან არცერთი არ უარყო. გადაწყვეტილების მოდელმა Jev 1.13-მა 49-დან 23 დაიჭირა, 48 სწორიდან კი არცერთი. Firecrawl-ის 24 მოგონილ მნიშვნელობაზე GPT-6 Luna-მ 20 დაიჭირა. 126 უნიკალური გვერდი-მნიშვნელობის წყვილის შემოწმება GPT-6 Luna-სთან $0,0049 დაჯდა, Jev-თან კი $0,0024.

Jev-მა მნიშვნელობით ახლოს მდგომი შეცდომები გამოტოვა, მაგალითად დასვენების, მომზადების ან ჯამური დროის მომზადების დროდ დაბრუნება, 6-დან არცერთი არ დაიჭირა. ამიტომ ბენჩმარკი ამ გაშვებაში უფრო ძლიერ შემმოწმებლად GPT-6 Luna-ს ასახელებს.

რას არ აჩვენებს ტესტი

შედეგები თითოეული მონაწილის ერთი გაშვებიდანაა, სინთეტურ გვერდებზე, ამიტომ რეალური საიტები შეიძლება სხვაგვარად მოიქცეს. ფასიანი API-ები უფასო პაკეტებზე და მხოლოდ წინადადებით გაეშვა, ScrapingBee-ზე კი null-ის წესი ყოველი ველის აღწერაში ჩაიწერა. ელფოსტის ხაფანგები და Hy4-ის წინასწარი ვერსია გამოირიცხა. ავტორების შენიშვნით, მარკეტპლეისზე განთავსება შეფასება არ არის, მომწოდებლის მტკიცებები არ მოწმდება.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.