AI ძიების აგენტები: პრობლემა ძიება კი არა, სწორი კითხვების დასმაა
Tencent Hunyuan-ისა და Tsinghua University-ის DiscoBench ბენჩმარკი ავლენს, რომ AI ძიების აგენტები იშლებიან არა ძიების, არამედ ორაზროვანი კითხვების გარკვევის ეტაპზე.
შესავალი: AI ძიების აგენტების ნამდვილი პრობლემა
Tencent Hunyuan-ისა და Tsinghua University-ის მკვლევარებმა შექმნეს ახალი ბენჩმარკი — DiscoBench, რომელიც ამოწმებს AI ძიების აგენტების უნარს, ამოიცნონ ორაზროვნება და დასვან დამაზუსტებელი შეკითხვები. შედეგები გასაოცარია: ყველაზე ძლიერი მოდელებიც კი 50%-ზე დაბალ სიზუსტეს აჩვენებენ.
ოთხი ტიპის ორაზროვნება
DiscoBench განსაზღვრავს ორაზროვნების ოთხ ტიპს: ერთეულის (entity), დროის/ვერსიის, კრიტერიუმების და ფაქტობრივი შეცდომის. 211 დავალება 463 ორაზროვანი წერტილით 11 ცოდნის დომენში.
მოდელების შედეგები
Doubao Seed 2.0 Pro: 43.1%, Gemini 3.1 Pro: 40.8%, Claude Opus 4.7: 39.8%. Qwen3.6 Max: 12.3%. კლოდი წყვეტს ჩექპოინტების 57%-ს, მაგრამ მხოლოდ 39.8%-ს ბოლომდე — ერთი გადაუჭრელი ორაზროვნება ანგრევს მთელ ჯაჭვს.
გაფრთხილება საკმარისი არ არის
სისტემური პრომპტი, რომელიც აფრთხილებს ორაზროვნების შესახებ, ზრდის Detection F1-ს 45.3-დან 64.9-მდე, მაგრამ end-to-end სიზუსტე მხოლოდ 28.6-დან 33.7%-მდე იზრდება. Claude Opus 4.7-ისთვის guided prompt-მა სიზუსტე ოდნავ შეამცირა კიდეც.
ქცევითი პროფილები
SearchThenAsk: 93.4% წარმატება. DirectGuess: 56.5%. SearchHeavyGuess: 51.9% — უარესი, ვიდრე გამოცნობა. მეტი ძიება != უკეთესი შედეგი.
დასკვნა
AI ძიების აგენტებს სჭირდებათ მექანიზმები, რომლებიც ძიების გაურკვევლობას მომხმარებელთან ინტერაქციად აქცევს.