← უკან დაბრუნება
SiTech Team⏱️ 1 წთ. საკითხავი

AI ძიების აგენტები: პრობლემა ძიება კი არა, სწორი კითხვების დასმაა

AI ძიების აგენტები: პრობლემა ძიება კი არა, სწორი კითხვების დასმაა

Tencent Hunyuan-ისა და Tsinghua University-ის DiscoBench ბენჩმარკი ავლენს, რომ AI ძიების აგენტები იშლებიან არა ძიების, არამედ ორაზროვანი კითხვების გარკვევის ეტაპზე.

შესავალი: AI ძიების აგენტების ნამდვილი პრობლემა

Tencent Hunyuan-ისა და Tsinghua University-ის მკვლევარებმა შექმნეს ახალი ბენჩმარკი — DiscoBench, რომელიც ამოწმებს AI ძიების აგენტების უნარს, ამოიცნონ ორაზროვნება და დასვან დამაზუსტებელი შეკითხვები. შედეგები გასაოცარია: ყველაზე ძლიერი მოდელებიც კი 50%-ზე დაბალ სიზუსტეს აჩვენებენ.

ოთხი ტიპის ორაზროვნება

DiscoBench განსაზღვრავს ორაზროვნების ოთხ ტიპს: ერთეულის (entity), დროის/ვერსიის, კრიტერიუმების და ფაქტობრივი შეცდომის. 211 დავალება 463 ორაზროვანი წერტილით 11 ცოდნის დომენში.

მოდელების შედეგები

Doubao Seed 2.0 Pro: 43.1%, Gemini 3.1 Pro: 40.8%, Claude Opus 4.7: 39.8%. Qwen3.6 Max: 12.3%. კლოდი წყვეტს ჩექპოინტების 57%-ს, მაგრამ მხოლოდ 39.8%-ს ბოლომდე — ერთი გადაუჭრელი ორაზროვნება ანგრევს მთელ ჯაჭვს.

გაფრთხილება საკმარისი არ არის

სისტემური პრომპტი, რომელიც აფრთხილებს ორაზროვნების შესახებ, ზრდის Detection F1-ს 45.3-დან 64.9-მდე, მაგრამ end-to-end სიზუსტე მხოლოდ 28.6-დან 33.7%-მდე იზრდება. Claude Opus 4.7-ისთვის guided prompt-მა სიზუსტე ოდნავ შეამცირა კიდეც.

ქცევითი პროფილები

SearchThenAsk: 93.4% წარმატება. DirectGuess: 56.5%. SearchHeavyGuess: 51.9% — უარესი, ვიდრე გამოცნობა. მეტი ძიება != უკეთესი შედეგი.

დასკვნა

AI ძიების აგენტებს სჭირდებათ მექანიზმები, რომლებიც ძიების გაურკვევლობას მომხმარებელთან ინტერაქციად აქცევს.