უკან დაბრუნება
ფაქტი საკმარისი არ არის: ProvenanceGuard ამოწმებს MCP აგენტის პასუხის წყაროს
SiTech AI Team2 წთ. საკითხავი

ფაქტი საკმარისი არ არის: ProvenanceGuard ამოწმებს MCP აგენტის პასუხის წყაროს

Multiverse Computing-ის კვლევითი სისტემა ProvenanceGuard ამოწმებს არა მხოლოდ იმას, არის თუ არა მტკიცება სადმე დადასტურებული, არამედ იმასაც, ემთხვევა თუ არა ის წყარო, რომელსაც პასუხი ასახელებს.

ხელსაწყოების გამომყენებელი LLM აგენტები აღარ კითხულობენ ერთი ტექსტიდან: MCP-ის მეშვეობით ისინი რამდენიმე ხელსაწყოს შედეგს ერთ პასუხად აერთიანებენ.

Multiverse Computing-ის გუნდმა 29 სექტემბერს Hugging Face-ზე წარმოადგინა ნამუშევარი ProvenanceGuard.

„სადმე დადასტურებული“ არ ნიშნავს „სწორი წყაროთი დადასტურებული“

არსებული გადამწმედები, RAGAS-ის faithfulness-იდან MiniCheck-ამდე, AlignScore-ამდე და SummaC-ამდე, ამოწმებენ მხოლოდ იმას, ადასტურებს თუ არა მტკიცებას უკვე შეკრებილი მტკიცებულებათა ერთობლიობა.

სქემა: მტკიცება პოლიტიკის დოკუმენტითაა დადასტურებული, პასუხი კი ანგარიშის ჩანაწერს ასახელებს

ამას ავტორები cross-source conflation-ს უწოდებენ: მტკიცება მართალია სადღაც მტკიცებულებებში, მაგრამ არასწორ წყაროს მიეწერება. დახმარების აგენტის პასუხმა დაბრუნების 30-დღიანი ვადა შეიძლება ანგარიშის ჩანაწერს მიაწეროს, სინამდვილეში კი პოლიტიკის დოკუმენტი ადასტურებს.

რას აკეთებს ProvenanceGuard

ProvenanceGuard გენერაციის შემდგომი გადამოწმების ფენაა, რომელიც black-box MCP აგენტის თავზე მუშაობს. აგენტის ხელახლა წვრთნის გარეშე ის კითხულობს ჩაწერილ კვალს ხელსაწყოების შედეგებითა და წყაროს ID-ებით. ხუთი ნაბიჯია: მტკიცებებად დაყოფა, თითოეულისთვის შესაბამისი წყაროს მოძიება, მხარდაჭერის შემოწმება, წყაროს შედარება და გადაწყვეტილება - დაშვება თუ დაბლოკვა.

სქემა: ProvenanceGuard-ის ხუთსაფეხურიანი გადამოწმების ნაკადი

ექსპერიმენტებში ლოკალური მოდელები გამოიყენეს: MiniLM წყაროს ეძებს, DeBERTa-ზე დაფუძნებული NLI ვერიფიკატორი მხარდაჭერას ამოწმებს, ლოკალური ენობრივი მოდელი კი პასუხს მტკიცებებად ყოფს. წყაროში არმყოფი რიცხვი ან თარიღი ვერ გაივლის.

შედეგები

სისტემა სამედიცინო აგენტის 281 რეალურ კვალზე გამოსცადეს. ექსპერტებმა 40 პასუხიდან 361 მტკიცება შეამოწმეს: მათი აზრით, 139 არ უნდა გასულიყო, ProvenanceGuard-მა კი 138 დაიჭირა. მან ასევე შეაჩერა 67 დადასტურებული მტკიცება. სწორი წყარო შემთხვევათა დაახლოებით 86%-ში აირჩია.

დასაბლოკი მტკიცებების F1-ქულით ის ყველას გაუსწრო - 0,802 (MiniCheck 0,783, RAGAS Faithfulness 0,758, AlignScore 0,662, SummaC-ZS 0,436).

მსგავსი წყაროების რთულ ტესტში სისტემამ ბლოკირებაში 0,846 F1 მიიღო, ზუსტი წყარო კი მხოლოდ 50,3%-ში დაასახელა. კონტროლირებულ ტესტში წყაროს სახელი 50 შემთხვევაში შეიცვალა - სისტემამ ყველა დაიჭირა. RARR-ის სტილის გასწორების ციკლმა 173-ივე დაბლოკილი პასუხი გადაჭრა, თუმცა 144 შემცვლელი ტექსტით დასრულდა. იგივე მიდგომა NVIDIA-ს NVFlow-შიც გამოიყენება ფინანსური აგენტისთვის.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.