
Փաստը բավարար չէ. ProvenanceGuard-ը ստուգում է MCP գործակալի պատասխանի աղբյուրը
Multiverse Computing-ի հետազոտական համակարգը՝ ProvenanceGuard-ը, ստուգում է ոչ միայն այն, թե արդյոք պնդումը ինչ-որ տեղ հաստատված է, այլև այն, թե արդյոք այն համընկնում է պատասխանում նշված աղբյուրի հետ։
Գործիքներ օգտագործող LLM գործակալներն այլևս մեկ տեքստից չեն կարդում. MCP-ի միջոցով նրանք մի քանի գործիքի արդյունքը միավորում են մեկ պատասխանի մեջ։
Multiverse Computing-ի թիմը սեպտեմբերի 29-ին Hugging Face-ում ներկայացրեց ProvenanceGuard աշխատանքը։
«Ինչ-որ տեղ հաստատված է» չի նշանակում «ճիշտ աղբյուրով հաստատված է»
Գոյություն ունեցող ստուգիչները՝ RAGAS-ի faithfulness-ից մինչև MiniCheck, AlignScore և SummaC, ստուգում են միայն այն, թե արդյոք արդեն հավաքված ապացույցների ամբողջությունը հաստատում է պնդումը։

Հեղինակներն այն անվանում են cross-source conflation. պնդումը ճշմարիտ է ապացույցների ինչ-որ տեղ, բայց վերագրվում է սխալ աղբյուրին։ Աջակցության գործակալի պատասխանը կարող է 30-օրյա վերադարձի ժամկետը վերագրել հաշվի գրառմանը, մինչդեռ իրականում այն հաստատում է քաղաքականության փաստաթուղթը։
Ինչ է անում ProvenanceGuard-ը
ProvenanceGuard-ը գեներացումից հետո ստուգման շերտ է, որն աշխատում է black-box MCP գործակալի վրա։ Առանց գործակալին վերապատրաստելու՝ այն կարդում է գործիքների արդյունքներով և աղբյուրի ID-ներով գրանցված հետքը։ Հինգ քայլ կա՝ պնդումների բաժանել, յուրաքանչյուրի համար համապատասխան աղբյուր գտնել, աջակցությունը ստուգել, աղբյուրը համեմատել և որոշում կայացնել՝ թույլ տալ, թե արգելափակել։

Փորձերում օգտագործվել են տեղական մոդելներ. MiniLM-ը փնտրում է աղբյուրը, DeBERTa-ի վրա հիմնված NLI վերիֆիկատորը ստուգում է աջակցությունը, իսկ տեղական լեզվական մոդելը պատասխանը բաժանում է պնդումների։ Աղբյուրում չեղած թիվը կամ ամսաթիվը չի անցնի։
Արդյունքներ
Համակարգը փորձարկվել է բժշկական գործակալի 281 իրական հետքի վրա։ Փորձագետները ստուգել են 40 պատասխանից 361 պնդում. նրանց կարծիքով՝ 139-ը չպետք է անցներ, իսկ ProvenanceGuard-ը բռնել է 138-ը։ Այն նաև կանգնեցրել է 67 հաստատված պնդում։ Ճիշտ աղբյուրը ընտրել է դեպքերի մոտ 86%-ում։
Արգելափակման ենթակա պնդումների F1 միավորով այն գերազանցել է բոլորին՝ 0,802 (MiniCheck 0,783, RAGAS Faithfulness 0,758, AlignScore 0,662, SummaC-ZS 0,436)։
Նմանատիպ աղբյուրների դժվար թեստում համակարգը արգելափակման մեջ ստացել է 0,846 F1, սակայն ճշգրիտ աղբյուրը նշել է միայն 50,3%-ում։ Վերահսկվող թեստում աղբյուրի անունը փոխվել է 50 դեպքում. համակարգը բռնել է բոլորին։ RARR ոճի ուղղման ցիկլը լուծել է բոլոր 173 արգելափակված պատասխանները, թեև 144-ը ավարտվել է փոխարինող տեքստով։ Նույն մոտեցումը կիրառվում է NVIDIA-ի NVFlow-ում ֆինանսական գործակալի համար։
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։