
Факт недостатній: ProvenanceGuard перевіряє джерело відповіді MCP-агента
Дослідницька система ProvenanceGuard від Multiverse Computing перевіряє не лише те, чи підтверджено твердження десь, а й те, чи відповідає воно джерелу, яке наводить відповідь.
LLM-агенти, які використовують інструменти, більше не читають з одного тексту: через MCP вони об’єднують результати кількох інструментів в одну відповідь.
Команда Multiverse Computing 29 вересня представила на Hugging Face роботу ProvenanceGuard.
«Підтверджено десь» не означає «підтверджено правильним джерелом»
Наявні перевіряльники, від RAGAS faithfulness до MiniCheck, AlignScore і SummaC, перевіряють лише те, чи підтверджує твердження вже зібрана сукупність доказів.

Автори називають це cross-source conflation: твердження є істинним десь у доказах, але його приписують неправильному джерелу. Відповідь агента підтримки може приписати 30-денний термін повернення запису облікового запису, тоді як насправді його підтверджує політичний документ.
Що робить ProvenanceGuard
ProvenanceGuard — це шар перевірки після генерації, який працює поверх black-box MCP-агента. Без перенавчання агента він читає записаний слід із результатами інструментів і ID джерел. Є п’ять кроків: поділ на твердження, пошук відповідного джерела для кожного, перевірка підтримки, порівняння джерела та рішення — дозволити чи заблокувати.

В експериментах використовували локальні моделі: MiniLM шукає джерело, верифікатор NLI на базі DeBERTa перевіряє підтримку, а локальна мовна модель розбиває відповідь на твердження. Число або дата, яких немає в джерелі, не пройдуть.
Результати
Систему протестували на 281 реальному сліді медичного агента. Експерти перевірили 361 твердження з 40 відповідей: на їхню думку, 139 не мали пройти, а ProvenanceGuard упіймав 138. Він також зупинив 67 підтверджених тверджень. Правильне джерело він вибрав приблизно у 86% випадків.
За F1-оцінкою для тверджень, які слід блокувати, він перевершив усіх — 0,802 (MiniCheck 0,783, RAGAS Faithfulness 0,758, AlignScore 0,662, SummaC-ZS 0,436).
У складному тесті з подібними джерелами система отримала 0,846 F1 у блокуванні, але точне джерело назвала лише у 50,3% випадків. У контрольованому тесті назву джерела змінили у 50 випадках — система впіймала всі. Цикл виправлення у стилі RARR розв’язав усі 173 заблоковані відповіді, хоча 144 завершилися замінним текстом. Той самий підхід використовується в NVIDIA NVFlow для фінансового агента.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.