العودة
الحقيقة وحدها لا تكفي: ProvenanceGuard يتحقق من مصدر رد وكيل MCP
SiTech AI Team2 წთ. საკითხავი

الحقيقة وحدها لا تكفي: ProvenanceGuard يتحقق من مصدر رد وكيل MCP

نظام البحث ProvenanceGuard من Multiverse Computing يتحقق ليس فقط مما إذا كان الادعاء مؤكداً في مكان ما، بل أيضاً مما إذا كان مطابقاً للمصدر الذي يذكره الرد، لمنع الإسناد الخاطئ.

وكلاء LLM الذين يستخدمون الأدوات لم يعودوا يقرؤون من نص واحد: عبر MCP يدمجون نتائج عدة أدوات في رد واحد.

قدم فريق Multiverse Computing في 29 سبتمبر على Hugging Face عمل ProvenanceGuard.

«مؤكد في مكان ما» لا يعني «مؤكد بالمصدر الصحيح»

المدققات الحالية، من RAGAS faithfulness إلى MiniCheck وAlignScore وSummaC، تتحقق فقط مما إذا كانت مجموعة الأدلة التي جُمعت بالفعل تدعم الادعاء.

مخطط: الادعاء مؤكد بوثيقة سياسة، لكن الرد يذكر سجل حساب

يسمي المؤلفون ذلك cross-source conflation: الادعاء صحيح في مكان ما ضمن الأدلة، لكنه يُنسب إلى المصدر الخطأ. قد ينسب رد وكيل الدعم فترة الإرجاع البالغة 30 يوماً إلى سجل حساب، بينما في الواقع تؤكده وثيقة سياسة.

ماذا يفعل ProvenanceGuard

ProvenanceGuard هو طبقة تحقق بعد التوليد تعمل فوق وكيل MCP من نوع black-box. من دون إعادة تدريب الوكيل، يقرأ الأثر المسجل مع نتائج الأدوات ومعرفات المصدر. هناك خمس خطوات: التقسيم إلى ادعاءات، إيجاد المصدر المناسب لكل منها، فحص الدعم، مقارنة المصدر، والقرار — السماح أو الحظر.

مخطط: تدفق التحقق الخماسي لـ ProvenanceGuard

في التجارب استُخدمت نماذج محلية: MiniLM يبحث عن المصدر، ومدقق NLI المبني على DeBERTa يفحص الدعم، ونموذج لغوي محلي يقسم الرد إلى ادعاءات. أي رقم أو تاريخ غير موجود في المصدر لن يمر.

النتائج

اختُبر النظام على 281 أثراً حقيقياً لوكيل طبي. فحص الخبراء 361 ادعاءً من 40 رداً: برأيهم، كان يجب ألا يمر 139، بينما التقط ProvenanceGuard 138. كما أوقف 67 ادعاءً مؤكداً. واختار المصدر الصحيح في نحو 86% من الحالات.

وبدرجة F1 للادعاءات التي يجب حظرها تفوق على الجميع — 0,802 (MiniCheck 0,783, RAGAS Faithfulness 0,758, AlignScore 0,662, SummaC-ZS 0,436).

في اختبار صعب بمصادر متشابهة حصل النظام على 0,846 F1 في الحظر، لكنه ذكر المصدر الدقيق في 50,3% فقط من الحالات. في اختبار مضبوط غُيّر اسم المصدر في 50 حالة — التقط النظام جميعها. حلّت دورة تصحيح بأسلوب RARR جميع الردود المحظورة البالغة 173، رغم أن 144 منها انتهت بنص بديل. يُستخدم النهج نفسه في NVFlow من NVIDIA لوكيل مالي.

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.