Geri Dön
Gerçek yeterli değil: ProvenanceGuard MCP ajanının yanıt kaynağını doğrular
SiTech AI Team2 წთ. საკითხავი

Gerçek yeterli değil: ProvenanceGuard MCP ajanının yanıt kaynağını doğrular

Multiverse Computing'in araştırma sistemi ProvenanceGuard, bir iddianın bir yerde doğrulanıp doğrulanmadığını değil, yanıtın belirttiği kaynakla eşleşip eşleşmediğini de kontrol eder.

Araç kullanan LLM ajanları artık tek bir metinden okumuyor: MCP aracılığıyla birkaç aracın sonucunu tek bir yanıtta birleştiriyorlar.

Multiverse Computing ekibi 29 Eylül'de Hugging Face'te ProvenanceGuard çalışmasını sundu.

“Bir yerde doğrulandı” “doğru kaynakla doğrulandı” anlamına gelmez

Mevcut doğrulayıcılar, RAGAS faithfulness'ten MiniCheck, AlignScore ve SummaC'ye kadar, yalnızca hâlihazırda toplanmış kanıt kümesinin bir iddiayı destekleyip desteklemediğini kontrol eder.

Şema: iddia bir politika belgesiyle doğrulanıyor, ancak yanıt bir hesap kaydına atıfta bulunuyor

Yazarlar buna cross-source conflation diyor: iddia kanıtların içinde bir yerde doğrudur, ancak yanlış kaynağa atfedilir. Bir destek ajanının yanıtı 30 günlük iade süresini bir hesap kaydına atfedebilir, oysa gerçekte bunu bir politika belgesi doğrular.

ProvenanceGuard ne yapıyor

ProvenanceGuard, black-box bir MCP ajanının üzerinde çalışan üretim sonrası doğrulama katmanıdır. Ajanı yeniden eğitmeden, araç sonuçları ve kaynak ID'leri içeren kayıtlı izi okur. Beş adım vardır: iddialara ayırma, her biri için ilgili kaynağı bulma, desteği kontrol etme, kaynağı karşılaştırma ve karar — izin verme veya engelleme.

Şema: ProvenanceGuard'ın beş adımlı doğrulama akışı

Deneylerde yerel modeller kullanıldı: MiniLM kaynağı arar, DeBERTa tabanlı NLI doğrulayıcısı desteği kontrol eder, yerel bir dil modeli ise yanıtı iddialara böler. Kaynakta bulunmayan bir sayı veya tarih geçemez.

Sonuçlar

Sistem, tıbbi bir ajanın 281 gerçek izi üzerinde test edildi. Uzmanlar 40 yanıttan 361 iddiayı inceledi: onlara göre 139'u geçmemeliydi ve ProvenanceGuard 138'ini yakaladı. Ayrıca 67 desteklenen iddiayı durdurdu. Doğru kaynağı vakaların yaklaşık %86'sında seçti.

Engellenmesi gereken iddialar için F1 puanıyla herkesi geçti — 0,802 (MiniCheck 0,783, RAGAS Faithfulness 0,758, AlignScore 0,662, SummaC-ZS 0,436).

Benzer kaynaklarla yapılan zor testte sistem engellemede 0,846 F1 aldı, ancak tam kaynağı yalnızca %50,3'ünde belirtti. Kontrollü testte kaynak adı 50 vakada değiştirildi — sistem hepsini yakaladı. RARR tarzı düzeltme döngüsü 173 engellenmiş yanıtın tamamını çözdü, ancak 144'ü değiştirme metniyle sonuçlandı. Aynı yaklaşım NVIDIA'nın NVFlow'unda finansal bir ajan için kullanılıyor.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.