Geri Dön
Araştırmacı LLM belleğini kazara program analizine çevirdi
SiTech AI Team3 წთ. საკითხავი

Araştırmacı LLM belleğini kazara program analizine çevirdi

Güvenlik açığı incelemelerinde LLM ajanlarının unutmasını engellemeye çalışan Jordy Zomer, sohbet geçmişi yerine olguları, kuralları ve kökeni tutan Datalog tarzı Lemmalog motorunu geliştirdi.

Güvenlik araştırmacısı Jordy Zomer son aylarda güvenlik açığı araştırmalarında LLM ajanlarını kullandı. 28 Ağustos'ta yayımlanan bir yazıda, bu ajanların bellek sorunlarını düzeltme girişiminin nasıl Lemmalog adlı Datalog tarzı bir program analizi motoruna dönüştüğünü anlatıyor.

Sorun, ajanların büyük kod tabanlarında yön bulmakta kötü olması değil — bunu şaşırtıcı derecede iyi yapıyorlar. Ancak bir inceleme saatlerce sürdüğünde model, gerçekte neyin ortaya koyulduğunu yavaşça kaybediyor: elenen bir yaklaşımı yeniden öneriyor, bir varsayımın yanlış çıktığını unutuyor ya da artık geçerli olmayan bir gözlemden akıl yürütmeye devam ediyor.

Program analizi olarak bellek

Mevcut bellek sistemleri genellikle geçmiş konuşmaları ve gözlemleri saklar, gömer ve en ilgili parçaları geri getirir. Zomer bunun tek bir sözcük altında iki farklı problemi gizlediğini savunuyor: geri getirme "geçmişteki hangi bilgi bu soruyla ilgili?" sorusunu yanıtlar, ancak "şimdiye kadar öğrenilen her şey göz önüne alındığında şu anda ne doğru?" sorusunu yanıtlamaz.

Lemmalog işi ikiye ayırıyor: LLM "bulanık" kısmı üstlenip doğal dili, kaynak kodu ve hata ayıklayıcı çıktısını yapılandırılmış olgulara çevirirken, motor deterministik kısmı yürütüyor: olgular ve kurallar türetilmiş olgular üretiyor.

Geri alma, köken ve zaman

Bir olguyu silmek eklemekten zordur. Bir sonucun birden çok türetimi varsa, onu destekleyen bir olgunun silinmesi, başka bir destek sürdüğü sürece sonucu silmemelidir — güvenlik açığı araştırmalarında bu sık görülür, çünkü bir aday birden fazla bağımsız yoldan sömürülebilir olabilir. Bu yüzden motor her olgunun nasıl türetildiğini izler, bir şey değiştiğinde desteği günceller ve bir sonucun neden doğru kabul edildiğini yanıtlayabilir. Bir iddianın arkasında köken yoksa, o iddia sürdürülen durumun parçası değildir.

Kıyaslama sonuçları

Zomer sistemi LongMemEval ile LoCoMo'da, kıyaslamaların kendi standart okuyucu ve değerlendiricileriyle test etti; çıkarım her konuşma için bir kez yapılıyor. LongMemEval'de (102 soru) Lemmalog 0.463 F1 (±0.010) ve 0.575 doğruluk elde etti: OpenClaw (0.244) ve tam bağlam (0.222) yöntemlerinden iyi, PropMem (0.550) ve SimpleMem (0.480) sistemlerinden geride. En güçlü olduğu alan bilgi güncellemeleri (PropMem'in 0.528'ine karşı 0.579), en zayıf olduğu alan çok oturumlu akıl yürütme (0.211) oldu. LoCoMo'nun 1.986 sorusunda ortalama 0.533 F1 (±0.001) aldı; PropMem ve OpenClaw'ın gerisinde, ancak yanlış varsayım içeren sorularda tam bağlamın önünde (0.509'a karşı 0.707). Yanıtlayıcı model LongMemEval'de soru başına yaklaşık 104.000 yerine 2.700 token alıyor — yaklaşık 38 kat daha az bağlam, çünkü çıkarımın bedeli bir kez ödeniyor.

İyileşmenin çoğu gösterişsiz düzeltmelerden geldi: halüsinasyonu azaltmaya yönelik bir talimat okuyucunun 102 sorudan 32'sini yanıtlamayı reddetmesine yol açtı, kısa sözcükleri yok sayan çoğul kuralı ise sayım kanıtlarını sessizce düşürdü. Zomer, PropMem'in genel olarak hâlâ önde olduğunu ve LongMemEval örnekleminin küçük olduğunu açıkça belirtiyor. Sıradaki deney ise işin çıkış noktası: uzun süreli bir güvenlik açığı incelemesi.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.