
LLM-ის მეხსიერება შემთხვევით პროგრამულ ანალიზად იქცა
მკვლევარმა დაუცველობის ძიებაში LLM-ის მეხსიერების პრობლემა Datalog-ის სტილის ანალიზის ძრავით Lemmalog-ით გადაჭრა — ფაქტები, წესები და დასკვნების ავტომატური გაუქმება.
უსაფრთხოების მკვლევარი ჯორდი ზომერი ბოლო თვეების განმავლობაში LLM-აგენტებს დაუდევრობის ძიებაში იყენებდა. 28 აგვისტოს გამოქვეყნებულ პოსტში ის აღწერს, როგორ იქცა მათი მეხსიერების პრობლემის მოგვარების მცდელობა Datalog-ის სტილის პროგრამული ანალიზის ძრავად, სახელად Lemmalog.
პრობლემა ის არ არის, რომ აგენტები დიდ კოდურ ბაზებში ცუდად ორიენტირდებიან — პირიქით, ამას მოულოდნელად კარგად აკეთებენ. მაგრამ როცა გამოძიება საათობით გრძელდება, მოდელი თანდათან კარგავს იმას, რაც უკვე დადგინდა: სთავაზობს უკვე გამორიცხულ მიდგომას, ივიწყებს, რომ რაღაც დაშვება მცდარი აღმოჩნდა, ან აგრძელებს უკვე ბათილი დაკვირვებიდან მსჯელობას.
მეხსიერება როგორც პროგრამული ანალიზი
არსებული მეხსიერების სისტემები ჩვეულებრივ ინახავს წარსულ დაკვირვებებს, აწარმოებს მათ ვექტორულ ჩადგმას და ურთიერთობს ყველაზე შესაბამისებს. ზომერის აზრით, ასე ერთ სიტყვაში ორი სხვადასხვა ამოცანა ირევა: პოვნა პასუხობს კითხვას „რა არის წარსულიდან ამ კითხვისთვის აქტუალური?“, მაგრამ არა კითხვას „ყველაფრის გათვალისწინებით, რა არის ახლა ჭეშმარიტი?“.
Lemmalog სამუშაოს ორად ჰყოფს. LLM ამუშავებს „ბუნდოვან“ ნაწილს — ბუნებრივ ენას, კოდს და დებაგერის გამონატანს სტრუქტურირებულ ფაქტებად აქცევს, ხოლო ძრავა დეტერმინისტულ ნაწილს: ფაქტები და წესები წარმოქმნიან წარმოებულ ფაქტებს.
ფაქტების წაშლა, წარმომავლობა და დრო
ფაქტის წაშლა უფრო რთულია, ვიდრე დამატება: თუ დასკვნას რამდენიმე დამოუკიდებელი დასაბუთება აქვს, ერთი საყრდენი ფაქტის წაშლა დასკვნას არ უნდა აუქმებდეს, სანამ მეორე ძალაშია — დაუცველობის კვლევაში ეს ხშირად ხდება, რადგან კანდიდატი რამდენიმე დამოუკიდებელი გზით შეიძლება იყოს გამოსაყენებელი. ამიტომ ძრავა ინახავს, როგორ იქნა თითოეული ფაქტი გამოყვანილი, ცვლილებისას აახლებს მხარდაჭერას და პასუხობს კითხვას, თუ რატომ დაიჯერება რომელიმე დასკვნა. თუ მტკიცებას წარმომავლობა არ აქვს, ის შენახულ მდგომარეობაში არ შედის.
სატესტო შედეგები
ზომერმა სისტემა LongMemEval-სა და LoCoMo-ზე შეამოწმა ბენჩმარკების საკუთარი წამკითხავი მოდელებითა და შემფასებლებით, ფაქტების ამოღება კი ერთხელ ხდება. LongMemEval-ზე (102 კითხვა) Lemmalog-მა 0.463 F1 (±0.010) და 0.575 სიზუსტე აჩვენა — OpenClaw-ზე (0.244) და სრული კონტექსტის მიდგომაზე (0.222) უკეთესი, თუმცა PropMem-ზე (0.550) და SimpleMem-ზე (0.480) სუსტი. ყველაზე ძლიერი ის ცოდნის განახლებაში აღმოჩნდა (0.579 PropMem-ის 0.528-ის წინააღმდეგ), ყველაზე სუსტი — მრავალსესიურ მსჯელობაში (0.211). LoCoMo-ს 1 986 კითხვაზე საშუალო შედეგი 0.533 F1 (±0.001) იყო: PropMem-სა და OpenClaw-ზე ჩამორჩება, მაგრამ წინ არის წარმოსახვითი მცდარი წინაპირობის მქონე კითხვებში (0.707 სრული კონტექსტის 0.509-ის წინააღმდეგ). პასუხის მოდელი LongMemEval-ზე კითხვაზე დაახლოებით 2 700 ტოკენს იღებს 104 000-ის ნაცვლად — დაახლოებით 38-ჯერ ნაკლებ კონტექსტს, რადგან ფაქტების ამოღება მხოლოდ ერთხელ ხდება.
გაუმჯობესების ნაწილი უჩვეულო ხარვეზების გასწორებამ მოიტანა: ჰალუცინაციების შესამცირებელი ინსტრუქციის გამო წამკითხავმა 102 კითხვიდან 32-ზე უარი თქვა. ზომერი ღიად აღნიშნავს, რომ PropMem საერთო შედეგებში მაინც წინ არის და LongMemEval-ის ნიმუში მცირეა. შემდეგი გამოცდა კი სწორედ ისაა, რისთვისაც ეს ყველაფერი დაიწყო — ხანგრძლივი დაუცველობის კვლევა.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.