العودة
باحث يحوّل ذاكرة النماذج اللغوية إلى تحليل برامج
SiTech AI Team3 წთ. საკითხავი

باحث يحوّل ذاكرة النماذج اللغوية إلى تحليل برامج

في محاولة لمنع وكلاء النماذج اللغوية من نسيان ما أثبته تحقيق أمني، بنى جوردي زومر محرك Lemmalog بأسلوب Datalog يحفظ الوقائع والقواعد ومصدرها بدل تاريخ المحادثة.

استخدم الباحث الأمني جوردي زومر على مدار الأشهر الماضية وكلاء النماذج اللغوية الكبيرة في البحث عن الثغرات. وفي مقال نُشر في 28 أغسطس يشرح كيف تحوّلت محاولته إصلاح ذاكرتهم إلى محرك تحليل برامج بأسلوب Datalog يُدعى Lemmalog.

المشكلة ليست في أن الوكلاء يجدون صعوبة في التنقل داخل قواعد شيفرة ضخمة — بل على العكس، هم بارعون في ذلك بشكل مفاجئ. لكن عندما يستمر التحقيق ساعات، يفقد النموذج تدريجيًا ما تم إثباته فعلًا: يقترح نهجًا سبق استبعاده، وينسى أن فرضًا ما تبيّن أنه خاطئ، أو يواصل الاستدلال من ملاحظة لم تعد صالحة. وإخبار النموذج بأن شيئًا ما خطأ لا يعني أنه سيتوقف عن الإيمان بكل ما كان يعتمد عليه.

الذاكرة كتحليل برامج

تحفظ أنظمة الذاكرة القائمة عادة المحادثات والملاحظات السابقة، وتحوّلها إلى متجهات، ثم تستعيد أكثرها صلة. ويرى زومر أن هذا يخفي مشكلتين مختلفتين تحت كلمة واحدة: فالاسترجاع يجيب عن سؤال «ما الذي من الماضي يخص هذا السؤال؟»، لا عن سؤال «بالنظر إلى كل ما تعلمناه، ما الصحيح الآن؟». قد تُظهر قاعدة بيانات متجهية السجل القائل إن object_a يشير إلى object_b لأنه وثيق الصلة دلاليًا، لكنها لا تعرف أن هذا القول دُحض بعد ساعتين، ولا أن خمس نتائج كانت تعتمد عليه.

يقسّم Lemmalog العمل: يتولى النموذج اللغوي الجزء «الضبابي» بتحويل اللغة الطبيعية والشيفرة ومخرجات المصحّح إلى وقائع منظمة، بينما يتولى المحرك الجزء الحتمي: الوقائع والقواعد تُنتج وقائع مشتقة.

السحب والمصدر والزمن

حذف واقعة أصعب من إضافتها. فإذا كانت للنتيجة عدة اشتقاقات، فلا ينبغي لحذف واقعة داعمة واحدة أن يحذف النتيجة ما دامت أخرى قائمة — وهو أمر شائع في أبحاث الثغرات حين يكون المرشح قابلًا للاستغلال عبر أكثر من مسار مستقل. لذلك يتتبع المحرك كيفية اشتقاق كل واقعة، ويحدّث الدعم عند أي تغيير، ويستطيع تفسير سبب اعتبار نتيجة ما صحيحة. وإذا لم يكن خلف الادعاء مصدر، فهو ليس جزءًا من الحالة المحفوظة — وهو أمر مفيد حين يؤكد النموذج بثقة أننا «أثبتنا» شيئًا لم يُثبت قط. كما أن الوقائع تتغير ولا تختفي فقط، لذا يحفظ Lemmalog فترات صلاحيتها.

نتائج الاختبارات

وصل زومر النظام بمنصة MemEval واختبره على LongMemEval وLoCoMo باستخدام القارئات والمقيّمين القياسيين للمنصة، مع استخراج يُنفَّذ مرة واحدة لكل محادثة بواسطة Claude Sonnet 4.6. وفي LongMemEval (102 سؤالًا) حقق Lemmalog نتيجة 0.463 F1 (±0.010) ودقة 0.575 — أفضل من OpenClaw (0.244) ومن السياق الكامل (0.222)، لكنه أقل من PropMem (0.550) وSimpleMem (0.480). وكان الأقوى في تحديث المعرفة (0.579 مقابل 0.528 لـPropMem) والأضعف في الاستدلال متعدد الجلسات (0.211). وعلى أسئلة LoCoMo البالغة 1,986 سؤالًا بلغ متوسطه 0.533 F1 (±0.001): متأخرًا عن PropMem وOpenClaw، لكنه متقدم على السياق الكامل في الأسئلة ذات المقدمات الخاطئة (0.707 مقابل 0.509). ويتلقى النموذج المجيب في LongMemEval نحو 2,700 رمز لكل سؤال بدلًا من نحو 104,000 — أي سياق أقل بنحو 38 مرة، لأن تكلفة الاستخراج تُدفع مرة واحدة.

وجاء كثير من التحسن من إصلاحات غير لافتة: تعليمة أُضيفت لتقليل التخريف جعلت القارئ يرفض الإجابة عن 32 سؤالًا من أصل 102 كانت قابلة للإجابة، وقاعدة معالجة الجمع التي تتجاهل الكلمات الأقصر من خمسة أحرف كانت تُسقط بصمت أدلة العدّ، والتواريخ التي تُقارن كرموز Datalog كانت تُقارن بمعرّفات داخلية. ويؤكد زومر صراحة أن PropMem ما زال متقدمًا في المجموع وأن عينة LongMemEval صغيرة. أما التجربة القادمة فهي سبب كل هذا العمل: تحقيق مطوّل في ثغرة أمنية.

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.