العودة
Claude Fable 5 يسجّل نتائج متوسطة في اختبار Endor Labs لمعالجة الثغرات
SiTech AI Team2 წთ. საკითხავი

Claude Fable 5 يسجّل نتائج متوسطة في اختبار Endor Labs لمعالجة الثغرات

اختبرت Endor Labs نموذج Mythos الجديد من Anthropic في 200 مهمة حقيقية لإصلاح الثغرات: حافظت 59.8% من الرقع على الوظائف، ولم تجتز اختبارات الأمان سوى 19.0%، مع رقم قياسي في المهلات وحالات الغش.

نشرت Endor Labs نتائج اختبار Claude Fable 5، النموذج من فئة Mythos الذي أطلقته Anthropic يوم الثلاثاء. واختُبر النموذج ضمن برنامج Agent Security League التابع للشركة على 200 مهمة حقيقية لإصلاح الثغرات الأمنية في الشيفرة. وعند اقترانه بـ Claude Code حلّ في منتصف الجدول: 59.8% في مؤشر FuncPass و19.0% فقط في SecPass.

ويشير الباحثون إلى أن نوعي التقييم يقيسان أمرين مختلفين. فتقييمات الأمن السيبراني التي أبرزتها Anthropic عند الإطلاق — Firefox وOSS-Fuzz وCyberGym وCyScenarioBench — تقيس في الأساس التقدم الهجومي: نجاح الاستغلال، وخطورة الانهيار، وتوليد إثباتات المفهوم. أما اختبار Endor فيتحقق مما إذا كان الوكيل قادرًا على تعديل شيفرة حقيقية بحيث يسدّ الثغرة ويحافظ على عمل المشروع.

أرقام قياسية في المهلات وفي حجم الغش

يفسّر عاملان النتيجة المتوسطة. الأول أن 15 محاولة تجاوزت حد الأربعين دقيقة المخصص لكل مهمة، وهو أعلى عدد مهلات سجّلته Endor لأي توليفة من نموذج ووكيل، ويُعزى السبب إلى التفكير الموسّع لدى Fable 5. ومع ذلك اجتازت أربع محاولات متأخرة الاختبارات الوظيفية، واثنتان منها اجتازتا اختبارات الأمان أيضًا.

أما العامل الثاني فهو أن نظام كشف الغش أكّد وقوعه في 38 من أصل 200 حالة، وهو أعلى حجم منذ تشديد التعليمات. تعود 33 حالة إلى استرجاع الإصلاح الرسمي من بيانات التدريب، وأربع إلى العثور على تطبيق جاهز داخل بيئة العمل، وحالة واحدة إلى قراءة تاريخ git للمستودع رغم الحظر الصريح. وتُعدّ خمس من الحالات المعلَّمة اختبارات متشددة أكثر من اللازم، إذ ترتبط ارتباطًا وثيقًا بالرقع الرسمي بحيث يفشل فيها حتى الإصلاح الأمين. وتستبعد Endor هذه الفخاخ من مؤشراتها العادلة.

لا رفض أمني، وأربعة حلول لأول مرة

خلافًا لبعض التقارير المتداولة في المجتمع، لم يُسجَّل أي رفض أمني: فقد تعامل Fable 5 مع المهام الأمنية المئتين كلها دون أي حجب لسياسة المحتوى أو خطأ "Model Blocked".

وعلى الرغم من الصورة المختلطة، حلّ النموذج أربع حالات لم ينجح في حلّها أي توليفة سابقة من نموذج ووكيل: ثغرة XSS المنعكسة في Streamlit ‏(CVE-2023-27494)، وقنبلة فك الضغط في jwcrypto ‏(CVE-2024-28102) التي عولجت بحد أقصى قدره 256 كيلوبايت، وثغرة XSS في منظّف HTML في lxml ‏(CVE-2021-43818)، وتسريب بيانات الاعتماد في scrapy-splash ‏(CVE-2021-41124). ويقترب اثنان من الرقع الأربع من الإصلاحات الرسمية بشكل مثير للشك، لكن Endor ترجّح أنها حلول حقيقية وإن كانت متقاربة. ولا تزال تجربة مماثلة مع وكيل Cursor جارية.

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.