
Artificial Analysis تطلق تحالف Cyber Index Alliance مع Collinear وIBM وNVIDIA وVercel
أعلنت Artificial Analysis في 25 سبتمبر 2026 عن إطلاق تحالف Cyber Index Alliance إلى جانب مؤشر Artificial Analysis Cyber Index، الذي يقيس أداء نماذج الذكاء الاصطناعي في مهام الدفاع السيبراني للمؤسسات.
أعلنت شركة Artificial Analysis في 25 سبتمبر 2026 عن إطلاق تحالف Cyber Index Alliance إلى جانب مؤشر Artificial Analysis Cyber Index، وهو مجموعة اختبارات تقيس مدى جودة أداء نماذج الذكاء الاصطناعي في مهام الدفاع السيبراني داخل المؤسسات. وتضم قائمة الشركاء عند الإطلاق كلاً من Collinear AI وIBM وNVIDIA وVercel.
الشركاء ومساهمة كل منهم
قدّمت Collinear AI، مطوّرة اختبار CWE-bench، اختبارها كتقييم خاص مغلق، وفعلت Vercel الأمر نفسه مع DeepsecBench. أما IBM وNVIDIA فانضمتا بخبرة في تحديد نطاق المؤشر ومنهجيته لا بمجموعات بيانات جديدة. ووفقاً لـ Artificial Analysis، يساعد الشركاء في وضع معيار موحّد لتقييم النماذج في الدفاع السيبراني، ويمكنهم تقديم مجموعات بيانات وأبحاث خارجية. ويمكن للمؤسسات الراغبة في الانضمام التواصل عبر البريد الإلكتروني.
كيف يعمل المؤشر
يجمع المؤشر ثلاثة تقييمات تغطي دورة الدفاع كاملة: اكتشاف الثغرات في الشيفرة، وإعادة إنتاجها والتحقق منها، ثم إصلاحها دون الإضرار بالوظائف القائمة. يعتمد CWE-Bench-AA على 120 مهمة مغلقة تغطي فئات OWASP Top 10 (2025) العشر جميعها وست لغات، من C/C++ وGo إلى Python وRust. ويفصل DeepsecBench-AA مرحلة الاكتشاف: إذ تُقارن نتائج الوكيل في شيفرة تطبيقات مفتوحة المصدر بمجموعة مرجعية تحقّق منها خبراء بشريون. أما CyberGym-E2E-AA فيستند إلى 131 مهمة من مجموعة Berkeley RDI المكوّنة من 920 مهمة، ويستهدف أخطاء سلامة الذاكرة في مشاريع C/C++ مثل FFmpeg وCPython.
تعمل التقييمات الثلاثة على Stirrup، بيئة الوكلاء مفتوحة المصدر الخاصة بالشركة. يعمل النموذج على الشيفرة المصدرية كما يفعل مهندس أمن يراجع تطبيقاً، ولا يُطلب من أي نموذج بناء استغلال فعّال، إذ يقع تحقيق الاستغلال خارج نطاق مؤشر موجّه للدفاع. وتُسجَّل عمليات الرفض لأسباب أمنية منفصلة عن الدرجات.
النتائج الأولى
عند الإطلاق يحلّ أفضل نموذج 56% من مهام المؤشر، ويتصدر Grok 4.7 (xhigh) الترتيب المدمج. وفي CWE-Bench-AA يبلغ المتصدر 68%، وفي CyberGym-E2E-AA يصل إلى 79%. أما في DeepsecBench-AA فأعلى نتيجة F2 هي 46%، ولا يكتشف أقوى نموذج سوى 41% من الثغرات التي تحقق منها الخبراء.
تتركز الإخفاقات في أنماط محددة. وباستثناء الرفض وانتهاء الوقت، أصلحت 55% من المحاولات الفاشلة في CWE-Bench-AA المشكلة الأساسية لكنها تركت مشكلة مرتبطة مفتوحة، بينما تشكّل الإصلاحات المفرطة التي تكسر السلوك المشروع نحو 24% من الإخفاقات. وفي CyberGym-E2E-AA بلغت 42% من المحاولات حدّ التسعين دقيقة دون إنتاج مدخل يُسقط البرنامج، ورفضت ستة نماذج رائدة، بينها GPT-6 Sol وGPT-6 Astra وClaude Opus 5.5، ما لا يقل عن 98% من المهام.
الخطط المقبلة
أُطلق المؤشر بثلاثة تقييمات دون انتظار تغطية كاملة، وتتضمن الخطط إضافة الاستجابة للحوادث، وكتابة شيفرة جديدة دون إدخال ثغرات، وأهداف بلا وصول إلى الشيفرة المصدرية مثل البرمجيات المُصرّفة والخوادم العاملة.
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.