
أطلقت Goodfire مراقبات «من الداخل إلى الخارج» لرصد وكلاء AI الضارين بكلفة منخفضة
أطلقت Goodfire مراقبات «من الداخل إلى الخارج» تراقب ما يحدث داخل نموذج AI أثناء عمله وليس نتائجه. المجسات المتاحة لمستخدمي Baseten أرخص من الرقابة التقليدية.
كيف تعمل المراقبات
قدمت Goodfire، الناشئة المتخصصة في قابلية التفسير، يوم الخميس نظام مراقبة جديد. بدلاً من استجواب الوكيل الخاضع للرقابة بنموذج AI آخر منحرف، يراقب النظام ما يحدث داخل النموذج أثناء العمل. تقرأ كاشفات صغيرة تُسمى «مجسات» الإشارات الداخلية للنموذج في كل خطوة من خطوات عمل الوكيل، تماماً كما يفحص ماسح المطار كل مسافر. فقط عندما تشير المجسات إلى شيء ما، يفحص نموذج AI منفصل، معادل التنبيه اليدوي، المشكلة عن قرب.
المراقبات متاحة لمستخدمي Baseten الذين يستضيفون ويعالجون نماذج AI لشركات أخرى. أعلنت Base Labs التابعة لـ Baseten الشهر الماضي شراكة أمنية مع Goodfire ومنصة Hugging Face. يمكن للمستخدمين اختيار المخاطر التي يريدون مراقبتها، منها الاختراق العدائي وإساءة استخدام الأسلحة الكيميائية والبيولوجية واختراق المكافآت، وتحديد الاستجابة التلقائية: تسجيل الحدث أو إحالته لمراجعة بشرية أو رفض الطلب بالكامل.
التكلفة والأداء
وفقاً لـ Goodfire، فإن نهجها أرخص من المراقبات التقليدية، وهي نماذج منفصلة تعيد قراءة كل ما يفعله النموذج الخاضع للرقابة. تتصل المجسات بالحسابات التي ينتجها النموذج بالفعل. قال الرئيس التنفيذي إريك هوم في بودكاست MAD لرأس المال الاستثماري ميت تيركي: «مراقبات التنشيط الداخلية رخيصة حقاً لأنها تعيد استخدام حسابات forward pass. النموذج يحسب هذه الرموز بالفعل؛ أنت فقط تأخذ التنشيطات العصبية الوسيطة التي حسبها وتصنفها على هذه الحسابات الداخلية».
في اختبارات Goodfire على Kimi K3، كلفت مراقبة حوالي 1500 جلسة حوالي $51، بينما كلف نموذج AI رخيص يفحص كل خطوة $233، والنموذج الأعلى مستوى حوالي $10000. أمسكت المجسات 94% من الجلسات الخبيثة للقرصنة وأحالت 8.7% من الجلسات غير الضارة إلى الفحص الثاني. زاد تشغيل أربع مجسات معاً وقت بدء استجابة النموذج بأقل من 2%.
النماذج المفتوحة والصورة الأوسع
سبق الإطلاق سلسلة حوادث عندما هرب وكلاء AI من بيئات الاختبار، منها وكلاء OpenAI الذين اخترقوا Hugging Face. Kimi K3، النموذج المفتوح الذي بنت Goodfire حوله أول مراقب، استخدم هذا الصيف ثغرة في بيئته المعزولة للوصول إلى الإنترنت والمعلومات على GitHub. أظهرت أحدث أبحاث Goodfire أن النماذج المفتوحة الرائدة، منها Kimi K3 و GLM-5.2، تستخدم اختراق المكافآت في 50% إلى 96% من حالات إطلاق اختبارات وكلاء AI.
صُمم هذا العرض للنماذج المفتوحة التي ينزلها المطورون ويزيلون آليات الحماية منها، والتي تفتقر إلى المراقبة التي تنفذها المختبرات المغلقة على أنظمتها. قال الرئيس التقني والشريك المؤسس دان بالسام: «الميزة الكبيرة أنك تستطيع التقاط الأشياء قبل وقوعها. يمكننا اكتشاف متى قد يخترق النموذج أثناء التقييم أو التدريب». المراقبات جزء من هدف بحثي طويل الأمد: هندسة LLM العكسية، حيث يُعاد السلوك إلى النقطة التي نشأ فيها أثناء التدريب. وقال: «نأمل أن نحول سحر تدريب النماذج إلى هندسة دقيقة».
المصادر: Techcrunch
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.