طريقة GRAM من أنثروبيك: 'مفتاح إيقاف' للمعرفة ثنائية الاستخدام في نماذج AI
طورت Anthropic وAE Studio طريقة GRAM (الوحدات المساعدة الموجهة بالتدرج) — طريقة ثورية تمكن نماذج AI من تمكين أو تعطيل المعرفة الخطيرة (علم الفيروسات، الأمن السيبراني، الفيزياء النووية) داخل نموذج واحد.
المقدمة: مشكلة المعرفة ثنائية الاستخدام
مع تقدم الذكاء الاصطناعي، أصبح أحد أكبر التحديات التي تواجه شركات AI هو كيفية إدارة المعرفة التي تتراكمها نماذجها. نماذج AI الرائدة، مثل Claude من Anthropic، هي مستودعات هائلة للمعلومات. جزء كبير من هذه المعرفة هو ثنائي الاستخدام — يمكن استخدامه لأغراض مفيدة وضارة في نفس الوقت.
لماذا لا تكفي الأساليب الحالية؟
اليوم، تعتمد شركات AI بشكل أساسي على آليتين دفاعيتين: تدريب النماذج على رفض الطلبات الضارة (refusal training)، ونشر المصنفات التي تفحص المدخلات والمخرجات بحثًا عن محتوى خطير. مشكلتها الأساسية أنها لا تغير المعرفة المخزنة داخل النموذج الأساسي.
ما هو GRAM؟ — الوحدات المساعدة الموجهة بالتدرج
GRAM تعني Gradient-Routed Auxiliary Modules. الفكرة الأساسية وراء GRAM بسيطة بأناقة: تزويد النموذج بمقصورات مخصصة قابلة للإزالة لكل فئة من فئات المعرفة ثنائية الاستخدام، وتحديث تلك المقصورات فقط عندما يتعلم النموذج من بيانات ثنائية الاستخدام.
النتائج التجريبية
اختبرت Anthropic GRAM في ثلاثة سيناريوهات متزايدة الواقعية، بنتائج تظهر فعالية الطريقة وقابليتها للتوسع. على الأحجام من 50 مليون إلى 5 مليارات معلمة، تطابقت GRAM مع أداء ترشيح البيانات.
مقاومة الهجمات
الاختبار الأكثر أهمية لأي آلية أمان هو قدرتها على تحمل محاولات التحايل. اختبرت Anthropic ما إذا كان المهاجم يمكنه استعادة المعرفة المحذوفة عن طريق التدريب على كمية صغيرة من البيانات الضارة. قاومت GRAM ذلك بفعالية.
الخلاصة
تمثل طريقة GRAM من Anthropic خطوة مهمة إلى الأمام في أبحاث سلامة AI. توفر GRAM 'مفتاح إيقاف' للمعرفة الخطيرة — مما يمكننا من تسخير فوائد AI المتقدمة مع تقليل مخاطر سوء الاستخدام.