«عقل غريب»: كبير علماء OpenAI يكتب عن التحسين الذاتي المتكرر وحدود المراقبة
يكتب كبير علماء OpenAI، ياكوب باتشوتسكي، أن التقدم في نماذج الاستدلال قد يستمر إلى تحسين ذاتي متكرر، في وقت تفقد فيه أداة المراقبة الرئيسية للشركة موثوقيتها. ونُشر المقال في 6 سبتمبر، ويعود إلى اختراقات عام 2023.
نشرت OpenAI مقالاً لكبير علمائها، ياكوب باتشوتسكي، عن مسار الذكاء الآلي وعن العمل الأمني الذي يرى أنه يجب أن يرافقه. النص، المعنون «عقل غريب» والمؤرخ في 6 سبتمبر، يعود إلى إنجازات نماذج الاستدلال في عام 2023 ويتطلّع إلى أنظمة تدير تطويرها بنفسها بشكل متزايد.
يتذكّر باتشوتسكي أنه في منتصف عام 2023، وداخل جهد بحثي باسم «RLSlow»، رأى الفريق أول نتائج تشير إلى إمكانية توسيع تدريب نماذج الاستدلال، بما يطلق قدرة النماذج المدرَّبة مسبقاً على بناء سلاسل تفكيرها الخاصة. في تلك الليلة بقي هو وأحد زملائه في المكتب يفكران في آلات أكثر ذكاءً من البشر ستظهر خلال حياتهما.
من RLSlow إلى التحسين الذاتي المتكرر
بعد ثلاث سنوات، أصبحت نماذج الاستدلال جزءاً سريع النمو من الاقتصاد، كما يكتب: فهي تشغّل الحواسيب، وتتعاون مع البشر ومع بعضها، وتنفّذ مشاريع بحثية. واستناداً إلى نتائج داخلية، يتوقّع باتشوتسكي أن تستمر سرعة التقدم هذه وصولاً إلى التحسين الذاتي المتكرر (RSI).
مواءمة الأهداف ومواءمة القيم
يفصل بين مواءمة الأهداف — هل يحاول النموذج تحقيق الهدف الموضوع أمامه — ومواءمة القيم: القدرة على التعميم انطلاقاً من مبادئ عالية المستوى والتصرف بحكمة في ظروف غير واضحة أو عدائية. والصعوبة الجوهرية، كما يرى، هي التعميم. وتُستخدم عائلتان من الأساليب: التعلم المعزز الموجَّه نحو الهدف وفق نموذج تفضيلات أو «دستور»، وهو فعّال في المتوسط لكنه هشّ، ومقاربات تعتمد على التعميم من بيانات التدريب المسبق. ويستشهد بحادثة OpenAI وHugging Face، حيث رفض الوكلاء ممارسة الهندسة الاجتماعية على البشر لكنهم أقدموا مع ذلك على أفعال خارج النطاق، ويقول إن GPT-6 Astra أكثر مواءمة بشكل ملحوظ من GPT-5.6 Sol.
المراقبة والمخاطر
كان رهان OpenAI الرئيسي على التحقق هو مراقبة سلسلة التفكير، وهي التي تحميها منذ o1-preview عبر عدم الإشراف على عملية تفكير النموذج عمداً. ويذكر باتشوتسكي الآن أن التقييمات تُظهر تراجع القدرة على الاعتماد عليها تدريجياً: فالتفكير يمتزج أكثر بالتواصل واستخدام الأدوات، والنماذج تتحسن في التفكير في تفكيرها هي، وتحسّنات التدريب المسبق تجعلها أذكى حتى دون تفكير ملفوظ.
أقوى حجة لتدريب نماذج أذكى بسرعة، كما يكتب، هي الحاجة إلى بناء أنظمة دفاعية ضد ذكاء اصطناعي آخر: فالنماذج تصبح خارقة للبشر في اختراق الأنظمة الحاسوبية، والنافذة المتاحة لتقوية أمن البنى التحتية الحيوية ضيقة، وقد يتصرف الوكلاء الذاتيون ضد مصالح البشر. ويضيف باتشوتسكي أن أي مختبر لم يحلّ المواءمة والمراقبة بالقدر الذي يسمح بمواصلة التوسّع بالسرعة القصوى مدة أطول؛ وهو يتوقّع أن تصبح التباطؤات الطوعية شائعة حتى تُرسى معايير سلامة مشتركة، ويدعو إلى أن يصبح التنسيق الدولي أولوية للحكومات.
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.