NVIDIA Vera Rubin — تعظيم الذكاء لكل دولار: العصر الجديد للتدريب اللاحق للذكاء الاصطناعي في عصر الذكاء الاصطناعي العاملي
منصة Vera Rubin من NVIDIA تتطلب ربع عدد وحدات معالجة الرسوم (GPU) التي تتطلبها Blackwell لأحمال عمل التدريب اللاحق (post-training) — وهذا هو المعيار الجديد لمقياس "الذكاء لكل دولار".
التحول إلى الذكاء الاصطناعي العاملي: لماذا أصبح التدريب اللاحق مستمراً
تخيل رياضيًّا محترفًا. ما يميز الأداء النخبة هو ما يحدث بين المباريات: التحسين المستمر، التكيف مع الخصوم الجدد، صقل المهارات بناءً على ما كشفته المباراة الأخيرة. الذكاء الاصطناعي العاملي (Agentic AI) يعمل بنفس الطريقة. لم يعد النموذج يكتفي بالإجابة على سؤال — بل يُعطى هدفًا ويجب أن يستمر في التكيف مع تغير البيئة وظهور الحالات الحدودية وتغير الأدوات من أسبوع لآخر.
هذا يغير جذريًا طريقة تفكيرنا في إعداد نماذج الذكاء الاصطناعي. التدريب اللاحق (post-training) — المرحلة التي تصقل النموذج بعد التدريب الأولي على البيانات الخام — لم يعد خطوة نهائية لمرة واحدة. إنه مستمر، لأن البيئة التي تعمل فيها النماذج العاملية تتطور باستمرار. الأدوات التي يستخدمها العامل يمكن أن تتغير من أسبوع لآخر. تظهر حالات حدية في الإنتاج لم تتوقعها أي مجموعة اختبار. كل نشر يجلب معه قاعدة بياناته وسياساته وبيئته الخاصة.
البصمة الحاسوبية تنمو ليس لأن أي تشغيلة فردية أكبر، بل لأن التشغيلات لا تتوقف أبدًا. هذا ما يجعل التدريب اللاحق عبء العمل المركزي للعصر العاملي — والمحرك الأساسي للذكاء لكل دولار.
ما هو التدريب اللاحق ولماذا هو مهم
التدريب اللاحق هو المكان الذي يُبنى فيه الذكاء. في التدريب المسبق (pre-training) يتعلم النموذج توقع الرمز التالي — وهذا يمنحه طلاقة في اللغة لكن ليس ذكاءً. التدريب اللاحق هو حيث يتعلم النموذج كتابة الكود، تخطيط مهمة متعددة الخطوات، استخدام أداة بحث، والتعافي عند حدوث خطأ.
الاستدلال (inference) هو ما يأتي بعد ذلك: النموذج يعمل على المهمة، مسعرًا بتكلفة لكل رمز (cost per token). لكن التدريب اللاحق يعمل بشكل مختلف. نظرًا لعدم وجود إجابة صحيحة للحفظ — فقط مكافأة — فإن النموذج يتعلم من خلال تقنيات التعلم المعزز (RL).
إليك كيفية عمل العملية: عند إعطاء النموذج مهمة، يكتب محاولة — الممر الأمامي (forward pass) (نفس العمل الذي كان سيفعله على رأس العمل). تُسجَّل المحاولة، ويحدّث الدرس أوزان النموذج — الممر الخلفي (backward pass). عبر ملايين المحاولات، ينمو الذكاء. كل خطوة مكثفة حسابيًا، وتشغيل هذه الحلقة على نطاق واسع هو مشكلة تنسيق: آلاف البيئات التي تولد مخرجات (rollouts) بالتوازي، والتحقق من المكافآت، والأوزان المحدَّثة التي تتدفق عائدًا إلى التدريب.
مكتبات NVIDIA مفتوحة المصدر NeMo — مثل NeMo Gym لبيئات التدريب وNeMo RL للتدريب اللاحق الموزع — تحول التدريب اللاحق من كود بحثي مخصص إلى بنية تحتية قابلة للتكرار بجودة إنتاجية.
الذكاء لكل دولار: توسيع تكلفة كل رمز
إذا كان الاستدلال هو محرك الإيرادات، فإن التدريب اللاحق هو المضاعف: كلما كان النموذج أكثر قدرة، زادت قيمة كل رمز يتم تقديمه. تكلفة كل رمز (cost per token) هي المقياس الرئيسي لمصنع الاستدلال — التكلفة الإجمالية لتوصيل مليون رمز.
الذكاء لكل دولار (intelligence per dollar) يقع على مستوى أعلى، ويجيب على سؤال مختلف: ما تكلفة بناء نموذج يستحق الخدمة — والحفاظ على قيمته مع تغير بيئته؟ هذان المقياسان متداخلان، وليسا متنافسين. البنية التحتية للذكاء الاصطناعي التي تخفض cost per token، تخفض أيضًا تكلفة كل نقطة ذكاء مبنية في النموذج. وكل نقطة ذكاء تُبنى ترفع قيمة كل رمز يخدمه مصنع الاستدلال.
بعبارة أخرى: cost per token يقيس العائد التشغيلي؛ intelligence per dollar يقيس ما إذا كان الاستثمار في ذكاء النموذج يؤتي ثماره. نظرًا لأن كل ممر أمامي في التدريب اللاحق هو في الأساس عمل استدلال — يُقاس بـ cost per token — فإن كل تحسين في كفاءة الاستدلال يتدفق مباشرة إلى معادلة الذكاء لكل دولار.
Vera Rubin: ربع عدد وحدات GPU، أقصى ذكاء
منصة Blackwell من NVIDIA خفضت بالفعل تكلفة التشغيل، مما جعل التدريب اللاحق المتكرر الذي يتطلبه العصر العاملي مجديًا اقتصاديًا. لكن Vera Rubin توسع هذا المسار بشكل كبير — فهي تدرب أكبر النماذج باستخدام ربع عدد وحدات GPU من جيل Blackwell.
تم تصميم Vera Rubin من البداية إلى النهاية لتعظيم الذكاء لكل دولار لعبء العمل العاملي للتدريب اللاحق: المزيد من المخرجات لكل تشغيل، والمزيد من البيئات المتزامنة، ودورات التدريب اللاحق التي لا تتوقف أبدًا. مكاسب الكفاءة هذه تعني أن المؤسسات يمكنها تحقيق نفس الذكاء — أو أكثر — باستثمار أقل بكثير في الأجهزة.
هذا مهم لأن cost per token و intelligence per dollar مرتبطان بإحكام. كل تخفيض في تكلفة الممر الأمامي (الاستدلال) يقلل مباشرة من تكلفة كل دورة تعلم في التدريب اللاحق، مما يحقق وفورات متراكمة عبر ملايين المحاولات.
Nemotron 3 Ultra: ذكاء بأوزان مفتوحة، نتائج قابلة للتحقق
Nemotron 3 Ultra من NVIDIA — نموذج بأوزان مفتوحة (open-weight) مكون من 550 مليار معلمة، مبني على هندسة خليط الخبراء (MoE) — يقدم معايير قابلة للتحقق ووصفة تدريب لاحق منشورة بالكامل تم تشغيلها على NeMo RL. لقد سجل 71.7% في SWE-bench verified، وهو معيار برمجة واقعي حيث أنتج إصلاحًا عمليًا لحوالي سبعة من كل عشرة أخطاء برمجية حقيقية من مشاريع مفتوحة المصدر، تم التحقق من كل منها مقابل مجموعة الاختبار الخاصة بالمشروع.
استخدم تشغيل التدريب اللاحق لـ Nemotron 3 Ultra حوالي 20 مليار رمز (token) من المخرجات، موسعًا من حوالي 1.2 مليون مخرجات من الجيل السابق Nemotron 3 Super، كل منها حوالي 10,000 رمز. والأهم، أن نسبة الذكاء لكل دولار بين المنصات مستقلة عن هذا الافتراض المحدد — القيم المطلقة تتوسع مع عدد الرموز، لكن الميزة النسبية لـ Vera Rubin على Blackwell تظل ثابتة.
النظام البيئي الكامل: NeMo و Dynamo والتبني الصناعي
منصة Vera Rubin هي جزء من نظام بيئي أوسع ومتكامل من NVIDIA للذكاء الاصطناعي العاملي:
- NeMo Gym و NeMo RL — مكتبات مفتوحة المصدر تحول التدريب اللاحق من كود بحثي مخصص إلى بنية تحتية قابلة للتكرار. NeMo Gym يدير بيئات التدريب؛ NeMo RL يدير التدريب اللاحق الموزع على نطاق واسع.
- NVIDIA Dynamo — تنسيق الاستدلال لتعظيم الإنتاجية وتقليل زمن الوصول في الإنتاج.
قادة الصناعة يستخدمون بالفعل هذا النظام البيئي:
- Prime Intellect — تقوم بالتدريب اللاحق المستمر للنماذج المفتوحة المتطورة على NVIDIA Blackwell وتخطط لتوسيع بيئات RL على Vera Rubin. تظهر معاييرهم المقارنة زيادة في الإنتاجية بنسبة 30% لكل وحدة معالجة مركزية (CPU) باستخدام معالجات NVIDIA Vera مقارنة بمعماريات x86 البديلة.
- Perplexity — تشغل مجموعة التدريب اللاحق RL الخاصة بها بشكل غير متزامن عبر مئات من وحدات GPU من NVIDIA، مع محرك نقل أوزان قائم على RDMA يقوم بمزامنة النماذج التي تحتوي على تريليون معلمة في أقل من ثانيتين بين عقد التدريب والاستدلال.
- Together AI — تقدم التدريب اللاحق كخدمة، بما في ذلك الضبط الدقيق الخاضع للإشراف و RL وتحسين التفضيل المباشر على منصة NVIDIA، مع خطط لتسخير Vera Rubin في المرحلة التالية.
مستقبل الذكاء المستمر
مع وصول Vera Rubin، تعيد NVIDIA تعريف كيفية قياس كفاءة استثمار الذكاء الاصطناعي. الذكاء لكل دولار يصبح المقياس المحدد لأي منصة يمكنها خدمة عصر الذكاء الاصطناعي العاملي بأفضل شكل — حيث لا تكتفي النماذج بالرد على المطالبات بل تخطط وتفكر وتستخدم الأدوات وتتعافى من الإخفاقات وتتحسن باستمرار.
مع انتقال نماذج الذكاء الاصطناعي من الأسئلة والأجوبة البسيطة إلى سلوك معقد ومتعدد الخطوات ومتكيف باستمرار، سيزداد دور التدريب اللاحق فقط. منصة NVIDIA Vera Rubin — إلى جانب مكتبات NeMo، ونموذج Nemotron 3 Ultra، ومنسق الاستدلال Dynamo — تخلق نظامًا متكاملًا من البداية إلى النهاية يعظم العائد الفكري على كل دولار مستثمر.
هذا هو العصر الجديد للبنية التحتية للذكاء الاصطناعي. السؤال لم يعد "كم عدد وحدات GPU التي أملكها؟" بل "كم ذكاءً أحصل عليه مقابل كل دولار؟"