
الحوسبة السرية من NVIDIA تحافظ على 96% من إنتاجية استدلال الذكاء الاصطناعي على Blackwell
وفق مدونة NVIDIA التقنية، حافظ TensorRT LLM مع تشغيل الحوسبة السرية على 96.1-98.2% من إنتاجية رموز الخرج على ثماني معالجات Blackwell B200، وتشرح الشركة الافتراضات التي اضطرت للتغير.
نشرت NVIDIA تحليلاً تقنياً يشرح كيف تؤثر الحوسبة السرية (confidential computing) في استدلال نماذج اللغة الكبيرة، وكيف جرى تكييف إطار TensorRT LLM لتحافظ التشغيلية المشفّرة على معالجات Blackwell على معظم سرعتها.

الذاكرة المشفّرة تغيّر افتراضات التشغيل
تشغّل الحوسبة السرية أحمال العمل داخل أجهزة افتراضية بذاكرة مشفّرة، ومعالجات رسوميات سرية ووصلات NVLink مشفّرة. لكن التشغيل الآمن يغيّر افتراضات زمن تشغيل الاستدلال حول نقل البيانات في الذاكرة، وقياس الزمن، والجدولة، والاتصال بين عدة معالجات، وتلك التغييرات تكلف أداءً إذا لم يتكيّف الإطار.
لإظهار هذه الكلفة اختار الفريق سياق إدخال طويل وتوليداً ممتداً وتزامناً منخفضاً: نموذج DeepSeek-R1-0528-NVFP4 عبر واجهة PyTorch في TensorRT LLM، مع 32 ألف رمز إدخال وألف رمز خرج، وتزامن من 1 إلى 16 طلباً، وTP=8 وذاكرة KV من نوع FP8.
الحفاظ على 96% من الإنتاجية
لم تتغير سوى حالة الحوسبة السرية، فيما بقي النموذج والعتاد وإصدارات البرمجيات وأطوال التسلسلات والتوازي ومستوى التزامن ثابتة. تكونت منصة الاختبار من نظام NVIDIA DGX B200 واحد بثماني معالجات B200، وIntel TDX، وCUDA 13.2، وNCCL 2.30، وTensorRT LLM 1.3.0rc22.
وعند مستويات التزامن من 1 إلى 16، حافظ التشغيل السري على 96.1-98.2% من إنتاجية رموز الخرج، فيما بقي متوسط الزمن لكل رمز خرج داخل نطاق 1.2% إلى 4.3% من خط الأساس.

ثلاثة مواضع تكيّف فيها الإطار
تمر عمليات النقل من المضيف إلى الجهاز عبر مخزن وسيط مشفّر برمجياً، لأن المعالج الرسومي لا يصل مباشرة إلى ذاكرة الأجهزة الافتراضية المحمية. لذلك تفقد الذاكرة المثبّتة ميزتها غير المتزامنة، وقد تحجب بعض النسخ الخيط المستدعي؛ فيختار TensorRT LLM أنواع الذاكرة مع مراعاة الحوسبة السرية وينقل قراءة الرموز المتكررة إلى عامل غير متزامن (PR #11573).
يقارن مُعاير النوى التكتيكات عبر أحداث CUDA، لكن إشارة التوقيت تحت الحوسبة السرية كانت غير مستقرة؛ فأصبح يقيس عبر %globaltimer في المعالج الرسومي (PR #11657). ولا يتوفر البث المتعدد NVLink SHARP في تهيئات B200 السرية، لذا ينبغي للإطارات كشف توفر NVLS واختيار خوارزميات مناسبة.
قِس حملك الخاص
توصية NVIDIA هي التعامل مع إعداد الأمان وتحسين الاستدلال كمسألة نشر واحدة: تشغيل الحوسبة السرية، وإجراء تصديق للبيئة، ومقارنة التشغيل السري وغير السري على الحمل نفسه الذي تنوي تقديمه.
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.