SiTech Team⏱️ 1 წთ. საკითხავი
NVIDIA ModelExpress — توزيع نماذج الذكاء الاصطناعي بسرعة الضوء عبر مجموعات وحدات معالجة الرسوميات

تقدم NVIDIA ModelExpress — نظام ينقل أوزان نماذج الذكاء الاصطناعي من GPU إلى GPU عبر P2P RDMA. وقت تشغيل DeepSeek-V4 Pro انخفض من 8 دقائق إلى 1:44.
NVIDIA ModelExpress — عصر جديد لتوزيع النماذج
مع ازدياد حجم نماذج الذكاء الاصطناعي، يصبح توزيع أوزانها بكفاءة أكثر أهمية. تقدم NVIDIA ModelExpress (MX) — نظاماً جديداً يغير جذرياً طريقة توزيع أوزان نماذج الذكاء الاصطناعي على مجموعات وحدات معالجة الرسوميات. الفكرة الأساسية بسيطة: قبل تحميل النموذج، اسأل أولاً أين توجد نسخة متوافقة منه بالفعل.
كيف يعمل ModelExpress
عندما يحمل نظير خدمة بالفعل أوزاناً متوافقة في GPU، ينقلها MX مباشرة من GPU إلى GPU عبر P2P RDMA باستخدام NVIDIA Inference Xfer Library. MX نقل أوزان DeepSeek-V4 Pro وذاكرة التخزين المؤقت JIT من نسخة خدمة إلى أخرى في أقل من 10 ثوانٍ، مقارنة بـ 8 دقائق بدون النظام.