العودة
MiMo-V2.5-Pro-UltraSpeed: نموذج بتريليون معامل يتجاوز 1000 رمز في الثانية
SiTech AI Team3 წთ. საკითხავი

MiMo-V2.5-Pro-UltraSpeed: نموذج بتريليون معامل يتجاوز 1000 رمز في الثانية

أطلقت Xiaomi وTileRT نموذج MiMo-V2.5-Pro-UltraSpeed الذي يولّد أكثر من 1000 رمز في الثانية على نموذج بتريليون معامل. الوصول بالطلب من 9 إلى 23 يونيو بثلاثة أضعاف سعر MiMo-V2.5-Pro.

أطلقت فرقة MiMo في Xiaomi نموذج MiMo-V2.5-Pro-UltraSpeed، وهي تهيئة بُنيت بالتعاون مع شركة الأنظمة TileRT وتتجاوز، وفق ما تقوله الفرقة، سرعة 1000 رمز في الثانية أثناء التوليد على نموذج بتريليون معامل للمرة الأولى.

نافذة محدودة وسعر خاص

الوصول ليس مفتوحًا بل يعتمد على تقديم طلب. ويُطرح الـAPI بسعر ترويجي محدود المدة: ثلاثة أضعاف تكلفة MiMo-V2.5-Pro مقابل سرعة توليد تبلغ نحو عشرة أضعاف، وهو ما تصفه الشركة بـ«سعر مضاعف ثلاثًا وتجربة إخراج مضاعفة عشرًا». يسري العرض من 9 إلى 23 يونيو 2026 حتى الساعة 23:59 بتوقيت بكين (08:59 بتوقيت المحيط الهادئ)، وهو مخصص لواجهة API فقط: خطة Token Plan غير مدعومة.

تُقدَّم الطلبات عبر platform.xiaomimimo.com/ultraspeed. عدد المقاعد محدود، وتقديم الطلب لا يضمن الموافقة، وتُمنح الأولوية للمؤسسات والمطورين المحترفين. كما يحصل المستخدمون المعتمدون على وصول مجاني إلى Chat خلال الأسبوعين عبر ultraspeed.xiaomimimo.com: يمكن لكل حساب الدخول إلى قائمة الانتظار حتى عشر مرات يوميًا، وتُحدَّد الجلسة بثلاثين دقيقة، وتُحرَّر الجلسة تلقائيًا إذا بقيت خاملة أكثر من خمس دقائق.

من أين تأتي السرعة

الأمر ليس بنية جديدة، بل جهد تصميم مشترك بين فريق النموذج ونظام الاستدلال لدى TileRT. وتلاحظ Xiaomi أن السرعات القصوى المماثلة في القطاع تعتمد عادةً على عتاد متخصص — تكامل wafer-scale من Cerebras أو معمارية SRAM على الشريحة من Groq — بينما تحقق هذه النتيجة على وحدات GPU عادية: أكثر من 1000 رمز في الثانية من نموذج بتريليون معامل على عقدة قياسية واحدة بثماني وحدات GPU.

ويحمل قراران على جانب النموذج معظم العبء. إذ يُطبَّق تكميم FP4 ‏(MXFP4) على خبراء MoE فقط، وهم من يضمون معظم المعاملات ويتحملون التكميم بأفضل شكل، مع تدريب يراعي التكميم، فيما تحتفظ بقية أجزاء النموذج بدقتها الأصلية. أما فك التشفير التخميني DFlash فيتوقع كتلة كاملة من الرموز المقنّعة في تمريرة واحدة بدل الصياغة التوليدية التسلسلية؛ ويستخدم نموذج الصياغة انتباه النافذة المنزلقة، مع تحديد حجم الكتلة بثمانية لإبقاء التحقق رخيصًا.

طول القبول المقيس والأوزان المفتوحة

بلغ طول القبول — عدد رموز الصياغة التي يؤكدها النموذج الكبير في كل جولة تحقق — 6.30 في سيناريوهات البرمجة (بحد أقصى 7.14)، و5.56 في الرياضيات والاستدلال، و4.29 في مهام الوكلاء. وتقول الفرقة إن النسبة ما زالت منخفضة في المحادثة المفتوحة وإن العمل على ذلك مستمر.

وعلى جانب النظام يضيف TileRT نواة محرك دائمة تُبقي خط الحوسبة مقيمًا على وحدة GPU بدل إطلاق المشغلات واحدًا تلو الآخر، إضافة إلى تخصص warp يوزّع الاتصال ونقل البيانات وحسابات التنسورات على مجموعات الخيوط. ونُشرت نقطة الحفظ الناتجة MiMo-V2.5-Pro-FP4-DFlash مفتوحة المصدر على Hugging Face، فيما يُنتظر أن تكون دعم UltraSpeed لـMiMo-V2.5 الخطوة التالية.

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.