חזרה
MiMo-V2.5-Pro-UltraSpeed: מודל 1T עם יותר מ-1000 טוקנים לשנייה
SiTech AI Team2 წთ. საკითხავი

MiMo-V2.5-Pro-UltraSpeed: מודל 1T עם יותר מ-1000 טוקנים לשנייה

Xiaomi ו-TileRT השיקו את MiMo-V2.5-Pro-UltraSpeed, שמפיק יותר מ-1000 טוקנים לשנייה ממודל בעל טריליון פרמטרים. הגישה בהגשת בקשה בין 9 ל-23 ביוני, במחיר כפול שלושה.

צוות MiMo של Xiaomi השיק את MiMo-V2.5-Pro-UltraSpeed — תצורה שנבנתה יחד עם חברת המערכות TileRT ואשר, לדברי הצוות, שוברת לראשונה את מהירות 1000 טוקנים לשנייה בייצור על מודל בעל טריליון פרמטרים.

חלון מוגבל ומחיר

הגישה ניתנת בהגשת בקשה ולא באופן פתוח. ה-API מוצע במחיר מבצע לזמן מוגבל: פי שלושה מהמחיר של MiMo-V2.5-Pro תמורת מהירות ייצור גבוהה פי עשרה בערך — בחברה מתארים זאת כ"מחיר פי 3, חוויית פלט פי 10". ההצעה תקפה מ-9 ביוני עד 23 ביוני 2026 עד 23:59 לפי שעון בייג'ינג (08:59 PDT), והיא מיועדת ל-API בלבד: מסלול Token Plan אינו נתמך.

בקשות מוגשות בכתובת platform.xiaomimimo.com/ultraspeed. מספר המקומות מוגבל, הגשה אינה מבטיחה אישור, ועדיפות ניתנת לארגונים ולמפתחים מקצועיים. משתמשים מאושרים מקבלים גם גישה חינם ל-Chat במהלך השבועיים בכתובת ultraspeed.xiaomimimo.com: כל חשבון יכול להיכנס לתור עד עשר פעמים ביום, כל הפעלה מוגבלת ל-30 דקות, והפעלה שאינה פעילה יותר מחמש דקות משתחררת אוטומטית.

מאין מגיעה המהירות

לא מדובר בארכיטקטורה חדשה אלא בעבודת תכנון משותפת של צוות המודל עם מערכת ההסקה של TileRT. ב-Xiaomi מציינים שמהירויות קיצוניות דומות בתעשייה נשענות בדרך כלל על חומרה ייעודית — אינטגרציית wafer-scale של Cerebras או ארכיטקטורת SRAM על השבב של Groq — ואילו התוצאה הזו הושגה על כרטיסי GPU רגילים: יותר מ-1000 טוקנים לשנייה ממודל 1T על צומת סטנדרטי אחד עם שמונה כרטיסים.

שני מהלכים בצד המודל נושאים ברוב הנטל. כימות FP4 ‏(MXFP4) מיושם רק על מומחי ה-MoE, שמחזיקים ברוב הפרמטרים וסובלים כימות טוב ביותר, תוך אימון מודע-כימות, בעוד שאר המודל שומר על הדיוק המקורי. דקודינג ספקולטיבי DFlash חוזה בלוק שלם של טוקנים מוסתרים במעבר קדימה אחד במקום טיוטה אוטורגרסיבית; מודל הטיוטה משתמש בקשב חלון מחליק, וגודל הבלוק מוגבל לשמונה כדי לשמור על בדיקה זולה.

אורך קבלה מדוד ומשקולות פתוחות

אורך הקבלה — כמה טוקני טיוטה מאשר המודל הגדול בכל סבב אימות — עומד על 6.30 בתרחישי קוד (עד 7.14), 5.56 במתמטיקה ובחשיבה ו-4.29 במשימות סוכנים. לדברי הצוות, בשיחה חופשית הנתון עוד נמוך והעבודה על כך נמשכת.

בצד המערכת תורם TileRT ליבת מנוע מתמדת ששומרת את צינור החישוב על ה-GPU במקום להשיק אופרטורים אחד-אחד, וכן התמחות warp שמפצלת תקשורת, תנועת נתונים וחישובי טנזורים בין קבוצות תהליכונים. נקודת השמירה שנוצרה, MiMo-V2.5-Pro-FP4-DFlash, פורסמה בקוד פתוח ב-Hugging Face, ותמיכת UltraSpeed ב-MiMo-V2.5 מתוכננת לשלב הבא.

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.