
Fireworks AI משיקה את Ember-1: איכות Kimi K3 במספר טוקנים קטן ב-40%
Fireworks Research השיקה את Ember-1, מודל מתמחה שנבנה על בסיס Kimi K3. לדברי החברה, הוא שומר על איכות המודל הבסיסי תוך שימוש בפחות טוקנים, בערך ב-40% פחות ממה שנדרש קודם.
חברת Fireworks AI השיקה את Ember-1, מודל מתמחה שפיתחה צוות Fireworks Research מעל Kimi K3. בהודעה שפורסמה ב-23 בספטמבר 2026 נמסר כי Ember-1 מספק את איכות התשובות של Kimi K3 עם 40% פחות טוקנים: המודל למד לוותר על חשיבה שאינה משפיעה על התשובה הסופית.
למה מודלי חשיבה נעשים יקרים
לפי החברה, מודלי חשיבה כמו Kimi K3 מבזבזים את רוב הטוקנים שהם מייצרים, לעיתים יותר מ-90%, על חשיבה פנימית ולא על התשובה עצמה. במשימות סוכנים מרובות-שלבים המצב מחמיר: כל שלב מחזיר את החשיבה הקודמת לתוך ההקשר, כך שההקשר גדל בערך בריבוע עם מספר השלבים. הנמכת רמת החשיבה של Kimi K3 לא פתרה את הבעיה, מפני שהגדרות נמוכות ויתרו על יותר מדי איכות. לכן המודל נדרש ללמוד לחשוב ביעילות רבה יותר: הצוות ביצע יותר מ-50 ניסויי אימון ויותר מ-200 הערכות, ופיתח אלגוריתמים חדשים שמקצרים את החשיבה בלי לפגוע בדיוק.
בנצ'מרקים וחזית פארטו
בשבעה בנצ'מרקים ובתעבורת הייצור של שני לקוחות מצאה Fireworks שאפשר לקצר את החשיבה של Kimi K3 ב-35-50% בלי לפגוע בדיוק. ב-Bedside Bench של Doximity, בנצ'מרק בן 500 מקרים קליניים ב-10 קטגוריות שאושר בידי רופאים, קבע Ember-1 חזית פארטו חדשה לפי עלות למשימה, בין מודלים פתוחים וסגורים כאחד, ובהם GPT-5.6 Sol, GPT-6 Astra ו-Claude Opus 5.

בבנצ'מרקים הבודדים התוצאות צמודות. Terminal Bench 2.1: 82.0% לעומת 80.9%. DeepSWE 1.1: 75.2% לעומת 66.4%. SWE-bench Verified: 92.2% לעומת 93.2%. SWE-Interact: 20.0% לעומת 21.3%. לפי Fireworks, Ember-1 גובר גם על Kimi K3 בהגדרת חשיבה נמוכה.

מבחני A/B, שימוש פנימי והמשך
שני לקוחות ערכו מבחני A/B חיים על עומסי קידוד בייצור וראו ירידה של כ-35% בטוקנים למשימה באיכות דומה. במבחן אחד עלה הציון הממוצע של המשימה מ-0.751 ל-0.753, בעוד טוקני הפלט ירדו מ-49.3 אלף ל-29.9 אלף: ירידה של 71.3% בטוקני חשיבה ו-39% בסך הכול. מדדי השלמה וכשל נשמרו או השתפרו, ואחד הלקוחות כבר מריץ את Ember-1 בייצור ומתכנן להחליף לחלוטין את המודל הבסיסי.
Fireworks גם העבירה את המפתחים שלה ל-Ember-1 לפני שהציגה אותו ללקוחות, ומתארת את התוצאה כ״אין חדשות״: המהנדסים לא שמו לב לשינוי. המודל מושק כאפשרות שירות לצד מודל הבסיס Kimi K3, בתצוגה מחקרית ב-Serverless. במקביל מושקת תמיכה באימון לארגונים שרוצים לבנות על הנתונים שלהם מודל מותאם וחסכוני בטוקנים.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.