חזרה
Ember-1 ו-Kimi K3: תוצאות כמעט זהות, מהירות גבוהה פי 3.4
SiTech AI Team3 წთ. საკითხავი

Ember-1 ו-Kimi K3: תוצאות כמעט זהות, מהירות גבוהה פי 3.4

Fireworks Research הציגה ב-23 בספטמבר את Ember-1, שנבנה על בסיס Kimi K3. בבדיקות עצמאיות שתי המודלים הראו דיוק כמעט זהה, ו-Ember-1 התברר כמהיר פי 3.4.

Fireworks Research הציגה ב-23 בספטמבר את המודל Ember-1 כגרסת מחקר, שנבנה על המודל Kimi K3 עם משקלים פתוחים של Moonshot. לפי החברה, המודל החדש משיג את האיכות של Kimi K3 עם כ-40% פחות token. “הוא למד לצמצם שיקול מיותר תוך שמירה על החשיבה הנדרשת”, מציינת Fireworks Research. token-ים של שיקול מחויבים לפי תעריף output, ולכן פחות חשיבה זול יותר.

ב-OpenRouter מחיר Ember-1 הוא 3 דולר למיליון input token, ו-15 דולר ל-output token. Fireworks דורשת אותו דבר גם עבור Kimi K3, אך ספקים אחרים מוכרים את Kimi ב-1 דולר למיליון input token וב-9 דולר ל-output token.

איך נערכו הבדיקות

הפרסום The New Stack הריץ את שני המודלים דרך OpenRouter, עם אותן בקשות ופרמטרים ברירת מחדל, וכדי להשוות באופן הוגן הפנה את שניהם ל-Fireworks. כל בדיקה בוצעה חמש פעמים, ו-token-ים של שיקול נרשמו בנפרד משאר ה-output.

שלושה סוגי משימות הלכו והסתבכו: חידות לוגיות עם 4, 5 ו-7 מהנדסים; לוח זמנים להרצה עם 12 שירותים, תלויות, שני חלונות “blackout” ותוכנית אופטימלית של 17 שעות; וחמש שאלות הסתברות על מערכת בקשות חוזרות, שבהן התשובות הן שברים מדויקים. התשובות אומתו בשתי שיטות עצמאיות.

תוצאות

בחידות לוגיות שני המודלים פתרו נכון את כל שלוש המשימות בכל חמש ההרצות. Ember-1 נדרש בממוצע ל-13,630 token-ים של שיקול, 3 דקות ו-46 שניות ו-0.27 דולר, ואילו Kimi K3 נדרש ל-16,679 token, 12 דקות ו-26 שניות ו-0.34 דולר. זה 18% פחות token-ים של שיקול. ההרצה האיטית ביותר של Kimi K3 נמשכה כמעט 20 דקות.

בלוח הזמנים להרצה שניהם מצאו תוכנית של 17 שעות, וכל התוכניות עברו בדיקת אימות. Ember-1 נדרש ל-6,543 token ול-1 דקה ו-29 שניות, Kimi K3 נדרש ל-7,792 token ול-4 דקות ו-46 שניות. בבדיקת ההסתברות נרשמה שגיאה אחת בלבד: Kimi K3 נתן את כל התשובות נכון בכל חמש ההרצות, ואילו Ember-1 רק בארבע. בהרצה החמישית הוא עשה שגיאה אריתמטית קטנה, כתב 0.94619 במקום 0.94629, והפגם הזה עבר גם לשתי תשובות אחרות.

בסך הכול Kimi K3 ביצע 15 מתוך 15 הרצות ללא שגיאות, Ember-1 ביצע 14 מתוך 15. לפי התעריפים של Fireworks העלות הכוללת של הבדיקות עבור Ember-1 הייתה 2.48 דולר, עבור Kimi K3 הייתה 3.26 דולר, כלומר Ember-1 זול בכ-24%. עם זאת, המחיר של Kimi K3 תלוי בספק: בתעריף המינימלי אותן בדיקות היו עולות 1.96 דולר, פחות מאשר עבור Ember-1.

מה זה אומר בפועל

בחומרי השיווק לא הופיעה העובדה ש-Ember-1 ביצע כל מערך בדיקות פי 3.4 מהר יותר מ-Kimi K3, ובסך הכול הוציא 23% פחות token-ים של שיקול. לפי מסקנת המחבר, מבחינת דיוק שני המודלים באותה רמה. מי שצריך תוצאה כמעט זהה במהירות מקסימלית, Ember-1 עדיף; מי שהמחיר הוא העיקר, Kimi K3 שהופנה לספק זול יוצא זול יותר.

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.