العودة
Ember-1 و Kimi K3: نتائج شبه متطابقة وسرعة أعلى بـ3,4 مرات
SiTech AI Team3 წთ. საკითხავი

Ember-1 و Kimi K3: نتائج شبه متطابقة وسرعة أعلى بـ3,4 مرات

قدمت Fireworks Research في 23 سبتمبر نموذج Ember-1 المبني على Kimi K3. في اختبارات مستقلة أظهر كلا النموذجين دقة شبه متطابقة، بينما كان Ember-1 أسرع بـ3,4 مرات.

قدمت Fireworks Research في 23 سبتمبر، كإصدار بحثي، نموذج Ember-1 المبني على نموذج Kimi K3 مفتوح الأوزان من Moonshot. وتزعم الشركة أن النموذج الجديد يبلغ جودة Kimi K3 باستخدام token أقل بنحو 40%. وقالت Fireworks Research: «لقد تعلم تقليل التفكير الزائد مع الحفاظ على التفكير اللازم». تُحتسب tokenات التفكير وفق تسعيرة output، لذا فإن التفكير الأقل أرخص.

على OpenRouter، سعر Ember-1 هو 3 دولارات لكل مليون input token و15 دولارًا لكل output token. وتطلب Fireworks الشيء نفسه مقابل Kimi K3، لكن مزودين آخرين يبيعون Kimi بمليون input token مقابل دولار واحد وoutput token مقابل 9 دولارات.

كيف أُجري الاختبار

أطلقت مجلة The New Stack كلا النموذجين عبر OpenRouter، بطلبات متطابقة وإعدادات افتراضية، وأعادت توجيه كليهما إلى Fireworks لمقارنة عادلة. نُفذ كل اختبار خمس مرات، وسُجلت tokenات التفكير منفصلة عن باقي output.

كانت ثلاثة أنواع من المهام تزداد صعوبة تدريجيًا: ألغاز منطقية بـ4 و5 و7 مهندسين؛ وجدول تشغيل بـ12 خدمة، وتبعيات، ونافذتي «blackout»، وخطة مثالية مدتها 17 ساعة؛ وخمسة أسئلة احتمالات على نظام طلبات متكررة، حيث تكون الإجابات كسورًا دقيقة. تحققت الإجابات بطريقتين مستقلتين.

النتائج

في الألغاز المنطقية، حل كلا النموذجين المهام الثلاث جميعها بشكل صحيح في كل مرات التشغيل الخمس. احتاج Ember-1 في المتوسط إلى 13 630 token تفكير و3 دقائق و46 ثانية و0,27 دولار، بينما احتاج Kimi K3 إلى 16 679 token و12 دقيقة و26 ثانية و0,34 دولار. هذا أقل بنسبة 18% في tokenات التفكير. استغرق أبطأ تشغيل لـKimi K3 نحو 20 دقيقة.

في جدول التشغيل، وجد كلاهما خطة مدتها 17 ساعة، واجتازت كل الخطط اختبار التحقق. احتاج Ember-1 إلى 6 543 token و1 دقيقة و29 ثانية، بينما احتاج Kimi K3 إلى 7 792 token و4 دقائق و46 ثانية. في اختبار الاحتمالات سُجل الخطأ الوحيد: أعطى Kimi K3 جميع الإجابات الصحيحة في مرات التشغيل الخمس كلها، بينما أعطاها Ember-1 في أربع فقط. وفي الخامسة ارتكب خطأً حسابيًا صغيرًا، فكتب 0,94619 بدل 0,94629، وانتقل هذا الخلل إلى إجابتين أخريين.

إجمالًا، نفذ Kimi K3 15 من 15 عملية تشغيل دون أخطاء، بينما نفذ Ember-1 14 من 15. وفق تسعيرات Fireworks، كانت التكلفة الإجمالية للاختبارات 2,48 دولار لـEmber-1 و3,26 دولار لـKimi K3، أي أن Ember-1 أرخص بنحو 24%. لكن سعر Kimi K3 يعتمد على المزود: بأدنى تسعيرة، كانت الاختبارات نفسها ستكلف 1,96 دولار، أي أقل من Ember-1.

ماذا يعني هذا عمليًا

في المواد التسويقية لم يرد أن Ember-1 كان ينفذ كل مجموعة اختبارات أسرع من Kimi K3 بـ3,4 مرات، بينما كان يستهلك إجمالًا tokenات تفكير أقل بنسبة 23%. ووفق استنتاج الكاتب، فإن النموذجين على المستوى نفسه من الدقة. من يحتاج إلى نتائج شبه متطابقة بأقصى سرعة، فإن Ember-1 أفضل؛ ومن كانت التكلفة أهم لديه، فإن Kimi K3 الموجّه إلى مزود أرخص يصبح أقل تكلفة.

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.