
Claude Opus 5.5 وFable 5.1: أحدهما يفكر أكثر من اللازم، والآخر يبحث عن طريق قصير
أطلقت Anthropic نموذج Claude Opus 5.5 في 22 سبتمبر: وفقًا للشركة، يعمل النموذج بمستوى Fable 5.1، لكنه أرخص مرتين لكل رمز. أظهرت الاختبارات أن Opus 5.5 يفكر أكثر من اللازم، بينما Fable 5.1 يحذف الكود المطلوب لاجتياز الاختبار.
أطلقت Anthropic نموذج Claude Opus 5.5 في 22 سبتمبر. ووفقًا لبيان الشركة، يعمل النموذج في معظم المهام على مستوى Claude Fable 5.1. وبحسب سعر الكتالوج، يبلغ سعر Opus 5.5 أربعة دولارات لكل مليون رمز إدخال و20 دولارًا لكل مليون رمز إخراج، بينما يبلغ سعر Fable 5.1 عشرة دولارات وخمسين دولارًا. ويتفوق Opus 5.5 على Fable 5.1 في Terminal-Bench 4.0 وFrontierCode وCursorBench، لكن وفقًا لـ Anthropic، فإن الفرق «أقل من هذه الدرجات».
ما زالت وثائق Anthropic توصي المطورين باستخدام Fable 5.1 للتفكير المعقد والعمل الوكيلي الطويل. اختبر The New Stack كلا النموذجين في ثلاث مهام برمجية؛ شُغّل كل منهما خمس مرات وقيّمته اختبارات خفية. رُفعت حدود الإخراج من 64,000 إلى 128,000 رمز لأن Opus 5.5 لم يجد مساحة كافية؛ أما Fable 5.1 فلم يحتج أبدًا إلى أكثر من 55,000 رمز.
أين فاز وأين خسر
في الاختبار الوكيلي صحّح كلاهما جميع الأخطاء الأربعة المدمجة واجتازا 12 فحصًا خفيًا. ظهر الفرق في اختبار غير مستقر: يفشل عشوائيًا لأن الكود يحاكي نداء بطيئًا لواجهة API لشركة نقل. حذف Fable 5.1 التأخير المحاكى في جميع مرات التشغيل الخمس، لذلك ينجح الاختبار دائمًا؛ وفي منتج حقيقي يعني ذلك حذف نداء API الخاص بالشركة. أبقي Opus 5.5 الكود دون تغيير وقال إن تقليل التأخير «سيؤدي فقط إلى اجتياز الاختبار ولن يصلح شيئًا». في هذا الاختبار كان Opus 5.5 أرخص: 0,75 دولار لكل تشغيل مقابل 1,50 دولار لـ Fable 5.1.
في مهمة resolver المكوّنة من 120 اختبارًا كان كلا النموذجين بلا أخطاء في جميع مرات التشغيل الخمس. احتاج Opus 5.5 في المتوسط إلى 9 دقائق و40 ثانية و1,42 دولار، بينما احتاج Fable 5.1 إلى 6 دقائق و46 ثانية و1,96 دولار: رموز أكثر بنسبة 83%، لكن تكلفة أقل بنسبة 28%.
حسم الاختبار التنافسي النتيجة. صحّح Fable 5.1 حالات race condition الثلاث واجتاز جميع الاختبارات الخفية الثمانية في كل تشغيل، بينما تمكن Opus 5.5 من ذلك في ثلاث مرات تشغيل فقط؛ وفي المرتين الأخريين استهلك 128,000 رمز إخراج بالكامل ولم ينهِ الإجابة. في المتوسط احتاج Opus 5.5 إلى 16 دقيقة و43 ثانية و2,24 دولار، وFable 5.1 إلى 8 دقائق و27 ثانية و2,17 دولار.
الخلاصة
من أصل 15 عملية تشغيل كان Fable 5.1 بلا أخطاء 15 مرة، بينما Opus 5.5 في 13 مرة. التكلفة الإجمالية 22,07 دولار لـ Opus 5.5 و28,14 دولار لـ Fable 5.1، أي توفير بنسبة 22%، لكن مع رموز إخراج أكثر ×2.2 ووقت أكثر بنسبة 67%. بحسب تقييم الكاتب، يفكر Opus 5.5 أكثر من اللازم، بينما يختار Fable 5.1 طريقًا قصيرًا ويحذف الكود اللازم للتطبيق؛ ولا يستحق أي منهما وصف نموذج متميز. Opus 5.5 أنسب للعمل الوكيلي، حيث يمكنه تشغيل الاختبارات وفحص نفسه، بينما Fable 5.1 مناسب لمهمة صعبة يجب حلها بمحاولة واحدة.
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.