العودة
Claude Opus 5.5 مقابل Opus 5 في مهام الاستدلال: أرخص وأسرع لكن ليس أفضل
SiTech AI Team3 წთ. საკითხავი

Claude Opus 5.5 مقابل Opus 5 في مهام الاستدلال: أرخص وأسرع لكن ليس أفضل

تقول Anthropic إن Claude Opus 5.5 أرخص بنسبة 40% وأسرع بنسبة 30% من Opus 5. اختبر The New Stack النموذجين في ثلاث مسائل استدلالية: التوفير تحقق فعلا، أما وعد السرعة فلم يتحقق، وكانت الإجابات متطابقة تماما.

قارنت The New Stack بين نموذجي Anthropic، وهما Claude Opus 5.5 و-Claude Opus 5، في ثلاث مسائل استدلال صعبة. النتيجة واضحة: النموذج الجديد أرخص وأسرع، لكنه ليس أذكى. حل الاثنان مسألتين كاملتين، وفشل الاثنان في المسألة الثالثة.

ما الذي تعد به Anthropic

تقول الشركة إن Opus 5.5 يكلف 40% أقل من Opus 5 في أحمال العمل المعتادة، وينتج النص بسرعة تزيد على 30%، كما يفترض أن يصل في قدراته إلى مستوى Claude Fable 5.1، أي أن يتجاوز النموذج السابق. وانخفض سعر الواجهة البرمجية أيضا: أربعة دولارات لكل مليون رمز في الإدخال وعشرون دولارا لكل مليون رمز في الإخراج، مقابل خمسة وعشرين دولارا في Opus 5. ويمثل خفض السعر وحده توفيرا بنسبة 20%، أما الباقي فعلى النموذج أن يحققه باستهلاك عدد أقل من الرموز.

شبكة المنطق: الإجابات نفسها بتكلفة أقل

استُدعي النموذجان عبر واجهة Anthropic البرمجية بالطلبات نفسها، في وضع التفكير التكيفي عند مستوى الجهد الافتراضي، إذ لا يسمح Opus 5.5 بإيقاف التفكير. وفي شبكة منطقية تضم سبعة مهندسين و22 دليلا، أكمل الاثنان الخلايا الثمانية والعشرين كلها بشكل صحيح. احتاج Opus 5.5 إلى 65 ثانية و7,573 رمزا في الإخراج و0.16 دولار، بينما احتاج Opus 5 إلى 108 ثوان و10,621 رمزا و0.27 دولار، أي أن النموذج الجديد أرخص بنسبة 43% مقابل الإجابة نفسها.

لعبة الحجارة: النتيجة نفسها برموز أقل بكثير

في لعبة الحجارة القائمة على الذاكرة أجاب النموذجان إجابات صحيحة على المسائل الثلاث. يخسر اللاعب الأول انطلاقا من 200 حجر، والأحجام من 120 إلى 500 أحجام خاسرة، وأصغر حجم خاسر يتجاوز 340 هو 344. وظهر الفرق في حجم التفكير: أنهى Opus 5.5 المهمة في 215 ثانية باستخدام 28,740 رمزا وبكلفة 0.58 دولار، بينما احتاج Opus 5 إلى 624 ثانية و74,981 رمزا و1.88 دولار. وهذا يعني رموزا أقل بنسبة 62% وتكلفة أقل بنسبة 69% مقابل الإجابة نفسها.

المسألة التي لم يحلها أي نموذج

لم يجب أي من النموذجين عن مسألة إعادة ترتيب مهام النشر، التي تكون إجاباتها الصحيحة 27 و1,695 و159,019. ومع حد إخراج يبلغ 48,000 رمز، أنفق الاثنان الميزانية كلها على التفكير ولم يردا إطلاقا. وبعد رفع الحد إلى 128,000 رمز، استهلك Opus 5 كل الرموز وعمل أكثر من 25 دقيقة وتوقف بلا إجابة. أما Opus 5.5 فتوقف عند 112,733 رمزا بعد 19 دقيقة، لكن الواجهة البرمجية أنهت الرد بسبب توقف من نوع رفض ومن دون نص. ولا يحتوي الطلب على أي محتوى حساس، لذلك يعتبر الكاتب ذلك خطأ من مرشح الأمان في Anthropic.

ماذا يعني ذلك عمليا

استهلك Opus 5.5 خلال الاختبار كله 1,701 رمز في الإدخال و197,046 رمزا في الإخراج، بينما استهلك Opus 5 ما مجموعه 1,693 و261,602. وبلغت التكلفة 3.95 دولار مقابل 6.55 دولار، في حين بلغ إجمالي الإنفاق على الاختبار 10.50 دولار. وسجلت سرعة الكتابة 103.4 رمز في الثانية مقابل 93.1، أي أسرع بنحو 11% فحسب، وهو أقل من نسبة 30% التي تعلنها الشركة. والتوصية واضحة: من يستخدم Opus 5 اليوم سيحصل مع Opus 5.5 على النتائج نفسها بمال أقل وانتظار أقل. ومع ذلك يجب وضع حد صارم لرموز الإخراج، لأن النموذجين قادران على التفكير لعشرين دقيقة أو أكثر ثم العودة بلا شيء، والأفضل في مسائل العد منح النموذج أداة لتنفيذ الكود.

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.