
GPT-6 Sol مقابل Claude Opus 5.5: الرخص يفيد فقط حين تتكرر النتائج نفسها
اختبر The New Stack نموذجي GPT-6 Sol من OpenAI وClaude Opus 5.5 من Anthropic في ثلاثة اختبارات تطويرية صعبة، خمس مرات لكل منها. جاء Sol أرخص بنحو ستة أضعاف، لكنه أخطأ في ثلاث محاولات من أصل 15، بينما كان Opus 5.5 مثالياً في جميعها.
أطلقت OpenAI نموذج GPT-6 Sol في 22 سبتمبر 2026، وأعلنت أنه يتفوق على Claude Opus 5 في مهام سير العمل بنسبة 9% من كلفة المهمة الواحدة: 33,2% في اختبار AutomationBench من Zapier مقابل 26,9% لـ Opus 5. وفي اليوم نفسه أطلقت Anthropic نموذج Claude Opus 5.5، فاختبرت الصحافية Jessica Wachtel من The New Stack هذا النموذج الأحدث.
بحسب أسعار القائمة، يكلف Sol دولارين لكل مليون رمز إدخال و10 دولارات لكل مليون رمز إخراج، أي نصف سعر GPT-5.6 Sol؛ أما Opus 5.5 فيكلف 4 و20 دولاراً. لذلك حتى لو استهلك Sol رموزاً أكثر، فقد يبقى أرخص.
ثلاثة اختبارات، خمس محاولات لكل منها
انتهت الجولة الأولى بالتعادل: أصلح النموذجان ثلاثة أخطاء مزروعة في خدمة فواتير مكتوبة بـ Python، وصنّفا 40 مهمة CI فاشلة، وأجابا عن 20 سؤالاً حول SDK وهمي من دون اختراع أي دالة. كما انتهت النسخ الأصعب، تقرير عطل من 3,664 سطراً وتنفيذ مواصفة قيّمتها 120 اختباراً خفياً، بالتعادل أيضاً. لم يفصل بينهما سوى المحاولات المتكررة.
استُدعي النموذجان عبر API برسائل متطابقة وبأعلى مستوى جهد لكل منهما، خمس مرات لكل اختبار. في تصنيف CI يقرر النموذج لكل مهمة من 40 مهمة فاشلة: إعادة المحاولة أم الحجب أم استدعاء المناوب؛ وتغطي سجلات العطل 3,664 سطراً من خمس خدمات وسبعة أسئلة؛ أما مواصفة المحلّل فتطلب كتابة محلل تبعيات من مواصفة من صفحتين من دون تشغيل أي كود.
ماذا تقول الأرقام
في تصنيف CI، وهو الأقرب إلى ادعاء OpenAI، نجح النموذجان خمس مرات من خمس. بلغ متوسط Opus 5.5 دقيقة و27 ثانية و11,127 رمز إخراج و0,24 دولار للمحاولة؛ أما Sol فبلغ 18 ثانية و1,143 رمزاً و0,02 دولار، أي 8% من الكلفة، وهو ما يقارب نسبة 9% التي تعلنها OpenAI.
غيّرت سجلات العطل الصورة: كان Opus 5.5 مثالياً في المحاولات الخمس، وSol في اثنتين فقط. فوّت Sol مرتين العميل نفسه، الذي تأكد دفعه بعد 52 ثانية من نجاح إعادة المحاولة، وأحصى مرة واحدة 27 عملية دفع فاشلة بدل 28. بلغ متوسط Opus 5.5 ست دقائق و44 ثانية و53,308 رمز إخراج و1,68 دولار للمحاولة؛ ومتوسط Sol دقيقة و41 ثانية و7,073 رمزاً و0,30 دولار، وقرأ السجل نفسه برموز إدخال أقل بنسبة 25%.
في مواصفة المحلّل نجح Opus 5.5 في كل المحاولات، وSol في أربع من خمس: قوس إغلاق زائد في السطر 78 أسقط الملف عند الاستيراد وأفشل الاختبارات الـ120 كلها. بلغ متوسط Opus 5.5 تسع دقائق و40 ثانية و70,687 رمز إخراج و1,42 دولار؛ ومتوسط Sol ست دقائق و28 ثانية و21,435 رمزاً و0,22 دولار.
أرخص، لكن ليس دائماً صحيحاً
من أصل 15 محاولة كان Opus 5.5 مثالياً في كل مرة، بينما كان Sol مثالياً في 12. وكلفت محاولات Sol الـ15 ما مجموعه 2,68 دولار، أي نحو 16% من 16,72 دولاراً لـ Opus 5.5. وتقسم Wachtel الاستخدام بحسب كلفة الخطأ: يصلح Sol للأعمال كثيفة الحجم التي يراجع ناتجها إنسان أو مجموعة اختبارات، وبهذه الأسعار يمكن تشغيله مرتين والمقارنة بين النتيجتين؛ أما Opus 5.5 فيلزم حين تكون الإجابة الخاطئة مكلفة ولا يراجعها أحد. أخطاء Sol تمر من دون ملاحظة: عميل سقط من قائمة الاسترداد، أو ملف لا يُستورد.
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.