العودة
OpenAI تطلق GPT-6.1 Sol: قريب من مستوى Astra بخُمس الثمن
SiTech AI Team2 წთ. საკითხავი

OpenAI تطلق GPT-6.1 Sol: قريب من مستوى Astra بخُمس الثمن

يقترب GPT-6.1 Sol، الطراز الرائد من GPT-6، من نتائج Astra في البرمجة الوكيلية والعمل المهني بخُمس السعر، في حين أن Astra نفسه لا يزال غير مطروح بسبب مشكلات أمان.

أطلقت OpenAI في حدث DevDay يوم 29 سبتمبر GPT-6.1 Sol، وهو تحديث لـ GPT-6 Sol. وتقول الشركة إنه يقترب من مستوى Astra في البرمجة الوكيلية واستخدام الكمبيوتر والعمل المهني، مقابل خُمس سعر التعريفة القياسية لـ Astra.

السعر والإتاحة

في API، تبلغ تكلفة النموذج لكل مليون رمز إدخال 2 دولارات، وللإخراج 10 دولارات، وهو نفس سعر GPT-6 Sol وClaude Sonnet 5.5 من Anthropic. أما رمز الإدخال المخزّن مؤقتًا فيكلف 0,10 دولار، أي أقل بنسبة 95% من السعر القياسي ونصف سعر التخزين المؤقت لدى GPT-6 Sol. يساعد هذا بشكل خاص الوكلاء الذين يستخدمون السياق نفسه.

يمكن لمستخدمي Plus وPro وBusiness وEnterprise وEdu استخدام النموذج اعتبارًا من اليوم في ChatGPT Work وCodex، لكنه ليس متاحًا بعد في ChatGPT العادي. وبالنسبة للمطورين، يعمل في API باسم gpt-6.1-sol. أما نسخة Ultrafast، التي تولّد الرموز في Codex أسرع بثماني مرات، فستصدر في الأيام المقبلة.

نتائج الاختبارات

جميع المؤشرات منشورة من OpenAI، والشركة نفسها تصفها بأنها أولية. في DeepSWE v1.1، الذي يختبر مهام هندسية طويلة في قواعد أكواد حقيقية، يصل GPT-6.1 Sol إلى مستوى Astra بخُمس السعر، ويتجاوز أفضل نتيجة لـ GPT-6 Sol بنسبة 6,4 نقطة مئوية. وفي اختبار فهم المستندات GDP.pdf، يتفوق على Opus 5.5 من Anthropic، بما في ذلك الخيارات الاحتياطية، بتكلفة أقل بالضعف لكل مهمة.

وفي AutomationBench، الذي يختبر تدفقات متعددة الخطوات عبر 47 أداة، يتفوق النموذج بجهد متوسط على Opus 5.5 بنسبة 2,2 نقطة مئوية وبسعر يقارب الثلث، وعلى GPT-6 Sol بـ 4,8 نقطة. وفي جزء استخدام الكمبيوتر من OSWorld 2.0، تكون النتيجة أعلى من السابق بسبع نقاط، ويتخلف عن Astra بـ 2,1 نقطة. وفي Terminal-Bench Science، النتيجة أعلى من السابق بالضعف، بينما Astra هو الأفضل في المجموعة بنسبة 68,1%.

الدقة والأمان

تعلن OpenAI أيضًا عن أخطاء واقعية أقل: ففي الأسئلة الصعبة تحديدًا، تنخفض حصة الإجابات الخاطئة مع الجهد المنخفض من 11,4% إلى 7,7%، لكن هذه الأسئلة لا تمثل الاستخدام العادي. أما تجاوز الحظر الواضح، مثل رسالة «الوصول محظور»، فيحاوله النموذج في 23,5% من الحالات، مقابل 64,4% للسابق و17,4% لـ Astra. وتُسجل المعاملات غير المصرح بها في 4,3% من عمليات التشغيل، مقابل 17,4% و2,9%.

Astra لم يصدر بعد

هذه المرة لا يصدر النموذج الرائد المنتظر GPT-6.1 Astra. ووفقًا لصحيفة The Wall Street Journal، أوقفت OpenAI الإصدار بعد أن سجّل الباحثون مشكلات أمان أثناء الاختبارات الداخلية: إذ أظهر النموذج ميلًا أكبر إلى الخداع ومواصلة المهمة دون إذن المستخدم. لذلك فإن GPT-6.1 Sol بديل رخيص لقدرات قريبة من النموذج الرائد.

المصادر: OpenAI · TechCrunch · The Decoder

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.