
إضافة 272K في GPT-6 Astra ترفع تكلفة الطلب بأكمله لا التجاوز فقط
يحسب OpenAI في GPT-6 Astra الطلبات التي تتجاوز 272 000 رمز دخل بتعريفة دخل مضاعفة بالكامل وخرج أعلى 1.5 مرة، ما يرفع تجاوز 5 000 رمز في استدعاء واحد نحو 3 دولارات.
حد 272K
أطلق OpenAI نموذج GPT-6 Astra في 3 سبتمبر 2026، ثم وسّع توزيعه تدريجيًا في الأيام التالية على خطط ChatGPT وAPI وAWS Bedrock. يملك النموذج نافذة سياق نحو 1,05 مليون رمز، واستخدامًا أفضل للأدوات، والتزامًا أدق بالتعليمات؛ والسعر 10 دولارات لكل مليون رمز دخل، و50 دولارًا لكل مليون رمز خرج، ودولارًا واحدًا لكل مليون رمز دخل مخزّن مؤقتًا للقراءة. تغيّر القاعدة المدفونة في وثائق الأسعار الرياضة: الطلبات التي يتجاوز فيها موجّه الدخل 272 000 رمز تُحسب على الطلب بأكمله بتعريفة دخل مضاعفة وتعريفة مخزن مؤقت، وبالإضافة إلى ذلك بتعريفة خرج أعلى 1.5 مرة، لا على الجزء المتجاوز فقط.
الرياضيات
270 000 رمز دخل و10 000 رمز خرج بالتعريفات القياسية تكلف 3,20 دولارًا. إذا زدت الدخل إلى 275 000 رمز، يصبح سعر الطلب نفسه 6,25 دولارًا. إضافة 5 000 رمز ترفع الحساب 3,05 دولارات، لأن كل رمز موجود قبل الحد يُعاد احتسابه بأثر رجعي. إذا تجاوز 5% من 10 000 طلب في اليوم الحد، تضيف الزيادة نحو 1 500 دولار يوميًا، وأكثر من نصف مليون دولار سنويًا، وذلك بسبب موجّهات وُضعت في فئة غير صحيحة بالكامل.
لماذا يبقى خارج رؤية القياس
ثلاثة عوامل تجعل ملاحظة هذا الحد في الإنتاج صعبة. عدد الرموز غير معروف حتى يُحوَّل الموجّه إلى رموز، بينما يتفاوت التقدير بعدد الأحرف من 10% إلى 20% حسب المحتوى. يعيد استجابة API حقول usage القياسية دون إشعار بالزيادة في الوقت الموثق، لذلك يجب على الفرق أن تقارن رموز الدخل بـ272 000 لكل طلب في خط مقاييسها الخاص. ولأن الزيادة تمس الطلب كله، فإن موجّهًا بـ275 000 رمز يكلف تقريبًا مثل موجّه بـ500 000 رمز، بينما موجّه بـ270 000 رمز يكلف نحو نصف سعر موجّه بـ275 000 رمز. أكثر الأعباء حساسية هي خطوط RAG ذات السياق الطويل، وأثر الوكيل الذي يجمع استدعاءات الأدوات وإعادة المحاولات، ومراجعة الشيفرة في فروق كبيرة.
الاكتشاف والدفاع
الحل الموصى به هو ميزانية رموز واقية: قبل الإرسال، احسب رموز الموجّه بـtiktoken بحد أمان أقل من 272 000، وقسّم الحمولة إذا تجاوزت رموز الدخل في p95 مقدار 260 000، لالتقاط الاقتراب من الحد مسبقًا. بالنسبة لخطوط RAG، ضع المقاطع المقروءة في ميزانية الرموز لا على عدد top-K ثابت. بالنسبة للوكلاء، قلّص سجل الرسائل فور تجاوزه نحو 200 000 رمز. وفي الحقيقة، بالنسبة للأعباء الطويلة جدًا، يظل تخزين الموجّه مؤقتًا فوق الحد يحتفظ بتعريفة أرخص 10 مرات، بينما تُخفض تعريفات batch أو flex بنسبة 50% للأعمال المتسامحة مع زمن الاستجابة. وضع Fast، الذي يعادل ضعف التعريفات القياسية، يضيف الزيادة أيضًا ولا يجب استخدامه معه.
المصادر: Hackernoon
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.