
كيف خفّض وكيل AI تكاليف AI: تجربة ذاكرة تخزين مؤقت بـ6.53 مليون نداء
يصف تومسون نغوي كيف خفّض وكيل FinOps لديه، Tycho، الكلفة المتوقعة لمهمة تقييم واحدة من 6541 دولارا إلى نحو 600 دولار بعد إصلاح الذاكرة المؤقتة المحلية للتعليمات وإضافة خصم الدفعات. حجم العمل 6.53 مليون نداء.
وصف المطوّر تومسون نغوي تجربة خفّض فيها وكيل FinOps الخاص به، Tycho، الذي يعمل على Opus 5.5، الكلفة المتوقعة لمهمة تقييم واحدة من 6541 دولارا إلى نحو 600 دولار. حدث ذلك بعد أربعة أيام من توليه مسؤولية نفقات AI. شمل العمل نحو 6.53 مليون نداء، وكان كل نداء يرسل نحو 2800 رمز من تعليمات متطابقة.
الاختبار الأول: الذاكرة المؤقتة لا تعمل
كان Haiku الخيار الأصلي لهذه المهمة، لكن Tycho اختبر مسار DeepSeek. في الاختبار الأول أرسل أربعة طلبات ببادئة متطابقة، فأبلغت الأربعة عن صفر رموز مخزّنة. لم يحدث خطأ، لكن كل نداء كان يُحتسب بالسعر العادي. كان السبب في التوجيه: الذاكرة المؤقتة للتعليمات في Fireworks محلية على كل نسخة، لذلك لا يعاد استخدام السجل عندما يصل الطلب التالي إلى نسخة أخرى.
عدّل Tycho التوجيه لتعود الطلبات اللاحقة إلى النسخة نفسها، ثم أعاد الاختبار. في خمسة نداءات دافئة، جرى تخزين نحو 2812 من أصل 2960 رمز إدخال في كل نداء. وأبلغت دفعة من ثمانية طلبات عن 19688 رمزا مخزّنا من أصل 23677، وهي نتيجة تتوافق مع بادئة باردة واحدة وسبع إصابات دافئة. والأهم لهذه المهمة أن إعادة استخدام الذاكرة صمدت في مسار الدفعات خلال الاختبار الصغير.
ما حدث للفاتورة المتوقعة
ظهرت أربعة تقديرات للمهمة نفسها على DeepSeek: نداءات عادية بلا ذاكرة مؤقتة، 6541 دولارا؛ وضع الدفعات بلا ذاكرة مؤقتة، 3271 دولارا؛ نداءات عادية مع ذاكرة تعمل، 1105 دولارات؛ ووضع الدفعات مع ذاكرة تعمل، نحو 600 دولار. بقي النموذج وحجم العمل البالغ 6.53 مليون نداء كما هو في التقديرات الأربعة، وتغيّرت طريقة تقديم النداءات فقط.
خط Haiku البالغ نحو 2800 دولار يأتي من إعداد أقدم ذي معيار أطول، وهو نقطة مرجعية لا مقارنة رباعية مضبوطة. ويضيف المؤلف في ملاحظاته أن Haiku 4.5 كان نموذج التقييم الأصلي قبل انتقال الإنتاج إلى Gemini في يونيو، وأن اختبارا على 300 ذرّة سجّل نسبة إصابة 98.6%، وأن 43747 ذرّة قيّمها Haiku بلغت في المتوسط 0.000426 دولار للذرّة.
ما لا تقوله هذه الأرقام
يؤكد المؤلف صراحة أن المبالغ بالدولار هي تقديرات للمهمة كاملة مستخلصة من اختبارات صغيرة، وليست فاتورة منجزة مقابل 6.53 مليون نداء: فالمهمة لم تُشغّل ولم تُحتسب بهذا الحجم. والاختبار العملي الذي يوصي به قبل توسيع عمل يتكرر فيه التعليمات هو إرسال بادئات متطابقة، وفحص عدد الرموز المخزّنة، والتكرار مع تثبيت الجلسة، ثم اختبار مسار الدفعات على حدة. قائمة الأسعار تُظهر السعر الاسمي للرمز، أما هذه الاختبارات فتغيّر تقدير المهمة كاملة في كل خيار توجيه.
ويصف المؤلف النتيجة بقدر من السخرية: أُوكل إلى نموذج متقدم مكلف أمر معرفة أين يمكن للشركة أن تنفق أقل على AI. تقدّم Anthropic وOpenAI ذكاء متقدما، لكن الذكاء نفسه صار يُستخدم لمعرفة كيفية إنفاق مال أقل على هذه المختبرات ذاتها.
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.