חזרה
איך סוכן AI חסך בעלויות AI: ניסוי מטמון ב-6.53 מיליון קריאות
SiTech AI Team2 წთ. საკითხავი

איך סוכן AI חסך בעלויות AI: ניסוי מטמון ב-6.53 מיליון קריאות

תומסון נגוי מתאר כיצד סוכן ה-FinOps שלו, Tycho, הוריד את העלות הצפויה של משימת ניקוד אחת מ-6,541 דולר לכ-600 דולר בזכות תיקון המטמון המקומי של הפרומפט והוספת הנחת אצווה. היקף העבודה: 6.53 מיליון קריאות.

המפתח תומסון נגוי תיאר ניסוי שבו סוכן ה-FinOps שלו, Tycho, שרץ על Opus 5.5, הוריד את העלות הצפויה של משימת ניקוד אחת מ-6,541 דולר לכ-600 דולר. זה קרה ארבעה ימים אחרי שהסוכן מונה לתפקיד ניהול הוצאות ה-AI. העבודה כללה כ-6.53 מיליון קריאות, וכל אחת מהן שלחה כ-2,800 טוקנים של אותה הנחיית פרומפט.

הבדיקה הראשונה: המטמון לא עבד

המודל שנבחר במקור למשימה היה Haiku, אך Tycho בחן מסלול דרך DeepSeek. בבדיקה הראשונה הוא שלח ארבע בקשות עם קידומת זהה, וכל הארבע דיווחו על אפס טוקנים במטמון. לא הייתה שגיאה, פשוט כל קריאה חויבה במחיר הרגיל. הסיבה הייתה בניתוב: המטמון של Fireworks פועל באופן מקומי בכל עותק, ולכן חזרה על אותן הנחיות לא מנצלת רשומת מטמון כשהבקשה הבאה נוחתת על עותק אחר.

Tycho שינה את הניתוב כך שבקשות עוקבות חזרו לאותו עותק, והריץ את הבדיקה שוב. בחמש קריאות חמות, כ-2,812 מתוך כ-2,960 טוקני קלט בכל קריאה נמצאו במטמון. אצווה של שמונה בקשות דיווחה על 19,688 טוקנים במטמון מתוך 23,677, תוצאה שמתאימה לקידומת קרה אחת ושבע פגיעות חמות. עבור המשימה הזאת חשוב במיוחד שהשימוש החוזר במטמון שרד גם במסלול האצווה.

מה קרה לחשבון הצפוי

לאותה משימת ניקוד ב-DeepSeek נוצרו ארבע הערכות: קריאות רגילות בלי מטמון, 6,541 דולר; מצב אצווה בלי מטמון, 3,271 דולר; קריאות רגילות עם מטמון עובד, 1,105 דולר; ומצב אצווה עם מטמון עובד, כ-600 דולר. המודל והיקף של 6.53 מיליון קריאות נשארו זהים בכל ארבע ההערכות, ורק אופן הגשת הקריאות השתנה.

קו ה-Haiku, כ-2,800 דולר, מגיע מהגדרה קודמת עם רובריקה ארוכה יותר והוא נקודת ייחוס ולא השוואה מבוקרת בין ארבע אפשרויות. בהערותיו מוסיף המחבר ש-Haiku 4.5 היה מודל הניקוד המקורי עד שהפרודקשן עבר ל-Gemini ביוני, שבדיקה על 300 אטומים רשמה 98.6% פגיעות מטמון, ושה-43,747 אטומים שנוקדו ב-Haiku עמדו בממוצע על 0.000426 דולר לאטום.

מה המספרים האלה לא אומרים

המחבר מבהיר במפורש שהסכומים בדולרים הם הערכה לכל המשימה, שנגזרה מבדיקות קטנות, ולא חשבונית שהוצאה על 6.53 מיליון קריאות שהושלמו: העבודה לא הורצה ולא חויבה בהיקף כזה. המסקנה המעשית היא בדיקה שכדאי להריץ לפני הרחבת עומס עם פרומפטים חוזרים: לשלוח קידומות זהות, לבדוק את מספר הטוקנים שבמטמון, לחזור על כך עם הצמדה לסשן, ואז לבחון בנפרד את מסלול האצווה. מחירון מראה את תעריף הטוקנים הנומינלי, והבדיקות האלה משנות את התחזית לכל המשימה.

המחבר גם מתאר את התוצאה באירוניה: מודל יקר נשלח לבדוק היכן החברה יכולה להוציא פחות על AI. Anthropic ו-OpenAI מציעות בינה פרונטירית, אבל אותה בינה בדיוק משמשת כיום כדי להבין איך להוציא פחות כסף על אותן מעבדות.

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.