
לפי נתוני OpenRouter, סוכני AI מובילים יותר בשימוש בטוקנים
לפי נתוני OpenRouter שפורסמו על ידי a16z, באוגוסט סוכנים השתמשו ב-7.3 טריליון טוקנים לעומת 1.4 טריליון של בני אדם; פרומפטים מטמונים וביקוש לזיכרון מעוותים הערכת עלויות.
סוכנים שולטים בנפח הטוקנים ב-OpenRouter
סוכני AI ייצרו באוגוסט 7.3 טריליון טוקנים ב-OpenRouter, לעומת 1.4 טריליון של משתמשים אנושיים, לפי תרשים של Andreessen Horowitz המבוסס על נתוני OpenRouter. דניאל ניומן, מנכ"ל Futurum Group, ציין מספרים אלה שישה חודשים לאחר מכן, כאשר שימוש הסוכנים עקף לראשונה את זה של בני אדם.
פיטר ווקר, ראש אסטרטגיית התוכן ב-OpenRouter, הראה בתרשים שמאז צלקת פברואר, שימוש הסוכנים בטוקנים גדל פי 14, בעוד שלבני אדם גדל פי 2.8. קטגוריה מעורבת גדלה פי 4.7 באותה תקופה, לפי ניתוח המקור. מכיוון שקטגוריה זו עשויה לכלול הן התנהגות של סוכן והן של בן אדם, גודל העדיפות של הסוכנים עשוי להשתנות.
OpenRouter מקצה לכל מפתח API קטגוריה של סוכנית, מעורבת או אנושית באמצעות ציון משוקלל מורכב המבוסס על שבעה אותות. הסיווג לוקח בחשבון גורמים כמו תדירות קריאות לכלים, מספר צעדים ומרווחי זמן.
מגמה חזקה, אך לא מדד מלא של השוק
מדדי OpenRouter מודדים נפח טוקנים ולא עלויות, וכוללים רק פלטפורמה אחת. המגמה לא הייתה עקבית לחלוטין: באפריל וביולי נרשמה ירידה, וקיומה של תעבורה מעורבת מעוות ישירות השוואות.
סקר State of AI לשנת 2026 של McKinsey הראה כי 40% מהנשאלים בארגונים גדולים דיווחו על הרחבת סוכני AI, לעומת 27% בשנה שעברה. ניומן כתב כי כיום סוכנים משתמשים ב-AI פי חמש יותר מבני אדם וחזה שיחס זה יגיע לפי 10 וימשיך לגדול. תחזית זו נותרה תחזית בלבד, שכן נתוני OpenRouter מכסים רק פעילות של שירות אחד.
פרומפטים מטמונים מגדילים עומס זיכרון
יותר מ-85% מטוקני הסוכנים הגיעו מפרומפטים מטמונים, כך הכריזה a16z על סמך OpenRouter. החברה הצהירה גם כי טוקנים מטמונים היוו כמעט את כל הגידול היחסי בשימוש בטוקנים. פרומפטים מטמונים זולים יותר מעיבוד פרומפט מאפס, אך המידע השמור עדיין צריך להישאר בזיכרון.
מודלים שומרים הקשר ב-KV cache, שדורש נפח זיכרון גבוה יותר מזיכרון GPU בעל רוחב פס גבוה. a16z, משקיעת OpenRouter, מקשרת מגבלה זו לעליית הביקוש ל-HBM. יומני חברת הייעוץ Colocate, שבדקה ניצול DeepSeek על Nvidia H200, מראים כי כשהסוכנים שלה השתמשו ב-Claude Code בספטמבר, 96% מכלל הנתונים הנכנסים כללו קריאה חוזרת של שיחות קודמות. יחד עם מדדי OpenRouter, זה מעלה השערה שמספר הטוקנים עשוי לייצג באופן מוגזם תשלומים, אם כי עלות חומרת הזיכרון עדיין משמעותית.
Micron צופה כי מחסור ב-RAM ובהתקני אחסון יחמיר ב-2027 וב-2028, ומשתמשים ישלמו יותר משנה לשנה. יצרני זיכרון מעניקים עדיפות ל-HBM עבור מרכזי נתוני AI, מה שמציב את הנפח הנדרש להקשר סוכן בתחרות ישירה עם משתמשים אחרים.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.