
טוקנים זולים מדי לספירה: איך צונחת עלות ההסקה של AI
מאמר ב-jyn.dev טוען שמחיר האינטליגנציה המכונית יורד בכמה סדרי גודל בכל שנה, ושהיום שבו מספר הטוקנים יפסיק להיות המשאב החסר קרוב: האיכות והנגישות יהיו המגבלה האמיתית.
מאמר שפורסם ב-jyn.dev טוען שמחיר האינטליגנציה של למידת מכונה יורד בכמה סדרי גודל בשנה, בלי סימן להאטה, ושהמגבלה תהיה האיכות והנגישות — לא מספר הטוקנים.
הראיות
נתונים של Epoch AI שהמאמר מצטט מראים יעילות אנרגטית של GPU שעולה באופן מעריכי: בגרף לוגריתמי שיפוע המגמה הוא כ-1.3, כלומר היעילות מוכפלת בערך כל שנתיים — קצב שלא נראה מאז חוק מור.

מחיר הטוקן במודלי frontier אינו יורד בעקביות, אבל עלות השלמת משימה כן. בעקומת ה-pareto של Artificial Analysis ציר האינטליגנציה ב-2026 דומה לזה של 2025, בעוד ציר העלות נעשה זול בשני סדרי גודל במהלך 2025.

מנועי הסקה משתפרים ב-10% עד 50% בשנה: vLLM 0.11.1 (דצמבר 2025) צורך כ-40% פחות ג'אול לטוקן מ-0.5.4 (ספטמבר 2024), ו-NVIDIA מדווחת על שיפור יעילות של עד 50% מ-MLPerf 2.0 ל-2.1. גם הארכיטקטורות משתנות — Mixture-of-Experts מכבה שכבות מומחים מיותרות, כך שמודל יכול להיות קטן פי 7 (מ-6B ל-0.8B פרמטרים) באותה איכות.
מאיפה בא "זול מדי לספירה"
המודל Jev של TypeSafe AI אינו פולט טקסט: הוא בוחר בין אפשרויות שנקבעו מראש ומחזיר הסתברות — למשל אם פקודת shell מפרה הנחיית מערכת. בעמוד התמחור מוצגים מודלי LLM קיימים ב-0.20 עד 10 דולר למיליון טוקני קלט, כשהפלט יקר פי חמישה בערך, לעומת System One + Jev ב-0.042 דולר למיליון טוקני קלט — 42 דולר למיליארד — כשטוקני הפלט חינם. מדובר בכשלושה סנטים לקריאת חמישה ספרים.
כלים כבר מנצלים זאת: jgrep מחזיר הסתברות בכ-200 מילישניות ובכאלפית סנט, והמודל בקוד פתוח Laya רץ מקומית.
מה זה משנה
המאמר משווה גם תור אחד של מודל לכלים מקומיים: GPT-5.6 Luna עולה כ-30 סנט למיליון טוקנים, כך שהחלטה על קריאה לכלי בצריכת 10,000 טוקנים עולה שליש סנט, בעוד grep זול בכ-4.5 סדרי גודל. המחבר אינו צופה התפוצצות בועה: כמות זולה אינה הופכת את האיכות לזולה, ו-OpenAI ממשיכה לבנות — חמישה אתרי Stargate חדשים.
הוא מצפה שהאבטחה תיעשה קשה יותר, שתגדל השכרת GPU המיועדות להסקה, ושהחלק הקשה בפיתוח יעבור מאלגוריתמים לדרישות מוצר, בדיקות ועיצוב ממשק. למשתמשים מתווספת אפשרות רביעית: לבקש ממודל LLM לבנות את זה.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.