Назад
Токени, надто дешеві для обліку: як падає вартість AI-інференсу
SiTech AI Team2 წთ. საკითხავი

Токени, надто дешеві для обліку: як падає вартість AI-інференсу

Есе на jyn.dev стверджує, що ціна машинного інтелекту падає на кілька порядків щороку і що згодом дефіцитним ресурсом стане не кількість токенів, а якість та доступ до моделей.

Есе, опубліковане на jyn.dev, доводить: ціна інтелекту машинного навчання падає на кілька порядків на рік і не показує ознак уповільнення, а обмеженням стане не кількість токенів, а якість і доступ.

Докази

Дані Epoch AI, на які посилається текст, показують експоненційне зростання енергоефективності GPU: на логарифмічному графіку нахил тренду становить близько 1,3, тобто ефективність подвоюється приблизно кожні два роки — темпів, як у закону Мура, відтоді не було.

Енергоефективність GPU у часі, за даними Epoch AI

Ціна за токен для frontier-моделей стабільно не падає, але вартість виконання задачі — так. На кривій pareto від Artificial Analysis вісь інтелекту в 2026 році виглядає приблизно як у 2025-му, тоді як вісь вартості за 2025 рік стала дешевшою на два порядки.

Вартість задачі на кривій pareto 2026 року

Рушії інференсу покращуються на 10–50% на рік: vLLM 0.11.1 (грудень 2025) споживає приблизно на 40% менше джоулів на токен, ніж 0.5.4 (вересень 2024), а NVIDIA повідомляє про зростання ефективності до 50% у MLPerf від 2.0 до 2.1. Змінюються й архітектури — Mixture-of-Experts вимикає непотрібні експертні шари, тож модель може бути в 7 разів меншою (з 6B до 0,8B параметрів) за однакової якості.

Звідки береться «надто дешево, щоб рахувати»

Jev від TypeSafe AI не генерує текст: він обирає серед наперед заданих варіантів і повертає ймовірність — наприклад, чи порушує shell-команда системну інструкцію. На сторінці цін звичайні LLM коштують від $0,20 до $10 за мільйон вхідних токенів, а вихідні приблизно вп'ятеро дорожчі, тоді як System One + Jev — $0,042 за мільйон вхідних токенів, тобто $42 за мільярд, а вихідні токени безкоштовні. Це близько трьох центів за прочитання п'яти книжок.

Інструменти вже цим користуються: jgrep повертає ймовірність приблизно за 200 мілісекунд і близько тисячної цента, а відкрита Laya працює локально.

Що це змінює

Есе також порівнює один крок моделі з локальними інструментами: GPT-5.6 Luna коштує близько 30 центів за мільйон токенів, тож рішення про виклик інструмента на 10 000 токенів коштує третину цента, а grep — приблизно на 4,5 порядку дешевший. Буму автор не чекає: дешевий обсяг не робить дешевою якість, а OpenAI продовжує будувати — п'ять нових майданчиків Stargate.

Він очікує, що безпека ускладниться, зросте оренда GPU, оптимізованих під інференс, а складним у програмуванні стане не алгоритм, а вимоги, тестування й дизайн інтерфейсу. Користувачі ж отримують четвертий варіант: доручити LLM збудувати це.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.