
„ტოკენები ძალიან იაფია დასათვლელად“: როგორ იაფდება AI-ის ინფერენსი
jyn.dev-ზე გამოქვეყნებული ესეს ავტორი ამტკიცებს, რომ მანქანური ინტელექტის ფასი ყოველ წელს რამდენიმე რიგით ეცემა და ტოკენები დეფიციტური რესურსი მალე აღარ იქნება — დეფიციტური ხარისხი დარჩება.
jyn.dev-ზე გამოქვეყნებული ესეს ავტორის აზრით, მანქანური სწავლების ინტელექტის ფასი წელიწადში რამდენიმე რიგით ეცემა და შენელების ნიშანს არ აჩვენებს, ხოლო შემაკავებელი ფაქტორი ტოკენების რაოდენობა კი არა, ხარისხი და ხელმისაწვდომობა იქნება.
მტკიცებულება
Epoch AI-ის მონაცემებით, რომლებსაც ესე იშველიებს, GPU-ების ენერგოეფექტურობა ექსპონენციურად იზრდება: ლოგარითმულ გრაფიკზე ტენდენციის დახრილობა დაახლოებით 1.3-ია, ანუ ეფექტურობა ყოველ ორ წელიწადში ორჯერ დუბლირდება — Moore-ის კანონის შემდეგ ასეთი ტემპი არ ყოფილა.

ტოკენის ფასი frontier-ის მოდელებზე მუდმივად არ ეცემა, თუმცა ერთი ამოცანის შესრულების ღირებულება მკვეთრად მცირდება. Artificial Analysis-ის pareto-ის მრუდზე 2026 წელს ხარისხის ღერძი 2025-ის მსგავსია, ღირებულების ღერძი კი 2025 წელს ორი რიგით გაუმჯობესდა.

ინფერენსის ძრავები წელიწადში 10–50%-ით უმჯობესდება: vLLM 0.11.1 (2025 წლის დეკემბერი) 0.5.4-თან (2024 წლის სექტემბერი) შედარებით ტოკენზე დაახლოებით 40%-ით ნაკლებ ჯოულს ხარჯავს, NVIDIA-მ კი MLPerf 2.0-დან 2.1-მდე 50%-მდე მატება აჩვენა. იცვლება არქიტექტურებიც — Mixture-of-Experts ზედმეტ ექსპერტ-ფენებს თიშავს და მოდელი იმავე ხარისხით 7-ჯერ პატარა შეიძლება იყოს (6B-დან 0.8B პარამეტრამდე).
საიდან მოდის „ძალიან იაფი დასათვლელად“
TypeSafe AI-ის Jev ტექსტს არ წერს — ის წინასწარ განსაზღვრულ ვარიანტებს შორის ირჩევს და ალბათობას აბრუნებს, მაგალითად აფასებს, არღვევს თუ არა shell-ის ბრძანება სისტემურ ინსტრუქციას. კომპანიის ფასებით ჩვეულებრივი LLM-ები მილიონ შემავალ ტოკენზე 0.20–10 დოლარი ღირს, გამომავალი კი ხუთჯერ ძვირია, Jev-ზე კი შემავალი ტოკენი 0.042 დოლარია — 42 დოლარი მილიარდ ტოკენზე — გამომავალი კი უფასო. ეს ხუთი წიგნის წაკითხვაზე დაახლოებით სამი ცენტია.
ხელსაწყოები ამას უკვე იყენებენ: jgrep შეფასებას დაახლოებით 200 მილიწამში და მეათასედი ცენტის ფასად აკეთებს, ღია წონების Laya კი ლოკალურად მუშაობს.
რას ცვლის ეს
ესე მოდელის ერთ ნაბიჯს ლოკალურ ხელსაწყოებსაც ადარებს: GPT-5.6 Luna მილიონ ტოკენზე დაახლოებით 30 ცენტი ღირს, ანუ 10-ათასტოკენიანი გადაწყვეტილება მესამედი ცენტია, ხოლო grep დაახლოებით 4.5 რიგით იაფია. ბუშტის გახეთქვას ავტორი არ ელოდება: ტოკენების სიმრავლე ხარისხს არ აიაფებს, OpenAI კი აშენებას აგრძელებს — ხუთი ახალი Stargate-ის ცენტრი.
ის ელოდება, რომ უსაფრთხოება რთულდება, იზრდება ინფერენსზე ოპტიმიზებული GPU-ების გაქირავება და იცვლება ის, რაც პროგრამულ უზრუნველყოფაში რთულია: ალგორითმები კი არა, პროდუქტის მოთხოვნები, ტესტირება და ინტერფეისის დიზაინი. მომხმარებელს კი მეოთხე ვარიანტი გაუჩნდა — LLM-ს შეუძლია პროგრამა ააშენოს.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.