Geri Dön
Ölçülemeyecek Kadar Ucuz Token'lar: AI Çıkarım Maliyeti Neden Düşüyor
SiTech AI Team2 წთ. საკითხავი

Ölçülemeyecek Kadar Ucuz Token'lar: AI Çıkarım Maliyeti Neden Düşüyor

jyn.dev'de yayımlanan bir yazı, makine zekâsının maliyetinin yılda birkaç mertebe düştüğünü ve kıt kaynağın token sayısı değil, kalite ile erişim olacağını savunuyor.

jyn.dev'de yayımlanan bir yazı, makine öğrenmesi zekâsının fiyatının yılda birkaç mertebe düştüğünü ve yavaşlama belirtisi göstermediğini savunuyor; sınırlayıcı faktör ise token arzı değil kalite ve erişim olacak.

Kanıtlar

Yazının atıfta bulunduğu Epoch AI verilerine göre GPU'ların enerji verimliliği üstel biçimde artıyor: logaritmik grafikte eğilim çizgisinin eğimi yaklaşık 1,3, yani verimlilik kabaca iki yılda bir ikiye katlanıyor — Moore Yasası'ndan bu yana görülmemiş bir tempo.

Epoch AI verileriyle GPU enerji verimliliği

Frontier modellerde token fiyatı istikrarlı biçimde düşmüyor, ama bir görevi tamamlamanın maliyeti düşüyor. Artificial Analysis'in izlediği pareto eğrisinde zekâ ekseni 2026'da 2025'e benziyor; maliyet ekseni ise 2025 boyunca iki mertebe ucuzladı.

2026 pareto eğrisinde görev başına maliyet

Çıkarım motorları yılda %10–50 iyileşiyor: vLLM 0.11.1 (Aralık 2025), 0.5.4'e (Eylül 2024) kıyasla token başına yaklaşık %40 daha az joule harcıyor; NVIDIA ise MLPerf 2.0'dan 2.1'e kadar %50'ye varan verimlilik artışı bildiriyor. Mimariler de değişiyor — Mixture-of-Experts gereksiz uzman katmanlarını devre dışı bırakıyor, böylece bir model aynı kalitede 7 kat küçülebiliyor (6B'den 0,8B parametreye).

"Ölçülemeyecek kadar ucuz" nereden geliyor

TypeSafe AI'ın Jev'i metin üretmiyor: önceden belirlenmiş seçenekler arasından seçim yapıp olasılık döndürüyor. Fiyat sayfası mevcut LLM'leri milyon giriş token'ı başına 0,20–10 dolar, çıkış token'ı yaklaşık beş katı olarak gösterirken System One + Jev'i milyon giriş token'ı başına 0,042 dolar, yani milyar token başına 42 dolar olarak listeliyor; çıkış token'ları ücretsiz. Bu, beş kitap okumak için yaklaşık üç sent demek.

Araçlar bunu şimdiden kullanıyor: jgrep bir olasılığı yaklaşık 200 milisaniyede ve bir cent'in binde biri karşılığında döndürüyor, açık ağırlıklı Laya ise yerelde çalışıyor.

Neyi değiştiriyor

Yazı bir model adımını yerel araçlarla da karşılaştırıyor: GPT-5.6 Luna milyon token başına yaklaşık 30 sent, yani 10.000 token tüketen bir araç çağrısı kararı üçte bir sent ediyor; grep ise yaklaşık 4,5 mertebe daha ucuz. Yazar balon patlaması beklemiyor: ucuz hacim kaliteyi ucuzlatmıyor ve OpenAI inşa etmeye devam ediyor — beş yeni Stargate sahası.

Ayrıca güvenliğin zorlaşmasını, çıkarıma özel GPU kiralama pazarının büyümesini ve yazılımda zor olan şeyin algoritmalar değil ürün gereksinimleri, test ve arayüz tasarımı hâline gelmesini bekliyor. Kullanıcılar da dördüncü bir yol kazanıyor: bir LLM'e bunu yaptırmak.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.