Geri Dön
Qwen3.8 Max, Artificial Analysis'in ajan indeksinde zirveye çıktı
SiTech Team2 წთ. საკითხავი

Qwen3.8 Max, Artificial Analysis'in ajan indeksinde zirveye çıktı

Alibaba'nın amiral gemisi akıl yürütme modeli, Artificial Analysis'in derlediği ajan indeksinde ilk sıraya yerleşti; bu sıralama, AI sistemlerinin sınav sorularını değil, uzun soluklu işleri nasıl yürüttüğünü ölçüyor.

Artificial Analysis'in ajan indeksinde yeni bir lider var: Alibaba'nın 3 Ağustos 2026'da yayımladığı amiral gemisi akıl yürütme modeli Qwen3.8 Max. Bağımsız değerlendirme sitesinde yayımlanan sıralama, modeli özellikle ajan işleri üzerine kurulu bir indeksin zirvesine taşıyor — yani bir soruyu yanıtlamak yerine plan yapması, araç kullanması ve bitmiş bir sonuç teslim etmesi gereken görevlerin.

İndeks neyi ölçüyor

Ajan indeksi, Artificial Analysis'in kendi yürüttüğü değerlendirmelere dayanıyor. Bunlar arasında elektronik tablolar, sunumlar ve notlar gibi çıktılarla uzun soluklu bilgi işini sınayan AA-Briefcase v1.1; gerçek dünya iş görevleri üzerine kurulu GDPval-AA v2.1; SaaS iş akışlarını kapsayan AutomationBench-AA ve kod yazma ile terminal kullanımına odaklanan Terminal-Bench 4.0 yer alıyor. Bu ajan testleri, sitenin şu anda on değerlendirmeyi birleştiren daha geniş Intelligence Index'inde klasik bilgi kıyaslamalarının yanında duruyor.

Sıralamanın arkasındaki model

Qwen3.8 Max kapalı kaynaklı bir akıl yürütme modeli ve Alibaba parametre sayısını açıklamıyor. Metin, görüntü ve video girdisi alıyor, metin üretiyor ve bir milyon token'lık bağlam penceresi sunuyor. Artificial Analysis Intelligence Index'te 40 puan alıyor; bu, benzer modeller için geçerli 24'lük medyanın oldukça üzerinde. Bedeli hız ve uzunlukta: model saniyede yaklaşık 41 token üretiyor, yani kendi sınıfının yavaş ucunda, ve değerlendirme sırasında yaklaşık 180 milyon token harcadı — medyanın iki katı. API fiyatı milyon girdi token'ı başına 2 dolar, milyon çıktı token'ı başına 6 dolar; önbelleğe alınmış girdide yüzde 88 indirim uygulanıyor.

Neden önemli

Ajan kıyaslamaları, ücretli işi andırdıkları ve ezberlenmiş yanıtlarla tatmin edilmeleri çok daha zor olduğu için alanın ana sınav sahası hâline geldi. Bu sıralamada Alibaba'nın kapalı kaynaklı bir modelinin başı çekmesi, tek bir sürümden çok pratik yapay zekânın sınırının nereye kaydığını gösteriyor: rekabet artık modellerin çok adımlı işleri ne kadar güvenilir tamamladığı ve bu güvenilirliğin ne kadara mal olduğu üzerinden yürüyor.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.