
Qwen3.8 Max Artificial Analysis-in agent indeksində zirvəyə çıxdı
Alibaba-nın flaqman düşünmə modeli Artificial Analysis-in tərtib etdiyi agent indeksində birinci yerə yüksəlib — bu sıralama AI sistemlərinin imtahan suallarını deyil, uzunmüddətli iş tapşırıqlarını necə yerinə yetirdiyini ölçür.
Artificial Analysis-in agent indeksində yeni lider var: Alibaba-nın 2026-cı il avqustun 3-də buraxdığı flaqman düşünmə modeli Qwen3.8 Max. Müstəqil qiymətləndirmə saytında dərc olunan sıralama modeli xüsusi olaraq agent işləri üzərində qurulmuş indeksin zirvəsinə qaldırır — yəni suala cavab vermək yerinə plan qurmalı, alətlərdən istifadə etməli və hazır nəticə təqdim etməli olan tapşırıqlarda.
İndeks nəyi ölçür
Agent indeksi Artificial Analysis-in özünün apardığı qiymətləndirmələrə əsaslanır. Onların arasında cədvəllər, təqdimatlar və memorandumlar kimi nəticələrlə uzunmüddətli bilik işini yoxlayan AA-Briefcase v1.1; real iş tapşırıqları üzərində qurulmuş GDPval-AA v2.1; SaaS iş axınlarını əhatə edən AutomationBench-AA və kodlaşdırma ilə terminal istifadəsinə yönəlmiş Terminal-Bench 4.0 var. Bu agent testləri saytın hazırda on qiymətləndirməni birləşdirən daha geniş Intelligence Index-ində klassik bilik bençmarklarının yanında dayanır.
Sıralamanın arxasındakı model
Qwen3.8 Max qapalı mənbəli düşünmə modelidir və Alibaba parametr sayını açıqlamayıb. O, mətn, şəkil və video girişi qəbul edir, mətn qaytarır və bir milyon tokenlik kontekst pəncərəsi təklif edir. Artificial Analysis Intelligence Index-də 40 bal toplayır — bənzər modellər üçün median olan 24-dən xeyli yuxarı. Bunun müqabilində sürət və uzunluq var: model saniyədə təqribən 41 token hasil edir, yəni öz sinfində yavaş sayılır və qiymətləndirmə zamanı təxminən 180 milyon token sərf edib — medianın iki qatı. API qiyməti milyon giriş tokeni üçün 2 dollar, milyon çıxış tokeni üçün 6 dollardır; keşlənmiş girişə 88 faiz endirim tətbiq olunur.
Niyə bu vacibdir
Agent bençmarkları sahənin əsas sınaq meydanına çevrilib, çünki onlar kvizə deyil, ödənişli işə bənzəyir və yadda saxlanmış cavablarla onları qane etmək qat-qat çətindir. Bu sıralamada məhz Alibaba-nın qapalı modelinin başda olması tək bir buraxılışdan çox, praktik süni intellektin sərhədinin hara köçdüyünü göstərir: rəqabət indi modellərin çoxaddımlı işləri nə qədər etibarlı tamamlaması və bu etibarlılığın nə qədərə başa gəlməsi üzərində gedir.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.