
Qwen3.8 Max очолила агентний індекс Artificial Analysis
Флагманська reasoning-модель Alibaba посіла перше місце в агентному індексі Artificial Analysis — рейтингу, що вимірює, як AI-системи виконують довготривалі робочі завдання, а не відповідають на екзаменаційні питання.
В агентного індексу Artificial Analysis новий лідер: Qwen3.8 Max — флагманська reasoning-модель, яку Alibaba випустила 3 серпня 2026 року. Рейтинг, опублікований на сайті незалежного оцінювання, ставить модель на чільне місце індексу, побудованого саме навколо агентної роботи — завдань, де система має планувати, користуватися інструментами й видавати готовий результат, а не просто відповідати на запитання.
Що вимірює індекс
Агентний індекс спирається на оцінювання, яке Artificial Analysis проводить власними силами. Серед них — AA-Briefcase v1.1, що перевіряє довготривалу інтелектуальну роботу через такі результати, як таблиці, презентації та службові записки; GDPval-AA v2.1, побудований на реальних робочих завданнях; AutomationBench-AA, що охоплює SaaS-процеси; і Terminal-Bench 4.0, присвячений програмуванню та роботі в терміналі. Ці агентні тести стоять поряд із класичними бенчмарками знань у ширшому Intelligence Index, який нині об'єднує десять оцінювань.
Модель за рейтингом
Qwen3.8 Max — закрита reasoning-модель, і Alibaba не розкриває кількість її параметрів. Вона приймає текст, зображення й відео, повертає текст і пропонує контекстне вікно на мільйон токенів. В Intelligence Index від Artificial Analysis модель набирає 40 балів — значно вище за медіану 24 для порівнюваних моделей. Компроміс — швидкість і багатослівність: модель видає близько 41 токена за секунду, що є повільним показником у своєму класі, а під час оцінювання згенерувала приблизно 180 мільйонів токенів — удвічі більше за медіану. Ціни API — 2 долари за мільйон вхідних токенів і 6 доларів за мільйон вихідних, із 88-відсотковою знижкою на кешований вхід.
Чому це важливо
Агентні бенчмарки стали головним випробувальним майданчиком галузі, бо вони імітують оплачувану роботу, а не тести, і їх складніше «обійти» завченими відповідями. Те, що саме закрита модель від Alibaba очолила цей рейтинг, говорить не стільки про один реліз, скільки про те, куди змістився фронтир практичного ШІ: конкуренція точиться навколо того, чи надійно моделі виконують багатокрокові завдання і скільки ця надійність коштує.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.