Назад
Qwen3.8 Max очолила агентний індекс Artificial Analysis
SiTech Team2 წთ. საკითხავი

Qwen3.8 Max очолила агентний індекс Artificial Analysis

Флагманська reasoning-модель Alibaba посіла перше місце в агентному індексі Artificial Analysis — рейтингу, що вимірює, як AI-системи виконують довготривалі робочі завдання, а не відповідають на екзаменаційні питання.

В агентного індексу Artificial Analysis новий лідер: Qwen3.8 Max — флагманська reasoning-модель, яку Alibaba випустила 3 серпня 2026 року. Рейтинг, опублікований на сайті незалежного оцінювання, ставить модель на чільне місце індексу, побудованого саме навколо агентної роботи — завдань, де система має планувати, користуватися інструментами й видавати готовий результат, а не просто відповідати на запитання.

Що вимірює індекс

Агентний індекс спирається на оцінювання, яке Artificial Analysis проводить власними силами. Серед них — AA-Briefcase v1.1, що перевіряє довготривалу інтелектуальну роботу через такі результати, як таблиці, презентації та службові записки; GDPval-AA v2.1, побудований на реальних робочих завданнях; AutomationBench-AA, що охоплює SaaS-процеси; і Terminal-Bench 4.0, присвячений програмуванню та роботі в терміналі. Ці агентні тести стоять поряд із класичними бенчмарками знань у ширшому Intelligence Index, який нині об'єднує десять оцінювань.

Модель за рейтингом

Qwen3.8 Max — закрита reasoning-модель, і Alibaba не розкриває кількість її параметрів. Вона приймає текст, зображення й відео, повертає текст і пропонує контекстне вікно на мільйон токенів. В Intelligence Index від Artificial Analysis модель набирає 40 балів — значно вище за медіану 24 для порівнюваних моделей. Компроміс — швидкість і багатослівність: модель видає близько 41 токена за секунду, що є повільним показником у своєму класі, а під час оцінювання згенерувала приблизно 180 мільйонів токенів — удвічі більше за медіану. Ціни API — 2 долари за мільйон вхідних токенів і 6 доларів за мільйон вихідних, із 88-відсотковою знижкою на кешований вхід.

Чому це важливо

Агентні бенчмарки стали головним випробувальним майданчиком галузі, бо вони імітують оплачувану роботу, а не тести, і їх складніше «обійти» завченими відповідями. Те, що саме закрита модель від Alibaba очолила цей рейтинг, говорить не стільки про один реліз, скільки про те, куди змістився фронтир практичного ШІ: конкуренція точиться навколо того, чи надійно моделі виконують багатокрокові завдання і скільки ця надійність коштує.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.