Z.ai представила GLM-5.3-Flash: рівень фронтиру за десяту частину ціни

Китайська Z.ai представила GLM-5.3-Flash — мультимодальну модель із 320 млрд параметрів і лише 18 млрд активних. Вона перевершує GLM-5.2 за десяту частину ціни та наближається до Claude Opus 4.8 у кодуванні.
Що сталося
26 серпня китайська AI-лабораторія Z.ai представила GLM-5.3-Flash — першу нативно мультимодальну модель серії GLM-5. У неї 320 мільярдів загальних параметрів, але лише 18 мільярдів активних на токен. За бенчмарками вона перевершує попередницю GLM-5.2 приблизно за десяту частину ціни й наближається до Claude Opus 4.8 у кодуванні та агентних сценаріях.
Архітектура для дешевого інференсу
Модель поєднує розріджену (sparse) і лінійну (linear) увагу в гібридній схемі та використовує Manifold-Constrained Hyper-Connections (mHC) для ефективнішого масштабування. Порівняно із серією GLM-4.5 кількість шарів майже вдвічі менша (45 проти 92), тому вартість обслуговування залишається низькою навіть за контексту в мільйон токенів.
Цифри та тихий тест
Перед релізом модель анонімно працювала як «ox-alpha» на OpenCode та OpenRouter і стала найпопулярнішою моделлю тижня — весь трафік обслуговували китайські AI-чипи. Вона набирає 57 балів в Artificial Analysis Intelligence Index v4.1.1 за приблизно $0,045 на задачу, а на DeepSWE v1.1 — 63,4 проти 46,2 у GLM-5.2.
Чому це важливо
Розрив між фронтирними та бюджетними моделями скорочується: топове кодування й агентні можливості за частину ціни змінюють те, що реально автоматизувати.