Назад
GLM побудувала власну inference-інфраструктуру за допомогою AI-агента
SiTech AI Team2 წთ. საკითხავი

GLM побудувала власну inference-інфраструктуру за допомогою AI-агента

Z.ai описала, як Infra Agent на базі GLM-5.3 побудував продакшн-сервіс inference для GLM-5.3-Flash на понад 100 тисячах китайських прискорювачів — менш ніж за два тижні.

17 вересня Z.ai опублікувала дослідницький пост про те, як Infra Agent на базі GLM-5.3 побудував сервіс inference, на якому сьогодні працює GLM-5.3-Flash. Заголовок матеріалу — «До рекурсивного самовдосконалення», хоча компанія прямо зазначає: мети ще не досягнуто, видно лише її ранні форми.

100 тисяч прискорювачів і два тижні

Увесь продакшн-inference для GLM-5.3-Flash працює на кластері з понад 100 тисячами китайських AI-прискорювачів. За словами компанії, кластер такого масштабу раніше ніхто не розгортав. Команда мала справу з обмеженою пам'яттю й пропускною здатністю чіпів, новою архітектурою моделі, контекстом на 1 млн токенів і мультимодальними запитами, а також із незрілою екосистемою та неповною підтримкою ядер.

Значну частину роботи виконав не лише колектив інфраструктурних інженерів, а й Infra Agent під керуванням GLM-5.3. Агресивні оптимізації пам'яті — ReplaySSM, квантизація W8A8, змішана точність кешу INT8/FP8/BF16, Layer Split та архітектура Encode-Prefill-Decode — прискорили наскрізну роботу сервісу приблизно втричі, а вартість токена й ефективність використання обладнання наблизилися до рівня мейнстримних GPU NVIDIA. Від початкової адаптації моделі до готовності до продакшну минуло менш ніж два тижні.

«Щільний зворотний зв'язок»

Головна теза поста: ефективність агента залежить не стільки від уміння писати код, скільки від детальності зворотного зв'язку. Наскрізна метрика лише повідомляє агенту, що стало гірше, але не пояснює чому. Тому команді дали безпосередньо придатні до використання тести коректності, мікробенчмарки, трейси виконання та runtime-події. Такий «щільний» зворотний зв'язок має три властивості: локальність, дешевизну й швидкість отримання та можливість об'єктивної перевірки через контрольовані експерименти.

Конкретні випадки

На шляху Context Parallelism ядра KDA агент виявив помилку числової точності: tl.dot за замовчуванням використовував обчислення TF32 навіть для FP32-входів, через що похибка накопичувалася на довгих контекстах. Виправлення — input_precision="tf32x3"; його прийняли і в проєкті Flash Linear Attention (PR #1180).

У випадку з вузьким місцем KV Transfer критерій приймання допускав розрив продуктивності не більше 5%, але агент виміряв понад 20%. Причина — функції intranode_dispatch та intranode_combine у DeepEP v1.2.1 не звільняли Python GIL і блокували потік Mooncake Transfer. Після звільнення GIL розрив упав нижче 1%.

Межі та результат

До запуску GLM-5.3-Flash анонімно тестували на OpenCode та OpenRouter під іменем Ox-Alpha, і за тиждень він став найуживанішою моделлю на обох платформах, обробивши понад 62 трлн токенів за шість днів. Пост наголошує: вибір цілей, встановлення меж і оцінка ризиків залишаються відповідальністю людини.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.