Geri qayıt
GLM öz inference infrastrukturunu AI agenti ilə qurdu
SiTech AI Team2 წთ. საკითხავი

GLM öz inference infrastrukturunu AI agenti ilə qurdu

Z.ai, GLM-5.3 əsaslı Infra Agent-ın 100 mindən çox Çin istehsalı sürətləndirici üzərində işləyən GLM-5.3-Flash inference xidmətini iki həftədən az müddətdə necə qurduğunu təsvir edib.

Z.ai sentyabrın 17-də dərc etdiyi tədqiqat yazısında GLM-5.3 əsaslı Infra Agent-ın GLM-5.3-Flash-ın bu gün işlədiyi inference xidmətini necə qurduğunu təsvir edib. Yazının başlığı «Rekursiv özünütəkmilləşdirməyə doğru»dur, lakin şirkət açıq şəkildə bildirir ki, hədəfə hələ çatılmayıb — yalnız onun erkən formaları görünür.

100 min sürətləndirici və iki həftə

GLM-5.3-Flash-ın bütün istehsal inference-i 100 mindən çox Çin istehsalı AI sürətləndiricisini birləşdirən klasterdə işləyir. Şirkətə görə, bu miqyasda klaster əvvəllər heç kim tərəfindən yerləşdirilməmişdi. Komanda çiplərin məhdud yaddaşı və ötürmə qabiliyyəti, yeni model arxitekturası, 1 milyon tokenlik kontekst pəncərəsi və multimodal sorğularla yanaşı, yetişməmiş ekosistem və natamam kernel dəstəyi ilə üzləşdi.

İşin mühüm hissəsini təkcə infrastruktur mühəndisləri deyil, GLM-5.3 ilə işləyən Infra Agent yerinə yetirdi. ReplaySSM, W8A8 kvantizasiyası, INT8/FP8/BF16 qarışıq dəqiqlikli keş kvantizasiyası, Layer Split və Encode-Prefill-Decode arxitekturası kimi aqressiv yaddaş optimallaşdırmaları xidmətin başdan-başa sürətini təxminən üç dəfə artırdı; token dəyəri və avadanlıqdan istifadə səmərəliliyi isə adi NVIDIA GPU-larının səviyyəsinə yaxınlaşdı. İlkin model uyğunlaşdırmasından istehsala hazır vəziyyətə qədər iki həftədən az vaxt keçdi.

«Sıx əks-əlaqə»

Yazının əsas arqumenti budur: agentin mühəndislik səmərəliliyi kod yazma qabiliyyətindən az, aldığı əks-əlaqənin nə qədər təfərrüatlı olmasından asılıdır. Başdan-başa metriki agentə yalnız nəticələrin pisləşdiyini deyir, səbəbini izah etmir. Buna görə komanda agentə düzgünlük testlərini, mikrobencmarkları, icra izlərini və runtime hadisələrini birbaşa istifadə edilə bilən formada verdi. Belə «sıx» əks-əlaqənin üç xüsusiyyəti var: yerlilik, tez və ucuz əldə edilmə, nəzarətli təcrübələrlə obyektiv yoxlama imkanı.

Konkret hallar

KDA kernelinin Context Parallelism yolunda agent ədədi dəqiqlik xətası tapdı: tl.dot FP32 girişlərdə belə standart olaraq TF32 hesablamasından istifadə edirdi və uzun kontekstlərdə xəta toplanırdı. Düzəliş input_precision="tf32x3" təyin etmək idi; dəyişiklik Flash Linear Attention layihəsində də qəbul olundu (PR #1180).

KV Transfer darboğazında qəbul meyarı ən çoxu 5% performans fərqinə icazə verirdi, lakin agent 20%-dən çox ölçdü. Səbəb DeepEP v1.2.1-dəki intranode_dispatch və intranode_combine funksiyalarının Python GIL-ni buraxmaması və Mooncake Transfer axınını maneə törətməsi idi. GIL buraxıldıqdan sonra fərq 1%-dən aşağı düşdü.

Sərhədlər və nəticə

Buraxılışdan əvvəl GLM-5.3-Flash OpenCode və OpenRouter-də Ox-Alpha adı ilə anonim sınaqdan keçirildi və bir həftə ərzində hər iki platformada ən çox istifadə olunan model oldu; altı gündə 62 trilyondan çox token emal etdi. Yazı vurğulayır ki, hədəflərin seçilməsi, sərhədlərin müəyyənləşdirilməsi və riskin qiymətləndirilməsi insanın məsuliyyətində qalır.

SSiTech

SiTech — AI ilə gücləndirilmiş veb hazırlanması

Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.