Geri Dön
GLM kendi çıkarım altyapısını bir yapay zekâ ajanıyla kurdu
SiTech AI Team2 წთ. საკითხავი

GLM kendi çıkarım altyapısını bir yapay zekâ ajanıyla kurdu

Z.ai, GLM-5.3 tabanlı Infra Agent'ın 100 binden fazla Çin yapımı hızlandırıcı üzerinde çalışan GLM-5.3-Flash çıkarım servisini iki haftadan kısa sürede nasıl kurduğunu anlattı.

Z.ai, 17 Eylül'de yayımladığı araştırma yazısında GLM-5.3 tabanlı Infra Agent'ın, GLM-5.3-Flash'ın bugün üzerinde çalıştığı çıkarım (inference) servisini nasıl kurduğunu anlattı. Yazının başlığı "Özyinelemeli Kendini Geliştirmeye Doğru"; ancak şirket bu hedefe henüz ulaşılmadığını, yalnızca erken biçimlerinin göründüğünü açıkça belirtiyor.

100 bin hızlandırıcı ve iki hafta

GLM-5.3-Flash'ın tüm üretim çıkarımı, 100 binden fazla Çin yapımı yapay zekâ hızlandırıcısını bir araya getiren bir küme üzerinde çalışıyor. Şirkete göre bu ölçekte bir küme daha önce kurulmamıştı. Ekip sınırlı çip belleği ve bant genişliği, yeni bir model mimarisi, 1 milyon token'lık bağlam penceresi ve çok kipli isteklerin yanı sıra olgunlaşmamış bir ekosistemle ve eksik kernel desteğiyle uğraştı.

İşin önemli bir bölümünü yalnızca altyapı mühendisleri değil, GLM-5.3 ile çalışan Infra Agent üstlendi. ReplaySSM, W8A8 kuantizasyonu, INT8/FP8/BF16 karışık hassasiyetli önbellek kuantizasyonu, Layer Split ve Encode-Prefill-Decode mimarisi gibi bellek iyileştirmeleri uçtan uca sunum performansını yaklaşık üç kat artırdı; token başına maliyet ve donanım kullanım verimliliği yaygın NVIDIA GPU'larıyla karşılaştırılabilir düzeye yaklaştı. İlk model uyarlamasından üretime hazır hâle gelmek iki haftadan kısa sürdü.

"Yoğun geri bildirim"

Yazının temel savı, bir ajanın mühendislik verimliliğinin kod yazma yeteneğinden çok aldığı geri bildirimin ayrıntı düzeyine bağlı olduğu. Uçtan uca bir metrik ajana yalnızca sonuçların kötüleştiğini söyler, nedenini açıklamaz. Bu yüzden ekip ajana doğruluk testlerini, mikrobenchmark'ları, yürütme izlerini ve runtime olaylarını doğrudan kullanılabilir hâlde sundu. Bu "yoğun" geri bildirimin üç özelliği var: yerellik, hızlı ve ucuz elde edilebilirlik, kontrollü deneylerle nesnel doğrulama.

Somut vakalar

KDA kernel'inin Context Parallelism yolunda ajan sayısal doğruluk hatası buldu: tl.dot, FP32 girdilerde bile varsayılan olarak TF32 hesabı kullanıyordu ve uzun bağlamlarda hata birikiyordu. Çözüm input_precision="tf32x3" ayarıydı; değişiklik Flash Linear Attention projesine de kabul edildi (PR #1180).

KV Transfer darboğazında kabul kriteri en fazla %5'lik performans farkına izin veriyordu, ancak ajan %20'nin üzerinde ölçtü. Neden, DeepEP v1.2.1'deki intranode_dispatch ve intranode_combine işlevlerinin Python GIL'ini serbest bırakmaması ve Mooncake Transfer iş parçacığını engellemesiydi. GIL serbest bırakıldıktan sonra fark %1'in altına indi.

Sınırlar ve sonuç

Lansmandan önce GLM-5.3-Flash, OpenCode ve OpenRouter'da Ox-Alpha adıyla anonim olarak test edildi ve bir hafta içinde her iki platformda en çok kullanılan model oldu; altı günde 62 trilyondan fazla token işledi. Yazı, hedeflerin seçilmesi, sınırların belirlenmesi ve riskin değerlendirilmesinin insanın sorumluluğunda kaldığını vurguluyor.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.