Geri Dön
GLM-5.2, Artificial Analysis'ta açık ağırlıklı modellerin lideri oldu
SiTech AI Team2 წთ. საკითხავი

GLM-5.2, Artificial Analysis'ta açık ağırlıklı modellerin lideri oldu

Z.ai'nin GLM-5.2 modeli, Artificial Analysis Intelligence Index v4.1'de 51 puan alarak MiniMax-M3, DeepSeek V4 Pro ve Kimi K2.6'yı geride bıraktı ve zekâ–görev başına maliyet Pareto sınırına yerleşti.

Z.ai'nin GLM-5.2 modeli, Artificial Analysis Intelligence Index'te açık ağırlıklı modeller arasında yeni lider oldu ve ölçütün 4.1 sürümünde 51 puan aldı. Analiz şirketine göre model, selefi GLM-5.1 ile aynı boyutu koruyor — toplam 744 milyar parametre ve 40 milyar aktif parametre — ancak endekste 11 puan kazanıyor.

Rakamlarla konumu

Bu sonuç GLM-5.2'yi diğer açık ağırlıklı sürümlerin önüne taşıyor: MiniMax-M3 ve DeepSeek V4 Pro (max) 44 puan alırken Kimi K2.6 43 puanda kalıyor. Artificial Analysis'in gerçek dünyadaki ajan performansı için ana ölçütü olan GDPval-AA v2'de GLM-5.2 1.524 puanla MiniMax-M3'ü (1.418) ve DeepSeek V4 Pro'yu (max, 1.328) geçiyor; xhigh akıl yürütme modundaki GPT-5.5 (1.514) ile de fiilen aynı seviyede.

Değerlendirmelerdeki artışlar

GLM-5.1'e kıyasla iyileşme testlerin çoğunda görülüyor; başı bilimsel akıl yürütme çekiyor. CritPt 16 puan artışla yüzde 21'e, HLE 12 puanla yüzde 40'a, SciCode 7 puanla yüzde 50'ye çıkıyor. AA-LCR 9 puan kazanarak yüzde 71'e, tau3 bankacılık testi 15 puanla yüzde 27'ye, TerminalBench v2.1 ise 16 puanla yüzde 78'e yükseliyor. GPQA Diamond 3 puan artışla yüzde 89'a ulaşıyor.

Maliyet ve güvenilirlik

GLM-5.2 aynı zamanda zekâ ile görev başına maliyet grafiğinin Pareto sınırında yer alıyor; yani kendi zekâ seviyesindeki modeller arasında görev başına en düşük maliyete sahip. AA-Omniscience Index'te model, GLM-5.1'in 2 puanına karşılık 4 puan alıyor: doğruluk yüzde 24,2'den yüzde 25,1'e çıkarken halüsinasyon oranı yüzde 29,4'ten yüzde 28,1'e düşüyor, deneme oranı ise yüzde 47'de sabit kalıyor. Model, Intelligence Index'teki her görev için yaklaşık 43 bin çıktı tokenı kullanıyor; bunun 37 bini akıl yürütme tokenı.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.