
Böyük modellər həll yolu deyil: GPT-5.5 86%, GLM-5.2 isə 28% halüsinasiya edir
arrowtsx.dev-də dərc olunan təhlil parametr yarışının tükəndiyini iddia edir: MIT lisenziyalı açıq model GLM-5.2 göstəricilərdə GPT-5.5-ə yaxınlaşır, dəqiqlikdə isə onu xeyli üstələyir.
Aparıcı süni intellekt laboratoriyaları parametrlərin sayının və təlim məlumatlarının sonsuz artımının avtomatik olaraq daha yaxşı model yaratdığı fərziyyəsinə getdikcə daha çox şübhə ilə yanaşır. arrowtsx.dev saytında 18 iyunda dərc olunan təhlildə müəllif miqyaslamanın həddinə çatdığını və böyük ölçünün artıq başqa bir problemlə bağlı olduğunu iddia edir: qeyri-müəyyənliyini qəbul etməyən modellər.
Müqayisə göstəriciləri və parametr yarışı
Mətn qeyri-adi bir nümunə ilə başlayır. Claude Fable 5-ə giriş buraxıldıqdan üç gün sonra ABŞ hökuməti tərəfindən məhdudlaşdırıldı; müəllifə görə bu, milli təhlükəsizlik səbəbilə qoyulan ilk ABŞ süni intellekt qadağasıdır və səbəbi tək bir jailbreak riskidir. Bu arada Z.ai-nin açıq çəkili modeli GLM-5.2 (753 milyard parametr, təxminən 40 milyardı aktiv) Artificial Analysis Intelligence Index-də GPT-5.5-dən cəmi 4 xal, Fable 5-dən isə 9 xal geri qalır. Opus 4.8 və GPT-5.5 qapalı modellərdir və ehtiyatlı təxminlərlə 1–2 trilyon parametr aralığında qiymətləndirilir. MIT lisenziyalı açıq modelin özündən bir yarım-iki dəfə böyük qapalı modelə bu qədər yaxınlaşması, müəllifin nəticəsinə görə, intellekt artımının praktiki olaraq dayandığını göstərir.
Halüsinasiya göstəriciləri
Təhlilin ikinci hissəsi doğruluğa həsr olunub. AA-Omniscience testində DeepSeek V4 Pro (1,6 trilyon parametr, 49 milyardı aktiv) 94% halüsinasiya göstəricisi qeydə alır: bilmədiyi suallarda bunu yalnız təxminən 6% halda etiraf edib. GLM-5.2 28%, Opus 4.8 36%, Fable 5 48%, GPT-5.5 isə 86% alıb. Müəllifin fikrincə, çox böyük həcmdə faktiki məlumatla təlim edilən modellər "bilmirəm" demək əvəzinə həmişə cavab verməyi öyrənir.
Test və həll olunmamış üçlük
Bunu göstərmək üçün hər iki modelə aşkar arxitektura qüsuru olan mürəkkəb Python sualı verildi — yüksək reasoning effort və temperature 1 parametrləri ilə, OpenRouter vasitəsilə. DeepSeek V4 Pro təxminən on qat çox düşünmə tokeni xərclədi və yenə də özündən əmin şəkildə yanlış cavab verdi. GLM-5.2-yə tək axınlı tapşırığın nəzarəti heç vaxt ötürmədən multiplekslənmiş I/O yerinə yetirə bilməyəcəyini anlamaq üçün təxminən 12 saniyə və 800 token lazım oldu. Ayrı sınaqda DeepSeek V4 Pro yaxşı formatlanmış, lakin səhv həll təqdim etməzdən əvvəl düşünmə dövrəsində 3 dəqiqə 26 saniyə sərf etdi.
Nəticə belədir: model təlimi və seçimi həll olunmamış üçlük ətrafında qurulmalıdır — xam qabiliyyət, qeyri-müəyyənliyin kalibrlənməsi və hesablama səmərəliliyi. Müəllif xəbərdar edir ki, modeli yalnız ölçüsünə və ya reytinq cədvəlindəki yerinə görə seçmək getdikcə yanlış cavabı inandırıcı şəkildə müdafiə edəcək bir sistem seçmək deməkdir.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.