Geri Dön
Büyük modeller çözüm değil: GPT-5.5 yüzde 86, GLM-5.2 yüzde 28 halüsinasyon görüyor
SiTech AI Team2 წთ. საკითხავი

Büyük modeller çözüm değil: GPT-5.5 yüzde 86, GLM-5.2 yüzde 28 halüsinasyon görüyor

arrowtsx.dev'de yayımlanan analiz, parametre yarışının tükendiğini savunuyor: MIT lisanslı açık model GLM-5.2 kıyaslamalarda GPT-5.5'e yaklaşırken doğrulukta onu açık ara geride bırakıyor.

Önde gelen yapay zekâ laboratuvarlarının sayısı arttıkça, parametre sayısındaki ve eğitim verisindeki sonsuz artışın kendiliğinden daha iyi modeller ürettiği varsayımına duyulan kuşku da artıyor. arrowtsx.dev'de 18 Haziran'da yayımlanan analizde yazar, ölçeklemenin sınırına ulaştığını ve büyük boyutun artık başka bir sorunla ilişkili olduğunu savunuyor: belirsizliğini kabul etmeyen modeller.

Kıyaslamalar ve parametre yarışı

Metin alışılmadık bir örnekle başlıyor. Claude Fable 5'e erişim, piyasaya çıkışından üç gün sonra ABD hükümeti tarafından kısıtlandı; yazara göre bu, tek bir jailbreak'in yarattığı risk nedeniyle ulusal güvenlik gerekçesiyle getirilen ilk ABD yapay zekâ yasağı. Bu arada Z.ai'nin açık ağırlıklı modeli GLM-5.2 (753 milyar parametre, yaklaşık 40 milyarı etkin), Artificial Analysis Intelligence Index'te GPT-5.5'in yalnızca 4 puan, Fable 5'in ise 9 puan gerisinde kalıyor. Opus 4.8 ve GPT-5.5 kapalı modeller ve ihtiyatlı tahminlerle 1–2 trilyon parametre aralığında. MIT lisanslı açık bir modelin, kendisinden bir buçuk ila iki kat büyük kapalı bir modele bu kadar yaklaşması, yazarın vardığı sonuca göre zekâ artışının büyük ölçüde durduğunu gösteriyor.

Halüsinasyon oranları

Analizin ikinci bölümü doğruluğa odaklanıyor. AA-Omniscience kıyaslamasında DeepSeek V4 Pro (1,6 trilyon parametre, 49 milyarı etkin) yüzde 94 halüsinasyon oranı kaydediyor: bilemediği sorularda yalnızca yaklaşık yüzde 6 oranında bilmediğini söyledi. GLM-5.2 yüzde 28, Opus 4.8 yüzde 36, Fable 5 yüzde 48, GPT-5.5 ise yüzde 86 aldı. Yazara göre çok büyük hacimde olgusal veriyle eğitilen modeller, "bilmiyorum" demek yerine her zaman bir yanıt üretmeyi öğreniyor.

Bir test ve çözülmemiş bir üçleme

Bunu göstermek için iki modele de bariz bir mimari kusur içeren karmaşık bir Python sorusu verildi; yüksek akıl yürütme eforu ve sıcaklık 1 ayarlarıyla, OpenRouter üzerinden. DeepSeek V4 Pro neredeyse on kat daha fazla akıl yürütme jetonu harcadı ve yine de kendinden emin biçimde yanlış yanıt verdi. GLM-5.2'nin, tek iş parçacıklı bir görevin denetimi hiç bırakmadan çoklanmış G/Ç yürütmesinin olanaksızlığını fark etmesi yaklaşık 12 saniye ve 800 jeton sürdü. Ayrı bir denemede DeepSeek V4 Pro, iyi biçimlendirilmiş ama hatalı bir çözüm sunmadan önce akıl yürütme döngüsünde 3 dakika 26 saniye harcadı.

Sonuç şu: model eğitimi ve seçimi çözülmemiş bir üçleme etrafında tasarlanmalı — ham yetenek, belirsizlik kalibrasyonu ve hesaplama verimliliği. Yazının uyarısına göre bir modeli yalnızca boyutuna ya da sıralamadaki yerine göre seçmek, giderek yanlış bir yanıtı ikna edici biçimde savunacak bir sistemi seçmek anlamına geliyor.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.