Geri Dön
“Modeller kasten aptallaşıyor”: laboratuvarlar bilgiyi akıl yürütmeyle değişiyor
SiTech AI Team2 წთ. საკითხავი

“Modeller kasten aptallaşıyor”: laboratuvarlar bilgiyi akıl yürütmeyle değişiyor

Bir blog yazısı, AI laboratuvarlarının dünya bilgisini bilinçli olarak akıl yürütme becerisiyle değiştirdiğini savunuyor: modeller matematik ve kodda ilerliyor, olguları hatırlamada geriliyor.

“Models Are Getting Dumber on Purpose” başlıklı blog yazısında yazar, önde gelen AI laboratuvarlarının dünya bilgisini bilinçli olarak akıl yürütme becerisiyle değiştirdiğini savunuyor: modeller her token başına daha az hesaplamayla matematik ve kod görevlerini çözüyor, ancak olguları hatırlamakta zorlanıyor.

Zıt yönleri gösteren kıyaslamalar

Yazıya göre GLM-5.2, AIME 2026'da token başına yaklaşık 40 milyar aktif parametreyle %99,2 alıyor; Qwen3.5 17 milyarla %91,3'e ulaşıyor; DeepSeek V4-Flash ise 13 milyarla çalışıyor. Kıyas için: 2023'te GPT-4'e yaklaşık 280 milyar aktif parametre atfediliyordu ve bir AIME sorusunu zar zor çözebiliyordu. Qwen3.5 9B, nicemlenmiş halde 6GB görüntü belleğine sığıyor ve Artificial Analysis zekâ endeksinde 10 milyar parametrenin altındaki en iyi modelin puanını yaklaşık ikiye katlıyor. Olgu hatırlama ise tersini gösteriyor: araç kullanımının yasak olduğu SimpleQA'da lider %53 ile Gemini 2.5 Pro, Qwen3.5 4B ve 9B'nin halüsinasyon oranı ise %80–82.

Olgular eskir, yöntemler eskimez

Bilgi kapasitesi üzerine araştırmalar, “Physics of Language Models” dizisi dahil, parametre başına yaklaşık iki bit olgusal bilgi tahmin ediyor. Yazar, akıl yürütmenin daha iyi sıkıştığını söylüyor; çünkü o, tekrar tekrar uygulanan küçük bir yöntemler kümesi: problemi parçalara ayırmak, ara durumu izlemek, kendi işini denetlemek, gerektiğinde geri dönmek. Phi-4, 14 milyar parametreli, ağırlıklı olarak ders kitabı tarzı sentetik veriyle eğitilmiş bir model: matematikte iyi, önemsiz olgularda zayıf. Olguların raf ömrü var — API'ler ve fiyatlar değişiyor, cebir ise değişmiyor.

Bilgi artık nerede duruyor

Modeller olguları saklamıyorsa bunu başka bir şey sağlıyor: arama, araç çağrıları, web araması, dokümantasyon. Bir kod ajanının bağımlılığın API yüzeyini ezbere bilmesi gerekmiyor; node_modules içinde arama yapıyor ya da dokümanı okuyor. Yazar, birkaç yıl içinde frontier kalitesinde akıl yürütmenin tek bir tüketici ekran kartında çalışacağını öngörüyor: DeepSeek V4-Flash hâlihazırda yaklaşık 13 milyar aktif parametreyle akıl yürütüyor; diğer 271 milyar ise çoğunlukla olgu deposu olan uzman katmanlarında duruyor. Ağırlıklara işlenmiş yanlış bir olgu ince ayar olmadan düzeltilemez; oysa bir dokümandaki hata düzeltilebilir ve sonraki tüm sorgular bundan yararlanır. Yazara göre model kartları bir gün bilgi kesinti tarihini hiç listelemeyebilir.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.