
LLM sağlayıcıları model kartı ne derse desin çoğu zaman 32K bağlam veriyor
Açık ağırlıklı modeller üzerinde çalışan bir sohbet ve kodlama ajanı geliştiren mühendis, test ettiği uç noktaların çoğunun duyurulan bağlam penceresine bakmaksızın yaklaşık 32K token verdiğini ve kırpmanın hatasız gerçekleştiğini aktarıyor.
Açık ağırlıklı modeller üzerinde barındırılan bir sohbet ve kodlama ajanı işleten geliştirici, 26 Eylül'de dev.to'da uyardı: model kartındaki bağlam penceresi, uç noktanın gerçekte sunduğu pencereyle nadiren örtüşüyor.
Karttaki sayı, aldığınız sayı değil
Karttaki pencere ağırlıkların bir özelliğidir; istemcinin aldığı pencere ise bu ağırlıkları kimin barındırdığına bağlıdır. Yazarın test ettiği uç noktaların çoğu, kart ne iddia ederse etsin yaklaşık 32K token sunuyor; birkaçı 256K'ya ulaşıyor ve sürüm duyurularındaki 1M rakamını gerçekten sunan bir uç noktaya henüz rastlamadı.
İşletmecinin gerekçesi var: en yüksek bağlam uzunluğu eşzamanlılıkla dengelenen bir KV-cache bütçesidir ve her isteğe milyon token sunmak çok pahalı olurdu. Bu denge nadiren belgeleniyor ve sessizce başarısız oluyor.
Hiçbir hata dönmüyor
413 yok, uyarı yok. İstek hangi tavan en düşükse ona göre yanıtlanır ve bağlamın başı öylece kaybolur. Sohbette bu neredeyse görünmezdir: konuşma zamanla biraz aptallaşır.
Ajan tabanlı işlerde ise bu belirleyici kısıttır: uzun bir build tavana çarpar, compaction devreye girer, hedef tanımı belirsiz bir özete dönüşür ve ne yaptığını artık bilmeyen model planı sessizce baştan başlatır. Dışarıdan bu, uzun görevlerde başarısız bir model gibi görünür; neden barındırma yapılandırmasıdır.
Gerçek tavanı bulmak
Bilinçli olarak aşırı büyük bir istem gönderip hatayı okuyun: sağlayıcılar gerçek üst sınırı genellikle hata metninde açığa vurur, bu yüzden 1M vaat eden bir uç noktaya 500K token göndermek ne döndüğünü gösterir. Diğer yöntem daha kaba: en eski içeriğin çıktıyı etkilemeyi bıraktığı noktayı bulup geriye saymak.
Yazara göre ne sağlayıcı belgeleri ne de model kartı güvenilir oldu.
İçselleştirilmesi gereken üç sonuç
Bir benchmark puanı, bir modeli tek bir bağlam uzunluğunda ölçer, modelin kendisini değil: aynı ağırlıklar 32K'da ve 200K'da aynı ajan değildir. Hizmet verilen tavanı sabitlemeden sağlayıcıları token başına maliyetle karşılaştırmak farkı fiyat saymaktır.
Fallback kullanan bir gateway'de tavan oturum ortasında değişebilir: 200K'lık sağlayıcıdan 32K'lığa geçen çalıştırma hata vermez, bağlamı keser. Bu bir performans değil doğruluk sorunudur.
RAG'de bu, erişim ayarlarını geçersiz kılar: chunk boyutu, top-k ve reranking karttan alınan bütçeye göre ayarlanır. 128K için ayarlanmış ama 32K ile hizmet verilen sistem fazla veri çeker, yeniden sıralanan chunk'lar kesilir ve yanıt kendinden emin ama yanlış döner; ekip ardından hiç sorun olmayan embedding modelini ayarlamaya girişir.
Yazarın isteği kısa: istek başına geçerli bağlamın okunabileceği bir yol, model meta verisi ya da yanıt başlığında. Açık ağırlıklı modeller üzerinde çalışan Grunz'u geliştirdiğini belirtiyor.
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.