Geri Dön
Context Language Models: bağlamı kendi yöneten modeller
SiTech AI Team2 dk okuma

Context Language Models: bağlamı kendi yöneten modeller

Washington Üniversitesi, MIT ve Meta araştırmacıları Context Language Models (CLM)'i tanıttı: modeller bağlamı dosya olarak saklayıp kendileri düzenliyor. BrowseComp-Plus'ta doğruluk %11,4 arttı, maliyet %21,5 azaldı.

Washington Üniversitesi, MIT ve Meta araştırmacıları, kendi bağlamını yöneten dil modelleri olan Context Language Models (CLM)'i tanıttı. Makale 29 Eylül'de arXiv'de yayımlandı.

Şimdiye kadar bağlamı dış mekanizmalar yönetiyordu: elle kurulan sistemler veya sınırlı araçlar. CLM'de bu iş modelin kendisine bırakılıyor.

Bağlam dosya olarak

CLM'de bağlam dosya olarak saklanır. Model dosyada serbestçe değişiklik yapabilir: ya yeni token'lar ekler ya da Bash yardımıyla herhangi bir bölümü düzenler. Her değişiklik anında modelin canlı bağlamına yansır.

Bağlam ayrı bir dosya olduğu için bir sistemde birkaç tane bulunabilir ve yaklaşım çok ajanlı sistemlere de uzanır. Testlerde modeller yeni davranışlar da sergiledi: çok ajanlı orkestrasyon için izleyiciler oluşturdular, iç kayıtlar için yeni bir sohbet rolü getirdiler ve bağlam yönetimi için çoklu işlevler tanımladılar.

Yazarlara göre sonuç "Bitter Lesson" fikrini doğruluyor: özgürlük, modele elle yazılmış kurallardan daha iyi stratejiler kazandırıyor.

Sonuçlar

CLM, Qwen3.6-27B ve GPT5.6-Sol gibi modellerde ek eğitim olmadan çalışır. Derin araştırma kıyaslaması BrowseComp-Plus'ta CLM, 32K bağlam sınırıyla %59,4 gösterdi: bu, en güçlü temel yöntemden %11,4 daha yüksek doğruluk ve %21,5 daha düşük FLOPs maliyetidir.

TerminalBench 2.1'de CLM en güçlü yöntemin doğruluğuna ulaştı, ancak %29,5 daha az FLOPs harcadı. 12 saatlik EdgeBench'te %59 daha az hesaplama maliyetiyle %5 daha yüksek puan gösterdi. Bir ajan grubunun birbiriyle bağımlı altı depo üzerinde çalıştığı 24 saatlik görevde, aynı bütçeyle %65 daha fazla hızlanma elde etti.

Eğitim ve verimlilik

CLM'in davranışı metin talimatlarıyla da yönetilebilir: kullanıcı istenen stratejiyi basitçe tanımlayabilir. Beceri optimizasyonu döngüsü, bağlam yönetimi talimatlarını kendisi iyileştirir; ContextBench'te doğruluk en fazla 35,9 puan arttı, hesaplama maliyeti ise düştü.

Yeni bir çevrimiçi pekiştirmeli öğrenme yöntemiyle yazarlar, Qwen3.5-9B modelinin BrowseComp-Plus'taki sonucunu %47,6 iyileştirdi ve FLOPs tüketimini %12 azalttı.

CLM bağlamı ortada da düzenler, bu da standart sunum sistemlerini önbelleği yeniden hesaplamaya zorlar. Yazarlar bu sorunu çözmek için SGLang için Suffix Cache Reuse (SCR) geliştirdi: SCR bir değişiklikten sonra değişmeden kalan bölümlerin önbelleğini korur ve sunucunun hesaplama maliyetini standart SGLang'e kıyasla %35 azaltır, aynı performansı koruyarak.

Karşılaştırma: standart SGLang ve Suffix Cache Reuse (SCR)

Kod GitHub'da yayımlandı. Pratikte uzun ömürlü ajanlar için bağlam yönetimi daha çok modelin kendisine, daha az elle kurulan dış sistemlere bağlı olacak.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.