
LLM provayderləri model kartında yazandan asılı olmayaraq çox vaxt 32K kontekst verir
Açıq çəkili modellər üzərində hostinq edilən söhbət və kodlaşdırma agentinin müəllifi bildirir ki, yoxladığı endpoint-lərin əksəriyyəti elan olunan kontekst pəncərəsindən asılı olmayaraq təxminən 32K token verir və kəsilmə səssizcə baş verir.
Açıq çəkili modellər üzərində hostinq edilən söhbət və kodlaşdırma agentinin müəllifi 26 sentyabrda dev.to-da xəbərdarlıq dərc edib: model kartındakı kontekst pəncərəsi endpoint-in əslində verdiyi pəncərəyə nadir hallarda uyğun gəlir.
Kartdakı rəqəm aldığınız rəqəm deyil
Kartdakı pəncərə çəkilərin xassəsidir, istifadəçinin aldığı pəncərə isə bu çəkiləri kimin hostinq etdiyindən asılıdır. Müəllifin yoxladığı endpoint-lərin çoxu kartda nə yazılmasından asılı olmayaraq təxminən 32K token verir, bir neçəsi 256K-ya çatır, buraxılış elanlarındakı 1M rəqəmi isə hələ heç bir endpoint-də müşahidə olunmayıb.
Operatorun səbəbi var: maksimal kontekst uzunluğu eyni vaxtda işlənən sorğularla balanslaşdırılan KV-cache büdcəsidir və hər sorğuya milyon token baha başa gələrdi. Bu güzəşt nadir hallarda sənədləşdirilir və səssizcə uğursuz olur.
Heç bir xəta qaytarılmır
Nə 413, nə də xəbərdarlıq. Sorğu hansı hədd daha aşağıdırsa, ona uyğun cavablandırılır və kontekstin başlanğıcı sadəcə yox olur. Söhbətdə bunu görmək demək olar ki, mümkün deyil: söhbət zamanla bir az mənasızlaşır.
Agentli ssenarilərdə isə bu əsas məhdudiyyətdir: uzun build həddə çatır, compaction işə düşür, məqsəd təsviri qeyri-müəyyən xülasəyə çevrilir və artıq dəqiq bilməyən model planı səssizcə yenidən başladır. Xaricdən bu, uzun tapşırıqlarda zəif işləyən model kimi görünür, əsl səbəb isə hostinq konfiqurasiyasıdır.
Əsl həddi necə tapmaq olar
Qəsdən həddindən artıq böyük sorğu göndərib xətanı oxuyun: provayderlər əsl maksimumu adətən xəta mətnində göstərirlər, ona görə 1M vəd edən endpoint-ə 500K token göndərmək nə qayıtdığını göstərir. Digər üsul daha kobuddur: ən erkən məzmunun nəticəyə təsirini dayandırdığı nöqtəni tapıb geriyə saymaq.
Müəllifə görə nə sənədlər, nə də model kartı etibarlı olub.
Mənimsəməyə dəyər üç nəticə
Benchmark balı modeli konkret bir kontekst uzunluğunda ölçür, modelin özünü yox: eyni çəkilər 32K-da və 200K-da eyni agent deyil. Provayderləri token qiymətinə görə müqayisə edib real həddi fiksə etməmək fərqi qiymət adlandırmaqdır.
fallback-lı gateway-də hədd sessiyanın ortasında dəyişə bilər: 200K-lıq provayderdən 32K-lığa keçən iş xəta qaytarmır, konteksti kəsir. Bu, məhsuldarlıq deyil, düzgünlük problemidir.
RAG-də bu, axtarışın tənzimlənməsini səssizcə etibarsız edir: chunk ölçüsü, top-k və reranking kartdan götürülən büdcəyə uyğunlaşdırılır. 128K üçün tənzimlənmiş, amma 32K alan sistem artıq məlumat çəkir, yenidən sıralanmış chunk-lar kəsilir və cavab arxayın, lakin yanlış qayıdır; sonra komanda heç vaxt problem olmayan embedding modelini tənzimləməyə keçir.
Müəllifin istəyi qısadır: hər sorğu üçün real kontekst həcmini oxumaq imkanı, model metadatasında və ya cavab header-ində. O, Grunz-u qurduğunu bildirir.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.