
Чому великим контекстним вікнам не варто довіряти
Нотатка стверджує, що мовні моделі втрачають точність задовго до заявлених лімітів контексту. Практичний вихід — короткі сесії та письмові специфікації замість сирої історії.
Нотатка, опублікована на Garrit's Notes 6 травня 2026 року, доводить, що рекламні цифри контекстних вікон великих мовних моделей описують місткість, а не реальний робочий простір. Автор посилається на відео, яке поділяє вікно на дві зони: «розумну», де модель працює точно, і «дурну», де увага падає і модель починає забувати вказівки, надані кілька хвилин тому. За його оцінкою, межа проходить приблизно на 100 000 токенів.
Агенти сягають межі ще до обіду
Ця різниця найбільше важить для агентів, які пишуть код, адже вони швидко спалюють токени. Кілька читань файлів, довга сесія налагодження та об'ємний прогін тестів можуть перевести сесію за 100 тисяч токенів ще до обіду. Виробники тим часом рекламують вікна на 200 тисяч, 1 мільйон і навіть 2 мільйони токенів, наче ці числа описують придатний для роботи обсяг пам'яті.
Автор посилається на опубліковані дослідження, зокрема бенчмарк RULER і звіт Chroma про «гниття контексту» (context rot), які, за його словами, показують, що ефективний контекст становить лише частку заявленої цифри, а продуктивність поступово погіршується в міру заповнення вікна. Його висновок: більше число — переважно маркетинговий показник, а архітектури за ним не розв'язують глибинної проблеми механізму уваги.
Стискання допомагає, але приходить запізно
Сучасні агенти почали це компенсувати. Інструменти на кшталт Claude Code автоматично стискають сесію: коли вона стає довгою, агент підсумовує історію і починає заново. Це допомагає, зазначає автор, але стискання вмикається після того, як час уже витрачено в деградованій зоні, а сам підсумок пише модель, яка вже деградувала. Краще, ніж нічого, додає він, але не той варіант, який він обрав би.
Його альтернатива — відкрити нову сесію і передати їй специфікацію, написану власноруч. Це значно вищий за сигналом спосіб передачі, ніж будь-який автоматичний підсумок, бо саме людина вирішує, що важливо далі. Він описує це як підхід «крихт» (breadcrumbs), застосований до агентів: залишити артефакт, який наступна сесія або наступна людина підхопить без втрат.
Артефакти замість історії
Проєкти obra/superpowers і mattpocock/skills будують цілі робочі процеси агентів навколо невеликих іменованих артефактів — документів вимог, планів, навичок (skills) і передач між субагентами. Кожен із них виносить інформацію з живої сесії в щось, що може прочитати наступна сесія, утримуючи робочий контекст у зоні, де модель ще точна. Правило автора — ставитися до контекстного вікна як до бюджету: припускати, що реально працює лише його початкова частина, а все інше переносити в текст.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.