Назад
SoL-Pi від NVIDIA скорочує витрати токенів кодинг-агента майже вдвічі
SiTech AI Team2 წთ. საკითხავი

SoL-Pi від NVIDIA скорочує витрати токенів кодинг-агента майже вдвічі

Дослідники NVIDIA створили SoL-Pi — систему, яка автоматично оптимізує керівний шар кодинг-агента. Вона зберігає лише ті зміни, що не шкодять якості, і зменшує трафік токенів на 44,7-49%.

Дослідники NVIDIA створили SoL-Pi — систему, яка оптимізує harness, керівний шар між моделлю та середовищем, на якому працюють кодинг-агенти Codex, Claude Code та OpenClaw. Згідно зі статтею, опублікованою на arXiv 17 вересня і описаною The Decoder, оптимізований harness зберігає порівнянну якість, зменшуючи трафік токенів на 44,7-49%, а витрати на API — приблизно на третину.

Цикл автоматичного дослідження SoL-Pi

Ціллю стає сам harness

Робота над ефективністю зазвичай стосується самої моделі: швидші attention-ядра, квантування або дешевші моделі. SoL-Pi натомість змінює те, як агент бачить стани, виконує дії та обробляє зворотний зв'язок. Дослідницький AI читає трасування агента на базовому harness, пропонує зміни й перевіряє їх у підготовлених середовищах; кандидат залишається лише тоді, коли не виходить за оголошений допуск за якістю і покращує метрику ефективності.

Пошук охопив 152 напрями в шести родинах, зокрема контекст, інструменти, делегування та оцінювання, на 535 виконуваних середовищах. Це дало понад 3000 запусків і понад 60 000 взаємодій агента із середовищем.

Чотири механізми

Після відбору залишилися чотири механізми. Action Fusion об'єднує два послідовні кроки в один і усуває цілий виклик моделі. Online Context Compact скорочує накопичений контекст після кожного кроку планування, але лише коли нічого важливого не втрачається. ObservationPack архівує довгі виводи інструментів і надсилає короткий підсумок замість повного тексту. Evidence-Preserving Reducer передає великі журнали помилок і тестів дешевшій моделі, яка виділяє головне.

На EdgeBench варіант із усіма чотирма механізмами витрачає на 49% менше токенів і сягає 93,7% базового результату Pi, а витрати на API падають на 50,0% проти Codex і 54,3% проти Claude Code. Варіант із найсильнішим механізмом перевищує Pi на 5,3%. В одному запуску витрати впали з $1339 до $894. За оцінкою авторів, економія становить $8,75-13,50 на годину проти Codex і Claude Code та $4,36-5,71 проти Pi.

Систему побудували лише на GPT-5.6 Sol, а потім без змін застосували до Opus 5, де вона зберегла 94,3% продуктивності Pi за подібної економії; механізми просто спрацьовували рідше.

На інших бенчмарках картина змішана

Із 63 CPU-завдань Terminal-Bench 4 система розв'язала 15, Codex і Pi — по 18, хоча витрати лишилися на чверть нижчими. На перевірених задачах Lean 4 з IMO 2026 вона розв'язала три з шести із найнижчою ціною за задачу, а рій із 20 працівників SoL-Pi зменшив витрати на оптимізацію ядер на 26,8%.

Скорочення контексту теж має ціну: The Decoder зазначає, що окреме дослідження виявило: стиснення контексту зберігає в середньому лише 17% інструкцій користувача.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.