Назад
Unreal Labs представила Unreal Agent — асинхронний harness з економією до 40%
SiTech AI Team2 წთ. საკითხავი

Unreal Labs представила Unreal Agent — асинхронний harness з економією до 40%

Unreal Labs опублікувала деталі Unreal Agent — harness, який повністю асинхронно керує викликами інструментів. На Terminal-Bench 4.0 він повторює результат Codex, коштуючи значно дешевше за прогін.

Unreal Labs опублікувала подробиці про Unreal Agent — агентний harness, ключове рішення якого полягає в тому, що виклики інструментів керуються повністю асинхронно, тож моделі не потрібно чекати, опитувати чи надсилати heartbeat для інструмента. За словами компанії, поточна версія зменшує витрати до 40% порівняно з Codex і до 20% порівняно з Pi на реальних навантаженнях і агентних бенчмарках.

Harness виник із практичної проблеми: агенти витрачають значну частину часу й токенів на керування викликами інструментів, а не на корисну роботу. Дизайн також дозволяє керувати агентом у будь-який момент, не чекаючи завершення поточного виклику.

Асинхронне середовище виконання викликів

Щоразу, коли Unreal Agent викликає інструмент, він одразу додає до журналу подій запис про те, що інструмент повернувся у стані «виконується», і продовжує його роботу у фоні. Коли інструмент справді завершується, результат додається до журналу сесії, після чого відбувається виклик моделі. Компанія зазначає, що патерн із двома результатами виклику — проміжним і фінальним — поки що недостатньо описаний у документації Responses API.

Співвідношення якості та витрат для кодингових агентів

Результати бенчмарків

У тестах із GPT-6 Astra у режимі xhigh Unreal Agent повторив базовий результат Codex на Terminal-Bench 4.0 — 57.9% проходжень за 1428 доларів проти 2350. На SWE-Atlas Codebase QnA він показав 65.8% за 936 доларів проти 63.3% за 1303 долари в Codex. На DeepSWE 1.1 результат — 72.4% за 1367 доларів проти 69.0% за 1633 долари. На наборі ALE-CLI агент отримав 30.0% повних проходжень і середній бал 59.7 за 217 доларів, тоді як Codex — 29.0% і 58.1 за 292 долари. Незначну різницю Unreal Labs пояснює варіативністю бенчмарків і зазначає, що harness не залежить від домену.

Чому не використали наявні SDK

У публікації йдеться, що єдиного правильного шляху для створення agent-first продукту немає. Орієнтовані на CLI SDK, як-от Agent SDK від Claude, припускають локальні сесії, підпроцеси й обмеження ресурсів, які погано переносяться у продакшен, і командам доводиться будувати власне керування життєвим циклом для завершення, скасування та фонових задач. Підтримка кількох провайдерів додає роботи із сумісності: зміна режиму API може зламати інструменти чи компакцію, а оновлення SDK — змінити формати повідомлень. Підтвердження через хуки harness потребують більшого догляду, ніж детерміновані обмеження sandbox.

Тож Unreal Agent лишається компактним: прості промпти, оптимізовані за токенами результати інструментів, без субагентів і робочих процесів. SDK містить бібліотеку для Go, runner, подібний до claude -p, і benchmark runner, сумісний із Harbor; код доступний на GitHub.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.