Назад
ThinkingBox від Microsoft оцінює AI-агентів за записами, залишеними в базі даних
SiTech AI Team3 хв читання

ThinkingBox від Microsoft оцінює AI-агентів за записами, залишеними в базі даних

Бенчмарк ThinkingBox від Microsoft і Hugging Face проганяє AI-агентів через 507 бізнес-процесів зі станом 20 разів і оцінює кінцевий стан і побічні ефекти, а не лише фінальні відповіді.

Стан, а не слова

Бенчмарк ThinkingBox від Microsoft і Hugging Face оцінює AI-агентів за записами, залишеними назад, а не лише за викликами інструментів або фінальними формулюваннями. Він охоплює 507 бізнес-процесів зі станом і проганяє кожне завдання 20 разів із чистого backend. В одному окремому випадку агент використав дев’ять викликів інструментів для запізнілої кухонної техніки на $745, а потім позначив квиток кур’єра як вирішений, хоча виняток перевізника залишався відкритим. Потрібним станом був hold, що спричинює невдачу, яку оцінювач викликів інструментів пропустив би.

Кожна спроба відбувається в ізольованій MCP-сесії з новоініціалізованим станом. Захоплення побічних ефектів фіксує зміни, а детерміновані судді порівнюють результат із потрібним результатом. Тестовий каркас і набори даних доступні на Hugging Face, а ThinkingBox-Bench — через OpenEnv. З 507 завдань 477 оцінюються лише за станом, а 30 додають рубрики відповідей для вимог, які не можна уявити лише за значенням чистої бази даних.

Стабільність — це окремий результат

ThinkingBox повідомляє pass@1, pass@20 і зафіксовані 20/20. Pass@1 вимірює частку успішних окремих спроб. Pass@20 вимірює завдання, які були вирішені хоча б один раз за 20 спроб, а зафіксовані 20/20 рахують завдання, які проходять у кожній спробі. У загальному порівнянні Claude Opus 5.5 лідирував у pass@1 з 67,16%, за ним йшли Claude Opus 5 з 66,50% і GPT-5.4 з 65,36%.

Повторюваність змінила картину. Kimi-K3 вирішив 476 з 507 завдань хоча б один раз, тобто 93,89%, але лише 68 завдань пройшли всі 20 спроб, тобто 13,41%. Claude Opus 5 пройшов 241 завдання у всіх 20 спробах, стільки ж, скільки Claude Opus 5.5. У абляції 121 680 дійсних спроб на 12 моделях 79 853 спроби впали під час виконуваних перевірок. З цих невдач 67,24% завершилися чисто, викликали інструмент, що змінює стан, і не повідомили фінальному інструменту про помилку. Перевірки виявили неправильні значення полів у 77,61%, зайві ефекти у 43,30% і пропущені необхідні ефекти у 25,36%; ці дані перетинаються.

Робота з інструментами та розгортання

У причинах невдач домінувало використання інструментів на 79,9%, за ним йшли неправильні оновлення стану на 10,3%, неповні рішення користувача на 7,0% і відсутність дії, що змінює стан, на 2,9%. Автори описують це як незважені середні частки та спостережувані причини для кожної моделі, а не як унікальні причинні пояснення. За їхніми словами, агенти часто починають робочий процес, але не можуть відновити помилки інструментів, невдалі передумови або порожні пошуки.

Для розгортання автори рекомендують перевіряти кінцевий стан перед здачею, класифікувати помилки інструментів і системні помилки, зменшувати поверхню інструментів і вимагати підтвердження людини для змін, які важко відкотити. Вони не вимірювали вплив цих заходів на бенчмарк. ThinkingBox також оцінює вартість надійного завдання, яка розраховується за 20-кратною кампанією та кількістю завдань, що пройшли всі 20 спроб. Серед моделей, які мають принаймні одне зафіксоване завдання 20/20, найнижчі оцінки в таблиці склали $6,80 для GPT-5.4, $7,45 для GPT-6 Astra і $7,80 для Claude Opus 5.5. Це відносні оцінки, а не фактичні хмарні рахунки. За публічним бенчмарком усі завдання є синтетичною реконструкцією, а робочі процеси та політики змодельовані за реальними патернами виробничих агентів; його користувачі не є реальними.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.