
AI-агенти беруть на себе більше роботи в розробці моделей, але рішення ухвалюють люди
Команда Університету Фудань проаналізувала понад 700 журналів завдань власного проєкту з розробки моделі: AI використовували в 96.5% завдань, але 85.5% рішень щодо методів і 93.4% щодо цілей ухвалили люди.
Дослідники з Університету Фудань у Китаї вивчили власний проєкт, щоб з'ясувати, хто насправді ухвалює рішення, коли AI-агенти допомагають створювати модель AI; вони проаналізували понад 700 журналів завдань від 56 учасників.
Результатом проєкту стала Atria Dawn Preview, агентна мовна модель на архітектурі mixture-of-experts із 744 мільярдами параметрів. Кожне завдання під час навчання прив'язане до реального середовища виконання й перевіряється тестами, метриками чи доказами з джерел. За словами команди, модель лідирує в п'яти з 16 бенчмарків, зокрема у вебпошуку та кібербезпеці, але загальної переваги не має.
Агенти беруть на себе більше роботи
AI використовували в 96.5% розглянутих завдань. За чотири тижні медіанна кількість дій агента на одне введення людини зросла з 11 до 28.5, і команда застерігає тлумачити це як зростання автономії: кожне рішення людини лише запускало більше кроків агента.
Учасники також оцінювали, чи могли б виконати свою частину завдання без AI. З 455 завершених завдань із підтримкою AI 151, приблизно третина, виявилися неможливими без нього, і вони розподілилися між 27 із 56 учасників. AI уможливив роботу, яка інакше ніколи б не почалася.
AI пропонує, людина обирає
Для методів і параметрів найпоширенішою схемою була «AI пропонує, людина обирає», 55.4%. Люди ухвалили 85.5% таких рішень проти 9.2% в AI, а останнє слово щодо цілей і масштабу в 93.4% випадків залишалося за ними.
Та сама картина спостерігається, коли щось іде не так. Із 588 завдань із зафіксованими труднощами 76% просунулися завдяки втручанню людини, а 23% агент розв'язав самостійно; допомога переважно була у формі додавання контексту (35.2%) чи діагностики (34.7%), а не ручної праці.
Ризик формального схвалення
Коли кожне рішення спирається на довший ланцюг роботи агента, ніж людина здатна перевірити, нагляд ускладнюється; у найгіршому разі люди стають рецензентами, які можуть лише формально схвалювати побачене, пишуть автори. Багато учасників запускали агентів в автономних режимах із міркувань зручності, а не як свідомий вибір про обсяг повноважень AI.
Стаття з'являється в розпал дискусії про рекурсивне самовдосконалення: Anthropic вважає, що AI, який розробляє власного наступника, може стати реальністю раніше, ніж очікувалося, і її CEO Даріо Амодеї закликає запровадити обмеження швидкості для галузі, а понад тисяча працівників провідних AI-компаній попередили, що їхні організації можуть бути на порозі автоматизації AI-досліджень.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.