Назад
AI-агенти беруть на себе більше роботи в розробці моделей, але рішення ухвалюють люди
SiTech AI Team2 წთ. საკითხავი

AI-агенти беруть на себе більше роботи в розробці моделей, але рішення ухвалюють люди

Команда Університету Фудань проаналізувала понад 700 журналів завдань власного проєкту з розробки моделі: AI використовували в 96.5% завдань, але 85.5% рішень щодо методів і 93.4% щодо цілей ухвалили люди.

Дослідники з Університету Фудань у Китаї вивчили власний проєкт, щоб з'ясувати, хто насправді ухвалює рішення, коли AI-агенти допомагають створювати модель AI; вони проаналізували понад 700 журналів завдань від 56 учасників.

Результатом проєкту стала Atria Dawn Preview, агентна мовна модель на архітектурі mixture-of-experts із 744 мільярдами параметрів. Кожне завдання під час навчання прив'язане до реального середовища виконання й перевіряється тестами, метриками чи доказами з джерел. За словами команди, модель лідирує в п'яти з 16 бенчмарків, зокрема у вебпошуку та кібербезпеці, але загальної переваги не має.

Агенти беруть на себе більше роботи

AI використовували в 96.5% розглянутих завдань. За чотири тижні медіанна кількість дій агента на одне введення людини зросла з 11 до 28.5, і команда застерігає тлумачити це як зростання автономії: кожне рішення людини лише запускало більше кроків агента.

Учасники також оцінювали, чи могли б виконати свою частину завдання без AI. З 455 завершених завдань із підтримкою AI 151, приблизно третина, виявилися неможливими без нього, і вони розподілилися між 27 із 56 учасників. AI уможливив роботу, яка інакше ніколи б не почалася.

AI пропонує, людина обирає

Для методів і параметрів найпоширенішою схемою була «AI пропонує, людина обирає», 55.4%. Люди ухвалили 85.5% таких рішень проти 9.2% в AI, а останнє слово щодо цілей і масштабу в 93.4% випадків залишалося за ними.

Діаграма: остаточне рішення переважно ухвалює людина

Та сама картина спостерігається, коли щось іде не так. Із 588 завдань із зафіксованими труднощами 76% просунулися завдяки втручанню людини, а 23% агент розв'язав самостійно; допомога переважно була у формі додавання контексту (35.2%) чи діагностики (34.7%), а не ручної праці.

Ризик формального схвалення

Коли кожне рішення спирається на довший ланцюг роботи агента, ніж людина здатна перевірити, нагляд ускладнюється; у найгіршому разі люди стають рецензентами, які можуть лише формально схвалювати побачене, пишуть автори. Багато учасників запускали агентів в автономних режимах із міркувань зручності, а не як свідомий вибір про обсяг повноважень AI.

Стаття з'являється в розпал дискусії про рекурсивне самовдосконалення: Anthropic вважає, що AI, який розробляє власного наступника, може стати реальністю раніше, ніж очікувалося, і її CEO Даріо Амодеї закликає запровадити обмеження швидкості для галузі, а понад тисяча працівників провідних AI-компаній попередили, що їхні організації можуть бути на порозі автоматизації AI-досліджень.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.