METR представляє нову метрику: коли AI-агенти стають дорожчими за людей?

კვლევითმა ორგანიზაცია METR-მა 'expenditure horizon' (ხარჯვის ჰორიზონტი) შემოიღო — მეტრიკა, რომელიც ზუსტად განსაზღვრავს, როდის ხდება AI აგენტები უფრო ძვირი, ვიდრე ადამიანური შრომა. ნანოGPT-ს ტესტებმა აჩვენა, რომ თითოეული 1%-იანი აჩქარება ადამიანს $2,500 უჯდება.
METR представляє нову метрику: коли AI-агенти стають дорожчими за людей?
Дослідницька організація METR (Model Evaluation and Threat Research) запропонувала нову метрику під назвою «expenditure horizon» (горизонт витрат) — показник у доларах, який точно визначає, коли AI-агенти стають дорожчими, ніж людська праця.
Що таке горизонт витрат (expenditure horizon)?
«Горизонт витрат» — це метрика, яка порівнює вартість виконання завдання AI-агентом із вартістю виконання тієї самої роботи людиною. Вона показує поріг, після якого використання штучного інтелекту стає дорожчим, ніж наймання співробітника. Це особливо важливо для компаній, які оцінюють окупність інвестицій (ROI) у технології AI.
Метрика об'єднує обидва типи витрат в єдиній валюті, що дозволяє проводити пряме порівняння. Вона враховує не лише прямі витрати на обчислювальні ресурси для AI, але й вартість людської праці, включаючи години роботи та погодинні ставки.
Тестування на NanoGPT Speedrun
METR протестувала свою метрику на проєкті NanoGPT speedrun — громадській ініціативі, спрямованій на прискорення тренування моделей GPT. Проєкт пройшов 82 кроки вдосконалення, досягнувши 33-кратного прискорення з травня 2024 року.
Людська праця: 16 годин роботи на 1% прискорення = $2,500 (при ставці $150/год). Вартість AI-агентів є змінною — вони часто дешевші для простих завдань, але дорожчі для складних комплексних проєктів. Час тренування NanoGPT скоротився з 45 хвилин до менш ніж 2 хвилин, що демонструє вражаючий прогрес у галузі.
Практичне значення для бізнесу
Для підприємств, які розглядають впровадження AI, «горизонт витрат» допомагає відповісти на ключове питання: які завдання варто доручати AI, а які — залишити людям? Прості, повторювані операції часто економічно вигідніше виконувати за допомогою AI, тоді як складні, творчі або багатоетапні завдання можуть потребувати людського втручання.
Обмеження метрики
Метрика має певні сліпі зони: вона вимірює лише роботу AI у повністю автономному режимі, не враховуючи необхідності людського нагляду. Крім того, новітні моделі AI можуть суттєво змінити результати. Незважаючи на ці обмеження, «горизонт витрат» залишається цінним інструментом для бізнесу, що допомагає приймати обґрунтовані рішення про впровадження AI-агентів.
Джерело: the-decoder.com