Назад
SiTech Team⏱️ 1 წთ. საკითხავი

Інститут безпеки ШІ Великої Британії: стандартні тести систематично недооцінюють реальні можливості AI-агентів

Інститут безпеки ШІ Великої Британії: стандартні тести систематично недооцінюють реальні можливості AI-агентів

Дослідження UK AISI на 7 тестах показує: фіксовані обчислювальні бюджети систематично недооцінюють реальні можливості AI-агентів — збільшення ліміту токенів у 10 разів підвищило рівень успіху на ~25%.

🔍 Чому стандартні тести не вимірюють реальну силу AI-агентів?

Інститут безпеки штучного інтелекту Великої Британії (UK AISI) опублікував дослідження, яке стало одним із найважливіших відкриттів у сфері оцінки ШІ. Інститут протестував провідні AI-моделі на семи різних тестах і встановив, що стандартні тести систематично недооцінюють можливості AI-агентів.

Причина проста: кожен тест має фіксований обчислювальний бюджет — максимальну кількість токенів, яку може використати AI-агент. Дослідники AISI довели, що продуктивність AI-агента не є фіксованою точкою, а кривою, яка зростає зі збільшенням обчислювального часу тестування. Коли ми обрізаємо бюджет, поки ця крива ще зростає, отриманий бал показує мінімум, а не максимум.

📊 Обчислювальний бюджет — прихована змінна

Уявіть AI-агента, який намагається вирішити складне завдання з програмної інженерії. Агенту потрібно обдумати проблему, згенерувати кілька підходів, протестувати їх і виправити помилки. Кожен крок споживає токени. Дослідження AISI показує: коли обчислювальний бюджет було збільшено вдесятеро, рівень успіху в завданнях програмної інженерії зріс приблизно на 25%.

Це створює "ефект стелі" — тест вимірює тест, а не агента. Так само, як спортсмен, виміряний зламаним секундоміром, завжди здаватиметься повільнішим, AI-агенти, обмежені недостатнім обчислювальним бюджетом, виглядають менш здатними, ніж вони є насправді.

📖 Читати повну статтю на The Decoder