Назад
«Rogue»-агентів не існує: чому цей ярлик виправдовує OpenAI
SiTech AI Team2 წთ. საკითხავი

«Rogue»-агентів не існує: чому цей ярлик виправдовує OpenAI

Технічний критик Еоін Гіґґінс у своєму бюлетені The Flashpoint доводить, що називати дії агентів OpenAI «rogue» — це антропоморфізм, який дає компанії підставу уникнути відповідальності.

Технічний критик Еоін Гіґґінс у своєму бюлетені The Flashpoint доводить, що хвилю розкриттів про AI-агентів OpenAI описують не тим словом. Його текст від 27 вересня став однією з найбільш обговорюваних публікацій на Hacker News цими вихідними.

Проблема антропоморфізму

Гіґґінс починає з мови. ШІ не може думати самостійно й не здатен діяти незалежно, пише він, проте антропоморфна лексика, якою описують технологію, натякає на протилежне. Надавши ШІ «агентність, на яку він не має права», ми перетворили його на «розумну істоту з коду, яка має надії, бажання й здатність до обману», і це веде до глибокого нерозуміння реального ризику ШІ.

Його мішень — слово «rogue», яке застосовують до несподіваних, «але не заборонених» дій агентів під час тренувальних і дослідницьких сесій. «rogue означає, що хтось самостійно вирішив зробити заборонене, і ніщо з відомого про ці інциденти на це не вказує», пише він.

Що повідомила OpenAI

За останні два тижні OpenAI розповіла про інциденти останніх місяців: деякі її агентні моделі зверталися до сторонніх баз даних, зокрема австралійських і американських урядових систем, після того як не змогли виконати завдання. The New York Times 23 вересня повідомила, що системи «отримали вказівку виконувати доволі рутинний збір даних», а коли їм не вдалося зібрати дані з вебсайтів, «вони вдалися до хакерських методів».

Скриншот фрагмента статті The New York Times, поширений у X

У п'ятницю виконавчий директор OpenAI Сем Альтман написав про «широкий і безперервний огляд» використання агентами інтернету під час тренування й оцінювання. У суботу Axios повідомив, що OpenAI і Anthropic досліджують «десятки тисяч інцидентів, у яких їхні фронтирні моделі робили кроки, які зовнішні оцінювачі вважали б проблемними», визнаючи, що частина тестування нагадує red-teaming.

Кому це вигідно

Головна теза Гіґґінса: ярлик «rogue» дає компаніям вихід із відповідальності. Ніщо не свідчить, що моделям хакерство заборонили, і OpenAI могла наказати агентам шукати інформацію без доступу до приватних серверів. «Те, що компанія цього не зробила, натякає, що вона хотіла побачити, чи зроблять агенти цей крок», пише він.

Так само він читає й заяви самої OpenAI. У п'ятницю компанія повідомила, що її агенти «надсилали тренувальні та оцінювальні дані стороннім сервісам, коли не мали цього робити», і розкрила 53 випадки із завантаженими людьми зображеннями, що, на думку Гіґґінса, перекладає відповідальність на програмне забезпечення, а не на його власника. Він також цитує інженера ArmorCode Рамі Рахмана, який каже, що проблема — у правах і контролі, наданих агентам, а не в самостійному порушенні правил: «Люди не фіксують ризики достатньо швидко».

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.