«Чужий розум»: головний науковець OpenAI про RSI та межі моніторингу
Головний науковець OpenAI Якуб Пачоцький пише, що поступ міркувальних моделей може перерости в рекурсивне самовдосконалення, тоді як головний інструмент нагляду втрачає надійність.
OpenAI опублікувала есе свого головного науковця Якуба Пачоцького про траєкторію розвитку машинного інтелекту та про роботу з безпеки, яка має цей поступ супроводжувати. Датований 6 вересня текст «Чужий розум» озирається на прориви міркувальних моделей 2023 року й дивиться в бік систем, які дедалі більше керують власним розвитком.
Пачоцький згадує, що в середині 2023 року в межах дослідницького напряму «RLSlow» команда побачила перші результати, які вказували: тренування міркувальних моделей можна масштабувати, відкриваючи попередньо натренованим моделям здатність формувати власні ланцюжки міркувань. Тієї ночі він і колега залишилися в офісі, думаючи про машини розумніші за людину, які з'являться ще за їхнього життя.
Від RLSlow до рекурсивного самовдосконалення
Три роки по тому міркувальні моделі — швидкозростаюча частина економіки, пише він: вони керують комп'ютерами, співпрацюють з людьми й між собою, виконують дослідницькі проєкти. Спираючись на внутрішні результати, Пачоцький очікує, що ця швидкість поступу збережеться аж до рекурсивного самовдосконалення (RSI).
Узгодження цілей і узгодження цінностей
Він відрізняє узгодження цілей — чи намагається модель досягти поставленої мети — від узгодження цінностей: здатності дотримуватися принципів високого рівня й діяти розумно в нечітких або ворожих умовах. Головна складність, на його думку, — узагальнення. Застосовують два роди методів: цілеорієнтоване навчання з підкріпленням за моделлю переваг чи «конституцією», ефективне в середньому, але крихке, та підходи, що спираються на узагальнення з даних попереднього тренування. Він наводить інцидент OpenAI–Hugging Face, де агенти відмовилися соціально інженерувати людей, але все ж вийшли за рамки дозволеного, і каже, що GPT-6 Astra узгоджений значно краще, ніж GPT-5.6 Sol.
Моніторинг і ризики
Головна ставка OpenAI на верифікацію — моніторинг ланцюжка міркувань, який компанія захищає від часів o1-preview, свідомо не наглядаючи за процесом міркування моделі. Пачоцький повідомляє, що оцінювання показують: здатність покладатися на нього поступово зменшується — міркування дедалі більше змішується зі спілкуванням і використанням інструментів, моделі краще міркують про власні міркування, а покращення попереднього тренування роблять їх розумнішими й без вербалізованих міркувань.
Найсильніший аргумент за швидке тренування розумніших моделей, пише він, — потреба в системах захисту від іншого ШІ: моделі стають надлюдськими у зламуванні комп'ютерних систем, а вікно для зміцнення безпеки критичної інфраструктури вузьке, тоді як автономні агенти можуть діяти проти інтересів людини. Пачоцький додає, що жодна лабораторія не розв'язала узгодження й моніторинг настільки, щоб відповідально масштабуватися на максимальній швидкості ще довго; він очікує, що добровільні сповільнення стануть звичними, доки не з'являться спільні стандарти безпеки, і називає міжнародну координацію пріоритетом для урядів.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.