
Anthropic вибачилася за невидимі обмеження Claude Fable
Anthropic визнала, що тихо спотворювати відповіді на підозри в дистиляції було неправильним рішенням, і тепер користувачі бачитимуть, коли запит Claude Fable 5 передають Opus 4.8.
Anthropic вибачилася за те, що тихо обмежувала свою нову модель Claude Fable 5 прихованими запобіжниками, які зачепили й дослідників, і конкурентів, котрі використовували її для створення власних систем. Компанія каже, що змінює курс і буде прозорішою щодо того, коли обмеження набирають чинності — навіть якщо через це Fable частіше відмовлятиметься відповідати.
Приховані запобіжники і вибачення
Fable — перша широкодоступна модель класу Mythos, про який компанія місяцями казала, що він занадто небезпечний для публічного випуску. Частину цих ризиків Anthropic вирішила, додавши моделі запобіжники, які блокують певні «високоризикові» запити. Одна з обмежених сфер — дистиляція, тобто навчання менших моделей на результатах більших. У системній картці Fable компанія писала, що відповіді на підозрілі запити просто змінюватиме й погіршуватиме, не повідомляючи користувача ні про спрацювання захисту, ні про те, що відповідь було змінено.
Тепер — перехід на Opus 4.8
Цей підхід змінюється. Запити, які виглядають як спроба дистиляції, тепер переадресовуватимуться до Claude Opus 4.8 — попередньої флагманської моделі компанії, — ідеться в дописі Anthropic у X. Користувачам про це повідомлятимуть: «Ви бачитимете це щоразу, коли це станеться». Механізм повторює те, як Fable працює з іншими високоризиковими темами — біологією, хімією та кібербезпекою: запити йдуть через Opus 4.8, якщо їх не блокують повністю за ширшими правилами щодо наркотиків, зброї та іншого забороненого вмісту. У біології запобіжники виявилися настільки широкими, що Fable практично непридатна навіть для базових питань — це The Verge підтвердив речник Anthropic Паруул Махешварі.
Критика дослідників
Розворот стався після гострої критики від спільноти дослідників ШІ, які попереджали, що тихе обмеження користувачів, підозрюваних у дистиляції Fable, зачепить і третіх осіб, які намагаються незалежно оцінити фронтирну модель. У системній картці Anthropic доводила, що здатність нових моделей прискорювати розвиток ШІ виправдовує таке обмеження, і зазначала: «використання Claude для створення конкурентних моделей уже порушує наші умови обслуговування». Раніше компанія звинувачувала китайських конкурентів, зокрема DeepSeek, у дистиляції її моделей «в індустріальних» масштабах.
У дописі в X Anthropic пояснила компроміс, на який пішла: «Видимі запобіжники можна перевіряти, тому вони мають бути надійними, а це потребує часу. Невидимі запобіжники можна спрямувати вужче, що дозволяє швидко випускати модель із дуже малою кількістю хибних спрацювань. Саме тому ми обрали невидимі запобіжники — і це був неправильний компроміс. Ви маєте бачити, які запобіжники ми застосовуємо і чому. Вибачте, що не втримали баланс».
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.