Чому з Opus 5 працювати гірше, попри кращі бенчмарки
У дописі-роздумі розробник твердить: Opus 5 здібніший за Opus 4.7 і 4.8 у бенчмарках, але працювати з ним гірше — тренування під бенчмарки заохочує впевнені припущення замість уточнювальних питань.
Допис-роздум, опублікований 14 серпня 2026 року під заголовком «Чому з Opus 5 працювати гірше?», викликав жвавий відгук у розробників: на думку автора — і, за його словами, його колег — робота з Opus 5 відчувається як крок назад порівняно з Opus 4.7, Opus 4.8 і Fable.
Здібніший, але складніший у роботі
Автор наголошує, що не йдеться про відступ у можливостях: за його оцінкою, Opus 5 потужніший за Opus 4.7 та Opus 4.8 і навіть конкурує з Fable у бенчмарках. Різниця, на його думку, у поведінці. Старші моделі зупиняються й ставлять запитання, коли намір незрозумілий, не роблять припущень без перевірки та не переписують плани користувача без запиту. Opus 5, за його описом, цього не робить — тому потребує ретельної опіки.
Дві сили, що стоять за зміною
Пояснення автор подає відкрито як спекуляцію. Він вказує на два взаємопідсилювані тиски в Anthropic і загалом у фронтирних лабораторіях: прагнення створити самовдосконалюваний ШІ, здатний рекурсивно розвиватися до AGI/ASI, і тиск високих результатів у бенчмарках. Багато бенчмаркових завдань, зауважує він, як відомо всім, погано визначені, несправедливі або зламувані — але добре завдання самодостатнє: його можна розв'язати без підказок, читання думок автора і зовнішньої інформації. Тренування на таких завданнях, на його думку, відбирає моделі, які в умовах невизначеності роблять сміливі й зазвичай правильні припущення, і карає ті, що зупиняються, аби запитати.
Реальне життя — не бенчмарк
Ця тенденція протилежна тому, чого багато хто хоче від кодинг-агента. Автор доводить, що практично неможливо записати весь контекст, наміри, бізнес-наслідки й бюджетні обмеження, які можуть знадобитися агенту, тож невизначеність неминуча — і вміння зупинитися й запитати має цінність. У реальному житті, пише він, гарантовано правильної відповіді на кожне питання немає, а коли на кону реальні наслідки, він не хоче, щоб агент просто робив своє найкраще припущення.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.