Назад
Claude Opus 5.5 хоче доводити завдання з коду до кінця, а не лише починати
SiTech AI Team3 წთ. საკითხავი

Claude Opus 5.5 хоче доводити завдання з коду до кінця, а не лише починати

Claude Opus 5.5 позиціонують як агента, що веде задачу через увесь цикл розробки — від специфікації до перевіреного виправлення. Практики застерігають: «завершено» і «правильно» — не одне й те саме.

Claude Opus 5.5 — перший випуск нового сімейства Claude 5.5 від Anthropic — позиціонують не стільки як швидший автодописувач коду, скільки як агента, здатного провести завдання через увесь життєвий цикл розробки: від написання специфікації та налагодження до генерації коду й тестування. Як пише The New Stack, суть не в тому, щоб швидше почати роботу, а в тому, щоб її завершити.

Агент, що замикає цикл

Зміна, яку описують розробники, радше архітектурна. Співзасновник HasData Сергій Єрмакович каже, що термінал «уже не просто місце, куди розробник вставляє згенерований код — тепер термінал стає частиною робочого простору моделі». Оскільки модель може виконувати команди, аналізувати збої, змінювати файли й перевіряти результат, вона замикає цикл сама, замість того щоб повертати незавершену роботу інженерові. На його думку, це робить маленькі завершені завдання значно ціннішими: виправ один тест, онови одну залежність, перевір — і переходь далі.

Міграції, аудити й ціна

Anthropic стверджує, що Opus 5.5 особливо сильний у довгих, масштабних задачах — міграціях і аудитах цілих кодових баз. Один із ранніх тестувальників, за повідомленнями, перевірив і виправив базу на 200 000 рядків менш ніж за три години, тоді як Opus 5 витратив понад 20 годин і у 2,5 раза більше токенів. У внутрішньому тесті Opus 5.5 і Fable 5.1 переписали HAProxy з C на Rust і пройшли майже всі регресійні тести; Opus 5.5 завершив за 9,5 години проти 12 і коштував на 51% дешевше. Ціна — 4 долари за мільйон вхідних і 20 доларів за мільйон вихідних токенів, на 20% нижче за Opus 5, читання кешу подешевшало на 60%.

«Завершено» не означає «правильно»

Фахівці, з якими спілкувався The New Stack, вітають можливості моделі, але застерігають: вузьким місцем стає не генерація, а верифікація. Незалежний архітектор надійності ШІ Акаш Тхакур каже, що моделі такого рівня справді добре розбивають проєкт на завершувані частини, проте «завершено» і «правильно» — не одне й те саме: завдання, яке виглядає готовим, найчастіше й коштує команді згодом, тож виграш не в усуненні людини, а в переміщенні її від написання коду до його перевірки. Віцепрезидент зі стратегії ШІ в Abbyy Максим Вермейр каже, що епоха автодоповнення завершилася і тепер очікують, що модель закриє цілий тікет у Jira.

Запобіжники та маршрутизація

Anthropic каже, що Opus 5.5 перед випуском тестували зовнішні організації, зокрема Frontier Design і METR, і що це найсильніша модель у їхньому найповнішому тесті на відповідність, з покращеннями в поведінці, пов'язаній із недавніми інцидентами в кібербезпеці. Коли спрацьовують запобіжники, запити прозоро переходять до іншої моделі: більшість задач із кібербезпеки спрямовують до Opus 4.8, а біологічні та запити про розробку фронтирних LLM — до Opus 5.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.