
Claude Opus 5.5 проти Opus 5 на задачах міркування: дешевше й швидше, але не краще
Anthropic заявляє, що Claude Opus 5.5 на 40% дешевший і на 30% швидший за Opus 5. The New Stack перевірив обидві моделі на трьох задачах міркування: економія підтвердилася, обіцянка щодо швидкості не справдилася, а відповіді були однакові.
The New Stack порівняв дві моделі Anthropic, Claude Opus 5.5 та Claude Opus 5, на трьох складних задачах міркування. Результат простий: новіша модель дешевша й швидша, але не розумніша. Обидві повністю розв'язали дві задачі з трьох і обидві провалили третю.
Що обіцяє Anthropic
За словами компанії, Opus 5.5 за типового навантаження коштує на 40% менше за Opus 5 і генерує текст понад 30% швидше, а за можливостями має перевершувати попередню модель. Ціна в API теж знизилася: 4 долари за мільйон вхідних токенів і 20 за мільйон вихідних проти 5 і 25 для Opus 5. Зниження ціни дає лише 20% економії, решту модель має забезпечити меншою витратою токенів.
Логічна сітка: ті самі відповіді за менші гроші
Обидві моделі викликали через API Anthropic з ідентичними запитами, у режимі адаптивного мислення з типовим рівнем зусиль; в Opus 5.5 мислення вимкнути не можна. На логічній сітці із сімома інженерами та 22 підказками обидві заповнили всі 28 клітинок правильно. Opus 5.5 витратив 65 секунд, 7 573 вихідні токени та 0,16 долара; Opus 5 витратив 108 секунд, 10 621 токен і 0,27 долара. Новіша модель виявилася на 43% дешевшою за ту саму відповідь.
Гра в камінці: той самий результат за меншої кількості токенів
У грі в камінці з пам'яттю обидві моделі дали три правильні відповіді з трьох. Перший гравець програє зі 200 камінців, розміри від 120 до 500 є програшними, а найменший програшний розмір, більший за 340, це 344. Різниця була в обсязі мислення: Opus 5.5 завершив за 215 секунд, витративши 28 740 токенів і 0,58 долара, а Opus 5 витратив 624 секунди, 74 981 токен і 1,88 долара. Це на 62% менше токенів і на 69% менша вартість за однакової відповіді.
Задача, яку не розв'язала жодна модель
Задачу з упорядкуванням завдань розгортання, де правильні відповіді 27, 1 695 і 159 019, не розв'язала жодна модель. За ліміту в 48 000 вихідних токенів обидві витратили весь бюджет на мислення і не відповіли. Після підвищення ліміту до 128 000 Opus 5 вичерпав усі токени, працював понад 25 хвилин і зупинився без відповіді. Opus 5.5 зупинився на 112 733 токенах за 19 хвилин, але API повернув причину зупинки «відмова» без тексту. Автор вважає це помилкою фільтра безпеки.
Що це означає на практиці
Загалом у тесті Opus 5.5 використав 1 701 вхідний і 197 046 вихідних токенів, а Opus 5 використав 1 693 і 261 602. Витрати склали 3,95 і 6,55 долара. Швидкість генерації становила 103,4 токена за секунду проти 93,1, тобто приблизно на 11% швидше, що менше за обіцяні 30%. Порада проста: якщо ви вже користуєтеся Opus 5, перехід на Opus 5.5 дає ті самі результати за менші гроші та менше очікування. Варто встановити жорсткий ліміт вихідних токенів, адже обидві моделі здатні думати 20 хвилин і більше й не повернути нічого, а для задач підрахунку краще дати моделі інструмент виконання коду.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.