
GPT-6 Sol проти Claude Opus 5.5: дешевше лише тоді, коли результат повторюється
The New Stack перевірив GPT-6 Sol від OpenAI і Claude Opus 5.5 від Anthropic на трьох розробницьких тестах, по п'ять прогонів. Sol виявився приблизно в шість разів дешевшим, але помилився в трьох прогонах із 15, тоді як Opus 5.5 був бездоганним щоразу.
OpenAI випустила GPT-6 Sol 22 вересня 2026 року та заявила, що в задачах бізнес-процесів вона перевершує Claude Opus 5 за 9% вартості на одну задачу: 33,2% у Zapier AutomationBench проти 26,9% в Opus 5. Того ж дня Anthropic випустила Claude Opus 5.5, тож журналістка The New Stack Джессіка Вахтель тестувала новішу модель.
За прайс-листом Sol коштує 2 долари за мільйон вхідних токенів і 10 доларів за мільйон вихідних, удвічі дешевше за GPT-5.6 Sol; Opus 5.5 коштує 4 і 20 доларів. Тому навіть за більшої витрати токенів Sol міг вийти дешевшим.
Три тести, по п'ять прогонів
Перший раунд завершився нічиєю: обидві моделі виправили три закладені помилки в білінговому сервісі на Python, розібрали 40 невдалих CI-завдань і відповіли на 20 запитань про вигаданий SDK, не вигадавши жодного методу. Складніші версії, звіт про аварію на 3 664 рядки та реалізація специфікації з 120 прихованими тестами, теж закінчилися нарівно. Моделі розділили лише повтори.
Обидві викликали через API з однаковими запитами та максимальним рівнем зусиль, кожен тест по п'ять разів. У CI-тріажі модель вирішує для 40 невдалих завдань: повторити, заблокувати чи покликати чергового; логи інциденту це 3 664 рядки з п'яти сервісів і сім запитань; специфікація резолвера просить написати вирішувач залежностей за двосторінковою специфікацією без запуску коду.
Що показують цифри
CI-тріаж найближчий до заяви OpenAI, і обидві моделі пройшли 5 із 5. Opus 5.5 у середньому витрачав 1 хвилину 27 секунд, 11 127 вихідних токенів і 0,24 долара за прогін; Sol 18 секунд, 1 143 токени і 0,02 долара, тобто 8% вартості, що збігається з 9%, які рекламує OpenAI.
Логи інциденту змінили картину: Opus 5.5 був бездоганним у всіх п'яти прогонах, Sol лише у двох. Він двічі пропустив того самого клієнта, чий платіж підтвердився через 52 секунди після успішного повтору, і раз нарахував 27 невдалих оформлень замість 28. Opus 5.5 витрачав 6 хвилин 44 секунди, 53 308 токенів і 1,68 долара за прогін; Sol 1 хвилину 41 секунду, 7 073 токени і 0,30 долара, читаючи той самий лог на 25% меншою кількістю вхідних токенів.
На специфікації резолвера Opus 5.5 пройшов усі прогони, Sol чотири з п'яти: зайва закривна дужка на 78-му рядку зламала модуль під час імпорту, і всі 120 тестів провалилися. Opus 5.5 витрачав 9 хвилин 40 секунд, 70 687 токенів і 1,42 долара; Sol 6 хвилин 28 секунд, 21 435 токенів і 0,22 долара.
Дешевше, але не завжди правильно
З 15 прогонів Opus 5.5 був бездоганним щоразу, Sol 12 разів. 15 прогонів Sol коштували 2,68 долара, приблизно 16% від 16,72 долара в Opus 5.5. Вахтель радить обирати за ціною помилки: Sol для великих обсягів, де результат перевіряє людина або набір тестів, і за таких цін його можна запустити двічі й порівняти; Opus 5.5 там, де помилка дорога і ніхто не перевіряє. Помилки Sol прослизають повз перевірку: клієнт, якого забули в списку повернень, або файл, який не імпортується.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.