Վերադառնալ
GPT-6 Sol և Claude Opus 5.5. էժանությունը կարևոր է միայն կայուն արդյունքի դեպքում
SiTech AI Team3 წთ. საკითხავი

GPT-6 Sol և Claude Opus 5.5. էժանությունը կարևոր է միայն կայուն արդյունքի դեպքում

The New Stack-ը OpenAI-ի GPT-6 Sol և Anthropic-ի Claude Opus 5.5 մոդելները փորձարկել է երեք բարդ ծրագրային թեստերում՝ յուրաքանչյուրը հինգ անգամ։ Sol-ը մոտ վեց անգամ ավելի էժան ստացվեց, սակայն 15 փորձարկումից երեքում սխալվեց, իսկ Opus 5.5-ը անթերի էր բոլորում։

OpenAI-ն GPT-6 Sol-ը թողարկել է 2026 թվականի սեպտեմբերի 22-ին և պնդում է, որ բիզնես առաջադրանքներում այն գերազանցում է Claude Opus 5-ին՝ մեկ առաջադրանքի արժեքի 9%-ով. Zapier-ի AutomationBench-ում Sol-ը հավաքում է 33,2%, իսկ Opus 5-ը՝ 26,9%։ Նույն օրը Anthropic-ը թողարկեց Claude Opus 5.5-ը, ուստի The New Stack-ի լրագրող Ջեսիկա Վախտելը փորձարկեց ավելի նոր մոդելը։

Ցուցակային գներով Sol-ը միլիոն մուտքային թոքենի համար արժե 2 դոլար, իսկ միլիոն ելքային թոքենի համար՝ 10 դոլար, այսինքն GPT-5.6 Sol-ի կես գինը։ Claude Opus 5.5-ը արժե 4 և 20 դոլար, ուստի ավելի շատ թոքեն ծախսելով անգամ Sol-ը կարող է ավելի էժան դուրս գալ։

Երեք թեստ, յուրաքանչյուրը հինգ անգամ

Առաջին փուլն ավարտվեց ոչ-ոքի. երկու մոդելներն էլ Python-ով գրված վճարային սերվիսում տեղադրված երեք սխալ գտան, դասակարգեցին 40 ձախողված CI առաջադրանք և պատասխանեցին կեղծ SDK-ի մասին 20 հարցի՝ չհորինելով ոչ մի մեթոդ։ Ավելի բարդ տարբերակները՝ 3 664 տողանոց վթարի հաշվետվությունը և 120 թաքնված թեստերով գնահատվող սպեցիֆիկացիան, նույնպես ավարտվեցին հավասար։ Մոդելներին բաժանեցին միայն կրկնվող փորձարկումները։

Երկուսն էլ կանչվեցին API-ի միջոցով՝ նույնական հարցումներով և ամենաբարձր կարգավորումով, յուրաքանչյուր թեստը՝ հինգ անգամ։ CI-ի դասակարգման թեստում մոդելը յուրաքանչյուր առաջադրանքի համար որոշում է՝ կրկնե՞լ, արգելափակե՞լ, թե՞ հերթապահ կանչել; վթարի մատյանները ներառում են 3 664 տող հինգ սերվիսներից և յոթ հարց; լուծիչի սպեցիֆիկացիան պահանջում է երկէջանոց մետից գրել լուծիչ՝ առանց կոդը գործարկելու։

Ինչ են ցույց տալիս թվերը

CI-ի դասակարգումը՝ OpenAI-ի պնդմանը ամենամոտ թեստը, երկու մոդելներն էլ անցան 5-ից 5-ը։ Opus 5.5-ը մեկ վազքի համար ծախսեց միջինը 1 րոպե 27 վայրկյան, 11 127 ելքային թոքեն և 0,24 դոլար, իսկ Sol-ը՝ 18 վայրկյան, 1 143 թոքեն և 0,02 դոլար, այսինքն արժեքի 8%-ը, որը համընկնում է OpenAI-ի գովազդած 9%-ի հետ։

Վթարի մատյանների թեստում պատկերը փոխվեց. Opus 5.5-ը անթերի էր բոլոր հինգ վազքերում, Sol-ը՝ միայն երկուսում։ Այն երկու անգամ բաց թողեց նույն հաճախորդին, ում վճարը հաստատվեց հաջող կրկնակի փորձից 52 վայրկյան անց, իսկ մեկ անգամ 28-ի փոխարեն հաշվեց 27 ձախողված գնում։ Opus 5.5-ը միջինում ծախսեց 6 րոպե 44 վայրկյան, 53 308 ելքային թոքեն և 1,68 դոլար, Sol-ը՝ 1 րոպե 41 վայրկյան, 7 073 թոքեն և 0,30 դոլար, կարդալով նույն մատյանը 25%-ով ավելի քիչ մուտքային թոքենով։

Լուծիչի սպեցիֆիկացիայի թեստում Opus 5.5-ն անցավ բոլոր վազքերը, Sol-ը՝ հինգից չորսը. 78-րդ տողում ավելորդ փակվող փակագիծը կործանեց մոդուլը ներմուծման ժամանակ, և բոլոր 120 թեստերը ձախողվեցին։ Opus 5.5-ը միջինում ծախսեց 9 րոպե 40 վայրկյան, 70 687 ելքային թոքեն և 1,42 դոլար, Sol-ը՝ 6 րոպե 28 վայրկյան, 21 435 թոքեն և 0,22 դոլար։

Ավելի էժան, բայց ոչ միշտ ճիշտ

15 վազքից Opus 5.5-ը անթերի էր ամեն անգամ, Sol-ը՝ 12 անգամ։ Sol-ի 15 վազքը արժեցին ընդհանուր 2,68 դոլար՝ Opus 5.5-ի 16,72 դոլարի մոտ 16%-ը։ Վախտելը խորհուրդ է տալիս ընտրել ըստ սխալի գնի. Sol-ը՝ մեծ ծավալի աշխատանքում, որտեղ արդյունքը ստուգում է մարդը կամ թեստերի հավաքածուն, և այդ գներով կարելի է այն երկու անգամ գործարկել ու համեմատել; Opus 5.5-ը՝ երբ սխալը թանկ է, իսկ ոչ ոք չի ստուգում։ Sol-ի սխալները անցնում են վերանայման կողքով՝ վերադարձի ցանկից դուրս մնացած հաճախորդ կամ չներմուծվող ֆայլ։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։