
Claude Opus 5.5-ը դատողական առաջադրանքներում՝ ավելի էժան ու արագ, բայց ոչ ավելի լավ
Anthropic-ը պնդում է, որ Claude Opus 5.5-ը 40%-ով ավելի էժան է և 30%-ով ավելի արագ, քան Opus 5-ը։ The New Stack-ը երկու մոդելները փորձարկել է դատողական երեք դժվար առաջադրանքով. խնայողությունը հաստատվեց, արագության խոստումը՝ ոչ, իսկ պատասխանները նույնն էին։
The New Stack-ը համեմատել է Anthropic-ի երկու մոդելները՝ Claude Opus 5.5-ը և Claude Opus 5-ը, դատողական երեք բարդ առաջադրանքով։ Արդյունքը պարզ է. նոր մոդելն ավելի էժան ու արագ է, բայց ավելի խելացի չէ։ Երկուսն էլ լուծեցին երկու առաջադրանք, իսկ երրորդում ձախողվեցին։
Ինչ է խոստանում Anthropic-ը
Ընկերության պնդմամբ՝ Opus 5.5-ը սովորական ծանրաբեռնվածության դեպքում 40%-ով ավելի էժան է, քան Opus 5-ը, և տեքստը գեներացնում է 30%-ից ավելի արագ, իսկ հնարավորություններով պետք է գերազանցի նախորդ մոդելին և հասնի Claude Fable 5.1-ի մակարդակին։ API-ի գինը նույնպես իջել է՝ միլիոն մուտքային տոկենը 4 դոլար է, ելքայինը՝ 20 դոլար, մինչդեռ Opus 5-ում դրանք 5 և 25 դոլար էին։ Զեղչն ինքնին տալիս է 20% խնայողություն, իսկ մնացածը մոդելը պետք է ապահովի ավելի քիչ տոկեն ծախսելով։
Տրամաբանական ցանցը՝ նույն պատասխանները, ավելի ցածր գին
Երկուսն էլ կանչվել են Anthropic-ի API-ով՝ միևնույն հարցումներով, հարմարվողական դատողության ռեժիմում, որը Opus 5.5-ում անջատելի չէ։ Յոթ ինժեների և 22 հուշման տրամաբանական ցանցը երկուսն էլ լուծեցին ճիշտ՝ բոլոր 28 վանդակներով։ Opus 5.5-ին պահանջվեց 65 վայրկյան, 7 573 ելքային տոկեն և 0,16 դոլար, իսկ Opus 5-ին՝ 108 վայրկյան, 10 621 տոկեն և 0,27 դոլար։ Նույն պատասխանի համար նոր մոդելը 43%-ով ավելի էժան ստացվեց։
Քարերի խաղը՝ նույն արդյունքը, շատ ավելի քիչ տոկեն
Հիշողությամբ քարերի խաղում երկու մոդելներն էլ ճիշտ պատասխանեցին երեք հարցերից երեքին։ Առաջին խաղացողը պարտվում է 200 քարի դեպքում, 120-ից 500 քար ընդգրկող չափերը պարտվողական են, իսկ 340-ից մեծ ամենափոքր պարտվողական չափը 344-ն է։ Տարբերությունը դատողության ծավալում էր. Opus 5.5-ը ավարտեց 215 վայրկյանում՝ 28 740 տոկենով և 0,58 դոլարով, իսկ Opus 5-ը՝ 624 վայրկյանում՝ 74 981 տոկենով և 1,88 դոլարով։ Սա 62%-ով ավելի քիչ տոկեն է և 69%-ով ցածր արժեք նույն պատասխանի համար։
Առաջադրանքը, որը ոչ մեկը չլուծեց
Տեղադրման աշխատանքների վերադասավորման առաջադրանքը, որտեղ ճիշտ պատասխաններն են 27, 1 695 և 159 019, ոչ մի մոդել չլուծեց։ 48 000 տոկենի սահմանաչափի դեպքում երկուսն էլ ամբողջ բյուջեն ծախսեցին դատողության վրա և պատասխան չտվեցին։ Սահմանաչափը 128 000-ի հասցնելուց հետո Opus 5-ը սպառեց բոլոր տոկենները, աշխատեց ավելի քան 25 րոպե և կանգ առավ առանց պատասխանի։ Opus 5.5-ը կանգ առավ 112 733 տոկենի վրա 19 րոպեում, սակայն API-ն պատասխանը դադարեցրեց «մերժում» պատճառով՝ առանց տեքստի։ Հարցման մեջ զգայուն ոչինչ չկա, ուստի հեղինակը դա համարում է անվտանգության ֆիլտրի սխալ։
Ինչ է սա նշանակում գործնականում
Ամբողջ թեստի ընթացքում Opus 5.5-ը ծախսեց 1 701 մուտքային և 197 046 ելքային տոկեն, իսկ Opus 5-ը՝ 1 693 և 261 602։ Ծախսը կազմեց 3,95 դոլար՝ 6,55 դոլարի դիմաց։ Գրելու արագությունը եղավ վայրկյանում 103,4 տոկեն՝ 93,1-ի դիմաց, այսինքն՝ մոտ 11%-ով արագ, ինչը ցածր է ընկերության խոստացած 30%-ից։ Խորհուրդը հստակ է. Opus 5-ից Opus 5.5-ին անցնելը տալիս է նույն արդյունքները՝ ավելի քիչ գումարով և ավելի քիչ սպասելով։ Պետք է սահմանել ելքային տոկենների խիստ սահմանաչափ, քանի որ երկու մոդելներն էլ կարող են 20 րոպե և ավելի մտածել ու ոչինչ չվերադարձնել, իսկ հաշվարկային առաջադրանքների դեպքում ավելի լավ է մոդելին տալ կոդ գործարկելու գործիք։
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։