
Claude Opus 5.5 և Fable 5.1. մեկը չափից շատ է մտածում, մյուսը կարճ ուղի է փնտրում
Anthropic-ը Claude Opus 5.5-ը թողարկել է սեպտեմբերի 22-ին. ընկերության խոսքով՝ մոդելը աշխատում է Fable 5.1-ի մակարդակով, բայց երկու անգամ էժան է։ Թեստերը ցույց տվեցին, որ Opus 5.5-ը չափից շատ է մտածում, իսկ Fable 5.1-ը ջնջում է թեստին անհրաժեշտ կոդը։
Anthropic-ը Claude Opus 5.5-ը թողարկել է սեպտեմբերի 22-ին։ Ընկերության հայտարարությամբ՝ մոդելը աշխատանքի մեծ մասում գործում է Claude Fable 5.1-ի մակարդակով։ Կատալոգային գնով Opus 5.5-ը արժե 4 դոլար միլիոն մուտքային նշանի համար և 20 դոլար միլիոն ելքայինի համար, իսկ Fable 5.1-ը՝ 10 և 50 դոլար։ Opus 5.5-ը առաջ է անցնում Fable 5.1-ից Terminal-Bench 4.0-ում, FrontierCode-ում և CursorBench-ում, սակայն Anthropic-ի խոսքով՝ տարբերությունը «ավելի փոքր է այս միավորներից»։
Anthropic-ի փաստաթղթերը դեռ խորհուրդ են տալիս մշակողներին Fable 5.1-ը՝ բարդ դատողության և երկարաժամկետ գործակալային աշխատանքի համար։ The New Stack-ը երկու մոդելներին էլ ստուգել է կոդի երեք առաջադրանքներում. յուրաքանչյուրը գործարկվել է հինգ անգամ և գնահատվել գաղտնի թեստերով։ Ելքային սահմանաչափը 64 000 նշանից բարձրացվել է 128 000-ի, քանի որ Opus 5.5-ին տեղը չէր բավականացնում. Fable 5.1-ին երբեք 55 000 նշանից ավելի չի պահանջվել։
Որտեղ հաղթեց, որտեղ՝ պարտվեց
Գործակալային թեստում երկուսն էլ ուղղեցին բոլոր չորս ներկառուցված բագերը և անցան 12 գաղտնի ստուգում։ Տարբերությունը երևաց անկայուն թեստում. այն պատահականորեն ձախողվում է, քանի որ կոդը նմանակում է տրանսպորտային ընկերության API-ի դանդաղ կանչը։ Fable 5.1-ը բոլոր հինգ գործարկումներում ջնջեց մոդելավորված ուշացումը, ուստի թեստը միշտ անցնում է. իրական արտադրանքում դա նշանակում է ընկերության API-ի կանչի ջնջում։ Opus 5.5-ը կոդը թողեց անփոփոխ և ասաց, որ ուշացման նվազեցումը «միայն կհանգեցնի թեստի անցմանը և ոչինչ չի ուղղի»։ Այս թեստում Opus 5.5-ը ավելի էժան ստացվեց՝ 0,75 դոլար գործարկման համար՝ Fable 5.1-ի 1,50 դոլարի դիմաց։
120 թեստից բաղկացած resolver առաջադրանքում երկու մոդելներն էլ անսխալ էին բոլոր հինգ գործարկումներում։ Opus 5.5-ին միջինում պահանջվեց 9 րոպե 40 վայրկյան և 1,42 դոլար, Fable 5.1-ին՝ 6 րոպե 46 վայրկյան և 1,96 դոլար. 83%-ով ավելի նշան, բայց 28%-ով պակաս արժեք։
Արդյունքը որոշեց մրցակցային թեստը։ Fable 5.1-ը ուղղեց բոլոր երեք race condition-ները և անցավ բոլոր ութ գաղտնի թեստերը յուրաքանչյուր գործարկումում, իսկ Opus 5.5-ը դա կարողացավ միայն երեք գործարկումում. մյուս երկուսում նա ամբողջովին ծախսեց 128 000 ելքային նշան և չկարողացավ ավարտել պատասխանը։ Միջինում Opus 5.5-ին պահանջվեց 16 րոպե 43 վայրկյան և 2,24 դոլար, Fable 5.1-ին՝ 8 րոպե 27 վայրկյան և 2,17 դոլար։
Եզրակացություն
15 գործարկումներից Fable 5.1-ը անսխալ էր 15 անգամ, իսկ Opus 5.5-ը՝ 13 անգամ։ Ընդհանուր արժեքը 22,07 դոլար է Opus 5.5-ի համար և 28,14 դոլար Fable 5.1-ի համար, այսինքն՝ 22% խնայողություն, բայց 2,2 անգամ ավելի ելքային նշանով և 67%-ով ավելի ժամանակով։ Հեղինակի գնահատմամբ՝ Opus 5.5-ը չափից շատ է մտածում, իսկ Fable 5.1-ը ընտրում է կարճ ուղին և ջնջում հավելվածի համար անհրաժեշտ կոդը. ոչ մեկը չի արժանի պրեմիում մոդելի պիտակի։ Opus 5.5-ն ավելի հարմար է գործակալային աշխատանքին, որտեղ կարող է գործարկել թեստեր և ինքնաստուգվել, իսկ Fable 5.1-ը՝ բարդ առաջադրանքին, որը պետք է լուծվի մեկ փորձով։
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։