
Claude Opus 5.5-ը ցանկանում է ավարտել կոդի առաջադրանքները, ոչ միայն սկսել
Anthropic-ը ներկայացրել է Claude 5.5 ընտանիքի առաջին մոդելը, որն ընդգրկում է մշակման կենսացիկլի մեծ մասը՝ ճշգրտումից մինչև ստուգված ուղղում: Մասնագետները զգուշացնում են՝ «ավարտվածը» «ճիշտ» չէ:
Anthropic-ի նոր Claude 5.5 ընտանիքի առաջին թողարկումը՝ Claude Opus 5.5-ը, ներկայացվում է ոչ այնքան որպես կոդի ավելի արագ ինքնալրացում, որքան որպես գործակալ, որը կարող է առաջադրանքն անցկացնել մշակման ողջ կենսացիկլով՝ դիզայնի ճշգրտում գրելուց և վրիպազերծումից մինչև կոդի գեներացում ու թեստավորում: The New Stack-ի փոխանցմամբ՝ շեշտը ոչ թե աշխատանքն ավելի արագ սկսելն է, այլ այն ավարտելը:
Գործակալ, որը փակում է ցիկլը
Մշակողների նկարագրած փոփոխությունը ճարտարապետական է: HasData-ի համահիմնադիր Սերգեյ Երմակովիչի խոսքով՝ տերմինալը «այլևս այն տեղը չէ, որտեղ մշակողը տեղադրում է գեներացված կոդը. այժմ տերմինալը դառնում է մոդելի աշխատանքային տարածքի մաս»: Քանի որ մոդելը կարող է գործարկել հրամաններ, ուսումնասիրել ձախողումները, փոփոխել ֆայլերը և ստուգել արդյունքը, այն ինքն է փակում ցիկլը՝ անավարտ աշխատանքը ինժեներին չվերադարձնելով: Ըստ նրա՝ դա փոքր, բայց ավարտուն առաջադրանքները դարձնում է ավելի արժեքավոր. ուղղիր մեկ ձախողված թեստ, թարմացրու մեկ կախվածություն, ստուգիր և անցիր հաջորդին:
Միգրացիաներ, աուդիտներ և գին
Anthropic-ը պնդում է, որ Opus 5.5-ը հատկապես ուժեղ է երկար, մեծածավալ աշխատանքներում՝ ամբողջ կոդբազայի միգրացիաներում և աուդիտներում: Վաղ փորձարկողներից մեկը, ըստ հաղորդումների, 200 000 տողանոց կոդբազան ստուգել և ուղղել է երեք ժամից պակաս ժամանակում, մինչդեռ Opus 5-ին պահանջվել է ավելի քան 20 ժամ և 2,5 անգամ ավելի շատ թոքեն: Ներքին թեստում Opus 5.5-ը և Fable 5.1-ը HAProxy-ն C-ից վերաշարադրել են Rust-ով և անցել ռեգրեսիոն թեստերը. Opus 5.5-ն ավարտել է 9,5 ժամում՝ 12-ի փոխարեն, և 51%-ով ավելի էժան: Գինը՝ 4 դոլար միլիոն մուտքային և 20 դոլար միլիոն ելքային թոքենի համար՝ 20%-ով ցածր Opus 5-ից, քեշի ընթերցումը էժանացել է 60%-ով:
«Ավարտվածը» չի նշանակում «ճիշտ»
The New Stack-ի հետ զրուցած մասնագետները ողջունում են հնարավորությունները, սակայն զգուշացնում են, որ խցանումն այժմ գեներացումը չէ, այլ ստուգումը: Անկախ SRE և AI հուսալիության ճարտարապետ Ակաշ Թաքուրը նշում է, որ այս մակարդակի մոդելները իսկապես լավ են նախագիծը ավարտելի մասերի բաժանում, բայց «ավարտվածը» և «ճիշտը» նույնը չեն. ավարտուն թվացող առաջադրանքը հաճախ հենց այն է, որը թիմին ավելի ուշ թանկ է նստում, ուստի հաղթանակը մարդուն հեռացնելը չէ, այլ նրան կոդ գրելուց կոդը ստուգելուն տեղափոխելը: Abbyy-ի AI ռազմավարության փոխնախագահ Մաքսիմ Վերմեյրը ասում է, որ ինքնալրացման դարաշրջանն ավարտված է, և այժմ սպասում են, որ մոդելը փակի ամբողջ Jira տոմսը:
Պաշտպանիչ միջոցներ և երթուղավորում
Anthropic-ը հայտնում է, որ Opus 5.5-ը թողարկումից առաջ թեստավորվել է արտաքին կազմակերպությունների՝ այդ թվում Frontier Design-ի և METR-ի կողմից, և իրենց ամենահամապարփակ համապատասխանության թեստի ամենաուժեղ մոդելն է: Երբ պաշտպանիչ միջոցները գործարկվում են, հարցումները թափանցիկ կերպով փոխանցվում են այլ մոդելի. կիբեռանվտանգության առաջադրանքների մեծ մասն ուղղվում է Opus 4.8-ին, իսկ կենսաբանության և ֆրոնթիեր LLM-ների զարգացման հարցումները՝ Opus 5-ին:
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։