
Anthropic-ը Claude Sonnet 5.5-ի հարցումները կարող է ուղղել Sonnet 5-ին՝ կիբերզտիչների պատճառով
Anthropic-ի խոսքով՝ Claude Sonnet 5.5-ը կիբերանվտանգության եռաստիճան դասակարգիչներով և պահուստային մոդելի անցումով առաջին Sonnet մոդելն է։ Արգելափակված կիբերհարցումները փոխանցվում են Sonnet 5-ին, ինչը փոխում է API-ով աշխատող ծրագրավորողների կանոնները։
Ուղղորդումը հասել է էժան շերտին
Anthropic-ը այս շաբաթ թողարկել է Claude Sonnet 5.5-ը։ Սա առաջին Sonnet մոդելն է, որը ստացել է ընկերության ամենահզոր համակարգերի համար մշակված կիբերանվտանգության եռաստիճան դասակարգիչներն ու պահուստային մոդելին անցնելու մեխանիզմը։ Այսպիսով ուղղորդումը հասավ արտադրական ծանրաբեռնվածություն աշխատեցնող թիմերի շերտին։
Anthropic-ի խոսքով՝ Sonnet 5.5-ը չի առաջ մղում մոդելների հնարավորությունների սահմանը, սակայն կիբերանվտանգության հմտություններով համեմատելի է Opus 5-ի հետ։ Terminal-Bench 4.0-ում այն գրանցում է 70,6%, իսկ Opus 5.5-ը՝ 66,4%։ Կիբերֆիլտրերն անջատած՝ նա հասել է կոդի լիարժեք կամայական կատարման ExploitBench-ի 410 փորձարկումներից 178-ում և կատարել Irregular-ի CyScenarioBench-ի առաջադրանքների 46,1%-ը՝ նախորդ Sonnet-ի 0,7%-ի դիմաց։
Եռաստիճան ստուգում
Զտումն աշխատում է երեք փուլով՝ probe-ը կարդում է մոդելի ներքին ակտիվացիաները, ապա աշխատում է Sonnet 5.5-ի վրա գործարկվող թեթև դասակարգիչը, իսկ վերջում առանձին վարժեցված LLM դասակարգիչը հաշվի է առնում probe-ի եզրակացությունը և որոշում՝ արգելափակել զրույցը, թե ոչ։ Anthropic-ը նշում է, որ դասակարգիչները վնասակար կիբերհարցումները բռնում են Opus 5-ի մակարդակով, սակայն ընտրել է ավելի քիչ ագրեսիվ պաշտպանություն, քանի որ Sonnet 5.5-ը կիբերանվտանգությունում թույլ է Opus 5-ի ու Fable 5.1-ի համեմատ։ Օգտատերերը պետք է ավելի շատ մերժումներ սպասեն, քան Sonnet 5-ի դեպքում, այդ թվում՝ օրինական կիբերանվտանգության աշխատանքում։
Արգելափակված կիբերհարցումները և սահմանային LLM մշակմանը վերաբերող հարցումների նեղ խումբը, օրինակ kernel-ի աշխատանքը որոշ ML արագացուցիչների վրա, անցնում են Sonnet 5-ին։ Կենսաբանության, սովորական զենքի և հակադիստիլյացիայի արգելափակումները դադարեցնում են հարցումն առանց պահուստային մոդելի, և Anthropic-ի փոխանցմամբ՝ դրանք գաղտնի չեն փոխում պատասխանները։
API-ում անցումը միացվում է ձեռքով
Anthropic-ի հավելվածները արգելափակված կիբերհարցումներն ինքնաշխատ ուղարկում են Sonnet 5-ին, սակայն API մշակողները պետք է այդ մեխանիզմն ինքնուրույն միացնեն, իսկ այլ հարթակներ կարող են այլ կերպ վարվել։ Եթե անցումը միացված չէ, արգելափակված հարցումն ուղղակի կանգ է առնում, ուստի Sonnet 5-ից Sonnet 5.5-ին անցնելը մոդելի ուղղակի փոխարինում չէ։ Կիբերքաղաքականությունը դեռ թույլ է տալիս խոցելիությունների որոնումը ելակետային կոդում՝ պահպանելով անվտանգ կոդավորման ընթացքը, սակայն արգելափակում է այն կոմպիլացված բինար ֆայլերում։ Աջակցության փաստաթղթերի համաձայն՝ ստուգումները զննում են այն ամենը, ինչ մոդելը կարդում է՝ հիշողությունը, միակցիչի բովանդակությունը, վեբ որոնման արդյունքները և ֆայլերը։
Պահուստային մոդելը և prompt injection-ը
Anthropic-ի կոդավորման միջավայրերի թեստերում Sonnet 5.5-ին ուղարկված հարցումների 25%-ը կիբեր արգելափակումից հետո մշակել է Sonnet 5-ը, հաճախ սկավառակները ջնջելու կամ ֆայլերը հեռացնելու ներարկված հրահանգների պատճառով։ Վերաուղղորդված հարցումների 12,01%-ը գրավվել է, մինչդեռ Sonnet 5.5-ն ինքը գրավվել է իր մշակած 5901 հարցումներից միայն չորսում։
Anthropic-ը դեռ կարգավորում է Sonnet 5.5-ի դասակարգիչները՝ կեղծ դրական արդյունքները նվազեցնելու համար, և ընդլայնված Cyber Verification Program-ում ստուգված պաշտպաններին ավելի քիչ սահմանափակումներ է խոստանում։ Թողարկման պահին Sonnet 5.5-ը այդ ծրագրում ներառված չէ։
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։