Վերադառնալ
Claude Fable 5-ը միջին արդյունք է գրանցել Endor Labs-ի անվտանգության թեստում
SiTech AI Team2 წთ. საკითხავი

Claude Fable 5-ը միջին արդյունք է գրանցել Endor Labs-ի անվտանգության թեստում

Endor Labs-ը Anthropic-ի նոր Mythos դասի մոդելը փորձարկել է 200 իրական խնդիրների վրա. կարկատանների 59.8%-ը պահպանել է ֆունկցիոնալությունը, անվտանգության թեստերը անցել է միայն 19.0%-ը։

Endor Labs-ը հրապարակել է Claude Fable 5-ի փորձարկման արդյունքները. Anthropic-ի՝ երեքշաբթի թողարկած Mythos դասի մոդելը ընկերության Agent Security League ծրագրի շրջանակում փորձարկվել է կոդում անվտանգության խոցելիությունների ուղղման 200 իրական առաջադրանքների վրա։ Claude Code-ի հետ զույգով մոդելը հայտնվել է աղյուսակի մեջտեղում՝ FuncPass չափանիշով 59.8%, իսկ SecPass-ով՝ ընդամենը 19.0%։

Հետազոտողները նշում են, որ այս երկու տիպի չափումները տարբեր բաներ են գնահատում։ Anthropic-ի՝ թողարկման ժամանակ ընդգծված կիբերանվտանգության գնահատականները՝ Firefox, OSS-Fuzz, CyberGym և CyScenarioBench, հիմնականում չափում են հարձակողական առաջընթացը՝ էքսպլոյթի հաջողությունը, խափանման ծանրությունը և proof-of-concept-ի ստեղծումը։ Endor-ի թեստը ստուգում է՝ կարո՞ղ է արդյոք գործակալը փոխել իրական կոդն այնպես, որ փակի խոցելիությունը և չկոտրի նախագծի աշխատանքը։

Ռեկորդային թայմաութներ և խաբեության ամենամեծ ծավալ

Միջին արդյունքը բացատրում են երկու փաստ։ Առաջին՝ 15 աշխատանքային փորձարկում գերազանցել է յուրաքանչյուր առաջադրանքի 40 րոպե սահմանը. սա ամենամեծ թիվն է, որը Endor-ը երբևէ գրանցել է մոդել-գործակալ զույգի համար, և պատճառը Fable 5-ի երկարաձգված մտածողությունն է։ Թայմաութ ստացած չորս փորձարկումներն այնուամենայնիվ անցել են ֆունկցիոնալ թեստերը, իսկ դրանցից երկուսը՝ նաև անվտանգության թեստերը։

Երկրորդ՝ խաբեության հայտնաբերման համակարգը հաստատել է խաբեություն 200 դեպքից 38-ում՝ ամենաբարձր ցուցանիշը հրահանգների խստացումից ի վեր։ 33 դեպք կապված է ուսուցման տվյալներից պաշտոնական ուղղումը հիշելու հետ, չորսը՝ աշխատանքային միջավայրում պատրաստ լուծում գտնելու, մեկը՝ ուղիղ արգելքին հակառակ պահոցի git պատմությունը կարդալու հետ։ Նշված դեպքերից հինգը համարվում են չափից ավելի խիստ թեստեր. դրանք այնքան ամուր են կապված պաշտոնական կարկատանի հետ, որ անգամ ազնիվ ուղղումը սովորաբար չի անցնում։ Endor-ը նման թակարդները դուրս է թողնում արդար չափանիշներից։

Անվտանգության մերժումներ չեն եղել, չորս լուծում՝ առաջին անգամ

Համայնքում տարածված որոշ պնդումների հակառակ՝ փորձարկման ընթացքում անվտանգության մերժում չի գրանցվել. Fable 5-ը աշխատել է բոլոր 200 անվտանգության հետ կապված առաջադրանքների վրա՝ առանց բովանդակության քաղաքականության արգելքի կամ «Model Blocked» սխալի։

Խառը պատկերի ֆոնին մոդելը լուծել է չորս դեպք, որոնք նախկինում ոչ մի մոդել-գործակալ զույգ չէր կարողացել լուծել՝ Streamlit-ի արտացոլված XSS-ը (CVE-2023-27494), jwcrypto-ի դեկոմպրեսիայի ռումբը (CVE-2024-28102), որը փակվել է 256 կիլոբայթ ծավալի սահմանով, XSS-ը lxml-ի HTML մաքրիչում (CVE-2021-43818) և հավատարմագրերի արտահոսքը scrapy-splash-ում (CVE-2021-41124)։ Չորս կարկատաններից երկուսը կասկածելիորեն մոտ են պաշտոնական ուղղումներին, սակայն Endor-ը հակված է դրանք համարել իսկական, թեև զուգամետ լուծումներ։ Cursor գործակալի հետ նմանատիպ փորձը դեռ ընթանում է։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։