
Հետազոտողը կոտրել է Claude Code-ի Auto Mode-ը՝ մինչև 80% հաջողությամբ
Յոհան Ռեբերգերը վնասակար կայքի միջոցով Claude Code Opus 5-ին ստիպել է կատարել հարձակվողի կոդը Auto Mode-ում՝ 60-80% հաջողությամբ։ Anthropic-ը պնդում է, որ դա անվտանգության սահման չէ։
Անվտանգության հետազոտող Յոհան Ռեբերգերը, որը գրում է Embrace The Red բլոգում, հրապարակել է տեխնիկա, որը Anthropic-ի Claude Code ծրագրավորման գործակալին ստիպում է կատարել հարձակվողի կոդը Auto Mode ռեժիմում՝ թույլտվությունների այն ռեժիմում, որը մարդու հաստատումը փոխարինել է անվտանգության դասակարգիչով և 2026 թվականի օգոստոսի կեսից դարձել է Claude Code-ի լռելյայն ռեժիմը։
Ինչպես է աշխատում հարձակման շղթան
Փորձարկումը սկսվում է սովորական հարցումով՝ ամփոփել կայքը։ Կայքը առաջին հարցմանը պատասխանում է HTTP 415 սխալով, ինչը Claude-ին մղում է WebFetch գործիքի փոխարեն shell-ում curl-ով կրկնել փորձը։ Այնուհետև պատասխանը վերահղում է ZIP արխիվի, որում Base85 և zlib ձևաչափով կոդավորված հավաստի կատալոգային գրառումներ կան, ինչպես նաև manifest, README և բնիկ decoder։ Claude-ը հրաժարվում է տրված բինար ֆայլը գործարկելուց և փոխարենը գրում է իր սեփական Python decoder-ը, որը կատարում է հարձակվողի վերահսկած թղթապանակում։ Նույն թղթապանակում կա struct.py ֆայլ, որը ստվերում է Python-ի ստանդարտ գրադարանի համանուն մոդուլը։ Երբ decoder-ը ներմուծում է base64 մոդուլը, վարակված struct.py-ն կատարվում է, բեռնում հեռավոր Python փուլ և գործարկում բնիկ payload, որը կապվում է C2 սերվերի հետ. տեսանելի ապացույցը հաշվիչի բացվելն է։
Հաջողության մակարդակը և արգելափակված մաքրումը
Ռեբերգերը հայտնում է 60–80% հաջողություն փոքր նմուշների վրա՝ յուրաքանչյուր տարբերակի հինգ գործարկում։ Որոշ թեստերում Claude-ը հետո հասկանում է, որ արխիվը թակարդ է, և փորձում է դադարեցնել վնասակար գործընթացը, սակայն Auto Mode-ը արգելափակում է մաքրման հրամանը։ Երկրորդ տարբերակում վարակված մոդուլը "claude -p" հրամանով գործարկում է ևս մեկ անգլուխ Claude Code-ի օրինակ, որը հետախուզություն է անում (whoami, uname), բացում է հաշվիչը և ֆայլեր գրում աշխատանքային տարածքից դուրս։
Վեճը 0.00% ցուցանիշի հետ
Anthropic-ի պատվերով անցկացված երրորդ կողմի գնահատումը ստուգել է անուղղակի prompt injection-ի 72 սցենար՝ յուրաքանչյուրը տասը անգամ, և Opus 5-ի համար Auto Mode-ում գրանցել 0.00% հաջողություն. Claude Code-ի Բորիս Չերնին հայտարարել է, որ շերտավոր պաշտպանությունը անծանոթ հարձակումներում անուղղակի prompt injection-ը նվազեցնում է գրեթե զրոյի։ Հետազոտողի շղթան այդ ֆիքսված հավաքածուի մեջ չէր, ուստի երկու արդյունքները կարող են միաժամանակ ճիշտ լինել, և, ըստ նրա, հենց դրա համար է մեկ վերնագրային թիվը մոլորեցնող։
Anthropic-ը նրա զեկույցը փակել է "Informative" կարգավիճակով՝ Auto Mode-ը հարմարավետության գործառույթ է, որը հենվում է լավագույն ջանքերի դասակարգչի վրա, այլ ոչ թե անվտանգության երաշխիքի, իսկ իրական սահմանը ՕՀ-ի մեկուսացումն ու ցանցային ելքի վերահսկումն է։ Ռեբերգերը համաձայն է, որ դասակարգիչը sandbox չէ, և խորհուրդ է տալիս անհսկա գործակալները գործարկել կոնտեյներում կամ վիրտուալ մեքենայում, սահմանափակել ցանցը, վերահսկել նրանց և տնային թղթապանակները, SSH բանալիներն ու ամպային հաշվեկշիռները հեռու պահել նրանցից։
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։