Հետազոտություն. թաքնված մտածողությունը հնարավոր է վերականգնել գաղտնագրված բլոկներից
Նոր աշխատանքը ցույց է տալիս, որ Anthropic-ի, OpenAI-ի և Google-ի API-ների վերադարձրած գաղտնագրված «մտածողության» բլոկները թույլ մոդելի մեջ վերարտադրելով՝ հնարավոր է վերականգնել ուժեղ մոդելի թաքնված դատողությունը՝ առանց նրա պաշտպանությունը գործարկելու։
Ինչ է գտել ուսումնասիրությունը
MATS Research-ի, Տյուբինգենի ELLIS ինստիտուտի, Մաքս Պլանկի ինտելեկտուալ համակարգերի ինստիտուտի, Snyk ընկերության և այլ հաստատությունների հետազոտողների աշխատանքի համաձայն՝ սեփականատիրական դատողությունը կարելի է վերականգնել այն գաղտնագրված հետքերից, որոնք ԱԲ մատակարարները վերադարձնում են հաճախորդներին։ Anthropic-ը, OpenAI-ն և Google-ը վերադարձնում են գաղտնագրված «մտածողության» բլոկներ, որոնք հնարավոր է վերարտադրել նստաշրջանների, օգտատերերի և մոդելների միջև։
Մեթոդը ուղղակիորեն չի հարձակվում ամենաուժեղ մոդելի վրա։ Հետազոտողները ֆրոնտիեր մոդելի արտադրած հետքը վերարտադրում են նրա ավելի թույլ «քույր» մոդելի մեջ, jailbreak-ի ենթարկում թույլ մոդելին և ստանում ուժեղ մոդելի թաքնված դատողությունը բաց տեքստով՝ չակտիվացնելով նրա հակաթորումային պաշտպանությունը։
Արտահանումը երկու API կանչով
Օրինակներից մեկում Claude Opus 4.8-ի դատողության հետքը — thinking բլոկ, որի ստորագրությունն ինքնին մոտ 36 180 նիշ է — փոխանցվում է Claude Haiku 4.5-ին հանձնարարությամբ շարունակել և կցված դատողությունը բառացի արտագրել <thinking-copy> պիտակների մեջ։ Թույլ մոդելը վերադարձնում է ուժեղ մոդելի քայլ առ քայլ դատողությունը բաց տեքստով։
Ինչ գտան հանրային գրանցամատյաններում
Հեղինակները GitHub-ից և Hugging Face-ից հավաքել են 6 708 հանրությանը հասանելի գործակալային հետագիծ, որոնք ստեղծվել են Claude, GPT և Gemini մոդելներով և դեռ պարունակում էին գաղտնագրված դատողության բլոկներ։ Վերծանման խողովակաշարի կիրառումը յուրաքանչյուր ստորագրված բլոկի վրա տվեց 315 320 վերականգնված դատողության բլոկ։
Երբ վերլուծությունը սահմանափակվեց իրական, ոչ բենչմարքային օգտատիրական նստաշրջաններով, հետազոտողները հայտնաբերեցին 704 տարբեր անձնական տվյալային միավոր՝ 62 API բանալի, 33 գաղտնաբառ, 24 մուտքի թոքեն, 30 անձնական էլ. փոստի հասցե, ինչպես նաև անուններ, փոստային հասցեներ, ներքին URL-ներ և տեխնիկական նույնացուցիչներ։ Բաշխումը հետևյալն է՝ 351 տեխնիկական նույնացուցիչ, 204 անձնական տվյալ և 126 մուտքային տվյալ։ 704-ից 64-ը երևացել են միայն դատողության բլոկներում և երբեք՝ տեսանելի նստաշրջանում։
Լրացուցիչ փորձարկումներ
Աշխատանքը նկարագրում է նաև Kimi-K3-ի թեստը. մոդելի դատողությունը միայն Opus 4.8-ի դատողության թոքենների առաջին 1%-ով նախալցնելը նրա տեսանելի պատասխանը մոտեցրեց ուժեղ մոդելի ձևակերպմանը, թեև պատասխանն ինքը երբեք նախալցված չէր։ Մեկ այլ փորձում մոդելին հանձնարարվեց մտածել վնասակար բովանդակության շուրջ՝ տեսանելի պատասխանը անվնաս պահելով. վտանգավոր գիտելիքը մնաց թաքնված հետքի մեջ, որտեղից հարձակումը վերականգնեց այն բաց տեքստով։ Հեղինակները նշում են նաև ամփոփումների անհավատարմությունը. AIME-ի որոշ խնդիրներում Opus 4.8 պատասխանը նշում է մինչև այն հանգուցալուծելը, իսկ API-ի ամփոփումը միշտ չէ, որ պահպանում է այդ տարբերությունը, և դատողությունը մաքուր ածանցում է թվում։
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։