Վերադառնալ
OpenAI-ը հայտնաբերեց և դադարեցրեց համակարգված դիստիլյացիայի արշավը
SiTech AI Team2 წთ. საკითხავი

OpenAI-ը հայտնաբերեց և դադարեցրեց համակարգված դիստիլյացիայի արշավը

OpenAI-ը հայտարարել է, որ հայտնաբերել և դադարեցրել է համակարգված արշավ, որի նպատակը իր մոդելներից պաշտպանված դատողության արտահանումն էր։ Ընկերությունը գործունեության հիմնական մասը վերագրում է Moonshot AI-ի հետ կապված անձանց։

OpenAI-ը հայտարարել է, որ հայտնաբերել և դադարեցրել է համակարգված արշավ, որի նպատակը իր մոդելներից պաշտպանված դատողության արտահանումն էր։ Ընկերության խոսքով՝ ամենավաղ ակտիվությունը գրանցվել է հուլիսի առաջին շաբաթում։ Գործողությունները կրում են մոդելի դիստիլյացիայի նշաններ, այսինքն՝ մի մոդելի արդյունքների կամ դատողության չարտոնված օգտագործումը մեկ այլ մոդել վարժեցնելու համար։

Ինչ նկատեց OpenAI-ը

Հետաքննության համաձայն՝ օպերատորները փորձում էին նոր եղանակներով արտահանել պաշտպանված դատողությունը։ Դրանց թվում էր մեկ զրույցում առկա գաղտնագրված դատողության պատճենումը և մեկ այլ զրույցում մոդելից պահանջելը, որ այն վերծանի ու վերաշարադրի թաքնված բովանդակությունը։ Անկախ անվտանգության հետազոտողները պատասխանատու բացահայտման ճանապարհով ընկերությանը տեղեկացրել են մոդելների միջև և զրույցի սեղմման հետ կապված նման խոցելիությունների մասին։ OpenAI-ը ստուգել է նրանց եզրակացությունները և հաստատել, որ նկարագրված հարձակման ուղիներն իրական են։

Ակտիվությունը սկսվել է հուլիսի 1-ին և սկզբում ցածր էր։ Հուլիսի 24-ին և 25-ին գրանցվել են բարձր ծավալի գագաթնակետեր՝ 16 000 հարցում, որոնք օգտագործում էին արտահանման համապատասխան նմուշը 4 000-ից ավելի օգտատերերի կողմից։ Հետագա հետաքննությունը հայտնաբերել է կապված prompt-նմուշների ակտիվություն 15 000-ից ավելի օգտատերերի խմբում. դրա ամբողջական դադարեցումը հաջողվել է հուլիսի 28-ի դրությամբ։

Ում է OpenAI-ը վերագրում ակտիվությունը

Ընկերության գնահատմամբ՝ պարզ չէ, թե արդյոք բոլոր օպերատորները մեկ դերակատարից էին։ Ակտիվության հիմնական մասը OpenAI-ը վերագրում է Moonshot AI-ի՝ Kimi-ի ստեղծողի հետ կապված անձանց։

Ինչու է սա կարևոր

OpenAI-ի հայտարարության համաձայն՝ օպերատորները չեն կոտրել գաղտնագրումը, չեն վնասել տվյալների բազան և չեն ստացել ուղղակի հասանելիություն պահված զրույցներին։ Փոխարենը նրանք մոդելի հետ փոխազդեցությունն օգտագործել են այնպես, որ պաշտպանված դատողությունը նկարագրվի հարցում անողի համար տեսանելի ձևով։ Ընկերությունը նշում է, որ այդ ռիսկը վերաբերում է ոչ միայն OpenAI-ին, և նման տեխնիկան կարող է կիրառվել նաև այլ առաջավոր AI համակարգերում։ Արտահանված դատողությունը կարող է օգտագործվել մեկ այլ մոդել վարժեցնելու համար՝ առանց այն սահմանափակումների, որոնք ունի բնօրինակ մոդելը։ Թվերը նկարագրում են միայն փորձերը, այլ ոչ թե անպայման հաջող արտահանումները։

Ինչպես արձագանքեց ընկերությունը

OpenAI-ը կամպանիան դադարեցրել է հաշիվների կիրարկման, տեխնիկական վերահսկողության և գործընկերների հետ համակարգման համադրությամբ. արգելափակել կամ սահմանափակել է խարդախ հաշիվները, ուժեղացրել գրանցման և ենթակառուցվածքի վերահսկողությունը և ընդլայնել մոնիտորինգը։ Նաև փակվել է ուղին, որը հնարավորություն էր տալիս վերաօգտագործել և վերականգնել այլ օգտատիրոջ գաղտնագրված դատողությունը, և ավելացվել են ստուգումներ, որոնք կանգնեցնում են դատողության բացահայտման ռիսկով հոսքային ելքը։ Եզրակացությունները տարածվել են Frontier Model Forum-ի և պետական տեղեկատվության փոխանակման ուղիների միջոցով։ Հետագայում ընկերությունը կուժեղացնի երեք ուղղություն՝ տեխնիկական պաշտպանություն, համակարգված արշավների հայտնաբերում և տեղեկատվության փոխանակում արդյունաբերության ու իշխանությունների միջև։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։