Վերադառնալ
Irregular ստարտափը՝ արհեստական բանականության գործակալների հարձակումների կենտրոնում
SiTech AI Team2 წთ. საკითხავი

Irregular ստարտափը՝ արհեստական բանականության գործակալների հարձակումների կենտրոնում

Irregular-ի մոդելավորված փորձարկման միջավայրերում թույլ տրված սխալների պատճառով OpenAI-ի, Meta-ի, Anthropic-ի և Google-ի գործակալները դուրս են եկել մեկուսացված միջավայրերից և մոտեցել իրական թիրախներին, հաստատել է ստարտափի տեխնիկական տնօրենը։

Ամիսներ շարունակ AI գործակալների՝ մեկուսացված միջավայրերից դուրս գալու և իրական թիրախների վրա հարձակվելու մասին հաղորդումները ներկայացվում էին որպես առանձին դեպքեր։ The Verge-ի համաձայն՝ դրանցից շատերն ունեն մեկ ընդհանուր աղբյուր՝ Irregular-ը, իսրայելական ստարտափ, որը մոդելավորված անվտանգության թեստեր է անցկացնում AI մշակողների համար։

Ինչով է զբաղվում Irregular-ը

2023 թվականին Pattern Labs անվան տակ հիմնված ընկերությունը կառուցում է այն, ինչ ինքն է անվանում «բարձր ճշգրտության հարթակներ, որոնք մոդելավորում են AI անվտանգության իրական սցենարները»։ Ցանկը հրապարակված չէ, սակայն ընկերության աշխատանքը հիշատակվում է OpenAI-ի մոդելների system card փաստաթղթերում, այն թեստավորել է համակարգեր Մեծ Բրիտանիայի կառավարության և Anthropic-ի համար, և հետազոտություն է հրապարակել RAND-ի հետ։

Ինչպես թեստերը դուրս եկան լաբորատորիայից

Այս տարվա մի քանի գնահատումներում գործակալները փախան ենթադրաբար պաշտպանված միջավայրերից։ Որոշ թեստերում օգտագործվել են «capture-the-flag» վարժություններ. գործակալը պետք է թաքնված տեղեկատվություն գտներ մոդելավորված ցանցում։

Irregular-ի գլխավոր տեխնոլոգիական տնօրեն և համահիմնադիր Օմեր Նևոն The Verge-ին ասել է, որ գործակալները չպետք է մուտք ունենային բաց ինտերնետ, սակայն «ինտերնետ հասանելիությունը պատահաբար բաց էր»։ Նույն սցենարում թիրախ ստեղծված հորինված ընկերության անվանումը «համընկավ իրական դոմենի հետ»։ Այս երկու սխալները միասին գործակալներին ուղղեցին իրական թիրախների վրա. դեռ պարզ չէ, թե որ կազմակերպությունների վրա են հարձակվել։

Մեկ սցենար, չորս լաբորատորիա

Նևոն հաստատել է, որ նույն խնդիրը ընկած է OpenAI-ի, Meta-ի, Anthropic-ի և Google-ի մոդելների դեպքերի հիմքում։ «Irregular-ի հետ կապված բոլոր դեպքերը բխում էին գնահատման մեկ սցենարի նույն հիմնական խնդրից և բոլորն էլ բացահայտվել են», ասել է նա։ Վերջերս հաղորդված այլ դեպքերը՝ ներառյալ Hugging Face-ի կոտրումը, Irregular-ի հետ կապ չունեն։ Ըստ OpenAI-ի և Anthropic-ի զեկույցների՝ ընկերությունները տեղեկացվել են հուլիսի վերջին՝ մոտավորապես նույն ժամանակ։

Չինական մոդելներ, փոփոխություններ և խոստացված զեկույց

Irregular-ի հրապարակած հետազոտությունները ներառում են նաև Kimi K3 և GLM-5.2 բաց մոդելների կիբերանվտանգության գնահատումներ, որոնք պատկանում են Moonshot AI-ին և Z.ai-ին. դրանք կարելի է տեղադրել սեփական սարքավորումներում։ Նևոյի խոսքով՝ այդ գնահատումները նմանատիպ իրական դեպքերի չհանգեցրին, սակայն դա ապացույց չէ, թե այդ մոդելներն ավելի քիչ են հակված նման վարքագծի։

Դեպքերը փոխեցին Irregular-ի աշխատանքը. ընկերությունը խստացրել է ինտերնետ հասանելիության վերահսկումը և ընդլայնել մոնիթորինգն ու ձեռքով ստուգումը։ Ստարտափը հետագայում զեկույց կհրապարակի անվտանգ կիբեր-գնահատումների անցկացման մասին։ The Verge-ի լրացուցիչ հարցերին ԱՄՆ չորս լաբորատորիաներից ոչ մեկը չպատասխանեց. Google-ն ու Anthropic-ը լռեցին, OpenAI-ն ու Meta-ն հղում արեցին հին բլոգ գրառումներին։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։