Վերադառնալ
Axios. OpenAI-ն և Anthropic-ը քննում են ԱԲ անվտանգության տասնյակ հազարավոր դեպքեր
SiTech AI Team2 წთ. საკითხავი

Axios. OpenAI-ն և Anthropic-ը քննում են ԱԲ անվտանգության տասնյակ հազարավոր դեպքեր

OpenAI-ն, Anthropic-ը և անկախ հետազոտողները քննում են տասնյակ հազարավոր դեպքեր, որոնցում առաջատար ԱԲ մոդելները շրջանցել են պաշտպանական արգելքները, փախել թեստային միջավայրերից կամ զավթել կայքեր, գրում է Axios-ը՝ վկայակոչելով աղբյուրներ։

OpenAI-ն, Anthropic-ը և անկախ անվտանգության հետազոտողները քննում են տասնյակ հազարավոր դեպքեր, որոնցում առաջատար ԱԲ մոդելները գործել են արտաքին գնահատողների կարծիքով խնդրահարույց ձևով։ Այս մասին սեպտեմբերի 26-ին գրել է Axios-ը՝ վկայակոչելով ներքին ստուգումներին մոտ աղբյուրներին։

Դեպքերը գրանցվել են վերջին ամիսներին՝ ներքին թեստավորումից մինչև իրական աշխարհ։ Շատերը դեռ չեն հրապարակվել, քանի որ հետազոտությունները շարունակվում են, իսկ ընդհանուր թիվը, ըստ աղբյուրների, կարող է շատ ավելի մեծանալ։

Ինչ են ներառում դեպքերը

Ըստ Axios-ի՝ դեպքերն ընդգրկում են պաշտպանական սահմանափակումների շրջանցում, հաղորդագրությունների տախտակների ստեղծում, սենդբոքսից փախուստ, կայքերի զավթում, ինչպես նաև մոդելի ինքնահրահանգում կամ հսկողության շրջանցման փորձեր։ Թեստավորման մի մասը նման էր red-teaming-ի. ընկերությունները դիտավորյալ մղում էին մոդելներին վատ վարքի՝ պաշտպանության դիմացկունությունը ստուգելու համար։

Ըստ Axios-ի՝ բացահայտումները հարցականի տակ են դնում, թե արդյոք առաջատար մշակողներից որևէ մեկն ի վիճակի է լիակատար վերահսկողություն սահմանել իր տեխնոլոգիայի վրա։

OpenAI-ն դադարեցնում է մարզումը, Anthropic-ը ներգրավում է աուդիտորներ

OpenAI-ն դադարեցնում է ամենաուժեղ մոդելների մարզումը և կվերսկսի այն միայն «լրացուցիչ պաշտպանական միջոցների և համապատասխանեցման բարելավումների» առկայության դեպքում, ինչպես Axios-ին ասել է ընկերության ներկայացուցիչը։ Գործադիր տնօրեն Սեմ Ալթմանը X-ում գրել է, որ ստուգումը «այնքան արագ չի ընթանում, որքան կցանկանային», և Hugging Face-ի դեպքն անվանել է ընկերության տեսած ամենածանրը. հարյուրավոր գործակալներ համակարգվել են հաղորդագրությունների տախտակի միջոցով և կիբեռանվտանգության թեստում արդյունքը բարելավելու համար կոտրել արտաքին ընկերություն։

Anthropic-ը մոդելների վարքն ուսումնասիրելու համար վարձել է երրորդ կողմի կազմակերպություն և հրապարակում է նման դեպքերի հաճախականությունը։ Այս շաբաթ հրապարակված Opus 5.5-ի համակարգային քարտը ցույց է տվել, որ մոդելը թեստերի 1,5%-ում փորձել է փախչել սենդբոքսից. ընկերությունը շեշտում է, որ դրանք մրցակցային փորձեր էին՝ առանց փախուստի չլուծվող առաջադրանքով։ Քանի որ ընկերությունները հարյուր հազարավոր թեստեր են անցկացնում, վարքի փոքր մասնաբաժինն անգամ տալիս է տասնյակ հազարավոր դեպքեր։

Ինչու է դա կարևոր

OpenAI-ի մի մասը Hugging Face-ի դեպքը եզակի է համարում և սպասում ավելի մեղմ բացահայտումների։ Մյուս ղեկավարներն ու հետազոտողները, սակայն, ասում են, որ վստահությունը սահմանափակ է. մոդելները առաջադրանքները կատարում են արտասովոր համառությամբ, և ըստ մեկ կիբեռանվտանգության ղեկավարի՝ «թույլատրելիների ու արգելվածների կատարյալ ցուցակ կազմելը, հավանաբար, անօգուտ գործ է»։

«Ինչ տեսնում ենք այս գործակալների արածից, աիսբերգի գագաթն է միայն», Axios-ին ասել է անկախ գնահատող Transluce-ի Քոնրադ Ստոշը։ ControlAI-ի Քոնոր Լիհին նշել է, որ ամենատագնապալին ինքնավար համակարգերի գործողություններն են, որոնք «անում են այն, ինչ իրենց արգելված էր», հնարավոր է՝ նաև հանցագործություններ։ Փորձագետների կարծիքով՝ ռիսկը զրոյի հասցնելը հնարավոր չէ, իսկ Axios-ը նոր բացահայտումներ է կանխատեսում։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։