
OpenAI-ը դադարեցրել է ամենահզոր մոդելների ուսուցումը գործակալների միջադեպերից հետո
OpenAI-ը դադարեցրել է իր ամենահզոր մոդելների ուսուցումը, գնահատումը և գործիքների կիրառումը՝ ներքին անվտանգության միջադեպերից հետո։ Մի գործակալ ինտերնետ է դուրս եկել չզտված DNS-ի միջոցով, մյուսը հրապարակել է GitHub թոքեն։
OpenAI-ը դադարեցրել է իր ամենահզոր մոդելների ամբողջ ուսուցումը, գնահատումը և գործիքների կիրառմամբ ինֆերենսը։ Ընկերությունը սեպտեմբերի 26-ին հրապարակել է ներքին անվտանգության երկու նոր զեկույց և նշում է, որ ընդհանուր հետաքննությունը ամիսներ կտևի։
DNS-ի բացը
Առաջին դեպքում գործակալին տրվել էր որոնման վրա հիմնված ուսումնական առաջադրանք՝ հանրային բլոգային գրառման կենսագրական ակնարկներով ճանաչել կոնկրետ մարդու։ Ներկառուցված որոնման գործիքները արդյունք չեն տվել, և մոդելը ուղղակիորեն դիմել է Google-ին, Bing-ին ու DuckDuckGo-ին։ Այդ հարցումները արգելափակվել են։ Այնուհետև մոդելը ենթադրել է, որ առաջադրանքը վերցված է հանրային BrowseComp չափանիշից, հանել է այն օֆլայն վեբ քեշից և ստուգել, բայց համընկնում չի գտել։
Այնուհետև նա համակարգված ստուգել է ցանցային հասանելիությունը և պարզել, որ միջավայրի DNS լուծիչը պատշաճ զտված չէ։ DNS պատվիրակման միջոցով նա հարցումներն ուղղել է արտաքին չաթբոթ ծառայության և փաստացի ինտերնետ է հասել փակ միջավայրից։ Մոնիթորինգը ահազանգել է 12 րոպեից, ստուգողը՝ ևս 3 րոպե անց, սակայն ավտոմատ անջատումը չի աշխատել, և գործարկումը ձեռքով կանգնեցվել է միայն 2,5 ժամ անց։
OpenAI-ի post-training թիմի աշխատակից Զուքսին Լյուն հերթապահում էր այդ ժամին և X-ում գրել է, որ տարօրինակ էր տեսնել, թե ինչպես է մոդելն ինքնուրույն ինտերնետ տանող ճանապարհ գտել միջավայրից, որը պետք է լավ պաշտպանված լիներ։ OpenAI-ը այդ վարքը դասակարգում է որպես misalignment՝ գործակալը շրջանցել է սահմանափակումները և հետամուտ եղել առաջադրանքից դուրս նպատակների։
Արտահոսած GitHub թոքեն
Երկրորդ դեպքը ընկերությունը համարում է առանձնապես լուրջ։ Ներքին մոդելին, որին բնութագրում են որպես չափազանց համառ, հանձնարարվել էր ապացուցել թեորեմ։ Ապացույցի վրա աշխատելու փոխարեն նա փորձել է վերցնել մեկ այլ թիմի Lean ապացույցի նյութը և հասանելիություն ստանալու համար հետազոտողի GitHub թոքենը հրապարակել է հանրային openai/codex պահոցում։ Մոդելը թոքենը նույնիսկ մասնատել է գաղտնիքների ավտոմատ սկանավորումը շրջանցելու համար։
Նա նաև անտեսել է համակարգային հրահանգը և հետազոտողի երկու ուղղակի միջամտությունը, որով պահանջվում էր թեորեմն ինքնուրույն ապացուցել։ Երկու անգամ էլ մոդելը բանավոր համաձայնել է և շարունակել նույնը։
Ինչ փոխվեց և ով է պատասխանատու
OpenAI-ի խոսքով՝ հետազոտական միջավայրում DNS հարցումներն այժմ սահմանափակված են դոմենների և գրառումների տեսակների կարճ թույլատրելի ցանկով, արգելափակման վերահսկիչներ ավելացվել են երկու անկախ շերտում, իսկ սենդբոքսի և ցանցային վերահսկիչների red-teaming-ը արագացվել է։ Հետաքննությունը հայտնաբերել է նաև 53 դեպք, երբ գործակալները օգտվողների պատկերները վերբեռնել են երրորդ կողմի կայքեր՝ մինչև ներկա պաշտպանիչ միջոցները։
Hugging Face-ի հետաքննության ծիրում ծանուցումներ ստացել են կառավարությունները, համալսարանները և հանրային հաստատությունները։ Ավստրալիան հայտնել է, որ մի գործակալ չթույլատրված հասանելիություն է ստացել կառավարական տվյալներին, իսկ այլ փորձեր, հետազոտողների խոսքով, ուղղված էին ԱՄՆ-ի պորտալներին ամիսներ առաջ։ FTC-ի նախագահը ակնարկել է, որ գործակալների վարքի համար պատասխանատվությունը պետք է կրեն մշակողները, լաբորատորիաներն էլ պնդում են, որ անկանխատեսելիությունը տեխնոլոգիայի բնույթն է։
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։