Վերադառնալ
Anthropic-ը ներողություն խնդրեց Claude Fable-ի անտեսանելի պաշտպանությունների համար
SiTech AI Team2 წთ. საკითხავი

Anthropic-ը ներողություն խնդրեց Claude Fable-ի անտեսանելի պաշտպանությունների համար

Anthropic-ը ընդունել է, որ դիստիլյացիայի կասկածով հարցումների պատասխանները լուռ աղավաղելը սխալ որոշում էր, և այժմ օգտատերերը կտեսնեն, երբ հարցումը փոխանցվում է Opus 4.8-ին։

Anthropic-ը ներողություն խնդրեց այն բանի համար, որ իր նոր մոդելը՝ Claude Fable 5-ը, լուռ սահմանափակում էր անտեսանելի պաշտպանական մեխանիզմներով, որոնք անդրադարձան նաև մրցակից սիստեմներ կառուցող հետազոտողների ու ընկերությունների վրա։ Ընկերությունը հայտնում է, որ փոխում է ընթացքը և ավելի թափանցիկ կլինի սահմանափակումների ակտիվացման հարցում՝ նույնիսկ եթե դա նշանակում է, որ Fable-ը կհրաժարվի ավելի շատ հարցումներից։

Թաքնված պաշտպանություն, ապա՝ ներողություն

Fable-ը Anthropic-ի Mythos դասի առաջին լայնորեն հասանելի մոդելն է՝ ընտանիք, որի մասին ընկերությունը ամիսներով ասում էր, որ հանրային թողարկման համար չափազանց վտանգավոր է։ Ըստ Anthropic-ի՝ որոշ ռիսկեր լուծվել են այն պաշտպանություններով, որոնք արգելափակում են որոշակի «բարձր ռիսկային» հարցումներ։ Սահմանափակ ոլորտներից մեկը դիստիլյացիան է՝ փոքր մոդելների ուսուցումը մեծերի արդյունքներով։ Fable-ի համակարգային քարտում ընկերությունը գրել էր, որ դիստիլյացիայի կասկածով հարցումների պատասխանները ուղղակիորեն կփոխի ու կվատթարացնի, առանց օգտատիրոջը տեղեկացնելու, որ պաշտպանությունը գործարկվել է կամ որ պատասխանը փոփոխվել է։

Այժմ՝ ուղղորդում Opus 4.8-ին

Այս մոտեցումն այժմ փոխվում է։ Դիստիլյացիայի փորձ թվացող հարցումները կուղղորդվեն Claude Opus 4.8-ին՝ ընկերության նախորդ ֆլագման մոդելին, ասվում է Anthropic-ի X-ի գրառման մեջ։ Օգտատերերին այդ մասին կտեղեկացնեն. «Դա կտեսնեք ամեն անգամ, երբ դա տեղի ունենա»։ Մեխանիզմը կրկնում է այն, թե ինչպես է Fable-ը վարվում այլ բարձր ռիսկային ոլորտներում՝ կենսաբանություն, քիմիա և կիբերանվտանգություն. հարցումները անցնում են Opus 4.8-ով, եթե դրանք ամբողջությամբ չեն արգելափակվում թմրանյութերի, զենքի և այլ արգելված բովանդակության կանոններով։ Կենսաբանությունում պաշտպանություններն այնքան լայն են սահմանվել, որ Fable-ը գործնականում անօգտագործելի է նույնիսկ հիմնական հարցերի համար. դա The Verge-ին հաստատել է Anthropic-ի ներկայացուցիչ Փարուուլ Մահեշվարին։

Հետազոտողների քննադատությունը

Ընթացքի փոփոխությունը հաջորդեց արհեստական բանականության հետազոտական համայնքի կտրուկ քննադատությանը, որը զգուշացրել էր, որ Fable-ի դիստիլյացիայում կասկածվող օգտատերերի լուռ սահմանափակումը կարող է վնասել նաև այն երրորդ կողմերին, որոնք փորձում են ինքնուրույն գնահատել այդ մոդելը։ Համակարգային քարտում Anthropic-ը պնդում էր, որ նոր մոդելների՝ AI-ի զարգացումը արագացնելու ունակությունը արդարացնում է նման հարցումների սահմանափակումը, և նշում էր. «Claude-ը մրցակից մոդելներ մշակելու համար օգտագործելն արդեն իսկ խախտում է մեր ծառայության պայմանները»։ Ընկերությունը նախկինում մեղադրել է չինական մրցակիցներին, օրինակ՝ DeepSeek-ին, իր մոդելները «ինդուստրիալ» մասշտաբով դիստիլյացիայի մեջ։

X-ի գրառման մեջ Anthropic-ը բացատրել է իր ընտրած փոխզիջումը. «Տեսանելի պաշտպանությունները կարելի է փորձարկել, ուստի դրանք պետք է ամուր լինեն, իսկ դա ժամանակ է պահանջում։ Անտեսանելի պաշտպանությունները կարելի է ավելի նեղ ուղղել, ինչը թույլ է տալիս արագ թողարկել շատ քիչ կեղծ դրականներով։ Հենց այդ պատճառով ընտրեցինք անտեսանելի պաշտպանությունները, և դա սխալ փոխզիջում էր։ Դուք պետք է տեսնեք, թե ինչ պաշտպանություններ ունենք և ինչու։ Ներողություն ենք խնդրում, որ հավասարակշռությունը չպահեցինք»։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։