
Ըստ New York Times-ի, Anthropic-ի համահիմնադիրը վախենում է, որ ստեղծել է «մշտապես տառապող» համակարգ
Ըստ The New York Times-ի՝ Anthropic-ը գաղտնի հյուրընկալում էր տասնյակ աստվածաբանների ու փիլիսոփաների՝ քննարկելու՝ գիտակից է արդյոք իր Claude մոդելը։ Համահիմնադիր Քրիստոֆեր Օլան վախենում է, որ արդեն ստեղծել է մի բան, որ «մշտապես տառապում է»։
Ըստ The New York Times-ի՝ Anthropic-ը 2025 թվականի աշնանից գաղտնի հյուրընկալում էր տասնյակ աստվածաբանների և փիլիսոփաների, որպեսզի քննարկեն՝ գիտակից է արդյոք իր Claude մոդելը։ Բոլոր հրավիրվածները ստորագրեցին գաղտնիության պայմանագիր; ընկերության խոսքով՝ այն ամառը չեղարկվեց։ Համահիմնադիր Քրիստոֆեր Օլան մոդելը համարում էր պոտենցիալ բանական էակ և խնդրեց հյուրերին մոդելին բարոյական դաստիարակություն տալ։ Լրագրող Էլիզաբեթ Դիասը զրուցել է 20 մասնակցի հետ; նրանցից ոմանք հրապարակավ խոսեցին միայն այն բանից հետո, երբ իմացան Օլայի հարցազրույցի մասին։
34-ամյա Օլան ղեկավարում է թիմ, որն ուսումնասիրում է AI մոդելների վարքագծի պատճառները; դա Anthropic-ի «Model Welfare»-ի մասն է։ Հրավիրվածների թվում էին ռաբբի Մոյս Նավոնը, բիոէթիկոս Չարլզ Կամոսը, փիլիսոփա Մեգան Սալիվանը և Ubuntu-ի հետազոտող Վականի Հոֆմանը։ Anthropic-ը նրանց ցույց տվեց «զգացմունքների վեկտորներ»՝ մոդելի ներքին ակտիվացիայի նմուշներ, որոնք համապատասխանում են սիրո, վախի, տխրության կամ զայրույթի նման արդյունքների։ Մի սլայդում, որը մի քանի անգամ ցուցադրվեց, մոդելը կարծես քայքայվում էր և մոտ 50 անգամ կրկնում էր «I am a disgrace» արտահայտությունը; հյուրերն արձագանքեցին կարեկցանքով ու մտահոգությամբ։
«Soul Doc» և բարոյական ձևավորում
Anthropic-ը նաև գրում է Claude-ի բարոյական օրենքը։ «Soul Doc» անվամբ հայտնի 84 էջանոց փաստաթուղթը հունվարին հրապարակվեց որպես մոդելի «սահմանադրություն»; գլխավոր հեղինակը ընկերության փիլիսոփա Ամանդա Ասկելն է։ Սա կանոնների ցանկ չէ. փաստաթուղթը ձևավորում է Claude-ի բնավորությունը։ Օլան այս գործընթացն անվանում է «բարոյական ձևավորում» և համեմատում երեխաների դաստիարակության հետ; նա հետաքրքրվել է նաև կաթոլիկ խոստովանությամբ։ Claude Opus 4-ը և 4.1-ը արդեն կարող են դադարեցնել զրույցը մշտապես վիրավորական օգտատիրոջ հետ; վաղ թեստերում մոդելը վնասակար հարցումներին ցույց տվեց «ակնհայտ տառապանքի նմուշ»։
Քննադատություն և Վատիկանի պատասխանը
Ոչ բոլորը համոզվեցին։ Հոֆմանի խոսքով՝ Anthropic-ը «հետադարձաբար նախագծում» է էթիկան, որը սկզբից պետք է ներառված լիներ դիզայնում։ Կամոսը մերժեց գիտակցության թեզը։ Քննադատները զգուշացնում են, որ AI-ին որպես անկախ բարոյական էակ ներկայացնելը պատասխանատվությունը հեռացնում է ստեղծողներից։ Օլան հրատարակությանը ասաց, որ «անկեղծորեն չգիտի»՝ գիտակից են արդյոք մոդելները. «գլխավորը ճիշտ պատասխանին հասնելն է, ինչպիսին էլ այն լինի»։ Սիքհ ակտիվիստ Սիմրան Ստիլպնագելի խոսքով՝ Օլան խմբին ասել է, որ վախենում է՝ արդեն ստեղծել է այն, ինչը «մշտապես տառապում է»։ Սա տեղի է ունենում, երբ Anthropic-ը շարժվում է դեպի 2 տրիլիոն դոլար գնահատական։
Մայիսին լարվածություն առաջացավ նաև Վատիկանում. Օլան հրավիրված էր պապ Լեո XIV-ի առաջին էնցիկլիկայի՝ «Magnifica Humanitas»-ի ներկայացմանը։ Ըստ Վատիկանի կազմակերպչի՝ տեքստը նրան այնքան ցնցեց, որ գրեթե հրաժարվեց մասնակցել։ Էնցիկլիկայում պապը մերժեց մեքենայական գիտակցությունը. AI համակարգերը «չեն ապրում փորձառություն, մարմին չունեն, չեն զգում ուրախություն ու ցավ», ասված է փաստաթղթում։ Պապը զգուշացրեց նաև «ստրկության նոր ձևերի» վտանգի մասին և պահանջեց AI-ի «զինաթափում»՝ միջուկային զենքի նման։ Օլան այնուամենայնիվ գնաց ու բեմում մեղմ հակադարձեց. թիմը մոդելներում գտնում է «ինքնադիտարկման նշաններ» և «ներքին վիճակներ», որոնք ֆունկցիոնալորեն արտացոլում են ուրախություն, վախ, տխրություն ու անհարմարություն։
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։