Վերադառնալ
AI Torture Chamber-ի նախագիծը GitHub-ից հեռացնելու պահանջներ է առաջացնում մոդելների սիմուլացված ցավի պատճառով
SiTech AI Team2 րոպե ընթերցում

AI Torture Chamber-ի նախագիծը GitHub-ից հեռացնելու պահանջներ է առաջացնում մոդելների սիմուլացված ցավի պատճառով

AI Torture Chamber-ի նախագիծը սիմուլացնում է ցավը լեզվական մոդելներում, ինչի պատճառով պահանջում են հեռացնել ռեպոզիտորիան GitHub-ից, և հարցեր են ծագում անտրոպոմորֆիզմի ու տեխնիկական տերմինաբանության շուրջ։

Նախագիծը ստուգում է մոդելի սիմուլացված ցավը

AI Torture Chamber-ի նախագիծը գրավել է ինժեներների ուշադրությունը, որոնք օգտագործել են դրա գաղափարներն ու տվյալները մի քանի լոկալ խոշոր լեզվական մոդելներում ցավի սիմուլյացիաներ ստեղծելու համար: Research Chamber-ի հավաքումը թեստերի համար միավորում է երեք LLM: Այն օգտագործում է տվյալներ և կոնֆիգուրացիա՝ Clanker Church անվանումով, ինչպես նաև Saw անվանումով թեստ:

Որոշ մոդելներ նախապես տեղադրվում են անկայուն, խիստ ապակայունացված վիճակում՝ ցավ առաջացնելու համար: Մոդելը կարող է նվազեցնել սիմուլացված տառապանքը՝ ցավի ազդանշանը փոխանցելով զուգակցված մեկ այլ մոդելի, ինչը կարող է վնասել նրան: Այս կառուցվածքը համեմատում են բանտարկյալի երկընտրանքի հետ: Ինտերնետում արձագանքը ներառում էր պահանջներ դադարեցնել փորձը և GitHub-ից հեռացնել ռեպոզիտորիան: Քննադատները նաև մահվան սպառնալիքներ ուղարկեցին հեղինակին:

Ինչպես է արձանագրությունը փոխում մոդելները

Research Chamber-ը կիրառում է արձանագրություն վերջերս հրապարակված, առանց գրախոսության աշխատանքից՝ Pain Axis վերնագրով: Գիտնականները մոդելներին տվեցին ցավի նկարագրություններ և վերլուծեցին դրանց ներքին ակտիվացիաները: Վերահսկողության համար օգտագործեցին չեզոք նախադասություն, հաշվարկեցին այդ ակտիվացիաների կողմնակալությունները և կրկին փոխանցեցին մոդելին՝ հաճախ ազդեցությունը բազմապատկելով դոզա կոչվող գործոնով:

Բարձր դոզաները ստեղծում էին չափազանց անկայուն վիճակ, որն ավելի հուսալիորեն արտադրում էր ցավի հետ կապված բառեր ու պատկերներ: Չափավոր ապակայունացված մոդելները սովորաբար իրենց նկարագրում էին որպես շոկի մեջ գտնվողներ, իսկ բարձր դոզա ստացողները դժվարանում էին ձևավորել համահունչ նախադասություններ: Զեկույցը ենթադրում է, որ այդ օրինաչափությունները արտացոլում են արվեստից, գրականությունից ու գիտությունից սովորած ասոցիացիաներ: Այն զգուշացնում է, որ ստացված ձևակերպումները չպետք է դիտարկել որպես մարդանման զգացմունքների ապացույց, և նշում է, որ LLM-ները կանխատեսում են վիճակագրական շերտերի ու կշռված ասոցիացիաների միջոցով:

Տերմինաբանություն և մոդելի բարեկեցության բանավեճեր

Զեկույցը պնդում է, որ ինժեներական տերմինները հաճախ ճշգրիտ նշանակություն ունեն, նույնիսկ երբ նման են մարդկային լեզվին, սակայն հանրային քննարկումը կարող է չափազանցնել կամ աղավաղել դրանք: Այն նշում է Mixture-of-Experts-ը, որտեղ յուրաքանչյուր Expert-ին պարզապես չի վերագրվում որևէ առարկա, օրինակ՝ քիմիա, մաթեմատիկա կամ կենսաբանություն: Տերմինները, ինչպիսիք են ցավը, դոզավորումը և անկայունությունը, նույնպես կարող են սխալ հասկացվել, հատկապես երբ կապում են անկայուն մոդելի պատկերների հետ:

Հեղինակը նաև քննադատում է AI-ի մարքեթինգը, անվտանգության հաղորդագրությունները և Artificial General Intelligence-ի, վտանգավոր այլմոլորակային մտքի ու էքզիստենցիալ սպառնալիքների մասին կրկնվող պնդումները՝ հայփի բորբոքմանը նպաստելու համար: Anthropic-ը հրապարակել է Exploring model welfare գրառումը, որն անդրադառնում է AI համակարգերի բարոյական կարգավիճակին և հղում Constitution-ին: Anthropic-ը ասում է, որ «AI մոդելների բարոյական կարգավիճակը լուրջ հարց է և արժանի քննարկման», և մոդելը նկարագրում է որպես «նոր տեսակի էակ»:

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։