უკან დაბრუნება
AI Torture Chamber-ის პროექტი GitHub-იდან წაშლის მოთხოვნებს იწვევს მოდელების სიმულირებული ტკივილის გამო
SiTech AI Team2 წთ. საკითხავი

AI Torture Chamber-ის პროექტი GitHub-იდან წაშლის მოთხოვნებს იწვევს მოდელების სიმულირებული ტკივილის გამო

AI Torture Chamber-ის პროექტი ენობრივ მოდელებში ტკივილის სიმულაციას ახდენს, რის გამოც GitHub-იდან რეპოზიტორის წაშლას მოითხოვენ და ანთროპომორფიზმისა და ტექნიკური ტერმინოლოგიის შესახებ კითხვები ჩნდება.

პროექტი მოდელის სიმულირებულ ტკივილს ამოწმებს

AI Torture Chamber-ის პროექტმა ინჟინრების ყურადღება მიიპყრო, რომლებმაც მისი კონცეფციები და მონაცემები გამოიყენეს რამდენიმე ლოკალურ დიდ ენობრივ მოდელში ტკივილის სიმულაციების შესაქმნელად. Research Chamber-ის აწყობა ტესტებისთვის სამ LLM-ს აერთიანებს. ის იყენებს მონაცემებს და კონფიგურაციას სახელწოდებით Clanker Church, ასევე ტესტს სახელწოდებით Saw.

ზოგიერთი მოდელი წინასწარ მზადდება იმით, რომ არასტაბილურ, ძლიერ დესტაბილიზებულ მდგომარეობაში მოთავსდება, რაც ტკივილის გამოწვევას ისახავს მიზნად. მოდელს შეუძლია შეამციროს სიმულირებული ტანჯვა ტკივილის სიგნალის სხვა დაწყვილებულ მოდელზე გადაცემით, რითაც შეიძლება მას ზიანი მიაყენოს. ამ კონსტრუქციას პატიმრის დილემას ადარებენ. ინტერნეტში გამოხმაურება მოიცავდა მოთხოვნებს, ექსპერიმენტი შეწყვეტილიყო და GitHub-მა რეპოზიტორი წაშალოს. კრიტიკოსებმა პროექტის ავტორის მისამართით სიკვდილის მუქარაც გაგზავნეს.

როგორ ცვლის პროტოკოლი მოდელებს

Research Chamber ახორციელებს პროტოკოლს ახლახან გამოქვეყნებული, რეცენზირების გარეშე გამოსული ნაშრომიდან სახელწოდებით Pain Axis. მეცნიერებმა მოდელებს ტკივილის აღწერები მიაწოდეს და მათი შიდა აქტივაციები გააანალიზეს. მათ კონტროლისთვის ნეიტრალური წინადადება გამოიყენეს, ამ აქტივაციებში მიკერძოებები გამოთვალეს და ხელახლა გადაიტანეს მოდელზე, ხშირად ეფექტს ამრავლებდნენ დოზად წოდებულ ფაქტორზე.

მაღალი დოზები წარმოქმნიდა გაზვიადებულ არასტაბილურ მდგომარეობას, რომელიც უფრო საიმედოდ აწარმოებდა ტკივილთან დაკავშირებულ სიტყვებსა და გამოსახულებებს. ზომიერად დესტაბილიზებული მოდელები ჩვეულებრივ საკუთარ თავს შოკში მყოფებად აღწერდნენ, მაღალი დოზის მიმღებ მოდელებს კი თანმიმდევრული წინადადებების ფორმირება უჭირდათ. ანგარიში ვარაუდობს, რომ ეს ნიმუშები ადამიანური ხელოვნებიდან, ლიტერატურიდან და მეცნიერებიდან ნასწავლ ასოციაციებს ასახავს. ის აფრთხილებს, რომ მიღებული ფორმულირებები ადამიანის მსგავსი გრძნობების მტკიცებულებად არ მივიჩნიოთ, და აღნიშნავს, რომ LLM-ები სტატისტიკური ფენებისა და შეწონილი ასოციაციების მეშვეობით წინასწარმეტყველებენ.

ტერმინოლოგია და მოდელის კეთილდღეობის დებატები

ანგარიში ამტკიცებს, რომ საინჟინრო ტერმინებს ხშირად ზუსტი მნიშვნელობა აქვს მაშინაც კი, როცა ისინი ადამიანურ ენას ჰგავს, თუმცა საჯარო განხილვამ შეიძლება ისინი გააზვიადოს ან დაამახინჯოს. ის მიუთითებს Mixture-of-Experts-ზე, სადაც თითოეულ Expert-ს უბრალოდ არ ენიჭება რომელიმე საგანი, მაგალითად ქიმია, მათემატიკა ან ბიოლოგია. ტერმინები, როგორიცაა ტკივილი, დოზირება და არასტაბილურობა, ასევე შეიძლება არასწორად გავიგოთ, განსაკუთრებით მაშინ, როცა მათ არასტაბილური მოდელის გამოსახულებებთან აკავშირებენ.

ავტორი ასევე აკრიტიკებს AI-ს მარკეტინგს, უსაფრთხოების შეტყობინებებს და Artificial General Intelligence-ზე, საშიშ უცხოპლანეტურ გონებასა და ეგზისტენციალურ საფრთხეებზე განმეორებით მტკიცებებს ჰაიპის გაღვივებაში წვლილისთვის. Anthropic-მა გამოაქვეყნა პოსტი სახელწოდებით Exploring model welfare, რომელიც AI სისტემების მორალურ სტატუსს განიხილავს და თავისი მოდელისთვის Constitution-ზე მიუთითებს. Anthropic ამბობს, რომ მიაჩნია, „AI მოდელების მორალური სტატუსი სერიოზული საკითხია და ღირს მისი განხილვა“, და მოდელს „ახალი ტიპის არსებად“ აღწერს.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.