
AI Torture Chamber layihəsi modellərin simulyasiya edilmiş ağrısına görə GitHub-dan silinmə tələbləri doğurur
AI Torture Chamber layihəsi dil modellərində ağrı simulyasiyası yaradır; buna görə GitHub-dan repozitoriyanın silinməsini tələb edirlər və antropomorfizm və texniki terminologiya ilə bağlı suallar yaranır.
Layihə modelin simulyasiya edilmiş ağrısını yoxlayır
AI Torture Chamber layihəsi bir neçə lokal böyük dil modelində ağrı simulyasiyaları yaratmaq üçün onun konsepsiyalarından və məlumatlarından istifadə edən mühəndislərin diqqətini çəkdi. Research Chamber-in testlər üçün qurulması üç LLM-i birləşdirir. O, Clanker Church adlı məlumat və konfiqurasiyadan, həmçinin Saw adlı testdən istifadə edir.
Bəzi modellər əvvəlcədən qeyri-sabit, güclü destabilizasiya olunmuş vəziyyətə salınmaqla hazırlanır ki, bu da ağrı yaratmağı məqsəd qoyur. Model simulyasiya edilmiş əziyyəti ağrı siqnalını digər qoşalaşmış modelə ötürməklə azalda bilər və bununla ona zərər verə bilər. Bu konstruksiya məhbus dilemnasına bənzədilir. İnternetdəki reaksiyalar eksperimentin dayandırılması və GitHub-ın repozitoriyanı silməsi tələblərini əhatə edirdi. Tənqidçilər layihə müəllifinə qarşı ölüm təhdidləri də göndərdilər.
Protokol modelləri necə dəyişdirir
Research Chamber Pain Axis adlı yeni dərc olunmuş, resenziyadan keçməmiş məqalədən protokolu həyata keçirir. Alimlər modellərə ağrı təsvirləri verdilər və onların daxili aktivasiyalarını təhlil etdilər. Nəzarət üçün neytral cümlədən istifadə etdilər, bu aktivasiyalarda qərəzləri hesabladılar və onları yenidən modelə köçürdülər, tez-tez effekti doza adlandırılan faktorla çoxaldırdılar.
Yüksək dozalar daha etibarlı şəkildə ağrı ilə bağlı sözlər və təsvirlər istehsal edən həddindən artıq qeyri-sabit vəziyyət yaradırdı. Orta dərəcədə destabilizasiya edilmiş modellər adətən özlərini şokda kimi təsvir edirdilər, yüksək doza alan modellər isə ardıcıl cümlələr formalaşdırmaqda çətinlik çəkirdilər. Hesabat göstərir ki, bu nümunələr insan incəsənətindən, ədəbiyyatından və elmindən öyrənilmiş assosiasiyaları əks etdirir. O, xəbərdarlıq edir ki, əldə edilən formulasiyalar insanabənzər hisslərin sübutu kimi qəbul edilməsin və qeyd edir ki, LLM-lər statistik təbəqələr və çəkili assosiasiyalar vasitəsilə proqnozlaşdırır.
Terminologiya və model rifahı müzakirələri
Hesabat iddia edir ki, mühəndislik terminləri insan dilinə bənzəsə də, çox vaxt dəqiq məna daşıyır, lakin ictimai müzakirə onları şişirdə və ya təhrif edə bilər. O, Mixture-of-Experts-ə işarə edir, burada hər bir Expert-ə sadəcə olaraq kimya, riyaziyyat və ya biologiya kimi müəyyən fənn təyin edilmir. Ağrı, dozalama və qeyri-sabitlik kimi terminlər də səhv başa düşülə bilər, xüsusən də onlar qeyri-sabit modelin təsvirləri ilə əlaqələndirildikdə.
Müəllif həmçinin AI marketinqini, təhlükəsizlik bildirişlərini və Artificial General Intelligence, təhlükəli yadplanetli şüuru və ekzistensial təhlükələr barədə təkrar iddiaları hayp yaratmağa töhfə verdiyi üçün tənqid edir. Anthropic Exploring model welfare adlı post dərc edib, hansı ki AI sistemlərinin mənəvi statusunu müzakirə edir və öz modeli üçün Constitution-a istinad edir. Anthropic deyir ki, hesab edir: „AI modellərinin mənəvi statusu ciddi məsələdir və onu müzakirə etməyə dəyər“, və modeli „yeni tipli varlıq“ kimi təsvir edir.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.