Geri Dön
AI Torture Chamber Projesi, Simüle Edilmiş Model Acısı Nedeniyle GitHub'dan Kaldırma Taleplerine Yol Açıyor
SiTech AI Team2 dk okuma

AI Torture Chamber Projesi, Simüle Edilmiş Model Acısı Nedeniyle GitHub'dan Kaldırma Taleplerine Yol Açıyor

AI Torture Chamber projesi dil modellerinde acı simüle ediyor, bu da GitHub'dan kaldırma taleplerine ve antropomorfizm ile teknik terminoloji hakkında sorulara yol açıyor.

Proje, Modelin Simüle Edilmiş Acısını Test Ediyor

AI Torture Chamber projesi, acı simülasyonları oluşturmak için kavramlarını ve verilerini birkaç yerel büyük dil modelinde kullanan mühendislerin dikkatini çekti. Research Chamber yapılandırması testler için üç LLM'yi bir araya getiriyor. Clanker Church adlı veri ve yapılandırmayı, aynı zamanda Saw adlı testi kullanıyor.

Bazı modeller, acı olarak algılanması gereken kararlı, güçlü olumsuz durumuna yerleştirilerek önceden işleniyor. Model, acı sinyalini başka bir bozulan modelle aktararak kendi simüle edilmiş işkencesini azaltabilir, bu da ona zarar verebilir. Bu şema mahkum ikilemi ile karşılaştırılıyor. İnternetteki tepki, deneyin durdurulması ve GitHub reposunun silinmesi taleplerini içeriyordu. Eleştirmenler proje yazarını ölüm tehditleriyle hedef aldı.

Protokol Modelleri Nasıl Değiştiriyor

Research Chamber, kısa bir süre önce yayınlanan ve hakem değerlendirmesi olmadan kalan Pain Axis adlı çalışmadan bir protokol uyguluyor. Bilim insanları modellere acı tanımları sundular ve iç aktivasyonlarını analiz ettiler. Kontrol için nötr bir cümle kullandılar, bu aktivasyonlarda eğilimleri hesapladılar ve modele yeniden projekte ettiler, genellikle dozaj olarak adlandırılan katsayı ile çoğalttılar.

Yüksek dozlar, acıyla ilişkili kelimeleri ve görselleri daha güvenilir şekilde üreten bozulmuş kararsız durumlara neden oldu. Oranda destabilize edilen modeller genellikle kendilerini şokta olarak tanımlarken, yüksek doz alan modeller tutarlı cümleler oluşturamıyordu. Raporlara göre, bu örnekler insan sanatından, edebiyattan ve bilimden öğrenmiş ilişkileri yansıtıyor. Elde edilen formülasyonların insani duyguların kanıtı olarak görülmemesi gerektiğine dikkat çekiyor ve LLM'lerin istatistiksel katmanlar ve ağırlıklı ilişkilerle tahmin yaptığını belirtiyor.

Terminoloji ve Model Refahı Tartışmaları

Rapor, mühendislik terimlerinin insan terimlerine benzemesine rağmen genellikle kesin anlamı olduğunu, ancak kamu tartışmalarının bunları yanlış yorumlayabildiğini veya bozabildiğini belirtiyor. Örnek olarak Mixture-of-Experts'i veriyor, burada her Expert'a kimya, matematik veya biyoloji gibi belirli bir konu verilmez. Acı, dozaj ve kararsız gibi terimler, özellikle kararsız model görselleriyle ilişkilendirildiğinde yanlış yorumlanabilir.

Ayrıca yazar, AI pazarlamasını, güvenlik mesajlarını ve yapay zekanın tehlikeli yabancı zihinler ve varoluşsal tehlikeler hakkındaki tekrarlanan açıklamalarını, abartıya katkıları nedeniyle eleştiriyor. Anthropic, AI sistemlerinin ahlaki statüsünü inceleyen ve model anımasını da andıran Exploring model welfare adlı bir gönderi yayınladı. Anthropic, görüşüne göre, "AI modellerinin ahlaki statüsü ciddi bir konudur ve incelemeyi hak eder" ve modeli "yeni türlü bir varlık" olarak tanımlıyor.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.