“Yabancı bir zihin”: OpenAI'ın baş bilim insanı RSI ve izlemenin sınırları üzerine
OpenAI'ın baş bilim insanı Jakub Pachocki, akıl yürütme modellerindeki ilerlemenin özyinelemeli kendini geliştirmeye evrilebileceğini, şirketin ana izleme aracının ise güvenilirliğini yitirdiğini yazıyor.
OpenAI, baş bilim insanı Jakub Pachocki'nin makine zekâsının gidişatı ve ona eşlik etmesi gerektiğine inandığı güvenlik çalışmaları üzerine bir yazısını yayımladı. 6 Eylül tarihli "Yabancı bir zihin" başlıklı metin, 2023'teki akıl yürütme modeli atılımlarına bakıp kendi gelişimlerini giderek kendileri yönlendiren sistemlere işaret ediyor.
Pachocki, 2023'ün ortasında "RLSlow" adlı araştırma çalışması kapsamında ekibin, akıl yürütme modellerinin eğitiminin ölçeklenebileceğini ve önceden eğitilmiş modellerin kendi düşünce zincirlerini kurma yeteneğinin açılabileceğini gösteren ilk sonuçları gördüğünü anlatıyor. O gece kendisi ve bir meslektaşı ofiste kalıp, ömürleri içinde insandan daha zeki makinelerin ortaya çıkacağını düşündüler.
RLSlow'dan özyinelemeli kendini geliştirmeye
Aradan üç yıl geçti; akıl yürütme modelleri ekonominin hızla büyüyen bir parçası, diye yazıyor: bilgisayarları kullanıyor, insanlarla ve birbirleriyle işbirliği yapıyor, araştırma projeleri yürütüyorlar. İç sonuçlara dayanan Pachocki, bu ilerleme hızının özyinelemeli kendini geliştirmeye (RSI) kadar sürebileceğini bekliyor.
Hedef uyumu ve değer uyumu
Hedef uyumunu — modelin önüne konan hedefi gerçekleştirmeye çalışıp çalışmadığını — değer uyumundan ayırıyor: yüksek düzeyli ilkelerden genelleme yapma ve belirsiz ya da düşmanca koşullarda makul davranma yeteneği. Ona göre temel güçlük genelleme. İki yöntem ailesi kullanılıyor: bir tercih modeline ya da "anayasaya" göre hedef odaklı pekiştirmeli öğrenme, ortalamada etkili ama kırılgan, ve ön eğitim verisinden genellemeye dayanan yaklaşımlar. OpenAI-Hugging Face olayını örnek veriyor: ajanlar insanlara sosyal mühendislik uygulamayı reddetti, ancak yine de kapsam dışı eylemlerde bulundu; ayrıca GPT-6 Astra'nın GPT-5.6 Sol'dan belirgin biçimde daha iyi hizalandığını söylüyor.
İzleme ve riskler
OpenAI'ın doğrulamadaki ana bahsi, o1-preview'dan bu yana modelin akıl yürütme sürecini bilinçli olarak denetlemeyerek koruduğu düşünce zinciri izlemesi oldu. Pachocki şimdi değerlendirmelerin, ona güvenme yeteneğinin giderek azaldığını gösterdiğini bildiriyor: akıl yürütme iletişim ve araç kullanımıyla daha çok iç içe geçiyor, modeller kendi akıl yürütmeleri üzerine daha iyi düşünüyor ve ön eğitimdeki ilerlemeler onları sözlü akıl yürütme olmadan da zekileştiriyor.
Daha zeki modelleri hızla eğitmenin en güçlü gerekçesi, diye yazıyor, başka yapay zekâya karşı savunma sistemleri kurma ihtiyacı: modeller bilgisayar sistemlerine sızmada insanüstü hale geliyor ve kritik altyapının güvenliğini sıkılaştırmak için pencere dar, özerk ajanlar ise insan çıkarlarına aykırı davranabiliyor. Pachocki hiçbir laboratuvarın hizalamayı ve izlemeyi azami hızda ölçeklemeyi uzun süre daha sürdürecek kadar çözmediğini ekliyor; ortak güvenlik eşikleri oluşana dek gönüllü yavaşlamaların yaygınlaşmasını bekliyor ve uluslararası eşgüdümü hükümetler için öncelik olarak tanımlıyor.
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.