
OpenAI koordineli distilasyon kampanyasını ortaya çıkardı ve durdurdu
OpenAI, modellerinden korumalı akıl yürütmeyi çıkarmayı amaçlayan koordineli bir kampanyayı tespit edip durdurduğunu açıkladı. Şirket, etkinliğin büyük bölümünü Moonshot AI ile bağlantılı kişilere atfediyor.
OpenAI, modellerinden korumalı akıl yürütmeyi çıkarmayı amaçlayan koordineli bir kampanyayı tespit edip durdurduğunu açıkladı. Şirkete göre en erken etkinlik temmuzun ilk haftasında kaydedildi. Eylemler model distilasyonu belirtileri taşıyor; yani bir modelin çıktılarının veya akıl yürütmesinin başka bir modeli eğitmek için izinsiz kullanılması.
OpenAI ne fark etti
Soruşturmaya göre operatörler korumalı akıl yürütmeyi yeni yöntemlerle çıkarmaya çalıştı. Bunlar arasında bir sohbetteki şifreli akıl yürütmeyi kopyalamak ve başka bir sohbette modelden gizli içeriği deşifre edip yeniden yazmasını istemek vardı. Bağımsız güvenlik araştırmacıları, sorumlu açıklama yoluyla şirkete modeller arası ve sohbet sıkıştırmayla ilgili benzer zafiyetleri bildirdi. OpenAI onların bulgularını doğruladı ve tarif edilen saldırı yollarının gerçek olduğunu onayladı.
Etkinlik 1 Temmuz'da başladı ve başlangıçta düşüktü. 24 ve 25 Temmuz'da yüksek hacimli zirveler kaydedildi: 4.000'den fazla kullanıcıdan çıkarma kalıbını kullanan 16.000 istek. Sonraki soruşturma, ilgili istem kalıplarının etkinliğini 15.000'den fazla kullanıcıdan oluşan bir grupta ortaya çıkardı; tamamen durdurulması 28 Temmuz'a kadar başarıldı.
OpenAI etkinliği kime atfediyor
Şirketin değerlendirmesine göre tüm operatörlerin tek bir aktörden gelip gelmediği belirsiz. OpenAI, etkinliğin büyük bölümünü Kimi'nin yapımcısı Moonshot AI ile bağlantılı kişilere atfediyor.
Bu neden önemli
OpenAI'ye göre operatörler şifrelemeyi kırmadı, veritabanını ele geçirmedi ve saklanan sohbetlere doğrudan erişim sağlamadı. Bunun yerine modelle etkileşimi, korumalı akıl yürütmeyi istekte bulunan kişi için görünür biçimde betimleyecek şekilde kullandılar. Şirket bu riskin yalnızca OpenAI'yi ilgilendirmediğini ve benzer tekniğin diğer ileri AI sistemlerinde de uygulanabileceğini belirtiyor. Çıkarılan akıl yürütme, başka bir modeli orijinal modelin sahip olduğu sınırlamalar olmadan eğitmek için kullanılabilir. Rakamlar yalnızca girişimleri tanımlar, mutlaka başarılı çıkarmaları değil.
Şirket nasıl yanıt verdi
OpenAI kampanyayı hesap yaptırımı, teknik kontrol ve ortaklarla koordinasyon birleşimiyle durdurdu: sahte hesapları engelledi veya kısıtladı, kayıt ve altyapı kontrollerini güçlendirdi ve izlemeyi genişletti. Ayrıca başka bir kullanıcının şifreli akıl yürütmesinin yeniden kullanılmasını ve geri getirilmesini mümkün kılan yol kapatıldı ve akıl yürütmenin açığa çıkma riski taşıyan akış çıktısını durduran kontroller eklendi. Sonuçlar Frontier Model Forum ve devlet bilgi paylaşım kanalları aracılığıyla yayıldı. Gelecekte şirket üç yönü güçlendirecek: teknik koruma, koordineli kampanyaların tespiti ve sektör ile yetkililer arasında bilgi paylaşımı.
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.