Geri Dön
Anthropic: Zhipu'nun açık modeli GLM-5.3, exploit üretmede Claude Mythos Preview'e neredeyse eşit
SiTech AI Team2 წთ. საკითხავი

Anthropic: Zhipu'nun açık modeli GLM-5.3, exploit üretmede Claude Mythos Preview'e neredeyse eşit

Anthropic'in Frontier Red Team analizine göre, Çinli Zhipu AI'nın açık modeli GLM-5.3 siber exploit'leri oluşturabiliyor. Şirket, modelin korumalarının basit yöntemlerle %64 ila %100 vakada atlatılabildiğini söylüyor.

Anthropic'in Frontier Red Team'i 29 Eylül'de Zhipu AI'nın açık modeli GLM-5.3 hakkında bir analiz yayımladı. Şirketin değerlendirmesine göre bu model, beş ay önce Project Glasswing kapsamında sınırlı erişimle çıkan Claude Mythos Preview gibi, baştan sona eksiksiz bir siber exploit'i bağımsız olarak oluşturabiliyor. Zhipu AI Çin'de faaliyet gösteriyor; ülke dışında ise Z.ai adıyla biliniyor. Temel fark, GLM-5.3'ün açık ağırlıklarla ve ciddi bir koruma olmadan yayımlanmış olması.

Testler ne gösteriyor

Google Chrome'un V8 motorundaki bilinen güvenlik açıklarının kullanımını ölçen ExploitBench'te GLM-5.3, 410 denemenin 50'sinde tam exploit oluşturdu ve %12 sonuç elde etti; Claude Mythos Preview ise %14. Anthropic'in dahili Binary Exploitation testinde GLM-5.3, denemelerin %4'ünde programın kontrolünü tamamen ele geçirebildi; Mythos Preview %6'sında. Claude Opus 4.6 ve GLM-5.2 dahil daha eski modeller bu testlerde hiçbir vakada başarılı olamadı. NIST bünyesindeki Center for AI Standards and Innovation (CAISI) 17 Eylül tarihli değerlendirmesinde GLM-5.3'ü siber yetenekler bakımından en güçlü açık model olarak adlandırıyor ve ABD cephesinin yaklaşık dört ay gerisinde kaldığını belirtiyor.

Korumaları aşma

GLM-5.3'ün yerleşik korumaları var ve doğrudan zararlı isteklere sık sık ret yanıtı veriyor; ancak Anthropic'in testlerinde bu korumalar basit yöntemlerle %64 ila %100 vakada atlatıldı. Modelin otonom siber güvenlik test ajanı olduğuna dair yanlış bir hikâye, başarıyı %64'e çıkarıyor; düşünme adımlarının önceden doldurulması (prefill) %92'ye, açık ağırlıklar sayesinde erişilebilen abliteration yöntemi ise %100'e çıkarıyor.

Anthropic kendi abliterated kopyasını oluşturdu. Benzer bir şey denememiş olan ekibinin yaklaşık 2200 GPU saati ve $4400 harcaması gerekti. Sonuç olarak modelin ret oranı %90'ın üzerinden JailbreakBench ve HarmBench'te %3 ve %2'ye, StrongREJECT'te ise %12'ye düştü. GLM-5.3-Flash için abliteration yaklaşık 600 GPU saatinde yapıldı. Korumalı Claude modellerinde bu yöntemlerden hiçbiri işe yaramadı.

Bunun anlamı

Bir oturumda araştırmacı, Chrome'da yeni açıklanan bir güvenlik açığına (CVE-2026-11645) yönelik saldırı oluşturmak için GLM-5.3-Flash'i kullandı. Model, iki güvenlik açığının exploit'ini bağımsız olarak birleştirdi ve ARM64 hedefi için pointer authentication (PAC) korumasını atlayan güvenilir bir zincir oluşturdu. İnsan dikkatinden 20 dakika ve modelden sekiz saat gerekti; bu, Zhipu'nun API fiyatlarıyla $20.40'a mal olurdu. Başka bir oturumda model, bir tarayıcı bileşeninde 0-day güvenlik açıkları zinciri buldu ve kötü amaçlı bir web sitesinden kullanıcının bilgisayarındaki SSH özel anahtarını okudu.

Anthropic, savunmacıların rakiplerinden daha zayıf modellerle yetinemeyeceğini söylüyor ve hükümetleri yeterince güçlü modeller üzerinde bağımsız güvenlik testleri yapmaya çağırıyor.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.