Geri qayıt
Anthropic Claude Sonnet 5.5 sorğularını kiber qoruyucular üzündən Sonnet 5-ə yönləndirə bilər
SiTech AI Team2 წთ. საკითხავი

Anthropic Claude Sonnet 5.5 sorğularını kiber qoruyucular üzündən Sonnet 5-ə yönləndirə bilər

Anthropic-ə görə Claude Sonnet 5.5 üç mərhələli kiber təsnifatlandırıcıları və ehtiyat modelə keçidi daşıyan ilk Sonnet modelidir. Bloklanan kiber sorğular Sonnet 5-ə yönləndirilir və bu, API üzərində işləyən tərtibatçıların qaydalarını dəyişir.

Yönləndirmə ucuz təbəqəyə gəldi

Anthropic bu həftə Claude Sonnet 5.5 modelini buraxdı. Bu, şirkətin ən güclü sistemləri üçün hazırladığı üç mərhələli kiber təsnifatlandırıcıları və ehtiyat modelə keçidi daşıyan ilk Sonnet modelidir. Beləliklə təsnifatlandırıcıya əsaslanan yönləndirmə bir çox komandanın istehsalat yükünü işlətdiyi təbəqəyə daxil oldu.

Anthropic-in sözlərinə görə, Sonnet 5.5 modellərin imkan sərhədini irəli aparmır, lakin kibertəhlükəsizlik bacarıqlarına görə Opus 5 ilə müqayisə oluna bilər. Terminal-Bench 4.0-da 70,6% göstərir, Opus 5.5 isə 66,4%-də qalır. Kiber filtrlər söndürülmüş halda ExploitBench-in 410 işə salınmasından 178-də kodun tam özbaşına icrasına çatdı və Irregular-ın CyScenarioBench testində tapşırıqların 46,1%-ni tamamladı; Sonnet 5-də bu göstərici cəmi 0,7% idi.

Üç mərhələli yoxlama

Filtrləmə üç mərhələdə işləyir: probe modelin daxili aktivasiyalarını oxuyur, sonra Sonnet 5.5-in özündə işləyən yüngül təsnifatlandırıcı çalışır, sonda ayrıca öyrədilmiş LLM təsnifatlandırıcısı probe-un qərarını nəzərə alıb söhbətin bloklanıb-bloklanmayacağını müəyyən edir. Anthropic deyir ki, təsnifatlandırıcılar zərərli kiber sorğuları Opus 5 səviyyəsində tutur, lakin şirkət daha az aqressiv müdafiə seçdi, çünki Sonnet 5.5 kibertəhlükəsizlikdə Opus 5 və Fable 5.1-dən zəifdir. İstifadəçilər Sonnet 5 ilə müqayisədə daha çox imtina görməlidir, o cümlədən qanuni kibertəhlükəsizlik işlərində.

Bloklanmış kiber sorğular və sərhəd LLM inkişafı ilə bağlı dar sorğu qrupu, məsələn müəyyən ML sürətləndiricilərində kernel işi, Sonnet 5-ə yönləndirilir. Biologiya, adi silahlar və antidistillyasiya blokları sorğunu ehtiyat model olmadan dayandırır və Anthropic-ə görə bu bloklar cavabları gizlicə dəyişmir.

API-də keçid əl ilə açılır

Anthropic-in öz tətbiqləri bloklanmış kiber sorğuları Sonnet 5-ə avtomatik göndərir, lakin API tərtibatçıları bu keçidi özləri açmalıdır və digər platformalar bloklanmış sorğuları fərqli idarə edə bilər. Keçid açıq deyilsə, bloklanmış sorğu sadəcə dayanır, buna görə Sonnet 5-dən Sonnet 5.5-ə keçid düz model dəyişimi deyil. Kiber siyasət mənbə kodunda zəiflik axtarışına hələ də icazə verir və təhlükəsiz kodlaşdırma axınlarını qoruyur, lakin kompilyasiya olunmuş binar fayllarda bunu bloklayır. Dəstək sənədlərinə görə yoxlamalar modelin oxuduğu hər şeyi nəzərdən keçirir: yaddaşı, konnektor məzmununu, veb axtarış nəticələrini və faylları.

Ehtiyat model və prompt inyeksiyası

Anthropic-in kodlaşdırma mühiti testlərində Sonnet 5.5-ə göndərilən sorğuların 25%-i kiber blok işə düşdükdən sonra Sonnet 5 tərəfindən icra olundu; buna çox vaxt diskləri silmək və ya faylları yox etmək barədə yeridilmiş təlimatların təsnifatlandırıcını işə salması səbəb oldu. Yenidən yönləndirilən sorğuların 12,01%-i ələ keçirildi, Sonnet 5.5-in özü isə icra etdiyi 5901 sorğudan yalnız dördündə.

Anthropic deyir ki, yanlış pozitivləri azaltmaq üçün Sonnet 5.5-in təsnifatlandırıcılarını hələ də tənzimləyir və genişləndirilmiş Cyber Verification Program çərçivəsində təsdiqlənmiş müdafiəçilərə daha az məhdudiyyətlə giriş verməyi planlaşdırır. Buraxılış anında Sonnet 5.5 bu proqramda deyil.

SSiTech

SiTech — AI ilə gücləndirilmiş veb hazırlanması

Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.