უკან დაბრუნება
Anthropic-მა Claude Sonnet 5.5-ს კიბერფილტრები დაუმატა, ნაწილი მოთხოვნა Sonnet 5-ზე გადადის
SiTech AI Team2 წთ. საკითხავი

Anthropic-მა Claude Sonnet 5.5-ს კიბერფილტრები დაუმატა, ნაწილი მოთხოვნა Sonnet 5-ზე გადადის

Anthropic-ის თქმით, Claude Sonnet 5.5 პირველი Sonnet მოდელია კიბერუსაფრთხოების სამსაფეხურიანი კლასიფიკატორებითა და სარეზერვო მოდელზე გადასვლის მექანიზმით. დაბლოკილი კიბერმოთხოვნები Sonnet 5-ზე გადადის, რაც API-ზე მომუშავე დეველოპერებს პირდაპირ ეხება.

გადამისამართება იაფ სეგმენტშიც შემოვიდა

Anthropic-მა Claude Sonnet 5.5 ამ კვირაში გამოუშვა. ეს პირველი Sonnet მოდელია, რომელსაც კიბერუსაფრთხოების სამსაფეხურიანი კლასიფიკატორები და სარეზერვო მოდელზე გადასვლის მექანიზმი მოჰყვა. ასეთი დაცვა კომპანიამ ყველაზე ძლიერი სისტემებისთვის შეიმუშავა, ახლა კი კლასიფიკატორზე დაფუძნებული გადამისამართება იმ დონეზე მოხვდა, სადაც ბევრი გუნდი პროდუქციულ დატვირთვას ამუშავებს.

Anthropic-ის თქმით, Sonnet 5.5 შესაძლებლობების მხრივ ფრონტის ხაზს არ ავითარებს, თუმცა კიბერუსაფრთხოებაში Opus 5-ის დონეს ედრება. Terminal-Bench 4.0-ზე Sonnet 5.5 70,6%-ს აფიქსირებს, Opus 5.5 კი 66,4%-ს. კიბერფილტრების გამორთვით მან ExploitBench-ის 410 გაშვებიდან 178-ში კოდის თვითნებურ შესრულებას მიაღწია, Irregular-ის CyScenarioBench-ზე კი ამოცანების 46,1% შეასრულა წინა Sonnet-ის 0,7%-ის ფონზე.

სამსაფეხურიანი შემოწმება

ფილტრაცია სამ ეტაპად მუშაობს: probe კითხულობს მოდელის შიდა აქტივაციებს, შემდეგ მუშაობს Sonnet 5.5-ზე გაშვებული მსუბუქი კლასიფიკატორი, ბოლოს კი ცალკე გაწვრთნილი LLM კლასიფიკატორი probe-ის დასკვნას ითვალისწინებს და წყვეტს, დაიბლოკოს თუ არა საუბარი. Anthropic-ის თქმით, კლასიფიკატორები მავნე კიბერმოთხოვნებს Opus 5-ის დონეზე იჭერენ, თუმცა კომპანიამ ნაკლებად აგრესიული დაცვა აირჩია, რადგან Sonnet 5.5 კიბერუსაფრთხოებაში Opus 5-ზე და Fable 5.1-ზე სუსტია. Sonnet 5-თან შედარებით მომხმარებელს მეტი უარი უნდა ელოდოს, ლეგიტიმურ კიბერუსაფრთხოების სამუშაოზეც.

დაბლოკილი კიბერმოთხოვნები და ფრონტის ხაზის LLM განვითარებასთან დაკავშირებული მოთხოვნების ვიწრო ნაწილი, მაგალითად გარკვეულ ML ამაჩქარებლებზე kernel-ის მუშაობა, Sonnet 5-ზე გადადის. ბიოლოგიის, ჩვეულებრივი იარაღისა და ანტი-დისტილაციის ბლოკები მოთხოვნას სარეზერვო მოდელის გარეშე აჩერებს და, Anthropic-ის თქმით, პასუხებს ფარულად არასდროს ცვლის.

API-ზე გადასვლა ჩართვას მოითხოვს

Anthropic-ის აპები დაბლოკილ კიბერმოთხოვნებს Sonnet 5-ზე ავტომატურად აგზავნიან, API დეველოპერებმა კი ეს ფუნქცია თავად უნდა ჩართონ, სხვა პლატფორმები კი დაბლოკილ მოთხოვნებს სხვანაირად შეიძლება მოეპყრონ. ჩართვის გარეშე დაბლოკილი მოთხოვნა უბრალოდ წყდება, ამიტომ Sonnet 5-იდან Sonnet 5.5-ზე გადასვლა მოდელის უბრალო შეცვლა არ არის. კიბერპოლიტიკა კვლავ უშვებს წყაროს კოდში სისუსტეების ძიებას და უსაფრთხო კოდირების პროცესს ინარჩუნებს, კომპილირებულ ბინარებში ძიებას კი ბლოკავს. კომპანიის დოკუმენტაციის მიხედვით, შემოწმება ყველაფერს გადის, რასაც მოდელი კითხულობს: მეხსიერებას, კონექტორის შიგთავსს, ვებძიების შედეგებსა და ფაილებს.

სარეზერვო მოდელი და პრომპტის ინექცია

კოდირების გარემოში ჩატარებულ ტესტებში Sonnet 5.5-ზე გაგზავნილი მოთხოვნების 25% კიბერბლოკის შემდეგ Sonnet 5-მა დაამუშავა, ხშირად იმიტომ, რომ დისკის წაშლის ან ფაილების განადგურების ინექციური მითითებები კლასიფიკატორს ჩართო. გადამისამართებული მოთხოვნებიდან 12,01% გატეხეს, თავად Sonnet 5.5 კი 5901 მოთხოვნიდან მხოლოდ ოთხში.

Anthropic-ის თქმით, კომპანია ჯერ კიდევ აუმჯობესებს Sonnet 5.5-ის კლასიფიკატორებს, რომ ცრუ დადებითი შედეგები შემცირდეს, და გაფართოებული Cyber Verification Program-ის ფარგლებში დადასტურებულ დამცველებს ნაკლები შეზღუდვით წვდომას ჰპირდება. გაშვებისთანავე Sonnet 5.5 ამ პროგრამაში არ მონაწილეობს.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.