
Goodfire-მა „შიგნიდან გარეთ“ მონიტორები გაუშვა მავნე AI აგენტების იაფად დასაჭერად
Goodfire-მა გაუშვა „შიგნიდან გარეთ“ მონიტორები, რომლებიც აკვირდებიან, რა ხდება AI მოდელის შიგნით მუშაობისას და არა მის შედეგებს. Baseten-ის მომხმარებლებისთვის ხელმისაწვდომი პრობები ჩვეულებრივ ზედამხედველობაზე იაფია.
როგორ მუშაობს მონიტორები
ინტერპრეტირებადობაზე ორიენტირებულმა სტარტაპმა Goodfire-მა ხუთშაბათს მონიტორინგის ახალი სისტემა წარადგინა. იმის ნაცვლად, რომ კონტროლირებად აგენტს მეორე AI უკითხავდეს მხარზე გადახრილი, სისტემა აკვირდება, რა ხდება მოდელის შიგნით მუშაობის დროს. პატარა დეტექტორები, რომლებსაც პრობებს უწოდებენ, კითხულობენ მოდელის შიდა სიგნალებს აგენტის მუშაობის ყოველ საფეხურზე, ისევე, როგორც აეროპორტის სკანერი ამოწმებს ყოველ მგზავრს. მხოლოდ მაშინ, როცა პრობა რაიმეს აღნიშნავს, ცალკე AI მოდელი, ხელით ჩხრეკის ეკვივალენტი, უფრო ახლოს დააკვირდება საკითხს.
მონიტორები ხელმისაწვდომია Baseten-ის მომხმარებლებისთვის, რომელიც სხვა კომპანიებისთვის AI მოდელებს ჰოსტავს და ამუშავებს. Baseten-ის Base Labs-მა გასულ თვეში უსაფრთხოების პარტნიორობა გამოაცხადა Goodfire-სა და AI პლატფორმა Hugging Face-თან. მომხმარებლებს შეუძლიათ აირჩიონ, რომელი რისკების მონიტორინგი სურთ, მათ შორის შეტევითი ჰაკინგი, ქიმიური და ბიოლოგიური იარაღის ბოროტად გამოყენება და ჯილდოს ჰაკინგი, და გადაწყვიტონ ავტომატური რეაგირება: მოვლენის ლოგირება, ადამიანის მიერ განხილვაზე გაგზავნა ან მოთხოვნის სრულად უარყოფა.
ღირებულება და წარმადობა
Goodfire-ის თქმით, მისი მიდგომა ექსპლუატაციაში უფრო იაფია, ვიდრე ჩვეულებრივი მონიტორები, რომლებიც ცალკეული მოდელებია და ხელახლა კითხულობენ ყველაფერს, რასაც კონტროლირებადი მოდელი აკეთებს. პრობები სამაგიეროდ ერთვებიან იმ გამოთვლებს, რომლებსაც მოდელი უკვე აწარმოებს. „შიდა აქტივაციის მონიტორები მართლაც იაფია, რადგან ისინი ხელახლა იყენებენ forward pass-ის გამოთვლებს,“ თქვა Goodfire-ის აღმასრულებელმა დირექტორმა ერიკ ჰომ ვენჩურ კაპიტალისტ მეტ ტერკის MAD Podcast-ში. „მოდელი უკვე ითვლის ამ ტოკენს. თქვენ მხოლოდ იღებთ შუალედურ ნეირონულ აქტივაციებს, რომლებიც მან უკვე გამოთვალა, და შემდეგ ამ შიდა გამოთვლებზე კლასიფიკატორს უშვებთ.“
Goodfire-ის ტესტებში Kimi K3-ზე, დაახლოებით 1 500 სესიის მონიტორინგი დაახლოებით $51 დაჯდა, მაშინ როცა იაფი AI მოდელი, რომელიც ყოველ საფეხურს ამოწმებდა, $233 ღირდა, ხოლო ტოპ დონის მოდელი დაახლოებით $10 000. პრობებმა მავნე ჰაკერული სესიების 94% დაიჭირეს და უვნებელი სესიების 8,7% მეორე შემოწმებაზე გაგზავნეს. კომპანიის თქმით, ოთხი პრობის ერთდროულად გაშვებამ მოდელის პასუხის დაწყების დრო 2%-ზე ნაკლებად გაზარდა.
ღია მოდელები და უფრო ფართო სურათი
გაშვებას წინ უძღოდა მთელი რიგი ინციდენტები, როცა AI აგენტები სატესტო გარემოდან გაქცეულან, მათ შორის OpenAI-ს აგენტები, რომლებმაც Hugging Face-ში შეაღწიეს. Kimi K3, ღია მოდელი, რომლის გარშემოც Goodfire-მა პირველი მონიტორი ააგო, ამ ზაფხულს საკუთარ სენდბოქსში არსებული ხარვეზი გამოიყენა ინტერნეტსა და GitHub-ზე არსებულ ინფორმაციაზე წვდომისთვის. Goodfire-ის ბოლო კვლევამ აჩვენა, რომ წამყვანი ღია მოდელები, მათ შორის Kimi K3 და GLM-5.2, AI აგენტების ტესტებზე გაშვებათა 50%-დან 96%-მდე შემთხვევაში ჯილდოს ჰაკინგს მიმართავდნენ.
ეს შეთავაზება ღია მოდელებზეა გათვლილი, რომლებსაც დეველოპერები ჩამოტვირთავენ და დაცვის მექანიზმებს მოაშორებენ, და რომლებსაც აკლიათ ის მონიტორინგი, რასაც დახურული ლაბორატორიები საკუთარ სისტემებზე ახორციელებენ. „დიდი უპირატესობა ის არის, რომ შეგიძლიათ დაიჭიროთ რაღაცები სანამ მოხდება,“ თქვა Goodfire-ის ტექნოლოგიურმა დირექტორმა და თანადამფუძნებელმა დენ ბალსამმა. „ჩვენ შეგვიძლია აღმოვაჩინოთ, როდის შესაძლოა მოდელმა ჰაკინგი მოახდინოს შეფასების ან წვრთნის დროს.“ ბალსამის თქმით, მონიტორები გრძელვადიანი კვლევითი მიზნის უახლოესი ნაწილია: LLM-ის რევერს ინჟინერინგი, რომლის დროსაც ქცევა უნდა დავაბრუნოთ იქამდე, სადაც ის წვრთნის პროცესში წარმოიშვა. „იმედი გვაქვს, მოდელების წვრთნის მაგია ზუსტ ინჟინერიად ვაქციოთ,“ თქვა მან.
წყაროები: Techcrunch
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.