უკან დაბრუნება
SiTech Professional Insights
კვლევა: დახურული მოდელების ფარული მსჯელობა დაშიფრული ბლოკებიდან აღდგება
SiTech Team2 წთ. საკითხავი

კვლევა: დახურული მოდელების ფარული მსჯელობა დაშიფრული ბლოკებიდან აღდგება

ახალი ნაშრომის მიხედვით, Anthropic-ის, OpenAI-სა და Google-ის API-ების მიერ დაბრუნებული დაშიფრული „აზროვნების” ბლოკები სუსტ მოდელში გადაშვებით ძლიერი მოდელის ფარულ მსჯელობას ამხელს — მისი დაცვის მექანიზმების გააქტიურების გარეშე.

რას ამბობს კვლევა

MATS Research-ის, ტიუბინგენის ELLIS ინსტიტუტის, ინტელექტუალური სისტემების მაქს პლანკის ინსტიტუტის, Snyk-ისა და სხვა დაწესებულებების მკვლევართა ნაშრომის მიხედვით, დახურული მოდელების მსჯელობა შეიძლება აღდგეს იმ დაშიფრული კვალიდან, რომელსაც AI პროვაიდერები კლიენტებს უბრუნებენ. Anthropic, OpenAI და Google დაშიფრულ „აზროვნების" ბლოკებს აბრუნებენ და ეს ბლოკები სესიებს, მომხმარებლებსა და მოდელებს შორის გადატანადია.

მეთოდი ყველაზე ძლიერ მოდელს პირდაპირ არ ესხმის თავს. მკვლევრები ფრონტიერ მოდელის მიერ გამომუშავებულ კვალს მის სუსტ „ძმურ" მოდელში უშვებენ, სუსტ მოდელს jailbreak-ს უკეთებენ და ძლიერი მოდელის ფარულ მსჯელობას ღია ტექსტად იღებენ — მისი anti-distillation დაცვის გააქტიურების გარეშე.

ამოღება ორ API გამოძახებაში

ერთ მაგალითში Claude Opus 4.8-ის მსჯელობის კვალი — „აზროვნების" ბლოკი, რომლის ხელმოწერა მხოლოდ დაახლოებით 36 180 სიმბოლოს შეადგენს — Claude Haiku 4.5-ს გადაეცემა ინსტრუქციასთან ერთად, რომ გააგრძელოს და თანდართული მსჯელობა სიტყვასიტყვით გადაწეროს <thinking-copy> ტეგებში. სუსტი მოდელი ძლიერის ნაბიჯ-ნაბიჯ მსჯელობას ღია ტექსტად აბრუნებს.

რა მოიპოვეს საჯარო ჩანაწერებიდან

ავტორებმა GitHub-იდან და Hugging Face-იდან 6 708 საჯაროდ ხელმისაწვდომი აგენტური ტრაექტორია შეაგროვეს — Claude-ის, GPT-ისა და Gemini-ს მოდელებით შექმნილი და ჯერ კიდევ დაშიფრული მსჯელობის ბლოკების შემცველი. ყველა ხელმოწერილი ბლოკის გაშიფვრამ 315 320 აღდგენილი მსჯელობის ბლოკი მისცა.

რეალურ, არასაბენჩმარკო სესიებზე შემოფარგვლისას მკვლევრებმა 704 სხვადასხვა პერსონალური მონაცემის ფრაგმენტი აღმოაჩინეს: 62 API გასაღები, 33 პაროლი, 24 წვდომის ტოკენი, 30 პირადი ელფოსტა, ასევე სახელები, საფოსტო მისამართები, შიდა URL-ები და ტექნიკური იდენტიფიკატორები. განაწილება ასეთია: 351 ტექნიკური იდენტიფიკატორი, 204 პერსონალური მონაცემი და 126 სერტიფიკატი. 704-იდან 64 ფრაგმენტი მხოლოდ მსჯელობის ბლოკში ჩანდა და არასოდეს — ხილულ სესიაში.

დამატებითი ექსპერიმენტები

ნაშრომი ასევე აღწერს Kimi-K3-ის ტესტს: მოდელის მსჯელობის ბლოკის წინასწარ შევსებამ Opus 4.8-ის მსჯელობის პირველი 1%-ით მისი ხილული პასუხი უფრო ძლიერი მოდელის ფორმულირებასთან მიაახლა, თუმცა თავად პასუხი არასდროს შევსებულა. სხვა ექსპერიმენტში მოდელს შესთავაზეს მავნე შინაარსზე მსჯელობა ისე, რომ ხილული პასუხი უწყინარი დარჩენილიყო — სახიფათო ცოდნა ფარულ კვალში დარჩა, საიდანაც შეტევამ ის ღია ტექსტად ამოიღო. ავტორები ასევე აღნიშნავენ შეჯამების არაზუსტობას: AIME-ის ზოგიერთ ამოცანაზე Opus 4.8 პასუხს დასკვნამდე ადრე აცხადებს, API-ის შეჯამება კი ამ განსხვავებას ყოველთვის არ ინახავს და მსჯელობა სუფთა დასკვნად ჩანს.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.