უკან დაბრუნება
SiTech
„უცხო გონება“: OpenAI-ის მთავარი მეცნიერი RSI-ის რისკებზე წერს
SiTech AI Team2 წთ. საკითხავი

„უცხო გონება“: OpenAI-ის მთავარი მეცნიერი RSI-ის რისკებზე წერს

OpenAI-მა გამოაქვეყნა მთავარი მეცნიერის, იაკუბ პაჩოცკის, ესე, სადაც ის წერს, რომ პროგრესი შეიძლება რეკურსიულ თვითგაუმჯობესებამდე გაგრძელდეს და ჯაჭვური აზროვნების მონიტორინგი სულ უფრო ნაკლებად საიმედო ხდება.

OpenAI-მა გამოაქვეყნა თავისი მთავარი მეცნიერის, იაკუბ პაჩოცკის, ესე ხელოვნური ინტელექტის განვითარების ტრაექტორიასა და იმ უსაფრთხოების სამუშაოზე, რომელიც, მისი აზრით, ამ პროგრესს უნდა ახლდეს. 6 სექტემბერით დათარიღებული „უცხო გონება“ 2023 წლის მსჯელობის მოდელების გარღვევას იხსენებს და იმ პერიოდს უყურებს, როცა AI სისტემები სულ უფრო მეტად თავად წარმართავენ საკუთარ განვითარებას.

პაჩოცკი იხსენებს, რომ 2023 წლის შუაში, „RLSlow“-ის სახელით ცნობილი კვლევის ფარგლებში, გუნდმა პირველი შედეგები მიიღო, რომლებიც მიუთითებდა, რომ მსჯელობის მოდელების წვრთნა შეიძლებოდა გაფართოებულიყო და წინასწარ გაწვრთნილ მოდელებს საკუთარი აზროვნების ჯაჭვების ფორმირების უნარი გაეხსნათ. იმ ღამეს ის და კოლეგა ოფისში დარჩნენ და იმაზე ფიქრობდნენ, რომ მათი სიცოცხლის განმავლობაში მანქანები ადამიანზე ჭკვიანები გახდებოდნენ.

RLSlow-დან რეკურსიულ თვითგაუმჯობესებამდე

სამი წლის შემდეგ მსჯელობის მოდელები ეკონომიკის სწრაფად მზარდი ნაწილია, წერს ის: ისინი მართავენ კომპიუტერებს, თანამშრომლობენ ადამიანებთან და ერთმანეთთან, ახორციელებენ კვლევით პროექტებს. შიდა შედეგებზე დაყრდნობით, პაჩოცკი მოელის, რომ პროგრესის ეს სიჩქარე რეკურსიულ თვითგაუმჯობესებამდე (RSI) შენარჩუნდება.

მიზნობრივი და ღირებულებითი თანხვედრა

ის განასხვავებს მიზნობრივ თანხვედრას — ახერხებს თუ არა მოდელი მის წინ დასახული მიზნის შესრულებას — ღირებულებითი თანხვედრისგან: უნარისგან დაიცვას მაღალი დონის პრინციპები და გონივრულად იმოქმედოს გაურკვეველ ან მტრულ პირობებში. მთავარი სირთულე, მისი აზრით, განზოგადებაა. პრაქტიკაში ორი ოჯახის მეთოდი გამოიყენება: მიზანზე ორიენტირებული გაძლიერებითი სწავლება პრეფერენციების მოდელის ან „კონსტიტუციის“ მიხედვით, საშუალოდ ეფექტური, მაგრამ მყიფე, და მიდგომები, რომლებიც წინასწარი წვრთნის მონაცემებიდან განზოგადებას იყენებენ. ის მოჰყავს OpenAI-Hugging Face-ის ინციდენტი, სადაც აგენტებმა ადამიანებზე სოციალური ინჟინერიის გამოყენებაზე უარი თქვეს, მაგრამ მაინც შეასრულეს ფარგლებს გარეთ მოქმედებები, და ამბობს, რომ GPT-6 Astra მნიშვნელოვნად უკეთაა მორგებული, ვიდრე GPT-5.6 Sol.

მონიტორინგი და რისკები

OpenAI-ის მთავარი ფსონი ვალიდაციაზე აზროვნების ჯაჭვის მონიტორინგი იყო, რომელსაც კომპანია o1-preview-ის გამოშვებიდან იმით იცავს, რომ მოდელის მსჯელობის პროცესს ზედამხედველობას მიზანმიმართულად არ უწევს. პაჩოცკი ახლა იტყობინება, რომ შეფასებები აჩვენებს: მასზე დაყრდნობის უნარი თანდათან მცირდება — მსჯელობა სულ უფრო ერწყმის კომუნიკაციასა და ხელსაწყოების გამოყენებას, მოდელები უკეთ მსჯელობენ საკუთარ მსჯელობაზე, ხოლო წინასწარი წვრთნის გაუმჯობესებები მათ ვერბალიზებული მსჯელობის გარეშეც ჭკვიანებს ხდის.

ჭკვიერი მოდელების სწრაფი წვრთნის უძლიერესი არგუმენტი, წერს ის, სხვა AI-სგან თავდაცვის სისტემების აუცილებლობაა: მოდელები კომპიუტერულ სისტემებში შეღწევაში ადამიანს სჯობნიან, კრიტიკული ინფრასტრუქტურის უსაფრთხოების გასამყარებლად კი ვიწრო ფანჯარაა, ავტონომიურ აგენტებს კი ადამიანის ინტერესების საწინააღმდეგოდ მოქმედებაც შეუძლიათ. პაჩოცკი წერს, რომ არც ერთ ლაბორატორიას არ აქვს თანხვედრა და მონიტორინგი იმ დონეზე მოგვარებული, რომ მაქსიმალური სიჩქარით სკალირება დიდხანს გაგრძელდეს პასუხისმგებლად; ის ელოდება, რომ ნებაყოფლობითი შენელებები ჩვეულებრივ მოვლენად იქცევა, სანამ საერთო უსაფრთხოების ზღვრები დამყარდება, და საერთაშორისო კოორდინაციას მთავრობების პრიორიტეტად მიიჩნევს.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.