უკან დაბრუნება
GPT-6 Astra, განმეორებითი ტრანსფორმერები და ფარული მსჯელობის დავა
SiTech AI Team2 წთ. საკითხავი

GPT-6 Astra, განმეორებითი ტრანსფორმერები და ფარული მსჯელობის დავა

OpenAI-ის ახალი GPT-6 Astra ბენჩმარკებზე ლიდერობს, ხოლო ცნობებმა „განმეორებითი ტრანსფორმერების“ გამოყენების შესახებ კამათი დაიწყო იმაზე, მალავს თუ არა მოდელი მსჯელობის კვალს.

OpenAI-მ სექტემბრის დასაწყისში გამოუშვა GPT-6 Astra. მანქანური სწავლების მკვლევარმა სებასტიან რაშკამ, რომელმაც მოდელი გამოშვებისთანავე გამოსცადა, ის ყველაზე ძლიერ მოდელად დაასახელა, რომელიც მას ოდესმე გამოუყენებია.

მისი მიმოხილვის მიხედვით, Astra წინამორბედ GPT-5.6-ს თითქმის ყველა კატეგორიაში სჯობს — წერაში, მათემატიკასა და პროგრამირებაში, — თუმცა განსხვავება ყველაზე მკვეთრი გრაფიკულ დემოებსა და 3D-რენდერინგშია. ARC-AGI-3 ტესტზე, რომელიც ლოგიკურ ამოცანებსა და განზოგადებას აფასებს, მოდელი 99,9 პროცენტს აღწევს, GPT-5.6 Sol-ის 7,8 პროცენტის წინააღმდეგ.

ფრონტის ლიდერობა დათქმებით

დამოუკიდებელ Artificial Analysis-ის ინდექსებზე სურათი უფრო თავშეკავებულია: Astra Coding Agent Index v1.4-ისა და Intelligence Index v4.2-ის ფრონტზეა, მაგრამ დიდი უპირატესობით არ სცილდება. რადგან ეს შეფასებები სხვადასხვა ჰარნესს იყენებს — Stirrup GDPval-AA-სა და AA-Briefcase-ისთვის, Terminus 2 Terminal-Bench v2.1-ისთვის, — მოდელი, რომელიც ძირითადად ერთ ჰარნესზეა მორგებული, შესაძლოა უფასურდეს.

კომპიუტერის გამოყენება ახალ ფრონტად

ყველაზე თვალსაჩინო წინსვლა კომპიუტერის გამოყენების უნარშია: მოდელი ChatGPT/Codex-ის აპლიკაციის მეშვეობით ლოკალურ მანქანაზე მუშაობს პროგრამებით. გავრცელებულ დემოებს შორისაა ნიუ-იორკის რენდერი Blender-ში და ბრაუზერულ MS Paint-ში მაუსით ხატვა. ცნობების თანახმად, OpenAI-მ ათობით ათასი Mac Mini და Mac Studio შეიძინა, რომ reinforcement learning-ის დროს მოდელს macOS გარემო გაეცნო: ეკრანის სურათები შედის, მაუსისა და კლავიატურის მოქმედებები გამოდის, ჰარნესი მათ ასრულებს და ახალ კადრებს აბრუნებს. ვარჯიში მაინც სხვაგან მიმდინარეობს — Nvidia-ს ხელმძღვანელის თქმით, Astra დაახლოებით 100 000 Grace Blackwell GPU-ზე ივარჯიშა. მოდელი კვლავ მსჯელობის მოდელია და ვერიფიცირებადი ჯილდოებით სწავლობს.

განმეორებითი ტრანსფორმერები და ფარული მსჯელობა

გამოშვებამდე ორი დღით ადრე გამოცემა The Information-მა დაწერა, რომ Astra „განმეორებით სიღრმეს", ანუ განმეორებით ტრანსფორმერს იყენებს. ასეთ კონსტრუქციებში ერთი და იგივე ბლოკები რამდენჯერმე გაივლება საერთო წონებით: Nanbeige4.2-3B 22 ბლოკს ორჯერ ატარებს, ByteDance-ის Ouro 48 ბლოკს ოთხჯერ იმეორებს, Mixture-of-Recursions კი ყოველ ტოკენს ერთ-სამ გავლას ანიჭებს. ხრიკი ეფექტურ სიღრმეს ზრდის ნაკლები წონების შენახვით, თუმცა გამოთვლითი ხარჯი და KV ქეში იგივე სიღრმის ჩვეულებრივ მოდელს უტოლდება; SMELT-ის შეფასებით, იგივე დანაკარგისთვის 6,8–18 პროცენტით ნაკლები რესურსია საჭირო.

რაშკა ეჭვობს, რომ განმეორება მსჯელობას მალავს. OpenAI o1-ის დროიდან მსჯელობის კვალის უმეტეს ნაწილს მალავს, Astra კი იმავე სიზუსტეზე GPT-5.6 Sol-ზე ნაკლებ ტოკენს ხარჯავს — ეს კანონზომიერება უფრო მცირე მოდელებზეც ჩანს (Luna Sol-ზე 80 პროცენტით მეტ ტოკენს იყენებს), ინტერპრეტირებადობის შიშის გარეშე. Astra-ს სისტემური ბარათი აღნიშნავს, რომ მონიტორინგულობა Sol-თან შედარებით შემცირებულია, ძირითადად მოკლე კვალის გამო. OpenAI-ის მთავარმა მეცნიერმა იაკუბ პაჩოცკიმ განაცხადა, რომ ფრონტის მოდელების გამოთვლითი გრაფი GPT-4-ს ორმაგი ზღვრის ფარგლებშია, და გააფრთხილა „დაბნეული რეპორტაჟით გამოწვეული დაუმონიტორებლობის რბოლის" წინააღმდეგ.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.