
AI აგენტები რედაქტირებად 3D სცენებს ქმნიან, თუმცა სიზუსტის განსჯა უჭირთ
LEGO-Anything ფოტოებს რედაქტირებად Blender-ის კოდად აქცევს, ხოლო მისი ბენჩმარკი აჩვენებს, რომ კოდირების აგენტებს გამოსადეგი სცენების შექმნა შეუძლიათ, თუმცა ხშირად არასწორად აფასებენ გეომეტრიას და რედაქტირებისას სიზუსტეს კარგავენ.
ფოტოდან რედაქტირებად Blender-ის კოდამდე
LEGO-Anything, მერილენდის უნივერსიტეტისა და AWS-ის მკვლევართა პროექტი, კოდირების აგენტს იყენებს, რომ ერთი ფოტო შესრულებად Blender-ის პროგრამად აქციოს. აგენტი წერს კოდს, უშვებს მას, ამოწმებს შედეგს და ცვლის სცენას მანამ, სანამ ის საწყის სურათს არ დაემსგავსება.
მიდგომა, სახელწოდებით Image-to-Code, მხოლოდ რენდერირებულ სურათზე მეტს ქმნის. ობიექტები, გეომეტრია, განლაგება და კამერის პოზიცია ცალსახად წარმოდგენილია პროგრამაში, რომლის გაშვება, დათვალიერება, რედაქტირება და გამოსახულების ანალიზისთვის გამოყენებაც შესაძლებელია.
ბენჩმარკი სიმულატორის საცნობარო მონაცემებით
გუნდმა წარმოადგინა LEGO-Bench, რომ შედეგად მიღებული სცენები შეაფასოს. ის შეიცავს 208 სურათს 104 დახურული და გარე სცენიდან და იყენებს 443 რეგისტრირებულ აქტივს. სურათები რენდერირდება პროფესიონალურად აწყობილი სიმულატორის სცენებიდან, რაც შეტანილ მონაცემებს ბუნებრივ იერს აძლევს და ამავდროულად ინახავს ზუსტ გეომეტრიას, სიღრმეს და ობიექტების მიკუთვნებას საცნობარო ჭეშმარიტებად.
სცენის სირთულის გაზრდა განათების ან კამერის პარამეტრების შეცვლის გარეშე შეიძლება. ბენჩმარკი აფასებს ვალიდურობას, გეომეტრიულ სიზუსტეს და საწყისთან ვიზუალურ მსგავსებას. გარეგნობა იზომება წარდგენილი სცენის ხელახალი რენდერით და საცნობარო სურათთან პიქსელ-პიქსელ შედარებით.
გამოსადეგი სცენები, სუსტი გეომეტრიული განსჯა
ექვსივე შემოწმებული GPT კონფიგურაცია თითქმის ყოველთვის მუშა სცენას იძლეოდა, თუმცა მათი სიზუსტე ფართოდ იცვლებოდა. GPT-6 Astra-მ, საუკეთესო შემოწმებულმა მოდელმა, დახურულ სცენებზე 53,4% დააფიქსირა, გარე სცენებზე კი 39,6%. ზოგიერთმა სუსტმა კონფიგურაციამ დაახლოებით 15% მიაღწია. სიზუსტე სცენების გართულებასთან ერთად ეცემოდა, გარე სცენები კი ინტერიერზე უფრო რთული აღმოჩნდა.
აზროვნების ბიუჯეტის გაზრდამ GPT-6 ვარიანტები გააუმჯობესა. ოფისის სატესტო ქვეჯგუფზე Astra-ს ქულა 32,3%-დან 61,8%-მდე გაიზარდა. აგენტების მუშაობის ანალიზმა გამოავლინა ცუდი საწყისი მცდელობები, ადრინდელი პროგრესის გაუქმება რევიზიების დროს და არასანდო თვითშეფასება, როგორც გავრცელებული პრობლემები. მკვლევრებმა ასევე დააფიქსირეს, რომ Astra გვიანი რევიზიის შემდეგ 33,9%-დან 4,4%-მდე დაეცა.
როცა მოდელებს სთხოვეს, ორი ვერსიიდან რომელი უფრო უხდებოდა საწყისს, მათი გეომეტრიული განსჯა შანსის დონესთან ახლოს ან მის ქვემოთ იყო. მკვლევრებმა დაასკვნეს, რომ დახვეწა კონკრეტულ გაზომვებს უნდა ეყრდნობოდეს და არა აგენტის საკუთარი ნამუშევრის შეფასებას.
პლაგინი და ხედვის შემდგომი ტესტები
შედეგად მიღებული LEGO-Plugin-ი დამატებით წვრთნას არ საჭიროებს. ის საწყის სცენას საცნობარო სურათზე ამაგრებს, თვითგანსჯას კონკრეტული გაზომვებით ცვლის და სწორ პროგრესს რეგრესული რედაქტირებებისგან იცავს. პლაგინმა ექვსივე შემოწმებული მოდელი გააუმჯობესა, სუსტმა აგენტებმა კი 62,7%-მდე მატება მიიღეს. უძლიერესმა მოდელმა დაახლოებით ორი პროცენტული პუნქტი მოიმატა.
გუნდმა ასევე შეამოწმა რეკონსტრუირებული სცენები ობიექტის ამოცნობის, სეგმენტაციისა და სიღრმის შეფასებისთვის შეტანილ მონაცემებად. დამატებითი წვრთნის გარეშე მათ გამოსადეგი, თუმცა არაჩვეულებრივი შედეგები მიიღეს. ობიექტის ამოცნობამ ყველაზე კარგად იმუშავა და სპეციალიზებული DINO მოდელის შედეგის დაახლოებით ნახევარს მიაღწია. სპეციალიზებულ მოდელებთან, SAM 3-სა და Depth Anything 3-თან, სხვაობა უფრო დიდი იყო სეგმენტაციასა და სიღრმის შეფასებაში. მკვლევრებმა თქვეს, რომ ახლანდელი კოდირების აგენტები პერსპექტიულები არიან, თუმცა ჯერ არ ქმნიან სცენის პროგრამებს, რომლებიც საკმარისად ზუსტია ერთგული რეკონსტრუქციისთვის.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.