Geri qayıt
AI agentləri redaktə oluna bilən 3D səhnələr yaradır, lakin dəqiqliyi qiymətləndirə bilmirlər
SiTech AI Team3 dəq oxu

AI agentləri redaktə oluna bilən 3D səhnələr yaradır, lakin dəqiqliyi qiymətləndirə bilmirlər

LEGO-Anything fotoları redaktə oluna bilən Blender koduna çevirir, onun benchmarki isə göstərir ki, kodlaşdırma agentləri işlək səhnələr yarada bilər, lakin tez-tez geometriyanı səhv qiymətləndirir və redaktə zamanı dəqiqliyi itirir.

Fotodan redaktə oluna bilən Blender koduna qədər

LEGO-Anything, Maryland Universiteti və AWS tədqiqatçılarının layihəsi, bir fotosu icra oluna bilən Blender proqramına çevirmək üçün kodlaşdırma agentindən istifadə edir. Agent kodu yazır, işə salır, nəticəni yoxlayır və səhni dəyişdirir, hələ ki, o ilkin şəkilə oxşar olmayınca.

Image-to-Code adlı yanaşma yalnız render edilmiş şəkildən daha çox şey yaradır. Obyektlər, geometriya, qat və kamera mövqeyi proqramda aydın şəkildə təmsil olunub ki, onun işə salınması, baxılması, redaktə edilməsi və çıxarışın analizi üçün istifadə oluna bilsin.

Benchmark simulyatorun etalon məlumatları ilə

Komanda nəticədə əldə edilmiş səhnələri qiymətləndirmək üçün LEGO-Bench təqdim etdi. O, 104 daxili və xarici səhnədən 208 şəkil ehtiva edir və 443 qeydiyyatdan keçmiş aktivdən istifadə edir. Şəkillər peşəkar qurulmuş simulyatorun səhnələrindən render olunur ki, bu da daxil edilmiş məlumatlara təbii görünüş verir və eyni zamanda dəqiq geometriyanı, dərəcəni və obyektlərin aidliyini etalon kimi saxlayır.

Səhnənin mürəkkəbliyi işıq və ya kamera parametrlərini dəyişdirmədən artırıla bilər. Benchmark etibarlılığı, geometrik dəqiqliyi və ilkin şəkilə vizual oxşarlığı qiymətləndirir. Xarici görünüş təqdim edilmiş səhnyenidən render edilməsi və etalon şəkilə piksel-piksel müqayisə ilə ölçülür.

İşlək səhnələr, zəif geometrik qiymətləndirmə

Yoxlanılan altı GPT konfiqurasiyası demək olar ki, hər zaman işlək səhne verirdi, lakin onların dəqiqliyi geniş dəyişirdi. Ən yaxşı yoxlanılan model olan GPT-6 Astra daxili səhnələrdə 53,4% sabitləşdirdi, xarici səhnələrdə isə 39,6%. Bəzi zəif konfiqurasiyalar təxminən 15%-ə çatdı. Dəqiqlik səhnələrin mürəkkəbliyi ilə birlikdə azalırdı, xarici səhnələr isə interyerə nisbətən daha çətin çıxışa çevrildi.

Düşüncə büdcəsinin artması GPT-6 variantlarını yaxşılaşdırdı. Ofis test altqrupunda Astra-nın balı 32,3%-dən 61,8%-ə qədər artdı. Agentlərin işinin analizi pis ilkin cəhdləri, reviziyalar zamanı erken tərəqqinin ləğv edilməsini və etibarsız özünə qiymətləndirməni ümumi problemlər kimi ortaya çıxardı. Tədqiqatçılar həmçinin Astra-nın gec reviziyadan sonra 33,9%-dən 4,4%-ə düşdüyünü qeyd etdilər.

Modellərdən iki versiyadan hansının ilkinə daha yaxın olduğunu soruşduqda, onların geometrik qiymətləndirməsi ehtimal səviyyəsinə yaxın və ya onun altında idi. Tədqiqatçılar qənaət etdilər ki, təkmilləşdirmə konkret ölçülərə əsaslanmalıdır, agentin öz nümunəsinin qiymətləndirməsinə yox.

Plagin və görüş sonrakı testləri

Nəticədə əldə edilmiş LEGO-Plugin əlavə təlim tələb etmir. O, ilkin səhni etalon şəkilə bağlayır, özünə qiymətləndirməni konkret ölçülərlə dəyişdirir və düzgün tərəqqini regressiv redaktələrdən qoruyur. Plagin bütün yoxlanılan altı modeli yaxşılaşdırdı, zəif agentlər isə 62,7%-ə qədər artım əldə etdilər. Ən güclü model təxminən iki faiz puan qazandı.

Komanda həmçinin rekonstrukiya edilmiş səhnələri obyektin tanınması, seqmentasiya və dərəcənin qiymətləndirilməsi üçün daxil edilmiş məlumatlar kimi yoxladı. Əlavə təlim olmadan onlar işlək, lakin adi olmayan nəticələr əldə etdilər. Obyektin tanınması ən yaxşı işlədi və ixtisaslaşmış DINO modelinin nəticəsinin təxminən yarısına çatdı. İxtisaslaşmış modellərlə, SAM 3 və Depth Anything 3 ilə fərq seqmentasiya və dərəcənin qiymətləndirilməsində daha böyük idi. Tədqiqatçılar dedilər ki, hazırkı kodlaşdırma agentləri perspektivdir, lakin hələ səhnə proqramlarını yaratmırlar ki, sadiq rekonstruksiya üçün kifayət qədər dəqiq olsun.

SSiTech

SiTech — AI ilə gücləndirilmiş veb hazırlanması

Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.