Назад
AI-агенти створюють редаговані 3D-сцени, але не вміють оцінювати точність
SiTech AI Team3 хв читання

AI-агенти створюють редаговані 3D-сцени, але не вміють оцінювати точність

LEGO-Anything перетворює фото на редагований код Blender, а його бенчмарк показує, що агенти кодування можуть створювати придатні сцени, однак часто неправильно оцінюють геометрію та втрачають точність під час редагування.

Від фото до редагованого коду Blender

LEGO-Anything, проєкт дослідників Університету Меріленду та AWS, використовує агента кодування, щоб перетворити одне фото на повноцінну програму Blender. Агент пише код, запускає його, перевіряє результат і змінює сцену, доки вона не стане схожою на вихідне зображення.

Підхід, який називається Image-to-Code, створює більше, ніж просто відрендерене зображення. Об'єкти, геометрія, компонування та позиція камери явно представлені в програмі, яку можна запускати, переглядати, редагувати та аналізувати на предмет візуалізації.

Бенчмарк із еталонними даними симулятора

Команда представила LEGO-Bench для оцінювання отриманих сцен. Він містить 208 зображень із 104 закритих і відкритих сцен і використовує 443 зареєстровані активи. Зображення рендеряться зі сцен професійно налаштованого симулятора, що надає вхідним даним природній вигляд і водночас зберігає точну геометрію, глибину та приналежність об'єктів як еталонну істину.

Складність сцени можна збільшувати без зміни освітлення чи параметрів камери. Бенчмарк оцінює валідність, геометричну точність та візуальну подібність до оригіналу. Зовнішній вигляд вимірюється повторним рендерингом згенерованої сцени та порівнянням з еталонним зображенням піксель за пікселем.

Придатні сцени, слабке геометричне оцінювання

Усі шість перевірних конфігурацій GPT майже завжди створювали робочу сцену, однак їхня точність суттєво варіювалася. GPT-6 Astra, найкраща перевірена модель, зафіксувала 53,4% на закритих сценах і 39,6% на відкритих. Деякі слабкі конфігурації досягли лише близько 15%. Точність падала зі зростанням складності сцени, а відкриті сцени виявилися складнішими за інтер'єрні.

Збільшення бюджету міркування покращило варіанти GPT-6. На тестовій підгрупі офісів оцінка Astra зросла з 32,3% до 61,8%. Аналіз роботи агентів виявив погані початкові спроби, скасування раннього прогресу під час ревізій та ненадійне самооцінювання як поширені проблеми. Дослідники також зафіксували, що Astra впала з 33,9% до 4,4% після пізньої ревізії.

Коли моделям пропонували вибрати, яка з двох версій більше схожа на оригінал, їхнє геометричне оцінювання було на рівні випадковості або нижчим. Дослідники зробили висновок, що вдосконалення має спиратися на конкретні вимірювання, а не на власну оцінку агента щодо своєї роботи.

Плагін та подальші тести зору

Отриманий LEGO-Plugin не потребує додаткового навчання. Він прив'язує початкову сцену до еталонного зображення, змінює самооцінювання на конкретні вимірювання та захищає правильний прогрес від регресивних редагувань. Плагін покращив усі шість перевірених моделей, причому слабкі агенти отримали приріст до 62,7%. Найсильніша модель додала приблизно два процентні пункти.

Команда також перевірила реконструйовані сцени як вхідні дані для розпізнавання об'єктів, сегментації та оцінки глибини. Без додаткового навчання вони отримали придатні, хоча не виняткові результати. Розпізнавання об'єктів спрацювало найкраще і досягло приблизно половини результату спеціалізованої моделі DINO. Зі спеціалізованими моделями, SAM 3 та Depth Anything 3, розрив був більшим у сегментації та оцінці глибини. Дослідники зазначили, що сучасні агенти кодування є перспективними, однак ще не створюють програм сцен, достатньо точних для відданої реконструкції.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.