
סוכני AI יוצרים סצנות 3D הניתנות לעריכה, אך מתקשים להעריך את הדיוק
LEGO-Anything ממיר תמונות לקוד Blender ניתן לעריכה, והבנצ'מרק שלו מראה שסוכני קידוד יכולים ליצור סצנות שימושיות, אך לעיתים קרובות מעריכים לא נכון את הגיאומטריה ומאבדים דיוק בעת עריכה.
מתמונה לקוד Blender ניתן לעריכה
LEGO-Anything, פרויקט של חוקרים מאוניברסיטת מרילנד ו-AWS, משתמש בסוכן קידוד כדי להמיר תמונה אחת לתוכנת Blender מלאה וניתנת לעריכה. הסוכן כותב קוד, מריץ אותו, בודק את התוצאה ומשנה את הסצנה עד שהיא דומה לתמונה המקורית.
הגישה, המכונה Image-to-Code, יוצרת יותר מסתם תמונה מרונדרת. אובייקטים, גיאומטריה, פריסה ומיקום המצלמה מיוצגים באופן מפורש בתוכנה, שאפשר להריץ, לצפות בה, לערוך ולנתח את הפלט שלה.
בנצ'מרק עם נתוני ייחוס של סימולטור
הצוות הציג את LEGO-Bench כדי להעריך את הסצנות שנוצרו כתוצאה. הוא כולל 208 תמונות מ-104 סצנות מסוגרות וחיצוניות ומשתמש ב-443 פעולים רשומות. התמונות מרונדרות מסצנות של סימולטור מסודר באופן מקצועי, מה שמעניק לנתוני הקלט מראה טבעי ובו זמנית שומר על גיאומטריה מדויקת, עומק ושיוך אובייקטים כאמת ייחוס.
ניתן להגדיל את מורכבות הסצנה ללא שינוי בתאורה או בפרמטרי המצלמה. הבנצ'מרק מעריך תקינות, דיוק גיאומטרי ודמיון ויזואלי למקור. החיצוניות נמדדת באמצעות רנדר חוזר של הסצנה המיוצגת והשוואה פיקסל-פיקסל לתמונת הייחוס.
סצנות שימושיות, הערכה גיאומטרית חלשה
כל שש התצורות של GPT שנבדקו יצרו כמעט תמיד סצנה עובדת, אך הדיוק שלהן נע בטווח רחב. GPT-6 Astra, המודל הטוב ביותר שנבדק, רשם 53,4% על סצנות מסוגרות ו-39,6% על סצנות חיצוניות. חלק מהתצורות החלשות הגיעו לכ-15%. הדיוק ירד ככל שהסצנות הפכו מורכבות יותר, וסצנות חיצוניות היו קשות יותר מאלו שבפנים.
הגדלת תקציב ההיגיון שיפרה את גרסאות GPT-6. בתת-קבוצת המשרד לבדיקה, הציון של Astra עלה מ-32,3% ל-61,8%. ניתוח פעולת הסוכנים חשף ניסיונות התחלתיים גרועים, ביטול התקדמות מוקדמת במהלך תיקונים והערכה עצמית לא אמינה כבעיות נפוצות. החוקרים רשמו גם ש-Astra צנח מ-33,9% ל-4,4% לאחר תיקון מאוחר.
כאשר המודלים נשאלו איזו משתי גרסאות יותר דומה למקור, ההערכה הגיאומטרית שלהם הייתה קרובה לרמת מקריות או מתחתיה. החוקרים הסיקו ששיפור צריך להסתמך על מדדים ספציפיים ולא על הערכת הסוכן של היצירה שלו עצמו.
פלאגין ובדיקות חזותיות שלב מאוחר
ה-LEGO-Plugin שנוצר כתוצאה לא דורש אימון נוסף. הוא מעמיד את הסצנה ההתחלתית כיחס לתמונת הייחוס, משנה את ההערכה העצמית באמצעות מדדים ספציפיים ומגן על התקדמות נכונה מפני עריכות רגרסיביות. הפלאגין שיפר את כל ששת המודלים שנבדקו, כשהסוכנים החלשים קיבלו שיפור של עד 62,7%. המודל החזק ביותר הרוויח כשתי נקודות אחוז בלבד.
הצוות בדק גם סצנות ששוזרו כנתוני קלט לזיהוי אובייקטים, סגמנטציה והערכת עומק. ללא אימון נוסף הם קיבלו תוצאות שימושיות אך יוצאות דופן. זיהוי האובייקטים עבד הכי טוב והגיע לכמעט חצי מתוצאת מודל DINO המומחה. בהשוואה למודלים מומחים, SAM 3 ו-Depth Anything 3, ההבדל היה גדול יותר בסגמנטציה ובהערכת עומק. החוקרים טענו שסוכני קידוד נוכחיים הם פרספקטיביים, אך עדיין לא יוצרים תוכניות סצנה שהן מספיק מדויקות לשחזור נאמן.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.