العودة
وكلاء الذكاء الاصطناعي ينشئون مشاهد ثلاثية الأبعاد قابلة للتحرير، لكنهم يجدون صعوبة في تقييم الدقة
SiTech AI Team3 دقيقة قراءة

وكلاء الذكاء الاصطناعي ينشئون مشاهد ثلاثية الأبعاد قابلة للتحرير، لكنهم يجدون صعوبة في تقييم الدقة

يحوّل LEGO-Anything الصور إلى كود Blender قابل للتحرير، بينما يُظهر معياره المرجعي أن وكلاء الترميز قادرون على إنشاء مشاهد مفيدة، لكنهم غالباً ما يقيّمون الهندسة بشكل خاطئ ويفقدون الدقة أثناء التحرير.

من الصورة إلى كود Blender قابل للتحرير

LEGO-Anything، وهو مشروع لباحثين من جامعة ماريلاند وAWS، يستخدم وكيلاً للترميز لتحويل صورة واحدة إلى برنامج Blender قابل للتنفيذ. يكتب الوكيل الكود، يشغّله، يتحقق من النتيجة، ويعدّل المشهد حتى يشبه الصورة الأصلية.

المنهجية، المسماة Image-to-Code، تنشئ أكثر من مجرد صورة مُصَيَّرة. يتم تمثيل الكائنات والهندسة والتخطيط وموضع الكاميرا بشكل صريح في البرنامج، الذي يمكن استخدامه للتشغيل والعرض والتحرير وتحليل المخرجات.

معيار مرجعي ببيانات محاكي مرجعية

قدّم الفريق LEGO-Bench لتقييم المشاهد الناتجة. يحتوي على 208 صورة من 104 مشاهد داخلية وخارجية، ويستخدم 443 نشاطاً مسجلاً. تُصوَّر الصور من مشاهد محاكي مركّبة احترافياً، مما يمنح البيانات المدخلة مظهراً طبيعياً مع الحفاظ على الهندسة الدقيقة والعمق وتعيين الكائنات كحقيقة مرجعية.

يمكن زيادة صعوبة المشهد دون تغيير الإضاءة أو معلمات الكاميرا. يقيّم المعيار المرجعي الصلاحية والدقة الهندسية والتشابه البصري مع الأصل. تُقاس المظهرية بإعادة تصيير المشهد الممثَّل ومقارنته بالبكسل مع الصورة المرجعية.

مشاهد مفيدة، تقييم هندسي ضعيف

جميع تكوينات GPT الستة المختبَرة أنتجت مشهداً عملياً في كل مرة تقريباً، رغم أن دقتها اختلفت على نطاق واسع. سجّل GPT-6 Astra، أفضل نموذج مختبَر، نسبة 53,4% في المشاهد الداخلية و39,6% في المشاهد الخارجية. بعض التكوينات الضعيفة حققت حوالي 15% فقط. انخفضت الدقة مع زيادة تعقيد المشهد، وكانت المشاهد الخارجية أكثر صعوبة من الداخلية.

أدت زيادة ميزانية الاستدلال إلى تحسين متغيرات GPT-6. في المجموعة الفرعية المكتبية للاختبار، ارتفعت درجة Astra من 32,3% إلى 61,8%. كشف تحليل أداء الوكلاء عن محاولات أولية سيئة، والتخلص من التقدم المبكر أثناء المراجعات، وتقييم ذاتي غير موثوق، كمشاكل شائعة. لاحظ الباحثون أيضاً أن Astra انخفضت من 33,9% إلى 4,4% بعد مراجعة متأخرة.

عندما طُلب من النماذج تحديد أي إصدارين كان أقرب إلى الأصل، كان تقييمها الهندسي قريباً من مستوى الصدفة أو دونه. استنتج الباحثون أن التحسين يجب أن يعتمد على مقاييس محددة وليس على تقييم الوكيل لعمله الخاص.

المكوّن الإضافي واختبارات الرؤية اللاحقة

لا يتطلب المكوّن الإضافي الناتج LEGO-Plugin تدريباً إضافياً. يربط المشهد الأولي بالصورة المرجعية، ويستبدل التقييم الذاتي بمقاييس محددة، ويحمي التقدم الصحيح من التراجعات التحريرية. حسّن المكوّن الإضافي جميع النماذج الستة المختبَرة، وحقق الوكلاء الضعفاء زيادة تصل إلى 62,7%. أما أقوى نموذج فحصل على نحو نقطتين مئويتين إضافيتين.

اختبر الفريق أيضاً المشاهد المعاد بناؤها كبيانات مدخلة للتعرف على الكائنات والتجزئة وتقدير العمق. دون تدريب إضافي، حققوا نتائج مفيدة وإن كانت غير عادية. عمل التعرف على الكائنات بشكل أفضل ووصل إلى نحو نصف نتيجة نموذج DINO المتخصص. مع النماذج المتخصصة، SAM 3 وDepth Anything 3، كان الفارق أكبر في التجزئة وتقدير العمق. صرّح الباحثون أن وكلاء الترميز الحاليين واعدون، لكنهم لا ينشئون بعد برامج مشاهد دقيقة بما يكفي لإعادة البناء الموثوقة.

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.