NVIDIA Cosmos-H-Dreams — محاكاة توليدية في الوقت الفعلي للروبوتات الجراحية

NVIDIA تطلق Cosmos-H-Dreams — محاكاة توليدية فورية للجراحة الروبوتية تعمل على بطاقة GPU واحدة. هذه التقنية يمكن أن تحدث ثورة في التدريب الجراحي.
مقدمة: عندما تلتقي الجراحة بالذكاء الاصطناعي التوليدي
الجراحة بمساعدة الروبوت قطعت شوطًا طويلاً منذ أولى أنظمة دا فينشي. لكن حتى الآن، كان تدريب وتقييم الأنظمة الجراحية الروبوتية مكلفًا وبطيئًا وصعب التكرار. تقدم NVIDIA حلاً جذريًا: Cosmos-H-Dreams، وهي محاكاة توليدية فورية للجراحة الروبوتية.
تعتمد هذه التقنية على نموذج تأسيسي عالمي — وهو نموذج ذكاء اصطناعي تعلم ديناميكيات العالم البصري من آلاف الساعات من الفيديو الجراحي الحقيقي. الفارق الرئيسي: المحاكاة لا تعتمد على قوانين فيزيائية مبرمجة يدويًا، بل على أنماط مستفادة من عمليات جراحية حقيقية.
هذا يعني أن الأطباء الجراحين يمكنهم الآن ممارسة العمليات في بيئة افتراضية واقعية، والروبوتات يمكنها التعلم من سيناريوهات لا حصر لها — دون تعريض مريض واحد للخطر.
من نموذج عالمي إلى محاكاة فورية
Cosmos-H-Dreams مبني على Cosmos-H-Surgical-Simulator — نموذج تأسيسي عالمي مبني على Cosmos-Predict2.5-2B من NVIDIA ومدرب على مجموعة بيانات Open-H-Embodiment. بينما يتطلب النموذج الأصلي دقائق لتوليد دقيقة واحدة من الفيديو، يستخدم Cosmos-H-Dreams تقنية مبتكرة تسمى "تقطير المعرفة" (التقطير) لتحقيق الأداء الفوري.
بدلاً من توليد كل إطار من الصفر، يتعلم النموذج الطالب من النموذج المعلم توليد تسلسلات بضع خطوات فقط. النتيجة: محاكاة تفاعلية تعمل على بطاقة GPU واحدة NVIDIA RTX PRO 6000.
كيف يعمل: تيار من الإطارات والإجراءات
تخيل أنك تجري عملية جراحية على الروبوت دا فينشي. تبدأ Cosmos-H-Dreams بإطار RGB أولي — صورة واحدة من كاميرا المنظار. ثم تتلقى دفقًا مباشرًا من إحداثيات الروبوت — أين توجد الأذرع، وكيف تتحرك، ما هي القوة المطبقة.
باستخدام هذه المعلومات، يولد النموذج الإطارات التالية، متوقعًا كيف سيبدو المشهد بعد الإجراءات المخطط لها. ثم تتكرر العملية: إجراء جديد → إطارات جديدة → إجراء جديد. هذه الحلقة المغلقة تخلق محاكاة فورية كاملة.