NVIDIA Cosmos-H-Dreams: Real-Time Generative Physics Simulation for Surgical Robotics
تقدم الورقة البحثية Cosmos-H-Dreams، وهو نموذج عالم توليدي في الوقت الفعلي ومستقل عن وحدة التحكم، يستفيد من تقنيات تقطير المعلم والطالب (teacher-student distillation) والفرض الذاتي (Self Forcing) لتمكين محاكاة جراحية تفاعلية وواقعية للغاية بسرعة 160 إطاراً في الثانية، مما يسد الفجوة بين التجارب الفيزيائية المكلفة والمحاكيات الكلاسيكية لأغراض التعليم، وتوليد البيانات الاصطناعية، ودعم اتخاذ القرار.
المؤلفون الأصليون:Javier Gamazo Tejero, Lukas Zbinden, Keyur Sheth, Raghavendra K M, Nadim Daher, Diego Granero Maraña, Filip Binkiewicz, Patrick Thornycroft, Mahdi Azizian, Sean D. Huver
المؤلفون الأصليون: Javier Gamazo Tejero, Lukas Zbinden, Keyur Sheth, Raghavendra K M, Nadim Daher, Diego Granero Maraña, Filip Binkiewicz, Patrick Thornycroft, Mahdi Azizian, Sean D. Huver
في غرفة العمليات، يمكن قياس الفارق بين إجراء ناجح وبين حدوث مضاعفات بالمليمترات والأجزاء من الثانية. يعتمد الجراحون على الأنظمة الروبوتية لأداء مهام دقيقة مثل خياطة الأوعية الدموية أو استئصال الأعضاء، لكن التدريب على هذه اللحظات كان تاريخياً عملية بطيئة ومكلفة وغالباً ما تكون خطيرة. لكي يتعلم المتدرب، قد يتدرب على أنسجة حيوانية أو جثث، وهي موارد محدودة ولا يمكن إعادة استخدامها. وبدلاً من ذلك، قد يستخدمون محاكاة حاسوبية، لكن هذه المحاكاة عانت طويلاً من صعوبة في محاكاة الواقع بدقة؛ إذ غالباً ما تفشل في تصوير كيفية تموج الأنسجة الرخوة، أو نزفها، أو تفاعلها مع حرارة الأدوات الجراحية. ولعقود من الزمن، ظل الفجوة واسعة بين ساحة التدريب الرقمية وغرفة العمليات الفيزيائية، مما أجبر الجراحين على الاعتماد بشكل كبير على الحدس وساعات ممارسة محدودة.
قام فريق من الباحثين من شركة NVIDIA وشركة CMR Surgical الآن ببناء نظام يسد هذه الفجوة، حيث أنشأوا عالماً رقمياً يمكن فيه تدريب واختبار الروبوتات الجراحية في الوقت الفعلي. وقد أطلقوا على ابتكارهم اسم Cosmos-H-Dreams. وخلافاً للمحاكاة السابقة التي تكتفي بتشغيل مقاطع فيديو مسجلة مسبقاً أو تعتمد على محركات فيزيائية صلبة تبدو متيبسة واصطناعية، يقوم هذا النظام بتوليد إطارات فيديو جديدة فوراً، مستجيباً للحركات التي يقوم بها الجراح أو برنامج الحاسوب. إنه نموذج توليدي، وهو نوع من الذكاء الاصطناعي الذي يتعلم قوانين الفيزياء والمظهر البصري للجراحة من خلال مشاهدة آلاف الساعات من لقطات الجراحة الحقيقية. والنتيجة هي محاكي يعمل بسرعة كافية ليشعر المستخدم بالتفاعل الحي، مما يسمح للإنسان بالتحكم في روبوت افتراضي عبر لوحة مفاتيح أو سماعة رأس، أو السماح لخوارزمية حاسوبية بتعلم ربط عقدة دون لمس أداة فيزيائية واحدة.
إن جوهر هذا الإنجاز هو استراتيجية مكونة من جزأين توازن بين الحاجة إلى مرئيات عالية الجودة والحاجة إلى السرعة. قام الباحثون أولاً بتدريب نموذج "معلم" ضخم على مجموعة هائلة من البيانات الجراحية من تسعة أنواع مختلفة من الأنظمة الروبوتية. تعلم هذا المعلم التنبؤ بما سيحدث تالياً في المشهد الجراحي بدقة عالية، ولكنه كان بطيئاً جداً للاستخدام في التفاعل المباشر؛ إذ كان يستغرق وقتاً طويلاً لحساب كل إطار جديد. ولحل هذه المشكلة، أنشأوا نموذج "طالب" أصغر وأسرع. استخدموا تقنية تسمى "التقطير" (distillation)، حيث يتعلم الطالب محاكاة تنبؤات المعلم ولكن بطريقة أكثر كفاءة بك jauh. ومن خلال تعليم الطالب توليد دفعات قصيرة من إطارات الفيديو في خطوتين فقط بدلاً من عشرات الخطوات، وعبر تحسين البرمجيات لتعمل على شريحة حاسوبية قوية واحدة، حقق الفريق طفرة في السرعة. يمكن للنظام الآن إنتاج تدفق مستمر من الفيديو الجراحي الواقعي بسرعة تقارب 160 إطاراً في الثانية على محطة عمل واحدة، وهي سرعة كافية للقضاء على التأخير (lag) الذي يجعل الواقع الافتراضي يبدو منفصلاً عن الحركة.
ما يجعل هذا النظام فريداً حقاً هو قدرته على قبول التحكم من أي مصدر. فقد أظهر الباحثون أن المحاكي يمكن توجيهه بواسطة شخص يكتب على لوحة مفاتيح، أو جراح يرتدي سماعة واقع افتراضي، أو حتى وحدة تحكم روبوت جراحي تجارية مثل Versius. كما يمكن التحكم فيه بواسطة سياسة ذكاء اصطناذعي تتعلم أداء المهام بمفردها. وفي هذه التجارب، يشاهد الذكاء الاصطناعي الفيديو الذي يولده، ويقرر الحركة، ثم يرى النتيجة البصرية المباشلة لتلك الحركة، مما يخلق حلقة مغلقة من التعلم. وهذه هي المرة الأولى التي يتم فيها تطبيق مثل هذا النموذج العالمي التفاعلي في الوقت الفعلي على الجراحة، مما يسمح لكل من البشر والآلات بالعمل داخل بيئة مُخلّقة وملاحظة النتائج فوراً.
اختبر الباحثون النظام بصرامة لمعرفة ما إذا كان العالم الرقمي يتصرف مثل العالم الحقيقي. جعلوا المحاكي يمر عبر آلاف مهام الخياطة وقارنوا النتائج بما يحدث عند تنفيذ نفس المهام على روبوت فيزيائي. أظهرت النتائج توافقاً عاماً متوسطاً بين المحاكاة والنتائج في العالم الحقيقي، مع معامل ارتباط بيرسون بلغ 0.696 عبر المهام. ومع ذلك، تباين الأداء بشكل كبير اعتماداً على الإجراء المحدد. أظهر النظام توافقاً قوياً نسبياً في مهام مثل التقاط الأشياء ورميها، ولكن في المهام الأكثر تعقيداً مثل المناولة وربط العقد، كان الارتباط سالباً، مما يشير إلى أن المحاكي كان يتنبأ أحياناً بالنجاح بينما يفشل الروبوت الحقيقي، أو العكس. لقد نجح النظام في التقاط فيزياء الأنسجة الرخوة وسلوك الأدوات الجراحية في معظم السيناريوهات. ومع ذلك، كشونت الدراسة أيضاً حدود هذه التكنولوجيا؛ فعندما تضمنت المحاكاة هياكل دقيقة للغاية ومتداخلة، مثل خيط يلتف فوق نفسه أثناء مهمة ربط عقدة، كان النظام يرتكب أخطاءً أحيانًا، حيث "يهلوس" بشكل الخيط بطرق لا تطابق الواقع. كانت هذه الأخطاء أكثر شيوعاً في النسخة السريعة التي تعمل في الوقت الفعلي مقارنة بنموذج المعلم الأبطأ والأكثر دقة، مما يشير إلى أنه رغم كون النظام أداة قوية للتدريب والتقييم، إلا أنه ليس مثالياً بعد لكل نوع من أنواع المناولات الدقيقة.
على الرغم من هذه القيود، فإن الآثار المترتبة على هذا العمل كبيرة. فمن خلال توفير بيئة واقعية، وقابلة للتوسع، وآمنة، يقدم Cosmos-H-Dreams أساساً جديداً للتعليم الجراحي. يمكن للجراحين الآن ممارسة الإجراءات المعقدة بشكل متكرر دون الحاجة إلى جثث أو حيوانات، ويمكن تدريب وتطوير سياسات الروبوت في "صندوق رمال" رقمي قبل نشرها في المستشفى. لقد أتاح الباحثون الكود والنموذج للجمهور، آملين في تسريع تطوير روبوتات جراحية أكثر أماناً وأدوات تدريب أفضل. وبينما يركز النظام حالياً على مهام الخياطة على الطاولة، يتطلع الفريق إلى توسيع نطاقه ليشمل إجراءات سريرية كاملة تتضمن تشريحاً معقداً. وفي الوقت الحالي، يظل النظام بمثابة إثبات لمفهوم أن مستقبل التدريب الجراحي قد لا يكون في مختبر فيزيائي، بل في عالم توليدي في الوقت الفعلي، حيث تكون الأخطاء آمنة، والتعلم لا ينتهي.
ملخص تقني: NVIDIA Cosmos-H-Dreams: محاكاة فيزيائية توليدية في الوقت الفعلي للروبوتات الجراحية
1. بيان المشكلة
تواجه عمليات تدريب الروبوتات الجراحية وتقييم السياسات (Policies) عقبات كبيرة؛ حيث تُعد التجارب الفيزيائية التي تتضمن مختبرات حيوانية أو جثثاً بشرية مكلفة، وتستغ-رق للوقت، ويصعب إعادة إنتاجها. ومن ناحية أخرى، تعاني أجهزة المحاكاة الكلاسيكية من صعوبة في التقاط المظهر الواقعي الضوئي وديناميكيات الأنسجة المعقدة القابلة للتشوه (مثل النزيف، ودخان الكي الكهربائي، والأسطح الرطبة اللامعة) المطلوبة للتدريب الجراحي الواقعي. وبينما توفر نماذج العالم الأساسية (World Foundation Models) بديلاً قائماً على البيانات لتخليق مستقبليات معقولة، إلا أن النهج الحالية غالباً ما تفشل في تحقيق التكامل بين الدقة البصرية/الفيزيائية العالية، والقدرة على التحكم عبر الأفعال، وسرعات التوليد في الوقت الفعلي اللازمة للمحاكاة التفاعلية. وتحديداً، هناك نقص في نماذج العالم الجراحية التي تدعم التحكم البشري الحي وتقييم السياسات في حلقة مغلقة (closed-loop) في الوقت الفعلي.
2. المنهجية
يقترح المؤلفون Cosmos-H-Dreams، وهو نظام متكامل لنموذج عالم جراحي يعمل في الوقت الفعلي. تتبع المنهجية مسار عمل متعدد المراحل يتضمن تجميع البيانات، تصميم بنية النموذج، استراتيجية تقطير (distillation) من معلم إلى طالب، وحزمة استدلال متخصصة.
2.1 استراتيجية البيانات
Open-H-Embodiment: مستودع ضخم متعدد التجسيدات يجمع 32 مجموعة بيانات عبر 9 تجسيدات روبوتية (بما في ذلك CMR Versius و dVRK) وحوالي 22 مليون إطار. يوفر هذا مساحة أفعال موحدة بـ 44 بُعداً تغطي أدوات وتشريحات وظروف إضاءة متنوعة.
dVRK Tabletop Suturing: لغرض الضبط الدقيق (fine-tuning) لمهام محددة، تم استخدام مجموعة بيانات خياطة dVRK بالكامل (بما في ذلك حلقات الفشل). تتكون هذه المجموعة من حوالي مليون إطار بتردد 10 هرتز، مُعبر عنها بتنسيق أفعال ثنائي الذراع بـ 20 بُعداً (تمت زيادة الحشو إلى 44 بُعداً).
2.2 بنية النموذج
بُني النظام على Cosmos-Predict2.5، وهو نموذج محول انتشار (Diffusion Transformer - DiT) مشروط بالأفعال.
الاشتراط (Conditioning): يستقبل النموذج أول إطار RGB (يتم تشفيره كرموز كامنة نظيفة)، ومخزن KV مؤقت متدفق للسياق الزمني، وكتلة من حركية الروبوت (متجه فعل موحد بـ 44 بُعداً). يتم حقن الأفعال عبر تعديل timestep/AdaLN بدلاً من كونها رموز انتباه منفصلة.
التدريب ثنائي المرحلة:
المعلم ثنائي الاتجاه (Bidirectional Teacher): يتم تهيئته من Cosmos-H-Surgical-Simulator متعدد التجسيدات، ويتم ضبطه بدقة على بيانات إجراءات محددة (مثل الخياطة على الطاولة) باستخدام هدف التدفق المصحح (rectified-flow). يتم تدريبه على آفاق زمنية متزايدة (تصل إلى 73 إطاراً) لتحسين استقرار المخرقات الطويلة (long-rollout stability).
الطالب السببي (Causal Student - التقطير): يتم تقطير المعلم ثنائي الاتجاه إلى طالب سببي ذاتي الانحدار (autoregressive) قادر على البث في الوقت الفعلي. يعالج هذا مشكلة "انحياز التعرض" (exposure bias) حيث يجب على النموذج الاشتراط على توليداته الماضية غير المثالية.
الإجبار الذاتي (Self Forcing): يتم تدريب الطالب على سياق مولد ذاتياً عبر مخرقات ذاتية (self-rollouts)، مما يسد الفجوة بين التدريب والاختبار.
تقطير مطابقة التوزيع (DMD): بدلاً من إعادة البناء بكسل مقابل بكسل، يقلل الطالب الفرق التوزيعي بين مقاطع الفيديو المولدة ذاتياً وبين مجال البيانات الحقيقية باستخدام شبكة درجة (score network) مجمدة وشبكة درجة زائفة قابلة للتدريب.
2.3 الاستدلال والخدمة
FlashDreams: تستخدم حزمة النشر مكتبة الاستدلال المتدفق FlashDreams لتمكين التوليد ذاتي الانحدار على أجهزة الحافة (edge hardware).
التحسينات: يستخدم النظام مخزن KV مؤقت متدفق ثابت الحجم، وانتباه زمني بنوافذ محلية مع بالوعات المظهر (appearance sinks)، ومشفرات/فك تشفير كامنة خفيفة الوزن (TAEHV)، وعمليات مسبقة الحساب.
تقليل زمن الاستجابة: يستبدل خط الأنابيب المعتمد كلياً على وحدة معالجة الرسومات (GPU-resident) تنسيق MJPEG بتشفير H.264 القائم على NVENC، مما يقلل زمن الاستجابة اللاحق بمقدار 1.20 ضعفاً.
واجهات التحكم: يدعم النظام التحكم الحي عبر WebRTC (لوحة مفاتيح المتصفح)، وWebXR (سماعة رأس Meta Quest)، وبروتوكولات TCP (السياسات المتعلمة)، والتكامل المباشر مع وحدات تحكم الروبوتات الجراحية (مثل CMR Surgical Versius).
3. المساهمات الرئيسية
أول نموذج عالم جراحي تفاعلي: النظام هو الأول الذي يدعم التحكم الحي من قبل المشغلين البشر (عبر VR/لوحة المفاتيح) والسياسات المتعلمة في حلقة مغلقة.
أساس متعدد التجسيدات: قدم نموذج Cosmos-H-Surgical-Simulator، وهو نموذج أساسي تم ضبطه بدقة عبر 9 تجسيدات روبوتية، مما يوفر نقطة فحص (checkpoint) قابلة لإعادة الاستخدام لنماذج الإجراءات النوعية اللاحقة.
بث في الوقت الفعلي على GPU واحد: من خلال الجمع بين تقطير الإجبار الذاتي وFlashDreams، يحقق النظام معدلات إطارات تفاعلية (~160 FPS) على وحدة معالجة رسومات واحدة من نوع NVIDIA RTX PRO 6000 Blackwell، حيث يولد كتل مكونة من 12 إطاراً بدقة 288×512.
معيار تقييم جديد: يقترح البحث تقييم نماذج العالم الجراحية بناءً على القدرة على التحكم في الأفعال في الحلقة المغلقة والاستقرار عبر مخرقات المهام الطويلة، متجاوزاً مقاييس البكسل الثابتة.
4. النتائج
جودة المحاكاة: في حلقات الخياطة على الطاولة، يحقق الطالب السببي المقطر ذو الخطوتين (باستخدام TAEV) مسافة فريدشيت لفرق الفيديو (FVD) تبلغ 265.36 وLPIPS قدره 0.1212، مقارنة بالمعلم الذي سجل 170.13 و0.0864. وهذا يحدد تكلفة الدقة مقابل التشغيل في الوقت الفعلي.
استقرار المخرقات (Rollout Stability): يقلل التدريب التصاعدي مع معلمات ذات أفق زمني أطول (تصل إلى 73 إطاراً) بشكل كبير من الانحراف الزمني في المخرقات ذاتية الانحدار الطويلة مقارنة بالمعلمات ذات الأفق القصير.
تقييم السياسة في الحلقة المغلقة: عند تقييم السياسات الجراحية (مثل π0 و GR00T N1) في المحاكاة مقابل نتائج dVRK في العالم الحقيقي، يظهر النظام توافقاً متوسطاً (معامل ارتباط بيرسون r=0.696).
لوحظ ارتباط قوي لمهام "الالتقاط" (pickup) و"الرمي" (throw) (r=0.67,0.77).
وُجدت ارتباطات سلبية لمهام "التسليم" (handover) و"ربط العقد" (knot tie) (r=−0.39,−0.24)، ويُعزى ذلك إلى الهلوسات في الهياكل الرقيقة والمتفاعلة ذاتياً (مثل هندسة الخيوط) في النموذج المقطر.
الأداء: يصل النظام إلى 161 إطاراً في الثانية لكتل الـ 12 إطاراً بدقة 288×512 على GPU واحد. عند الدقة الأعلى (540p)، ينخفض الاستدلال إلى ~30 إطاراً في الثانية، حيث يصبح تشفير NVENC أقل موثوقية ويتراجع إلى المعالج المركزي (CPU).
5. الأهمية والادعاءات
يدعي البحث أن Cosmos-H-Dreams يمثل تحولاً من مولدات الفيديو غير التفاعلية (offline) إلى محاكيات جراحية تفاعلية في الوقت الفعلي. وتكمن أهميته في تمكين:
التعليم الجراحي: توفير أساس مشترك للتدريب حيث يمكن للمشغلين البشر التصرف ومراقبة النتائج في الوقت الفعلي.
البيانات الاصطناعية القابلة للتوسع: توليد بيانات للسيناريوهات النادرة أو المضادة للواقع التي يصعب التقاطها فيزيائياً.
تطوير السياسات: توفير بيئة للحلقة المغلقة لتدريب وتقييم السياسات الروبوتية.
يصرح المؤلفون صراحةً أنه بينما يظهر النظام توليدًا تفاعلياً وتوافقاً متوسطاً مع الواقع (sim-to-real)، فإنه ليس بعد بديلاً للتقييم غير التفاعلي (offline) على التلاعب الثنائي اليدوي الدقيق الذي يتضمن هياكل رقيقة ومعقدة مثل الخيوط. وقد حددوا تدهور الدقة في هذه السيناريوهات كقيد أساسي، وأشاروا إلى أن العمل المستقبلي سيركز على توسيع المسار ليشمل الإجراءات السريرية ذات التشريح الأكثر ثراءً والتحقق من صحة النظام لدعم القرار أثناء العمليات الجراحية. ويضع البحث هذا النظام كخطوة تأسيسية، مع تحديد Cosmos 3 كعمود فقري طبيعي للجيل القادم لتحسين الدقة مع الحفاظ على سرعة المعالجة.