TwinOR: Photorealistic Digital Twins of Dynamic Operating Rooms for Embodied AI Research
تُعد TwinOR بنية تحتية من الواقع إلى المحاكاة تعمل على إنشاء توائم رقمية واقعية وديناميكية لغرف العمليات بدقة تصل إلى مستوى السنتيمتر، وذلك لتوفير بيئات آمنة وقابلة للتوسع وواقعية من حيث الاستشعار لتدريب وتقييم الذكاء الاصطناعي المتجسد في الأنظمة الجراحية.
المؤلفون الأصليون:Han Zhang, Yiqing Shen, Roger D. Soberanis-Mukul, Ankita Ghosh, Hao Ding, Lalithkumar Seenivasan, Jose L. Porras, Zhekai Mao, Chenjia Li, Wenjie Xiao, Lonny Yarmus, Angela Christine Argento, Masaru IsHan Zhang, Yiqing Shen, Roger D. Soberanis-Mukul, Ankita Ghosh, Hao Ding, Lalithkumar Seenivasan, Jose L. Porras, Zhekai Mao, Chenjia Li, Wenjie Xiao, Lonny Yarmus, Angela Christine Argento, Masaru Ishii, Mathias Unberath
تخيل أنك تحاول تعليم روبوت كيفية إجراء عملية جراحية. لا يمكنك ببساطة تركه يتدرب على مريض حقيقي في غرفة عمليات حقيقية؛ فهذا سيكون خطيراً للغاية، ومكلفاً جداً، ومزعجاً للرعاية الطبية الفعلية. أنت بحاجة إلى "صندوق رمال" (Sandbox) للتدريب فيه.
لفترة طويلة، حاول العلماء بناء هذه الصناديق باستخدام رسومات الكمبيوتر، لكنها غالباً ما كانت تبدو مثل ألعاب الفيديو من حقبة التسعينيات: مربعة، تبدو مزيفة، وغير قادرة على التعامل مع الواقع الفوضوي والمتحرك لغرفة المستشفى الحقيقية.
إليك "TwinOR". فكر في TwinOR ليس كلعبة فيديو، بل كـ مرآة رقمية حية ومثالية لغرفة عمليات حقيقية.
إليك كيف يعمل، مقسماً إلى مفاهيم بسيطة:
١. المخطط "المسافر عبر الزمن" (الهندسة الثابتة)
قبل حدوث أي عملية جراحية، يقوم الفريق بتصوير فيديو طويل وهادئ لغرفة العمليات الفارغة وجميع المعدات الكبيرة (مثل طاولة العمليات وجهاز الأشعة السينية).
التشبيه: تخيل أنك تأخذ صورة ٣٦٠ درجة لغرفة معيشتك، ثم تستخدم تطبيقاً سحرياً لتحويل تلك الصورة إلى نموذج "ليجو" ثلاثي الأبعاد مثالي لغرفتك.
ما يفعله TwinOR: يقوم بمسح الغرفة وبناء نموذج ثلاثي الأبعاد فائق الواقعية للجدران، والسقف، والآلات الثقيلة. إنه دقيق للغاية لدرجة أنك إذا قمت بقياس المسافة بين نقطتين في النموذج الرقمي والغرفة الحقيقة، فستكون الفروقات أقل من عرض ظفر الإصبع (دقة على مستوى السنتيمتر).
٢. "الممثلون الأشباح" (الحركة الديناميكية)
غرفة العمليات الحقيقية لا تكون ساكنة أبداً. الجراحون يتحركون، والممرضات يهرعن في الأرجاء، والروبوتات تغير مواقعها. النموذج ثلاثي الأبعاد الثابت ليس كافياً؛ فالمرآة يجب أن تتحرك أيضاً.
التشبيه: تخيل أن لديك مسرحية. لديك الديكور (الغرفة)، ولكن الآن تحتاج إلى ممثلين. يستخدم TwinOR شبكة من الكاميرات لمراقبة حركة البشر والروبوتات الحقيقية. ثم يقوم بإنشاء "أشباح رقمية" لهم في الغرفة الافتراضية تحاكي كل خطوة، ودورة، وإيماءة يقومون بها في الوقت الفعلي.
ما يفعله TwinOR: يتتبع الموقع ثلاثي الأبعاد لكل شخص وكل قطعة من المعدات أثناء حركتهم، مما يضمن بقاء المرآة الرقمية متزامنة مع العالم الحقيقي.
٣. "الملعب الآمن" للذكاء الاصطناعي
الآن بعد أن أصبح لديهم نسخة رقمية مثالية ومتحركة لغرفة العمليات، يمكنهم السماض لعناصر الذكاء الاصطناعي (AI) بالتدرب داخلها.
التشبيه: فكر في هذا الأمر كأنه محاكي طيران للطيارين. يمكن للطيار أن يحطم طائرة ألف مرة في المحاكي دون إيذاء أي شخص. TwinOR هو محاكي الطيران للروبوتات الجراحية.
النتيجة: يمكن للذكاء الاصطناعي تعلم كيفية التنقل في الغرفة، أو مناولة الأدوات للجراح، أو تجنب الاصطدام بممرضة. ولأن الغرفة الرقمية تبدو وتتحرك تماماً مثل الغرفة الحقيقية، فإن الذكاء الاصطناعي يتعلم مهارات تعمل بالفعل في العالم الحقيقي.
لماذا يعد هذا أمراً هاماً؟
لا مزيد من "الوادي غير المريح" (Uncanny Valley): كانت عمليات المحاكاة السابقة تبدو مزيفة. إذا تعلم الذكاء الاصطناعي في غرفة مزيفة، فقد يرتبك عندما يرى بشراً حقيقياً. TwinOR واقعي للغاية لدرجة أن الذكاء الاصطناعي لا يستطيع التمييز بينه وبين الواقع.
السلامة أولاً: يمكنك اختبار سيناريوهات خطيرة (مثل سقوط روبوت لأداة أو تعثر ممرضة) آلاف المرات في التوأم الرقمي لتحديد أفضل الحلول، كل ذلك دون المخاطرة بمريض واحد.
جسر "من الواقع إلى المحاكاة": عادةً ما توجد فجوة كبيرة بين ما يحدث في الكمبيوتر وما يحدث في الواقع. يقوم TwinOR بجسر هذه الفجوة. تُظهر الورقة البحثية أن الروبوتات التي تتدرب في TwinOR يمكنها التنقل وفهم العمق بنفس الكفاءة التي ستعمل بها في مستشفى حقيقي.
العائق (القيود)
النظام ليس مثالياً بعد.
ليس فورياً: بناء التوأم الرقمي يتطلب الكثير من قوة الكمبيوتر والوقت (مثل رندرة فيلم عالي الجودة).
ليس مجهرياً: هو بارع في التعامل مع الأشياء الكبيرة (البشر، الطاولات، الروبوتات)، ولكنه لا يتتبع بعد الأدوات الصغيرة أو الأنسجة الرخوة (مثل قلب ينبض) بتفاصيل دقيقة.
يحتاج إلى رؤية واضحة: إذا قام جراح بحجب رؤية الكاميرا تماماً، فقد يرتبك "الشبح الرقمي" للحظة.
الخلاصة
TwinOR هو مرآة سحرية تنشئ نسخة آمنة ومثالية ومتحركة لغرفة عمليات المستشفى. إنه يسمح للروبوتات والذكاء الاصطناعي بـ "الذهاب إلى المدرسة" في هذا العالم الرقمي، لتعلم كيف يكونون شركاء آمنين ومفيدين للأطباء البشر قبل أن يضعوا قدمهم في مستشفى حقيقي. إنها قفزة هائلة نحو جعل الروبوتات الجراحية أكثر ذكاءً وأماناً.
يتطلب تطوير الذكاء الاصطناعي المجسد (Embodied AI) للأنظمة الجراحية الذكية بيئات آمنة، وقابلة للتحكم، وعالية الدقة للتدريب والتقييم. ومع ذلك، تفرض غرف العمليات (ORs) الحقيقية عوائق كبيرة:
السلامة والقيود: تمنع لوائح السلامة الصارمة والقيود التشغيلية الوكلاء (Agents) من التفاعل بحرية أو ارتكاب الأخطاء في البيئات السريرية المباشرة.
ندرة البيانات: يعد جمع بيانات ضخمة متعددة الوسائط من العمليات الجراحية الحية أمراً غير عملي بسبب الخصوصية، وصعوبة الوصول، ومخاطر تعطيل سير العمل السريري.
قصور المحاكاة الحالية: تفتقر بيئات المحاكاة الاصطناعية الحالية غالباً إلى التعقيد الزماني والمكاني (Spatiotemporal complexity)، مما يؤدي إلى مظهر بصري غير واقعي أو حركة غير متسقة زمنياً.
الفجوة في التوائم الرقمية: تقتصر جهود التوأمة الرقمية الحالية لغرف العمليات غالباً على تجريدات ثنائية الأبعاد أو تمثيلات شبه ثابتة، مما يفشل في التقاط التطور المستمر لحركة البشر والمعدات المطلوب لأبحاث الذكاء الاصطناعي المجسد القوية.
2. المنهجية: إطار عمل TwinOR
إن TwinOR هو بنية تحتية للتحول من الواقع إلى المحاكاة (Real-to-Sim) قائمة على الإدراك، مصممة لبناء توائم رقمية ديناميكية وواقعية لغرف العمليات. يدمج النظام بين إعادة البناء ثلاثي الأبعاد عالي الدقة والإدراك الديناميكي متعدد الرؤى.
أ. بنية النظام
تتكون سلسلة المعالجة (Pipeline) من مرحلتين رئيسيتين:
إعادة البناء الاستاتيكي (الثابت): يعيد بناء هندسة غرفة العمليات والمعدات الثابتة من فيديوهات المسح المسبق.
الإدراك الديناميكي: يقوم بنمذجة حركة البشر والمعدات باستمرار أثناء الإجراءات الجراحية باستخدام نظام كاميرات متعدد الرؤى.
الدمج (Fusion): يجمع بين المكونات الاستاتيكية والديناميكية في بيئة غامرة ثلاثية الأبعاد (يتم تنفيذها في برنامج Blender) للمحاكاة وتوليد البيانات.
ب. البنية التحتية للكاميرات
الإعداد: أربع كاميرات ستيريو RGB مثبتة على الحائط (ZED-X) موضوعة بالقرب من زوايا الغرفة.
المزامنة: يتم الحفاظ عليها عبر الأجهزة باستخدام بروتوكول الوقت الدقيق (PTP) لتحقيق مزامنة بأجزاء من الملي ثانية.
المعايرة: يتم تحديد المعايير الخارجية (Extrinsics) بين الكاميرات باستخدام عصا ضوئية مخصصة ذات علامات كروية، ويتم تحسينها عبر ضبط الحزمة العالمي (Global Bundle Adjustment) لتحقيق دقة إعادة إسقاط دون البيكسل.
ج. نمذجة التوأم الرقمي (الاستاتيكي)
إعادة بناء الغرفة: يستخدم Neuralangelo (منهج إعادة بناء السطح العصبي) على فيديوهات المسح المسبق المحمولة لاستعادة الأسطح العصبية الكثيفة. تتم معالجتها لاحقاً لإزالة العيوب وتحويلها إلى شبكات (Meshes) منسوجة (~400 ألف وجه، بدقة 4K) لضمان الأداء.
إعادة بناء المعدات: يتم إعادة بناء المعدات الطبية القابلة للحركة (مثل طاولات العمليات، الروبوتات الجراحية، أجهزة C-arms) عبر فيديوهات محمولة بزاوية 360 درجة، وتُبسط إلى 20-40 ألف وجه، وتُنسج بدقة 2K.
د. الإدراك الديناميكي
نمذجة البشر: يستخدم نموذج الإنسان البارامتري SMPL.
سلسلة المعالجة: الكشف ← تقدير النقاط المفتاحية ثنائية الأبعاد (ViTPose+) ← التثليث ثلاثي الأبعاد ← ملاءمة نموذج SMPL.
التحسين: يتم تطبيق التحسين متعدد الرؤى والتنعيم الزمني للتعامل مع حالات الاحتجاب والحركة السريعة، مما يضمن مسارات منطقية فيزيائياً.
نمذجة حركة المعدات:
التقسيم (Segmentation): يستخدم نموذج Segment Anything Model 2 (SAM2) لتقسيم المعدات عبر الرؤى المختلفة.
تقدير الوضعية (Pose Estimation): يتم إسقاط المناطق المقسمة عكسياً إلى سحب نقاط ثلاثية الأبعاد، ومحاذاتها مع نماذج CAD باستخدام مطابقة سمات FPFH وتحسينها عبر Color ICP (التقارب المتكرر للألوان) لتقديل وضعيات الـ 6-DoF.
3. المساهمات الرئيسية
أول توأم رقمي ديناميكي لغرفة العمليات: يقدم إطار عمل يوحد إعادة بناء الهندسة الاستاتيكية مع الإدراك المستمر للحركة، مما يلتقط التعقيد الزماني والمكاني الكامل لسير العمل الجراحي الحقيقي.
دقة على مستوى السنتيمتر: يحقق دقة هندسية على المقياس المتري (على مستوى السنتيمتر) مع الحفاظ على دقة بصرية واقعية.
واقعية على مستوى المستشعرات: يثبت أن النماذج التي يتم تدريبها أو تقييمها على بيانات TwinOR تؤدي بشكل مشابه للمعايير الواقعية، مما يسد بفعالية فجوة المحاكاة إلى الواقع (Sim-to-Real Gap).
بنية تحتية قابلة للتوسع: يوفر مساراً نموذجياً غير مرتبط بغرفة محددة لتوليد بيانات اصطناعية لمهام الذكاء الاصطناعي المجسد (الإدراك، التحديد الموضعي، الملاحة).
4. النتائج التجريبية
تم تقييم الإطار على غرفتي عمليات (OR-A: عمليات جراحية محاكية؛ OR-B: جراحة رئوية روبوتية حقيقية).
أ. جودة إعادة البناء
الدقة البصرية: حقق قيم SSIM عالية (0.90/0.92) وPSNR (27.7/25.4 dB) لإعادة البناء العصبي. حافظت الأصول الشبكية (Mesh-based assets) على الواقعية مع SSIM قدره 0.72/0.82.
الدقة الهندسية: بالمقارنة مع سحب نقاط COLMAP، حقق TwinOR متوسط مسافات شامفر (Chamfer distances) قدره 14.1 ملم (OR-A) و 22.7 ملم (OR-B)، مما يؤكد الدقة المكانية على مستوى السنتيمتر.
ب. دقة الإدراك الديناميكي
وضعية البشر: حقق 98.34% PCP3D@0.5 ومتوسط خطأ في موضع المفصل (MPJPE) قدره 3.52 سم.
وضعية المعدات: بالنسبة للمعدات الصلبة (الطاولات، أجهزة C-arms)، حقق متوسط خطأ في الإزاحة قدره 9.12 سم، وخطأ في الدوران قدره 4.57 درجة، وتقاطع حجم (IoU) ثلاثي الأبعاد قدره 0.82.
ج. معايير الذكاء الاصطناعي المجسد
تقدير العمق الستيري (Stereo Depth Estimation): باستخدام FoundationStereo، حقق النظام خطأ نقطة نهاية (EPE) قدره 0.378 بيكسل ومتوسط خطأ مطلق (MAE) قدره 7 ملم في تقدير العمق، مما يطابق أداء المعايير الداخلية الواقعية.
التحديد الموضعي البصري: باستخدام ORB-SLAM3 على روبوت محاكى، حقق النظام خطأ المسار المطلق (ATE) قدره 0.12 م وخطأ الوضع النسبي (RPE) قدره 0.066 م، وهو ما يقع ضمن نطاقات خطأ SLAM الواقعية النموذجية.
5. الأهمية والتوجهات المستقبلية
سد الفجوة: يقلل TwinOR بشكل كبير من فجوة المحاكة إلى الواقع من خلال توفير واقعية على مستوى المستشعرات، مما يسمح للباحثين بتدريب وتقييم وكلاء الذكاء الاصطناعي المجسد دون المخاطر المرتبطة بالتجارب السريرية الحية.
تمكين البحث: يفتح آفاقاً جديدة لأبحال الاستقلالية الجراحية، والتعاون بين الإنسان والروبوت، والمساعدة الواعية بالسياق.
القيود والعمل المستقبلي:
حالياً هو مسار يعمل في وضع عدم الاتصال (Offline)؛ وتعد إعادة البناء في الوقت الفعلي (مثلاً عبر 3D Gaussian Splatting) هدفاً مستقبلياً.
لا يقوم حالياً بنمذجة التفاعلات الدقيقة (مثل التلاعب على مستوى الأصابع) أو الأنسجة القابلة للتشوه.
يهدف العمل المستقبلي إلى دمج التمثيلات الدلالية (Semantic representations) وتوسيع نطاق التعميم عبر تخطيطات المستشفيات وظروف الإضاءة المتنوعة.
الخلاصة: يؤسس TwinOR قاعدة قوية لنقل الذكاء المجسد من المحاكاة إلى البيئات السريرية الواقعية، مما يوفر بيئة اختبار آمنة، وقابلة للتوسع، وعالية الواقعية للجيل القادم من الأنظمة الجراحية الذكية.