← أحدث الأبحاث
🤖 AI

SurgRAW: Multi-Agent Workflow with Chain of Thought Reasoning for Robotic Surgical Video Analysis

تقدم هذه الورقة SurgRAW، وهو سير عمل متعدد الوكلاء يستفيد من استدلال سلسلة الأفكوات (Chain-of-Thought) ومعيار جديد (SurgCoTBench) لتحقيق فهم متفوق ومتوافق سريريًا للمشاهد الجراحية الروبوتية من خلال الصفر (zero-shot)، وذلك عبر التغلب على قيود النماذج المنعزلة والنماذج اللغوية البصرية العامة من خلال التعاون الهرمي والتوليد المعزز بالاسترجاع.

المؤلفون الأصليون: Chang Han Low, Ziyue Wang, Tianyi Zhang, Zhu Zhuo, Zhitao Zeng, Evangelos B. Mazomenos, Yueming Jin

نُشر 2026-09-17
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Chang Han Low, Ziyue Wang, Tianyi Zhang, Zhu Zhuo, Zhitao Zeng, Evangelos B. Mazomenos, Yueming Jin

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في غرف العمليات الحديثة، أصبحت الأنظمة الروبوتية أدوات أساسية، تتيح للجراحين إجراء عمليات دقيقة بمستوى من الدقة والثبات لا تستطيع الأيدي البشرية وحدها تحقيقه دائمًا. هذه الآلات، التي غالبًا ما تُوجَّه بواسطة كاميرات عالية الدقة، تحوّل حركات الجراح إلى أفعال صغيرة ومتحكم بها داخل جسم المريض. ومع ذلك، لكي تتمكن هذه الأنظمة حقًا من المساعدة في المستقبل، يجب أن تفعل أكثر من مجرد تحريك الأدوات؛ بل يجب أن تفهم ما يحدث على الشاشة. يتطلب هذا نوعًا من الذكاء الاصطناعي القادر على النظر إلى فيديو جراحي واستيعاب القصة المعقدة التي تتكشف أحداثها: تحديد الأدوات المستخدمة، والتعرف على الإجراءات المحددة التي يتخذها الجراح، والتنبؤ بما سيحدث بعد ذلك. ويكمن التحدي في أن المشاهد الجراحية تكون فوضوية بصريًا، حيث تتداخل الأدوات والأنسجة أو تتحرك بسرعة، مما يجعل من الصعب على الحواسيب تفسير المشهد دون أن ترتبك أو تخترع تفاصيل ليست موجودة بالفعل.

لقد حاول الباحثون لفترة طويلة تعليم الحواسيب فهم هذه المشاهد، لكن المحاولات السابقة كانت تعتمد غالبًا على برامج منفصلة مصممة لمهام فردية، مثل برنامج للعثور على الأدوات وآخر لتسمية الإجراءات. خلق هذا النهج رؤية مجزأة للجراحة، حيث لم يستطع الكمبيوتر الربط بين ما يراه وبين أهمية ذلك. وفي الآونة الأخيرة، تم تطويع النماذج اللغوية القوية للنظر في الصور، مما وفر وسيلة للتفكير في المشكلات البصرية. ومع ذلك، عند تطبيق هذه النماذج العامة على الجراحة، فإنها غالبًا ما تعاني مع اللغة المتخصصة والمنطق الخاص بغرفة العمليات، حيث تقدم إجابات واثقة ولكن خاطئة، أو تفشل في فهم التدفق المتسلسل للإجراء الجراحي. ولحل هذه المشكلة، طور فريق من الباحثين نظامًا جديدًا يحاكي الطريقة التي يتعاون بها الفريق الجراحي، باستخدام عملية استدلال منظمة وخطوة بخطوة لتحليل فيديوهات الجراحة الروبوتية بدقة غير مسبوقة.

قدم الفريق إطار عمل جديدًا يسمى SurgRAW، وهو اختصار لـ "سير عمل الاستدلال المصمم خصيصًا للذكاء الجراحي". وبدلاً من مطالبة ذكاء اصطناعي واحد بالنظر إلى إطار فيديو وتخمين الإجابة، يقوم هذا النظام بتفكيك المشكلة إلى جهد منسق بين عدة "وكلاء" متخصصين. تخيل لجنة من الخبراء يجلسون حول طاولة، لكل منهم دور محدد: أحدهم يركز على تحديد الأدوات، والآخر على الإجراءات التي يتم تنفيذها، والثالث على سياق المريض. في هذه اللجنة الرقمية، لا يعمل هؤلاء الوكلاء بمعزل عن بعضهم البعض؛ بل يناقشون الأدلة، ويتحققون من منطق بعضهم البعض، وينقحون استنتاجاتهم قبل الوصول إلى قرار نهائي. هذا النهج مبني على مجموعة بيانات جديدة أنشأها الباحثون، تحتوي على آلاف الأزواج من الأسئلة والأجوبة المستمدة من فيديوهات جراحية حقيقية، وتغطي خمسة مجالات رئيسية للاستدلال: التعرف على الأدوات، تحديد الإجراءات، التنبؤ بالخطوة التالية، فهم تفاصيل المريض، وتقييم النتيجة الجراحية.

لضمان تفكير النظام كجراح، صمم الباحثون تعليمات محددة توجه الذكاء الاصطناعي عبر سلسلة منطقية من الأفكار. فبدلاً من ترك النموذج يقفز إلى استنتاج، يجبره النظام أولاً على تحليل السؤال، ثم استخراج التفاصيل البصرية من الصورة، ومقارنة تلك التفاصيل مع القواعد الجراحية المعروفة، واستبعاد الخيارات المستحيلة، وأخيرًا التحقق من الإجابة مقابل المشهد العام. وبالنسبة للمهام التي تتطلب معرفة تتجاوز ما هو مرئي في الفيديو، مثل التنبؤ بالخطوة التالية في إجراء معقد، يستشير النظام أيضًا مكتبة رقمية من الإرشادات الطبية لترسيخ استدلاله في الحقائق الراسخة. هذا الجمع بين الاستدلال المنظم، والنقاش التعاوني بين الوكلاء، والوصول إلى معرفة طبية موثقة، يسمح للنظام بتجنب العثرات الشائعة للذكاء الاصطناعي، مثل اختلاق تفاصيل غير موجودة أو إساءة تفسير العلاقة بين الأدوات والأنسجة.

كانت نتائج اختبار هذا النظام مذهلة. فعند مقارنته بنماذج الذكاء الاصطناعي الموجودة، بما في ذلك تلك التي تم تدريبها خصيصًا على كميات كبيرة من البيانات الطبية، أدى النظام الجديد أداءً أفضل بشكل ملحوظ. وفي الاختبارات التي تقيس الدقة عبر مهام جراحية متنوعة، تفوق النظام على نموذج خاضع للإشراف القياسي بنسبة 14.61 بالمائة، وهي فجوة كبيرة في هذا المجال. كما أظهر اتساقًا ملحوظًا، حيث أنتج نتائج موثوقة مع تباين ضئيل جدًا بين عمليات التشغيل المختلفة، بينما كانت النماذج الأخرى غالبًا ما تتذبذب بشدة في أدائها. كان النظام فعالًا بشكل خاص في المهام التي تتطلب فهمًا عميقًا، مثل التنبؤ بالخطوة التالية في الجراحة أو استنتاج تفاصيل المريض من الإشارات البصرية، وهي المجالات التي عانت فيها النماذج السابقة أكثر من غيرها. ومن خلال الدمج الناجح لتدفقات الاستدلال المختلفة هذه، أظهر الباحثون أن النهج الموحد والتعاوني يمكن أن يوفر فهمًا أوضح وأكثر دقة للجراحة الروبوتية مقارنة بالأساليب المنعزلة.

يمثل هذا العمل خطوة مهمة نحو جعل الذكاء الاصطناعي شريكًا جديرًا بالثقة في غرفة العمليات. فمن خلال الانتقال من مجرد التعرف على الأنماط البسيطة نحو نظام يستدل، ويتناقش، ويتحقق من استنتاجاته الخاصة، نجح الباحثون في إنشاء أداة يمكنها شرح تفكيرها بطريقة تتماشى مع الواقع السريري. فالنظام لا يكتفي بتحديد أداة ما، بل يفهم ما تفعله تلك الأداة ولماذا. إنه لا يرى مجرد إطار فيديو، بل يستوعب سردية الإجراء الجراحي. وبينما يعمل النظام الحالي على إطارات فردية مأخوذة من فيديو مستمر، فإن المنطق الأساسي مصمم لدعم الطبيعة التدفقية والمعقدة للجراحة. ويخطط الباحثون لتوسيع هذا العمل ليشمل أنواعًا أكثر من الإجراءات واستكشاف كيفية تعلم النظام من التغذية الراجعة في الوقت الفعلي من الجراحين، بهدف توفير مساعدة إدراكية تعزز السلامة والنتائج في غرفة العمليات.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →