← أحدث الأبحاث
💻 computer science

Fine-Tuned Foundation Models for Multi-Category Segmentation and Triplet Recognition in Gastric Cancer Surgery

تقدم هذه الدراسة نهجاً يعتمد على نموذج تأسيسي مضبوط بدقة، يستفيد من مجموعة بيانات مُنسقة حديثاً تضم 2,909 إطاراً مشروحاً لتحقيق تجزئة دلالية عالية الدقة للأدوات الجراحية والتشريح، بالإضافة إلى التعرف القوي على ثلاثيات الأفعال الجراحية، مما يساهم في تعزيز التوجيه أثناء العمليات الجراحية والتقييم الآلي للمهارات في جراحة سرطان المعدة.

المؤلفون الأصليون: Xiaopeng Wang, Youdong Liu, Yi Wang, Rongyu Ma, Jie Chen, Jingzhe Qian, Zikai Wang, Yuanyuan Lin, Jiansen Song, Keyuan Hu, Hongda Pan, Fenglin Liu, Jun Lu

نُشر 2026-09-20
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Xiaopeng Wang, Youdong Liu, Yi Wang, Rongyu Ma, Jie Chen, Jingzhe Qian, Zikai Wang, Yuanyuan Lin, Jiansen Song, Keyuan Hu, Hongda Pan, Fenglin Liu, Jun Lu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

داخل جسم الإنسان، تُعد المعدة مشهداً معقداً من الأنسجة الرخوة، والأوعية الدموية، والأعضاء الدقيقة، وكلها محشورة في مساحة ضيقة. عندما يقوم الجراحون باستئصال معدة مصابة بالسرطان، يتعين عليهم التنقل في هذه البيئة المعقدة بدقة متناهية، وغالباً ما يستخدمون أدوات طويلة ونحيفة يتم إدخالها عبر شقوق صغيرة. هذه مهمة عالية المخاطر حيث يمكن لزلة واحدة أن تسبب ضرراً جسيماً. لعقود من الزمن، اعتمد الحل بالكامل على عيون الجراح وخبرته، ولكن هناك مجالاً جديداً من العلوم يحاول منحهم "عيناً رقمية ثانية". يستخدم هذا المجال الذكاء الاصطناعي لمراقبة فيديوهات العمليات الجراحية والتعلم من التعرف على ما يحدث في الوقت الفعلي. الفكرة الجوهرية بسيطة: إذا أمكن تعليم الكمبيوتر التمييز بين أداة جراحية وعضو حيوي، أو فهم ما يفعله الجراح بالضبط في أي لحظة معينة، فقد يتمكن في النهاية من تحذيرهم من الخطر قبل وقوع الخطأ. يتطلب هذا تعليم الآلات ليس فقط رؤية الأشكال، بل فهم قصة الجراحة أثناء تطور أحداثها.

لقد اتخذ فريق من الباحثين خطوة كبيرة نحو هذا الهدف من خلال إنشاء مكتبة متخصصة من اللحظات الجراحية وتعليم الكمبيوتر كيفية قراءتها. لقد ركزوا على جراحة سرطان المعدة، وهي إجراء معروف بصعوبته وارتفاع مخاطر حدوث مضاعفات. جمع الفريق ما يقرب من ثلاثة آلاف إطار فيديو من عمليات حقيقية، التقطت كلاً من الطرق التقليدية بالمنظار والتقنيات الأحدث المساعدة بالروبوت. ومن هذه الصور، رسموا يدوياً حدوداً تفصيلية حول كل أداة جراحية وكل بنية تشريحية مرئية، مثل المعدة، والأوعية الدموية، والعقد اللمفاوية. كما قاموا بتصنيف التفاعلات بينها، مما خلق سجلاً مهيكلاً يوضح أي أداة استُخدمت، وما هو الإجراء الذي قامت به، وأي نسيج لمسته. نتج عن هذا الجهد الهائل مجموعة بيانات تحتوي على ما يقرب من تسعة عشر ألف تسمية توضيحية متميزة، مما وفر خريطة غنية وتفصيلية للمجال الجراحي كانت مفقودة سابقاً.

ومع امتلاك هذه المكتبة الجديدة، اختبر الباحثون نوعاً قوياً من الذكاء الاصطناعي يُعرف باسم "النموذج التأسيسي" (foundation model). فكر في هذا النموذج كطالب قد درس بالفعل ملايين الصور الطبية وتعلم القواعد العامة لكيفية ظهور الأنسجة والأدوات، بدلاً من طالب يبدأ من الصفر. قام الباحثون بضبط هذا "الطالب" المدرب مسبقاً للتركيز خصيصاً على فيديوهات جراحة المعدة. وقد طلبوا من الكمبيوتر القيام بمهمتين: أولاً، رسم حدود دقيقة حول الأدوات والأعضاء، وثانياً، تحديد مجموعات محددة من الأدوات والأفعال والأهداف التي تحدث في الفيديو. وقارنوا هذا النهج المتقدم بمنهج رؤية حاسوبية تقليدي وأبسط لمعرفة أيهما يمكنه التعامل مع تعقيدات العالم الحقيقي بشكل أفضل.

أظهرت النتائج أن النموذج التأسسي المتقدم كان متفوقاً بمراحل في مهمة الرؤية والتحديد. فعندما طُلب منه تحديد الأدوات الجراحية، طابق النموذج شكل الأداة مع الصورة بنسبة تجاوزت خمسة وتسعين بالمائة في معظم الحالات. وعند تحديد البنى التشريحية مثل المعدة أو الأوعية الدموية، حقق معدل نجاح يقترب من تسعين بالمائة. وفي المقابل، عانت الطريقة التقليدية بشكل كبير، حيث أنتجت غالباً حدوداً مجزأة أو غير مكتملة أدت إلى تفويت تفاصيل حاسمة. ووجد الباحثون أن النموذج التأسيدي المتقدم يمكنه التعامل مع الواقع الفوضوي للجراحة — حيث تكون الأدوات أحياناً مخفية بسبب الدم أو الدخان — بشكل أفضل بكثير من التكنولوجيا القديمة. وهذا يشير إلى أن المعرفة المسبقة للنموذج التأسيسي بالصور الطبية منحته ميزة واضحة في تعلم الفروق الدقيقة لجراحة المعدة بسرعة ودقة.

أثبتت المهمة الثانية، وهي التعرف على الأفعال المحددة التي تجري، أنها أكثر صعوبة ولكنها واعدة أيضاً. طلب الباحثون من الكمبيوتر التنبؤ بـ "الثلاثية" (triplet) لكل حدث: الأداة، والفعل، والهدف. على سبيل المثال، كان على النظام أن يفهم أن أداة معينة تقوم بقطع قطعة من الأنسة الدهنية. وبينما لم يكن الكمبيوتر مثالياً بعد، إلا أنه كان يؤدي بشكل أفضل بكمتير من المحاولات السابقة لمهام مماثلة. وكشف التحليل أن الكمبيوتر كان أكثر موثوقية في التعرف على الفعل نفسه، مثل القطع أو السحب، بينما كان أقل دقة قليلاً في تحديد الأداة بالضبط أو العضو المحدد المعني. ويرجع ذلك على الأرجح إلى أن مجموعة البيانات احتوت على العديد من الأفعال الشائعة ولكن عدد قليل جداً من الأمثلة على المناورات النادرة والمعقدة. وأشار الباحثون إلى أن الحالات الأكثر صعوبة تضمنت أدوات نادرة أو أهدافاً تشريحية محددة ظهرت بضع مرات فقط في البيانات، مما يسلط الضوء على أن النظام لا يزال بحاجة إلى مزيد من التعرض لهذه السيناريوهات غير الشائعة ليصبح قوياً تماماً.

تخلص الدراسة إلى أنه على الرغم من أن التكنولوجيا ليست جاهزة بعد لإجراء عملية جراحية بمفردها، إلا أنها وصلت إلى مستوى من الدقة يجعلها أساساً قابلاً للتطبيق لأدوات السلامة المستقبلية. ويؤكد الباحثون أن القيمة الحقيقية لهذا العمل لا تكمن في الأرقام نفسها، بل فيما تمكنه: نظام يمكنه يوماً ما مراقبة جراحة وتنبيه الجراح إذا كانت أداة ما قريبة جداً من شريان حيوي أو إذا كان يتم تنفيذ خطوة حرجة بشكل غير صحيح. ويقر الفريق بأن عملهم يعتمد على بيانات من مستشفى واحد، وأن النماذج لا تزال بحاجة إلى الاختبار عبر جراحين ومعدات مختلفة لضمان عملها في كل مكان. ومع ذلك، من خلال إثبات أن هذه النماذج المتقدمة يمكنها فهم اللغة البصرية المعقدة لجراحة المعدة، توفر الدراسة الأساس التقني الضروري لبناء الجيل القادم من أنظمة التوجيه الجراحي التي يمكن أن تنقذ الأرواح يوماً ما عن طريق منع الأخطاء قبل وقوعها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →