← أحدث الأبحاث
💻 computer science

SurgOnAir: Hierarchy-Aware Real-Time Surgical Video Commentary

تقدم الورقة البحثية SurgOnAir، وهو نموذج رؤية-لغة للبث المباشر في الوقت الفعلي تم تدريبه على مجموعة بيانات هرمية لتوليد سرد جراحي فوري متعدد المستويات وكشف انتقالات سير العمل دون الوصول إلى الإطارات المستقبلية، مما يتيح مساعدة فورية بالذكاء الاصطناعي في غرفة العمليات.

المؤلفون الأصليون: Jingyi He, Yue Zhou, Long Bai, Kun Yuan, Nassir Navab, Yuan Bi

نُشر 2026-05-21
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jingyi He, Yue Zhou, Long Bai, Kun Yuan, Nassir Navab, Yuan Bi

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل جراحاً يقوم بعملية معقدة. بالنسبة لشخص غريب، قد يبدو الأمر وكأنه رقصة فوضوية من الأدوات والأنسجة. لكن بالنسبة للجراح، هي قصة منظمة للغاية لها بداية، ومنتصف، ونهاية، مقسمة إلى فصول، ومشاهد، وجمل حوارية محددة.

تقدم الورقة البحثية نظام SurgOnAir، وهو نظام ذكاء اصطناعي جديد مصمم ليكون "الراوي المباشر" لهذه القصة. إليك كيف يعمل، مشروحاً ببساطة:

المشكلة: زر "إعادة التشغيل" غير موجود

معظم أنظمة الذكاء الاصطناعي الحالية التي تصف الجراحة تشبه ناقد الأفلام الذي يشاهد الفيلم كاملاً، ثم يتوقف، ويفكر لفترة طويلة، ثم يكتب مراجعة. وبحلول الوقت الذي تصبح فيه المراجعة جاهزة، يكون الفيلم قد انتهى بالفعل.

في غرفة العمليات الحقيقية، لا يمكنك انتظار الذكاء الاصطناعي حتى ينتهي من قراءة الفيديو بأكمله قبل أن ينطق بأي شيء. إذا كان الذكاء الاصطناعي بطيئاً، فسيفتقد اللحظة التي يقطع فيها الجراح شرياناً معيناً أو يحرك أداة ما. الأمر يشبه محاولة التعليق على مباراة كرة قدم مباشرة عبر التحدث فقط بعد انتهاء المباراة.

الحل: مذيع إذاعي مباشر

SurgOnAir مختلف. فهو يعمل مثل مذيع راديو رياضي يشاهد المباراة أثناء حدوثها وينطق بالكلمات في اللحظة التي يرى فيها الحدث.

  • لا إعادة للوراء: إنه يعالج الفيديو إطاراً تلو الآخر (frame-by-frame) أثناء تدفقه. هو لا ينظر أبداً إلى "المستقبل" (ما سيحدث لاحقاً في الفيديو).
  • رد فعل فوري: بمجرد وصول إطار مرئي جديد، يقوم الذكاء الاصطناعي بتوليد كلمة أو كلمتين من السرد فوراً.

السر الكامن: "جدول المحتويات"

السحر الحقيقي لـ SurgOnAir ليس في كونه سريعاً فحسب؛ بل في فهمه لـ التسلسل الهرمي للجراحة.

تخيل كتاباً:

  • الفصل هو المرحلة (مثلاً: "استئصال المرارة").
  • المشهد هو الخطوة (مثلاً: "قطع القناة").
  • الحوار هو الإجراء (مثلاً: "قطع القناة بالمقص").

نماذج الذكاء الاصطناعي القديمة غالباً ما تضل الطريق. قد تصف عملية قص المقص دون إدراك في أي جزء من الجراحة هي الآن، أو قد تنتقل من "القص" إلى "الخياطة" دون ملاحظة الانتقال.

بُني SurgOnAir بـ "جدول محتويات" ذهني. فهو يحدث حالته الداخلية باستمرار:

"حسناً، نحن في الفصل الثالث (المرحلة)، المشهد الثاني (الخطوة). الجراح يقوم حالياً بـ 'قطع القناة' (الإجراء)."

عندما ينتهي الجراح من قطع القناة وينتقل إلى الخطوة التالية، لا يكتفي SurgOnAir بالاستمرار في الكلام؛ بل يولد "رمز انتقال" (transition token) خاصاً. فكر في هذا كراوٍ يقول: "والآن، ننتقل إلى المشهد التالي!". هذا يساعد الذكاء الاصطناعي على معرفة مكانه بدقة، مما يمنعه من الارتباك أو اختلاق حقائق (الهلوسة).

كيف علموه (الـ "كتاب المدرسي")

لتدريب هذا الذكاء الاصطناعي، لم يكتفِ الباحثون بتغذيته بفيديوهات عشوائية، بل أنشأوا مجموعة بيانات خاصة تسمى SurgOnAir-11k.

  1. أخذوا فيديوهات جراحية حقيقية مع الصوت الخاص بما يقوله الجراحون.
  2. استخدموا الذكاء الاصطناعي لتنقية الصوت، وإزالة الأشياء مثل "مرحباً بالجميع" أو "دعوني أشرح لماذا نفعل هذا"، والاحتفاظ فقط بالأجزاء التي تصف ما يحدث الآن (مثل "قطع الشريان").
  3. قاموا بتصنيف كل ثانية من الفيديو يدوياً بـ المرحلة، و الخطوة، و الإجراء.

أعطى هذا الذكاء الاصطناعي "كتاباً مدرسياً" مثالياً حيث كل كلمة منطوقة مرتبطة بلحظة بصرية محددة ومكان محدد في القصة الجراحية.

النتائج: من فاز بالسباق؟

اختبر الباحثون SurgOnAig مقابل نماذج أخرى:

  • "نقاد الأفلام" (النماذج غير المتزامنة/Offline): نظرت هذه النماذج إلى الفيديو كاملاً أولاً. كانت بطيئة وغالباً ما تفوت التفاصيل الدقيقة للحدث المباشر.
  • "المذيع العام" (نماذج البث القياسية): كانت سريعة ولكنها لم تفهم هيكلية الجراحة. كانت تتحدث عن الخطوة الخاطئة أو تخطئ في تحديد المرحلة.
  • SurgOnAir: لأنه فهم التسلسل الهرمي (المراحل والخطوات) وكان يبث في الوقت الفعلي، كان الفائز الواضح. كان أفضل بكثير في وصف ما يحدث بالضبط في اللحظة التي يحدث فيها.

الخلاصة

SurgOnAir هو أول نظام يمكنه مشاهدة الجراحة حية، وفهم الصورة الكبيرة (المراحل) والتفاصيل الصغيرة (الإجراءات) في آن واحد، وسردها فوراً دون النظر إلى الأمام أبداً. إنه يشبه امتلاك مساعد طيار فائق الذكاء يعرف نص الجراحة ويمكنه إخبارك بما يحدث بالضبط في اللحظة التي يقع فيها.

ملاحظة: تركز الورقة البحثية بالكامل على إنشاء نظام السرد الفوري هذا ومجموعة البيانات لتدريبه. وهي لا تدعي أنها تقوم بإجراء الجراحة نفسها أو التنبؤ بالأفعال المستقبلية بما يتجاوز اللحظة الحالية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →