MedicalNarratives: Connecting Medical Vision and Language with Localized Narratives
تقدم هذه الورقة MedicalNarratives، وهي مجموعة بيانات واسعة النطاق تضم 4.7 مليون زوج من الصور والنصوص الطبية المستمدة من فيديوهات تعليمية على يوتيوب تتميز بآثار مؤشر الفأرة الموضعية للتمركز الزمكاني، والتي تُستخدم لتدريب نموذج GenMedClip الذي يحقق أداءً هو الأفضل في حالته عبر 12 مجالاً طبياً.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم روبوت كيفية فهم الصور الطبية، مثل الأشعة السينية أو فحوصات الرنين المغناطيسي. المشكلة هي أن الروبوتات "شرهة للبيانات"؛ فهي تحتاج إلى ملايين الأمثلة لتتعلم، ولكن على عكس صور القطط أو السيارات، لا تتوفر صور طبية مصنفة (موسومة) بالقدر الكافي. عادةً، لكي يفهم الروبوت جزءاً معيناً من الصورة، يتعين على الإنسان أن يرسم صندوقاً حوله أو يتتبع خطاً باستخدام الفأرة بجهد مضنٍ. القيام بذلك لملايين الصور هو أمر بطيء، ومكلف، وممل.
تقدم هذه الورقة حلاً ذكياً يسمى MEDICALNARRATIVES. وإليك كيف يعمل، مقسماً إلى مفاهيم بسيطة:
1. خدعة "الإشارة أثناء التحدث"
فكر في كيفية شرح المعلم لرسم توضيحي على السبورة البيضاء. هم لا يتحدثون فقط، بل يشيرون بأصابعهم إلى الجزء المحدد الذي يصفونه. يقولون: "انظر هنا إلى العظمة المكسورة"، بينما يحوم إصبعهم فوق الكسر.
أدرك الباحثون أن الخبراء الطبيين على يوتيوب يفعلون الشيء نفسه تماماً. فهم يسجلون فيديوهات تعليمية حيث يتحدثون عن مسح طبي لمريض بينما يحركون مؤشر الفأرة على المناطق المحددة التي يناقشونها.
بدلاً من توظيف آلاف الأشخاص لرسم صناديق يدوياً حول كل صورة، ذهب الفريق إلى يوتيوب وجمعوا هذه الفيديوهات. لقد تعاملوا مع حركة مؤشر الفأرة كأنها "إصبع رقمي". فعندما يقول المعلم: "هل ترى هذا الورم؟" ويحوم المؤشر فوقه، يسجل الكمبيوتر هذا الارتباط.
2. بناء "كتاب قصص" الطب
بنى الفريق مكتبة ضخمة (مجموعة بيانات) تحتوي على 4.7 مليون زوج من الصور والنصوص.
- النص: استخدموا الذكاء الاصطناعي للاستماع إلى الفيديوهات، وتفريغ ما قاله الأطباء، وتنقية المصطلحات الطبية المعقدة.
- الصورة: حصلوا على الإطارات (frames) المحددة التي كان ينظر إليها الأطباء.
- "الأثر": سجلوا بالضبط أين كان مؤشر الفأرة عندما نطق الطبيب بكلمات محددة.
يحتوي حوالي مليون من هذه الأزواج على "آثار الفأرة"، والتي تعمل كخريطة توضح الجزء المحدد من الصورة الذي يتحدث عنه النص. إنه يشبه امتلاك كتاب حيث، بدلاً من مجرد قراءة "السيارة الحمراء"، لديك قلم تحديد يشير فعلياً إلى السيارة الحمراء في الصورة.
3. "الطالب الروبوت" (GENMEDCLIP)
لاختبار ما إذا كانت هذه الطريقة تعمل بالفعل، قام الباحثون بتدريب نموذج ذكاء اصطناعي جديد يسمى GENMEDCLIP. يمكنك التفكير في هذا النموذج كطالب طب.
- التدريب: قاموا بتغذية هذا الطالب بـ 4.7 مليون مثال من أمثلة "الإشارة والتحدث".
- الاختبار: أعطوا الطالب سلسلة من الاختبارات الطبية (المعايير المرجعية) تغطي 12 مجالاً مختلفاً، من فحوصات القلب إلى حالات الجلد.
النتيجة: تفوق هذا الطالب الذي تدرب على فيديوهات "الإشارة" على جميع النماذج الرائدة السابقة. لقد كان أفضل في تحديد الأمراض وإيجاد الصورة الصحيحة عند إعطائه وصفاً. تشير الورقة إلى أن إضافة بيانات الفيديو (آثار الإشارة) جعلت النموذج أكثر ذكاءً بشكل ملحوظ مقارنة باستخدام النصوص والصور الثابتة وحدها.
4. لماذا هذا مهم (وفقاً للورقة)
تدعي الورقة أن هذا النهج يحل مشكلة رئيسية وهي: التأصيل (Grounding).
- الطريقة القديمة: يرى الروبوت صورة ويقرأ جملة، لكنه لا يعرف أي جزء من الصورة تشير إليه الجملة. الأمر يشبه قراءة وصفة طعام دون معرفة أي مكون هو المقصود.
- الطريقة الجديدة: لأن آثار الفأرة توضح هذا الارتباط، يتعلم الروبوت أن كلمة "كسر" ترتبط تحديداً بالخط المتعرج في صورة العظم.
كما أظهر الباحثون أنه يمكن تحويل آثار الفأرة هذه إلى "أقنعة" (masks) (أشكال تحدد الكائن) باستخدام أدوات أخرى موجودة. وهذا يعني أن البيانات يمكن استخدامها لتعليم الروبوتات مهاماً أكثر تعقيداً، مثل رسم الخطوط الخارجية للأورام أو الأعضاء تلقائياً، دون الحاجة إلى قيام البشر برسم كل خط يدويًا.
باختัด
تقول الورقة: "لقد وجدنا منجماً من البيانات المجانية عالية الجودة في يوتيوب، حيث يشير الأطباء إلى الصور الطبية أثناء شرحها. لقد حولنا هذه الفيديوهات إلى مجموعة بيانات ضخمة حيث يتطابق النص تماماً مع أجزاء محددة من الصورة. وعندما علمنا نموذج ذكاء اصطناعي جديداً باستخدام هذه البيانات، أصبح الأفضل في فهم الصور الطبية على الإطلاق، مما يثبت أن 'الإشارة أثناء التحدث' هي طريقة فعالة للغاية لتعليم الحواسيب."
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.