← أحدث الأبحاث
💻 computer science

MedMO: Grounding and Understanding Multimodal Large Language Model for Medical Images

يُعد MedMO نموذجاً تأسيسياً طبياً متعدد الوسائط يستفيد من وصفة تدريب متخصصة متعددة المراحل — تشمل التدريب المسبق عبر الوسائط، والضبط الدقيق للتعليمات متعدد المهام، والتعلم التعزيزي مع مكافآت قابلة للتحقق — لتحقيق أداء فائق في فهم الصور الطبية، والاستنتاج، والتمركز المكاني عبر مجالات سريرية متنوعة.

المؤلفون الأصليون: Ankan Deria, Komal Kumar, Adinath Madhavrao Dukre, Eran Segal, Salman Khan, Imran Razzak

نُشر 2026-03-13
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ankan Deria, Komal Kumar, Adinath Madhavrao Dukre, Eran Segal, Salman Khan, Imran Razzak

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك طالباً طبياً عبقرياً، قرأ كل الكتب في المكتبة، لكنه لم يسبق له رؤية مريض حقيقي أو حتى النظر إلى صورة أشعة سينية. هو يعرف كلمات مثل "الالتهاب الرئوي" و"الكسر"، ولكن إذا عرضت عليه صورة ضبابية لرئة، فقد يخمن بشكل عشوائي أو يختلق معلومات لأنه يفتقر إلى الخبرة الواقعية.

هذه هي مشكلة نماذج الذكاء الاصطناعي الحالية في الطب. إنها ذكية، لكنها غالباً ما "تهلوس" (تختلق أشياء من عندها) لأنها لم تُدرب خصيصاً على الواقع المعقد والمضطرب للصور الطبية.

إليك MedMO (المتعدد الوسائط الطبي المفتوح). فكر في MedMO ليس مجرد طالب، بل كـ متدرب فائق القدرة خضع لـ "معسكر تدريبي" صارم مكون من أربع مراحل ليصبح خبيراً في التشخيص.

إليك كيف يشرح البحث رحلة MedMO، باستخدام تشبيهات بسيية:

1. المشكلة: "العامّي" مقابل "المتخصص"

نماذج الذكاء الاصط�عي الحالية تشبه الأطباء العامين الذين قرأوا القليل عن كل شيء. هم بارعون في الدردشة عن الأفلام أو كتابة القصائد، ولكن عندما تعرض عليهم صورة مجهرية للبكتيريا أو صورة مقطعية لدماغ، فإنهم غالباً ما يتوهون. قد يقولون: "هذا يبدو كأنه ورم"، بينما هو في الواقع مجرد ظل، أو قد يتجاهلون كسراً تماماً.

بُني MedMO لعلاج هذه المشكلة. إنه متخصص تم تدريبه حصرياً على البيانات الطبية، وصُمم ليس فقط لـ "يتحدث" عن الطب، بل لـ "يرى" و"يفهم" الطب.

2. المعسكر التدريبي المكون من أربع مراحل

لم يقم الباحثون بمجرد إلقاء البيانات على النموذج؛ بل علموه في أربع مراحل متميزة، مثل رفع المستوى في لعبة فيديو:

  • المرحلة 1: مرحلة "المكتبة" (الضبط الدقيق لتعلم الإشراف الطبي العام)

    • التشبيه: تخيل المتدرب وهو يقرأ 18.5 مليون كتاب طبي ودراسة حالة.
    • ماذا حدث: تعلم النموذج الأساسيات. ربط الصور (مثل الأشعة السينية) بالنصوص (مثل ملاحظات الأطباء). تعلم أن البقعة الداكنة في صورة الرئة تعني عادةً "الالتهاب الرئوي"، وليس "سحابة". منح هذا النموذج أساساً هائلاً من المعرفة الطبية.
  • المرحلة 2: مرحلة "المجهر عالي الدقة" (التوطين/الربط)

    • التشبيه: الآن، يُسلم المتدرب مجهراً عالي القدرة ومسطرة. هو لا يقرأ فحسب، بل يشير أيضاً.
    • ماذا حدث: هذا هو الجزء الأكثر تميزاً في MedMO. تم تدريب النموذج على الإشارة إلى الأشياء. إذا سألته: "أين العظم المكسور؟"، لن يكتفي MedMO بالقول: "إنه في الذراع"، بل سيرسم مربعاً حول المكان الدقيق في الصورة. هذا يسمى "التوطين" (Grounding). إنه يجبر الذكاء الاصطناعي على أن يكون دقيقاً، وليس غامضاً.
  • المرحلة 3: مرحلة "جولات الأطباء" (ضبط التعليمات)

    • التشبيه: المتدرب الآن يرافق كبار الأطباء. يتعلم كيف يتحدث مثل الطبيب، كيف يلخص تاريخ المريض، وكيف يجيب على أسئلة محددة مثل: "هل هذا المريض آمن للجراحة؟"
    • ماذا حدث: تعلم النموذج اتباع تعليمات معقدة. تعلم كتابة تقارير طبية كاملة، وتلخيص النتائج، والإجابة على الأسئلة الصعبة، محاكياً الطريقة التي يفكر ويتواصل بها الأطباء البشر.
  • المرحلة 4: مرحلة "صافرة المدرب" (التعلم التعزيزي)

    • التشبيه: المتدرب الآن يخوض امتحاناً نهائياً، ولكن مع وجود مدرب يقف فوق رأسه. في كل مرة يشير فيها المتدرب إلى المكان الخطأ أو يكتب تشخيصاً خاطئاً، يعطيه المدرب "رنيناً" (عقوبة). وفي كل مرة يصيب، يحصل على "رنين" (مكافأة).
    • ماذا حدث: تدرب النموذج آلاف المرات. إذا رسم مربعاً حول عضو خاطئ، كان النظام يقول: "لا، هذا خطأ". وإذا أصاب الموقع الصحيح، حصل على مكافأة. هذا "المدرب" (التعلم التعزيزي) قام بضبط النموذج بدقة فائقة لاكتشاف الأمراض ورسم المربعات حولها.

3. النتائج: لماذا يعد MedMO تغييراً لقواعد اللعبة؟

اختبر الباحثون MedMO مقابل نماذج طبية رائدة أخرى (مثل Fleming-VL و Lingshu) وحتى بعض العمالقة مغلقة المصدر (مثل Gemini من Google و GPT-4 من OpenAI).

  • اختبار "العيون": عندما طُلب منه العثور على بكتيريا في صورة مجهرية أو كسر في صورة أشعة سينية، كان MedMO أفضل بكثير من الجميع. بينما كانت النماذج الأخرى تخمن أو ترسم مربعات في أماكن خاطئة، كان MedMO دقيقاً.
  • اختبار "الدماغ": عندما طُلب منه الإجابة على أسئلة طبية معقدة (مثل "ما هو أفضل علاج لهذه الحالة؟")، سجل MedMO درجات أعلى من جميع المنافسين مفتوحي المصدر تقريباً.
  • اختبار "التقرير": عندما طُلب منه كتابة تقرير طبي بناءً على صورة، كتب MedMO تقارير تبدو كأنها صادرة عن طبيب حقيقي وتحتوي على أخطاء أقل.

4. الصورة الكبيرة

فكر في MedMO كـ أول "خبير تشخيص" مفتوح المصدر.

قبل هذا، إذا كنت تريد ذكاءً اصطناعياً طبياً يمكنه رؤية صورة، والإشارة إلى المشكلة، وكتابة تقرير، كان عليك استخدام أنظمة مغلقة وباهظة الثمن (مثل GPT-4) لا يمكنك فحصها أو تعديلها. MedMO هو مفتوح المصدر، مما يعني أن أي مستشفى أو باحث أو مطور يمكنه تحميله، ودراسة كيفية عمله، واستخدامه للمساعدة في علاج المرضى.

باخت-الاختصار:
MedMO هو ذكاء اصطناعي طبي لم يكتفِ بحفظ الكتب المدرسية فحسب؛ بل دخل كلية الطب، وتعلم استخدام المجهر، وتدرب على الرسم فوق صور الأشعة السينية، وتدرب تحت إشراف معلم صارم حتى أصبح قادراً على تشخيص وتحديد المشكلات بشكل أفضل من أي نموذج مفتوح المصدر آخر متاح اليوم. إنه يسد الفجوة بين "التحدث عن الطب" و"الفهم الفعلي للصور الطبية".

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →