AnatomiX, an Anatomy-Aware Grounded Multimodal Large Language Model for Chest X-Ray Interpretation
يُعد AnatomiX نموذجاً لغوياً كبيراً جديداً متعدد الوسائط يتكون من مرحلتين، يعمل على تعزيز تفسير الأشعة السينية للصدر بشكل كبير من خلال دمج تحديد البنية التشريحية مع المهام اللاحقة، محققاً تحسينات في الأداء تتجاوز 25% في الاستدلال التشريحي والتأسيس مقارنة بالنهج الحالية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم مساعد آلي ذكي للغاية كيفية قراءة صورة أشعة سينية للصدر. تريد من هذا الروبوت ألا يكتفي فقط بإخبارك بما هو الخطأ (مثل "هناك التهاب رئوي")، بل تريده أيضًا أن يشير بدقة إلى مكان وجوده في الصورة، وأن يفهم الفرق بين الرئة اليسرى والرئة اليمنى.
المشكلة هي أن معظم نماذج الذكاء الاصطناعي الحالية تشبه الطلاب الذين حفظوا الإجابات لكنهم لم يفهموا الخريطة. إذا عرضت عليهم صورة أشعة طبيعية، فسيصلون إلى التشخيص الصحيح. ولكن إذا قلبت الصورة رأساً على عقب أو بدلت الجانب الأيسر والأيمن، فسيصابون بالارتباك. قد يقولون: "أوه، الالتهاب الرئوي في الجانب الأيسر"، بينما هو في الواقع في الجانب الأيمن، ببساً لأنهم يخمنون بناءً على الأنماط بدلاً من "رؤية" التشريح فعلياً.
يقدم هذا البحث نموذج AnatomiX، وهو نموذج ذكاء اصطناعي جديد مصمم لإصلاح ذلك عبر العمل بشكل أقرب إلى طبيب الأشعة الحقيقي.
إليك كيف يعمل AnatomiX، مقسماً إلى تشبيهات بسيطة:
1. الطريقة القديمة: "لعبة التخمين"
تنظر معظم نماذج الذكاء الاصطناعي إلى الأشعة السينية وتحاول تخمين الإجابة في قفزة واحدة ضخمة. ترى بقعة داكنة وتقول: "هذا التهاب رئوي". لكنها لا تعرف حقاً في أي رئة توجد هذه البقعة. الأمر يشبه محاولة العثور على منزل معين في مدينة بمجرد النظر إلى صورة ضبابية للحي بأكمله. إذا تم قلب الصورة، فقد تشير إلى المنزل الخطأ.
2. طريقة AnatomiX: "المحقق ذو الخطوتين"
يغير AnatomiX قواعد اللعبة عن طريق تقسيم المهمة إلى خطوتين متميزتين، تماماً كما يفعل الطبيب البشري.
الخطوة 1: "صانع الخريطة" (وحدة إدراك التشريح - Anatomy Perception Module)
قبل محاولة التشخيص، يمتلك AnatomiX أداة داخلية خاصة تسمى وحدة إدراك التشريح (APM). فكر في هذا كـ نظام تحديد مواقع (GPS) يقوم بمسح الأشعة السينية أولاً.
- هو لا ينظر فقط إلى الصورة بأكملها؛ بل يبحث خصيصاً عن 36 جزءاً مختلفاً من الجسم (مثل القلب، الرئة اليسرى، الرئة اليمنى، عظام الترقوة، إلخ).
- يرسم صناديق غير مرئية حولها ويقول: "حسناً، لقد وجدت الرئة اليسرى هنا، والرئة اليمنى هناك".
- ينشئ "خريطة" مفصلة لأجزاء الجسم قبل أن يحاول الإجابة على أي سؤال.
الخطوة قة 2: "الطبيب" (النموذج اللغوي الكبير - Large Language Model)
بمجرد أن يقوم "صانع الخريطة" بتحديد وتسمية جميع أجزاء الجسم، فإنه يسلم هذه المعلومات المنظمة إلى "الطبيب" (العقل الرئيسي للذكاء الاصطناعي).
- الآن، لا يضطر "الطبيب" لتخمين مكان الأشياء. ينظر إلى الخريطة ويقول: "آه، أرى أن المستخدم سأل عن الرئة اليسرى. الخريطة تخبرني أن الرئة اليسرى موجودة هنا. دعني أتحقق مما يحدث في هذا الصندوق المحدد".
- ولأن لدى "الطبيب" خريطة واضحة، فإنه لن يرتبك أبداً إذا تم قلب الصورة. فهو يعرف أن "اليسار" هو دائماً "اليسار"، بغض النظر عن كيفية توجيه الصورة.
3. خدعة "البطاقات التعليمية" (الاسترجاع التبايني - Contrastive Retrieval)
أحد أروع أجزاء AnatomiX هو كيفية تعلم ما يجب قوله عن كل جزء من أجزاء الجسم.
- تخيل أن لدى الذكاء الاصطناعي مكتبة ضخمة من البطاقات التعليمية. كل بطاقة تحتوي على صورة لجزء معين من الجسم (مثل "الرئة السفلية اليمنى") على جانب، ووصف طبي على الجانب الآخر (مثل "تظهر علامات وجود سوائل").
- عندما يرى AnatomiX أشعة سينية جديدة، فإنه يجد "الرئة السفلية اليمنى" على خريطته، ويجلب البطاقة التعليمية المطابقة من مكتبته، ويستخدم ذلك الوصف لمساعدة "الطبيب" في كتابة التقرير. هذا يضمن أن يستخدم الذكاء الاصطناعي المصطلحات الطبية الصحيحة للجزء الصحيح من الجسم.
لماذا يهم هذا؟
اختبر الباحثون هذا النموذج الجديد مقابل أفضل نماذج الذكاء الاصطناعي الحالية. وإليك ما حدث:
- اختبار "الصورة المقلوبة": عندما قلبوا الأشعة السينية من اليسار إلى اليمين، فشلت النماذج القديمة فشلاً ذريعاً، حيث خلطت بين اليسار واليمين. أما AnatomiX، فقد أصاب الهدف في كل مرة تقريباً لأنه فهم التشريح فعلياً، وليس مجرد الأنماط البصرية.
- اختبار "الإشارة": عندما طُلب منه رسم صندوق حول مرض معين، كان AnatomiX أكثر دقة بنسبة 25% من النماذج الأخرى.
- اختبار "التقرير": كتب تقارير طبية أفضل، كانت أكثر دقة وأسهل في الثقة من قبل الأطباء.
الخلاصة
AnatomiX يشبه ترقية روبوت من ببغاء (يكرر ما يسمعه) إلى جراح (يفهم بنية الجسم). من خلال إجبار الذكاء الاصطناعي على تحديد أين توجد أجزاء الجسم أولاً قبل محاولة تشخيصها، فإنه يحل أكبر مشكلة في الذكاء الاصطناዊ الطبي: الارتباك المكاني.
هذا يعني أنه في المستقبل، لن تكون مساعدات الذكاء الاصطناعي "ذكية" فقط في قراءة النصوص؛ بل ستكون ذكية في فهم جسم الإنسان، مما يجعلها أدوات أكثر أماناً وموثوقية للأطباء.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.