Explainable Hybrid ConvNeXt–Vision Transformer Model for Pneumonia Detection from Chest X-ray Images
تقترح هذه الورقة إطار عمل هجين للتعلم العميق قابل للتفسير يجمع بين ConvNeXt-Base وCBAM وVision Transformer (ViT-B/16)، والذي يحقق دقة فائقة في اكتشاف الالتهاب الرئوي (94.03%) وقدرة على التفسير في صور الأشعة السينية للصدر مقارنة بالنماذج المرجعية الحالية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل عالماً تكون فيه عيناك هما المحققين الأذكى، ولكن أحياناً، حتى أكثر المحققين حدة يحتاجون إلى القليل من المساعدة لرؤية ما لا يُرى. في عالم الطب، يستخدم الأطباء كاميرات خاصة تسمى الأشعة السينية (X-rays) للنظر داخل صدورنا، محاولين رصد غازٍ متسلل يسمى الالتهاب الرئوي. الالتهاب الرئوي هو عدوى في الرئة تجعل التنفس صعباً، واكتشافه مبكراً يشبه إخماد حريق قبل أن يحرق المنزل بأكمله. لكن الجزء الصعب هنا هو: أحياناً يكون الفرق بين الرئة السليمة والمصابة بالعدوى دقيقاً كهمسة في وسط عاصفة. ومن السهل حتى على الخبير البشري أن يغفل عن هذه الأدلة.
دخل عالم الذكاء الاصطنا artificial intelligence (AI)، وتحديداً فرع يسمى "التعلم العميق" (Deep Learning). فكر في التعلم العميق كطالب فائق الذكاء يتعلم من خلال النظر إلى آلاف الصور. عادةً، يستخدم هذا الطالب طريقتين رئيسيتين للدراسة: إحدى الطريقتين تشبه النظر إلى لوحة باستخدام عدسة مكبرة لرؤية ضربات الفرشاة الصغيرة (وهذا يسمى الشبكة العصبية التلافيفية، أو CNN)، والطريقة الأخرى تشبه التراجع للخلف لرؤية الصورة الكاملة وكيفية ارتباط الألوان ببعضها البعض (وهذا يسمى محول الرؤية، أو ViT). لفترة طويلة، تناظر العلماء حول أي طالب هو الأفضل. ولكن ماذا لو استطعنا بناء "طالب خارق" يقوم بالاثنين معاً في نفس الوقت؟ هذا بالضبط ما سعى إليه فريق من الباحثين من الجامعة الإسلامية الدولية في تشيتاغونج. لقد أرادوا إنشاء أداة لا تكتفي فقط بتخمين ما إذا كانت الرئة مريضة، بل تشرح أيضاً لماذا تعتقد ذلك، مما يساعد الأطباء على اتخاذ قرارات أسرع وأكثر أماناً.
السلاح السري للطالب الخارق
بنى الباحثون نموذجاً "هجيناً"، وهو طريقة منمقة لقول إنهم دمجوا عقلين مختلفين من الذكاء الاصطناعي لصنع عقل خارق واحد. نصف هذا العقل يعتمد على ConvNeXt، وهو ممتاز في رصد التفاصيل المحلية، مثل البقع الصغيرة الضبابية التي تظهر غالباً عندما تكون الرئة مصابة بالعدوى. أما النصف الآخر فهو محول الرؤية (ViT)، وهو بارع في فهم الصورة الكبيرة وكيفية اتصال أجزاء الرئة المختلفة ببعضها.
لكنهم لم يتوقفوا عند هذا الحد؛ فقد أضافوا آلية انتباه خاصة تسمى CBAM. تخيل هذا كأنه نظارات سحرية تخبر الذكاء الاصطناعي: "هي، انظر هنا، هذا الجزء مهم، تجاهل تلك الخلفية الضبابية". يساعد هذا النموذج على التركيز على الأماكن الدقيقة في الأشعة السينية التي تهم، مع تصفية الضجيج والتشويش.
لتعليم هذا العقل الخارق الجديد، لم يستخدم الفريق مجرد صور قليلة؛ بل جمعوا مكتبة ضخمة تضم 6,590 صورة أشعة سينية للصدر. بعضها أظهر رئتين سليمتين، والبعض الآخر أظهر التهاباً رئوياً. قاموا بتقسيم هذه المكتبة إلى ثلاث مجموعات: واحدة للتعلم (التدريب)، وواحدة للتحقق من الواجب المنزلي (التحقق)، وواحدة للامتحان النهائي (الاختبار). وقبل تغذية هذه الصور للذكاء الاصطناعي، استخدموا بعض الحيل لجعل البيانات أفضل، مثل قلب الصور جانبياً أو تغيير سطوعها، لكي لا يرتبك الذكاء الاصطناعي إذا بدت الصورة مختلفة قليلاً.
النتائج: بطل جديد
عندما حان وقت الامتحان النهائي، كانت النتائج مبهرة. حقق النموذج الهجين النتيجة الصحيمة بنسبة 94.03% من المرات. ولتضع ذلك في الاعتبار، فقد اختبروه مقابل بعض طلاب الذكاء الاصطناي الأفضل في الغرفة، مثل ResNet152 وMobileNetV2، وحتى محول الرؤية بمفرده. تفوق النموذج الهجين عليهم جميعاً، محققاً درجات أعلى في الدقة (Accuracy)، والضبط (Precision)، والاستدعاء (Recall).
لكن السحر الحقيقي لم يكن مجرد الدرجة؛ بل كان في "القابلية للتفسير". في الماضي، كانت نماذج الذكاء الاصطناعي مثل "الصناديق السوداء": تضع صورة الأشعة السينية، فتخرج لك نتيجة "نعم" أو "لا"، ولكن ليس لديك أدنى فكرة عن السبب. استخدم الباحثون تقنية تسمى Grad-CAM لتحويل عملية تفكير الذكاء الاصطناعي إلى خريطة حرارية ملونة. عندما رأى النموذج الالتهاب الرئوي، أضاءت الخريطة الحرارية المناطق المصابة بدقة في الرئة، متوهجة باللون الأحمر لتخبر الطبيب: "أنا قلقة بشأن هذه البقعة". وهذا أمر بالغ الأهمية لأنه يبني الثقة؛ إذ يمكن للطبيب النظر إلى الأشعة السينية، ورؤية البقعة الحمراء المتوهجة، ويقول: "آه، أنا أرى ما يراه الكمبيوتر"، بدلاً من الثقة العمياء في مجرد تخمين.
لماذا يهم هذا (وما لا يمثله)
تشير هذه الدراسة إلى أن الجمع بين أنواع مختلفة من عقول الذكاء الاصطناي، جنباً إلى جنب مع طريقة للتركيز على التفاصيل المهمة، يخلق أداة أكثر موثوقية لرصد الالتهاب الرئوي. أظهر النموذج أنه قادر على التمييز بين الرئات المريضة والسليمة بثقة عالية، محققاً دقة قدرها 95.01% واستدعاءً بنسبة 92.74%. ويرى الباحثون أن هذا النهج أفضل من استخدام نوع واحد فقط من النماذج لأنه يلتقط كلاً من التفاصيل الدقيقة والصورة الكبيرة.
ومع ذلك، فإن الورقة البحثية حريصة على ملاحظة أن هذا ليس علاجاً سحرياً بعد. فلا يزال النموذج يعاني قليلاً عندما يبدو الالتهاب الرئوي خفيفاً جداً أو عندما تكون الصور صعبة، كما أنه تم اختباره على مجموعة بيانات محددة. ويقترح المؤلفون أنه بينما تعد هذه خطوة واعدة نحو أداة تشخيص بمساعدة الكمبيوتر، إلا أن هناك حاجة لمزيد من العمل لجعلها مثالية لكل مستشفى في العالم. كما أشاروا إلى أن مجموعة البيانات، رغم ضخامتها، يمكن أن تكون أكبر وأكثر تنوعاً.
باختصار، لا تدعي هذه الورقة أنها حلت مشكلة الالتهاب الرئوي للأبد. بدلاً من ذلك، هي تقدم طريقة جديدة، قوية وشفافة، لمساعدة الأطباء على رؤية ما لا يُرى، مثبتةً أنه عندما تجمع بين أفضل ما في عالمي الذكاء الاصتالي المختلفين وتضيف القليل من "الانتباه"، فإنك تحصل على أداة ليست ذكية فحسب، بل سهلة الفهم أيضاً.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.