← أحدث الأبحاث
💻 computer science

HMSViT: A Hierarchical Masked Self-Supervised Vision Transformer for Corneal Nerve Segmentation and Diabetic Neuropathy Diagnosis

تقترح الورقة البحثية نموذج HMSViT، وهو نموذج "Vision Transformer" هرمي يعتمد على التعلم الذاتي المقنع، والذي يستفيد من التدريب المسبق بالتقنيع الكتلي واستخراج الميزات متعدد المقاييس لتحقيق أداء رائد في تقسيم أعصاب القرنية وتشخيص اعتلال الأعصاب السكري، مع تقليل الاعتماد على البيانات المصنفة والتكاليف الحسابية.

المؤلفون الأصليون: Xin Zhang, Liangxiu Han, Yue Shi, Yanlin Zheng, Uazman Alam, Maryam Ferdousi, Rayaz Malik

نُشر 2026-02-17
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Xin Zhang, Liangxiu Han, Yue Shi, Yanlin Zheng, Uazman Alam, Maryam Ferdousi, Rayaz Malik

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

الصورة الكبيرة: إصلاح خريطة ضبابية

تخيل أنك طبيب يحاول تشخيص مريض يعاني من اعتلال الأعصاب السكري المحيطي (DPN). هذه حالة يتسبب فيها مرض السكري بتلف الأعصاب في القدمين والساقين، مما يؤدي غالباً إلى الألم أو التنميل، أو حتى بتر الأطراف إذا لم يتم اكتشافها مبكراً.

للعثور على هذا التلف، يستخدم الأطباء كاميرا خاصة تسمى التصوير المقطعي البؤري للقرنية (CCM). تلتقط هذه الكاميرا صوراً دقيقة للغاية للأعصاب الصغيرة في عينك (والتي تعمل كنافذة على صحة الأعصاب في جسمك).

المشكلة:
النظر إلى هذه الصور يشبه محاولة العثور على خيط محدد من المعكرونة (السباغيتي) داخل وعاء من الحساء وأنت ترتدي نظارات سميكة ضبابية.

  1. عمل شاق: يتعين على الأطباء تتبع كل ليفة عصبية يدوياً، وهو أمر يستغرق وقتاً طويلاً جداً.
  2. عدم الاتساق: قد يرى طبيب عصبًا ما، بينما يخطئه طبيب آخر.
  3. الذكاء الاصطناعي يعاني: كانت البرامج الحاسوبية السابقة (الذكاء الاصطناعي) إما بطيئة جداً، أو غير ذكية بما يكفي لرؤية الصورة الكاملة، أو كانت تحتاج إلى آلاف الأمثلة المصنفة (والتي لا يملك الأطباء الوقت لصنعها).

الحل: HMSViT
ابتكر المؤلفون نموذج ذكاء اصطناعي جديد يسمى HMSViT. فكر فيه كأنه محقق فائق الذكاء متعدد المستويات، يمكنه النظر إلى صور الأعصاب، والعثور على الخيوط الدقيقة، وإخبارك ما إذا كان المريض مريضاً، كل ذلك مع الحاجة إلى قدر ضئيل جداً من المساعدة من المعلمين البشر.


كيف يعمل HMSViT (التشبيه)

1. استراتيجية "عدسة الزووم" (التصميم الهرمي)

تخيل أنك تنظر إلى غابة من طائرة.

  • الذكاء الاصطناعي القياسي (CNNs): يشبه النظر عبر عدسة مكبرة. يرى الأوراق على شجرة واحدة بشكل جيد جداً، لكنه لا يستطيع رؤية شكل الغابة بأكملها أو كيفية اتصال الأشجار ببعضها.
  • نماذج Vision Transformers القديمة (ViTs): تشبه النظر إلى الغابة بأكملها من الفضاء. ترى الصورة الكبيرة، لكنها تفقد تفاصيل الأوراق الفردية.
  • HMSViT: هذا النموذج يشبه طائرة بدون طيار (درون) مزودة بعدسة زووم.
    • المستوى 1: يبدأ من القرب، حيث ينظر إلى التفاصيل الدقيقة لألياف الأعصاب (الأوراق).
    • المستوى 2 و3: يقوم بعمل "زووم للخلف" ببطء، ويجمع تلك التفاصيل معاً ليرى كيف تتفرع الأعصاب وتتصل.
    • المستوى 4: يبتعد تماماً ليرى الشبكة بأكملها (الغابة).
    • لماذا هذا مهم؟ من خلال القيام بذلك، يلتقط النموذج كلاً من ألياف الأعصاب الصغيرة والهشة والصورة الكبيرة لكيفية تضرر الأعصاب، دون أن يرتبك أو يصبح بطيئاً.

2. لعبة "التغطية" (التعلم الخاضع للإشراف الذاتي)

عادةً، لتعليم الكمبيوتر التعرف على الأعصاب، تحتاج إلى إنسان يرسم خطوطاً على آلاف الصور قائلاً: "هذا هو العصب". وهذا أمر مكلف وبطيء.

يستخدم HMSViT حيلة تسمى التعلم الخاضع للإشراف الذاتي (Self-Supervised Learning).

  • التشبيه: تخيل أنك تحاول تعلم كيفية عمل لغز (بازل). بدلاً من إعطائك الصورة الموجودة على الصندوق، يقوم شخص ما بتغطية 75% من قطع اللغز بقطعة قماش سوداء.
  • المهمة: على الذكاء الاصطناعي النظر إلى القطع المرئية وتخمين كيف تبدو القطع المخفية.
  • النتيجة: من خلال لعب لعبة "خمن الجزء المفقود" هذه مراراً وتكراراً مع ملايين الصور غير المصنفة، يتعلم الذكاء الاصطناعي بنية الأعصاب من تلقاء نفسه. يتعلم قائلاً: "أوه، الأعصاب عادة ما تتفرع بهذا الشكل"، دون أن يخبره إنسان بذلك أبداً.
  • الابتكار: لم يقم المؤلفون بتغطية بكسلات عشوائية فحسب؛ بل قاموا بتغطية كتل (Blocks) من الصورة. هذا يجبر الذكاء الاصطناعي على فهم المشهد (بنية العصب) بدلاً من مجرد تخمين ألوان عشوائية.

3. "الدماغ المزدوج" للانتباه

يمتلك النموذج طريقتين لتركيز الانتباه:

  • الانتباه المحلي (Local Attention): في المراحل الأولى، يركز بكثافة على مجموعات صغيرة من البكسلات (مثل محقق ينظر بتمعن إلى بصمة إصبع واحدة).
  • الانتباه العالمي (Global Attention): في المراحل اللاحقة، ينظر إلى الصورة بأكملها لفهم السياق (مثل محقق ينظر إلى مسرح الجريمة بأكمله).
    هذا يوفر قدرة الحوسبة لأنه لا يحاول النظر إلى كل بكسل وعلاقته بكل بكسل آخر في نفس الوقت.

النتائج: لماذا يجب أن نهتم؟

اختبر الباحثون HMSViT على بيانات حقيقية لمرضى من المملكة المتحدة. وإليك ما حدث:

  1. إنه طبيب أفضل: قام بتشخيص اعتلال الأعصاب السكري بدقة بلغت 85.6%. وهذا أفضل من أفضل النماذج السابقة (Swin Transformer و HiViT).
  2. إنه متتبع أفضل: عندما طُلب منه رسم الأعصاب، نجح في رسم 61.34% منها بشكل صحيح (وهو مقياس يسمى mIoU)، متفوقاً على المنافسين بفارق ملموس.
  3. إنه فعال: فعل كل هذا بينما استخدم 4فاقد من الموارد الحاسوبية (المعلمات/Parameters) مقارنة بالنماذج الرائدة الأخرى.
    • التشبيه: تخيل سيارة رياضية توفر استهلاك الوقود بشكل أفضل من الشاحنة بينما لا تزال أسرع منها. HMSViT هو تلك السيارة؛ فهو أخف، وأسرع، ويؤدي المهمة بشكل أفضل.

الخلا-صة

تقدم هذه الورقة أداة ذكاء اصطناعي جديدة تعمل مثل طائرة بدون طيار ذكية متعددة المستويات تتعلم من خلال لعب ألعاب "خمن الجزء المفقود". يمكنها النظر إلى صور العين، وتتبع ألياف الأعصاب الدقيقة، وتشخيص مضاعفات السكري بشكل أسرع وأكثر دقة من الطرق الحالية، وكل ذلك مع الحاجة إلى مساعدة بشرية أقل للتعلم.

هذه خطوة كبيرة للأمام لأنها قد تسمح للأطباء في النهاية بفحص آلاف المرضى بحثاً عن تلف الأعصاب بسرعة، وبتكلفة منخفضة، وبدقة عالية، مما يمنع المضاعفات الخطيرة مثل بتر الأطراف.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →