ThyroGuard-Net: A Sensitivity-Optimised, Explainable Hybrid CNN–Transformer Framework with Evidential Uncertainty for Thyroid Nodule Classification
تقدم هذه الورقة ThyroGuard-Net، وهو إطار عمل هجين يجمع بين EfficientNet وSwin Transformer تم تدريبه على مجموعة بيانات TN3K متعددة المراكز باستخدام فقدان مرجح بالحساسية، ويقين برهاني، وقابلية للتفسير قائمة على معايير TI-RADS، لتحقيق تصنيف قوي، وقابل للتعميم، ومعاير سريرياً لعقيدات الغدة الدرقية مع تحسين الحساسية مقارنة بالطرق الحالية.
المؤلفون الأصليون:Radwa Marzouk, Alhanof Almutairi, Munya A Arasi, Soha A. Bahanshal, Majed Nawaz, Sonia Choudhary
يعد سرطان الغدة الدرقية شكلاً شائعاً من هذا المرض، ويعتمد الأطباء بشكل كبير على صور الموجات فوق الصوتية (الألتراساوند) لرصد الكتل المشبوهة في الرقبة. وعندما تظهر عقدة، فإن الخطوة التالية المعتادة غالباً ما تكون خزعة بالأسطوانة الدقيقة، وهي إجراء يتم فيه أخذ عينة صغيرة من الخلايا وفحصها تحت المجهر. ومع ذلك، فإن هذه العملية ليست مثالية؛ إذ تعود نتيجة نحو حالة واحدة من كل خمس حالات من هذه العينات كحالة "غير محددة"، مما يعني أن الخلايا تبدو غريبة ولكنها ليست سرطانية بشكل واضح. يترك هذا المرضى في حالة صعبة من الحيرة: فلا يستطيع الأطباء التأكد مما إذا كانت الكتلة حميدة أم خطيرة، مما يؤدي غالباً إلى عمليات جراحية غير ضرورية لمجرد الاحتياط. لسنوات، حاول الباحثون استخدام الذكاء الاصطناعي للمساعدة في قراءة صور الموجات فوق الصوتية هذه، آملين في رصد علامات السرطان التي قد تخفى على العين البشرية. ومع ذلك، واجهت العديد من هذه البرامج الحاسوبية صعوبات عند انتقالها من المستشفى الذي بُنيت فيه إلى مستشفى آخر، حيث فشلت غالباً في التعرف على العقد في أجهزة مختلفة أو لدى مجموعات مختلفة من المرضى. كما أنها تميل إلى التركيز على الحصول على الدرجة الإجمالية الصحيحة، بدلاً من ضمان رصد كل حالة سرطان، وهو الهدف الأكثر أهمية في الطب.
يقدم دراسة جديدة نظاماً يسمى "ThyroGuard-Net"، صُمم لحل هذه المشكلات المحددة. فقد بنى الباحثون نموذجاً حاسوبياً هجيناً يجمع بين نوعين مختلفين من الذكاء الاصطناعي. يعمل جزء من النظام مثل عدسة مقربة، حيث يفحص الأنسجة والتفاصيل الدقيقة داخل العقدة، بينما يعمل الجزء الآخر مثل عدسة واسعة الزاوية، حيث ينظر إلى الشكل العام وكيفية استقرار العقدة ضمن الأنسجة المحيطة بها. ومن خلال السماح لهذين الجزأين بالتواصل مع بعضهما البعض، يخلق النظام فهماً أغنى بكثير للصورة مما يمكن لأي منهما تحقيقه بمفرده. والأهم من ذلك، وضع الفريق قاعدة محددة لهذا النظام: من المهم جداً رصد السرطان المختبئ أكثر من تصنيف كتلة حميدة عن طريق الخطأ على أنها خطيرة. هذا النهج يجبر الحاسوب على إعطاء الأولوية للحساسية، مما يضمن عدم إفلات حالات خطيرة من خلال الثغرات.
ولاختبار ما إذا كان بإمكان هذا النظام العمل في العالم الحقيقي، قام الباحثون بتدريبه على مجموعة كبيرة من صور الموجات فوق الصوتية من مستشفيات متعددة، ثم اختبروه على مجموعة أخرى مختلفة تماماً من الصور من مؤسسة منفصلة، دون إجراء أي تعديلات. كانت النتائج واعدة؛ ففي البيانات الجديدة وغير المرئية مسبقاً، حدد النظام العقد السرطانية بشكل صحيح بنسبة 88.5% تقريباً. ورغم أنه لا يوجد نظام مثالي، إلا أن هذا الأداء صمد جيداً حتى عندما جاءت البيانات من مصدر مختلف، مما يشير إلى أن النموذج تعلم العلامات الفعلية للمرض بدلاً من مجرد حفظ الخصائص المميزة لمعدات مستشفى واحد. ولعل الأهم من ذلك هو أن النظام يتضمن "مقياس عدم يقين" مدمجاً؛ فعندما يرى الحاسوب عقدة تكون محيرة للغاية بحيث لا يمكنه اتخاذ قرار واثق، فإنه لا يخمن، بل يصنف الحالة على أنها "غير محددة" ويحيلها إلى طبيب بشري لإلقاء نظرة ثانية. ويحدث هذا في حوالي 17% من الحالات، وهو معدل يحاكي الصعوبة التي يواجهها الأطباء في الواقع مع العينات غير المحددة.
كما جعلت الدراسة طريقة تفكير النظام مرئية؛ فبدلاً من مجرد إعطاء إجابة بـ "نعم" أو "لا"، يقوم النموذج بتسليط الضوء على الميزات المحددة التي استخدمها لاتخاذ قراره، مثل شكل العقدة أو نسيجها الداخلي، باستخدام نفس اللغة التي يستخدمها الأطباء في تقاريرهم. وهذا يسمح للمتخصص البشري بالتحقق من منطق الحاسوب. ومن خلال الجمع بين بنية "الدماغ المزدوج"، والتركيز على رصد كل حالات السرطان، وامتلاك وسيلة واضحة للاعتراف بعدم اليقين، يقدم هذا البحث أداة أكثر موثوقية لرعاية مرضى الغدة الدرقية. إنه يشير إلى أن مستقبل التشخيص الطبي لا يكمن في استبدال الأطباء، بل في إنشاء أنظمة تعرف حدودها وتُسلم أصعب الحالات إلى الخبراء البشريين، لضمان حصول المرضى على الرعاية المناسبة دون خوف أو جراحة غير ضرورية.
ملخص تقني: ThyroGuard-Net
بيان المشكلة يعد سرطان الغدة الدرقية أكثر أورام الغدد الصماء الخبيثة شيوعاً، ويتم تشخيصه عادةً عبر خزعة بالإبرة الدقيقة (FNA) تحت إرشاد الموجات فوق الصوتية. ومع ذلك، تواجه مسارات التشخيص الحالية قيوداً كبيرة: حيث تظهر حوالي 20-30% من عينات الخزعة (FNA) نتائج غير حاسمة خلوياً (Bethesda III–V)، مما يؤدي إلى عمليات جراحية غير ضرورية. علاوة على ذلك، تعاني نهج التعلم العميق (DL) الحالية لتصنيف عقد الغدة الدرقية من عدة فجوات حوسبية وإكلينيكية حرجة. وتكشف مراجعة الأدبيات من عام 2016 إلى 2026 أن معظم الدراسات تعتمد على مجموعات بيانات صغيرة ومن مركز واحد، مما يؤدي إلى ضعف القدرة على التعميم عبر المؤسسات وأجهزة الفحص المختلفة. وغالباً ما تعطي هذه النماذج الأولوية للدقة الإجمالية على حساب الحساسية (Sensitivity)، رغم أن تفويت تشخيص السرطان هو أمر أكثر تكلفة من الإنذار الخاطئ. بالإضافة إلى ذلك، تفتقر الطرق الحالية في كثير من الأحيان إلى التفسير القائم على أسس إكلينيكية (باعتمادها على خرائط حرارية فضفاضة بدلاً من واصفات TI-RADS المهيكلة) وتفشل في قياس عدم اليقين، مما يترك الحالات غير الحاسمة دون آلية للفرز البشري.
المنهجية: ThyroGuard-Net يقترح البحث إطار عمل ThyroGuard-Net، وهو نموذج هجين يجمع بين الشبكات العصبية الالتفافية (CNN) والمحولات (Transformer)، صُمم لمعالجة هذه القيود المحددة من خلال خط معالجة مكون من ثماني مراحل تم تدريبه على مجموعة بيانات TN3K (Thyroid Nodule 3000) والتحقق من صحته خارجياً على مجموعة بيانات DDTI دون إجراء ضبط دقيق (Fine-tuning).
المعالجة المسبقة: يستخدم خط المعالجة ترشيح الانتشار متباين الخواص (Perona–Malik diffusion filtering) لقمع ضوضاء "النمش" (Speckle noise) المتعددة مع الحفاظ على حواف عقدة الغدة. يتبع ذلك كاشف يعتمد على YOLO لتحديد منطقة الاهتمام (ROI)، ثم عمليات تعزيز البيانات (Augmentation) وأخذ عينات زائدة للفئات الأقلية لمعالجة عدم توازن الفئات.
استخراج الميزات ثنائي المسار:
مسار الـ CNN: يستخدم هيكل EfficientNet-B0 لالتقاط ملامح النسيج المحلية وتفاصيل التكلسات الدقيقة.
مسار الـ Transformer: يستخدم Swin Transformer لالتقاط الشكل العام، واستمرارية الحواف، والعلاقات السياقية طويلة المدى التي غالباً ما تفتقدها نماذج الـ CNN الصرفة.
دمج الانتباه المتقاطع (Cross-Attention Fusion): يتم دمج الميزات من كلا المسارين عبر آلية انتباه متقاطع متعلمة، حيث تعمل ميزات الـ CNN كاستعلامات (Queries) وميزات الـ Transformer كمفاتيح/قيم (Keys/Values). يسمح هذا للنموذج بإعادة وزن أدلة النسيج المحلية بناءً على السياق العالمي.
عنق الزجاجة المفاهيمي (Concept Bottleneck - القابلية للتفسير): يتم إسقاط التمثيل المدمج على "عنق زجاجة مفاهيمي" يتوافق مع واصفات TI-RADS (التركيب، الصدى، الشكل، الحافة، البؤر الصدوية). يوفر هذا مبررات مهيكلة وقابلة للقراءة من قبل الإكلينيكيين بدلاً من الخرائط الحرارية غير المنظمة.
دالة فقدان محسنة للحساسية: لإعطاء الأولوية لاكتشاف الخباثة، يستخدم النموذج دالة فقدان Focal-Tversky. تقوم هذه الدالة بتخصيص أوزان أعلى للسلبيات الكاذبة (حالات السرطان المفقودة) مقارنة بالإيجابيات الكاذبة، وتركز التدريب على الأمثلة الصعبة من الفئات الأقلية.
تقدير عدم اليقين بالدليل (Evidential Uncertainty Estimation): بدلاً من مخرجات softmax القياسية، يستخدم النموذج رأساً للتعلم العمدي بالدليل لنمذجة احتمالات الفئات كتوزيع ديليشليه (Dirichlet distribution). وهذا يولد درجة عدم يقين (u) لكل تنبؤ.
فرز الحالات غير الحاسمة: يتم توجيه الحالات ذات درجة عدم اليقين العالية (u>τ) تلقائياً إلى مسار "غير حاسم"، مما يستوجب مراجعة بشرية (مثل الخزعة أو الاختبار الجزيئي)، محاكياً بذلك سير العمل الإكلينيكي للعقد الغامضة.
طبقة التفسير: يدمج النظام Grad-CAM++ للتحديد على مستوى البكسل و SHAP للنسب المفاهيمي، مما يوفر قابلية تفسير ثنائية القنوات.
المساهمات الرئيسية يدعي البحث خمس مساهمات أساسية:
مراجعة شاملة: ملخص زمني مهيكل لدراسات تعلم الآلة/التعلم العميق للغدة الدرقية (2016–2026)، مع فهرسة صريحة لمحدودياتها فيما يتعلق بحجم البيانات، والتعميم، والحساسية.
تفكيك المشكلة: فصل واضح بين التحديات الإكلينيكية (عدم حسم الخلايا، قيود TI-RADS) والتحديات الحوسبية (الإفراط في التخصيص، عدم توازن الفئات، نقص تقدير عدم اليقين).
التوصية بمجموعة بيانات: تحديد مجموعة بيانات TN3K كمورد مثالي للموازنة بين مخاطر الإفراط في التخصيض، واحتياجات التعميم متعدد المراكز، والجدوى البحثية.
بنية مبتكرة: اقتراح إطار عمل موحد يدمج تعلم الهجين (CNN-Transformer)، وفقدان الحساسية الموزون، وعدم اليقين بالدليل، وعنق زجاجة مفاهيم TI-RADS.
التحقق التجريبي: بروتوكول تقييم صارم يختبر النموذج على TN3K (داخلياً) وعلى DDTI (خارجياً) دون ضبط دقيق، مما يثبت القدرة على التعميم عبر المؤسسات.
النتائج تم تقييم النموذج على مجموعة اختبار TN3K الداخلية (614 صورة) ومجموعة DDTI الخارجية (637 صورة).
التحقق الداخلي (TN3K): حقق 87.95% دقة، و91.46% حساسية، و85.60% نوعية (Specificity).
التحقق الخارجي (DDTI): حقق 84.30% دقة، و88.50% حساسية، و80.86% نوعية.
التعميم: كان الانخفاض في الدقة من الاختبار الداخلي إلى الخارجي لـ ThyroGuard-Net حوالي 3.65 نقطة مئوية. ويشير المؤلفون إلى أن هذا أقل بكثير من انخفاض الدقة البالغ 18 نقطة الملاحظ في الدراسات السابقة (مثل ThyroNet-X4، الذي انخفض من 85.6% إلى 67.0%) تحت منطق تقييم مماثل.
فرز عدم اليقين: قام وحدة عدم اليقين بتأجيل 13.03% من الحالات الداخلية و 16.95% من الحالات الخارجية كحالات "غير حاسمة". ويذكر المؤلفون أن هذه المعدلات تقع ضمن النطاق الإكلينيكي الممكن لعدم حسم Bethesda III–V في الواقع، رغم أنها أقل عددياً من الحد الأعلى لهذا النطاق.
أداء المجموعة الواثقة: عند استبعاد الحالات التي تم فرزها، تحسنت دقة المجموعة الواثقة إلى 91.76% (داخلياً) و 93.57% (خارجياً)، مما يشير إلى أن وحدة عدم اليقين تحدد بفعالية الحالات الغامضة.
جودة الفرز: احتوت سلة الحالات المفرزة على نسبة أعلى من حالات الخباثة الحقيقية (42.5% داخلياً، 48.1% خارجياً) مقارنة بالمعدلات الأساسية لمجموعات الاختبار، مما يشير إلى أن النموذج نجح في تحديد الحالات الغامضة عالية الخطورة.
الأهمية والادعاءات يفترض البحث أن ThyroGuard-Net يعالج "فجوة التعميم" و"مقايضة الحساسية والدقة" بشكل أكثر فعالية من النماذج المرجعية أحادية الآلية. ومن خلال الجمع بين التدريب المحسن للحساسية، وتفسير TI-RADS المهيكل، والفرز القائم على عدم اليقين، يقدم إطار العمل أداة قابلة للاستخدام إكلينيكياً لا تكتفي بالتصنيف فحسب، بل تحدد أيضاً الحالات التي تتطلب تدخلاً بشرياً. ويدعي المؤلفون أن قدرة النموذج على الحفاظ على حساسية عالية وانخفاض في خطأ التعميم عبر مؤسسات مختلفة (من TN3K إلى DDTI) دون ضبط دقيق، تثبت أن النموذج قد تعلم إشارات تشخيصية معلوماتية بدلاً من مجرد سمات خاصة بمجموعة البيانات. ويُقدم هذا العمل كخطوة نحو سد الفجوة بين الأداء الحوسبي والمنفعة الإكلينيكية في تصنيف عقد الغدة الدرقية.