PolyDetect: A Quality-Aware Hybrid Deep Learning Framework for Robust Polyp Segmentation in Degraded Colonoscopy Images
يُعد PolyDetect إطار عمل هجين للتعلم العميق في الوقت الفعلي ومدرك للجودة، يدمج وحدة تقييم جودة الصور بدون مرجع مع تحسين تكيفي وتدريب موزون لتحقيق تقسيم قوي ومتطور للسلائل في صور تنظير القولون المتدهورة.
تحصد سرطانات القولون والمستقيم، كل عام، أرواحاً لا حصر لها، مما يجعلها واحدة من أكثر الأسباب شيوعاً للوفيات المرتبطة بالسرطان في جميع أنحاء العالم. وتتمثل الطريقة الأكثر فعالية لاكتشاف هذا المرض مبكراً في عملية تنظير القولون، وهي إجراء يستخدم فيه الطبيب كاميرا مرنة للنظر داخل القولون. وإذا تمكن الأطباء من إيجاد وإزالة نموات صغيرة تسمى "الزوائد اللحمية" قبل أن تتحول إلى خلايا سرطانية، فيمكنهم منع المرض تماماً. ومع ذلك، فإن الصور الملتقطة خلال هذه الإجراءات غالباً ما تكون بعيدة كل البعد عن المثالية؛ إذ تتحرك الكاميرا، وقد يكون الإضاءة خافتة أو غير متساوية، كما أن بث الفيديو غالباً ما يكون مضغوطاً، مما يؤدي إلى إنشاء صور ضبابية أو مشوشة. هذه العيوب البصرية تجعل من الصعب للغاية على البرامج الحاسوبية رصد الزوائد اللحمية، مما يؤدي إلى تشخيصات خاطئة. ولسنوات، حاول الباحثون بناء ذكاء اصطناعي يمكنه الرؤية من خلال هذه العيوب، لكن معظم الأنظمة تعاني عندما لا تكون الصور واضحة تماماً.
لقد طور فريق من الباحثين نظاماً جديداً يسمى "PolyDetect"، صُمم خصيصاً للتعامل مع هذه الصور الواقعية المليئة بالعيوب. وبدلاً من محاولة إجبار الكمبيوتر على تجاهل الأجزاء السيئة من الصورة، يعلم هذا النهج الجديد النظام كيف يقيم جودة ما يراه أولاً. يعمل النظام مثل "محرر دقيق": فهو ينظر إلى كل إطار، ويقرر مدى تدهور جودته، ثم يطبق القدر المناسب من التصحيح. فإذا كانت الصورة واضحة بالفعل، يتركها النظام دون تغيير لتجنب إدخال أخطاء جديدة. أما إذا كانت الصورة ضبابية أو مظلمة، يقوم النظام بتفتيحها، وتحسين التباين، وإزالة الضجيج قبل محاولة العثور على الزائدة اللحمية. وتتم عملية التوجيه هذه عبر "درجة الجودة"، وهي رقم بسيط يخبر الكمبيوتر بمدى حاجته للمساعدة.
قام الباحثون بتدريب هذا النظام على آلاف الصور، لكنهم لم يكتفوا بعرض صور مثالية عليه فحسب؛ بل صنعوا عمداً آلاف المتغيرات التي تحاكي المشكلات الموجودة في المستشفيات الحقيقية، مثل ضبابية الحركة، والضجيج الحبيبي، والإضاءة الضعيفة. ومن خلال تعريض النظام لهذه الظروف الصعبة أثناء تدريبه، تعلم الكمبيوتر التعرف على الزوائد اللحمية حتى عندما تكون الرؤية محجوبة. وكان جزء رئيسي من نجاحهم هو مكون خاص يركز على حواف الزوائد اللحمية؛ فبما أن الزوائد اللحمية غالباً ما تندمج مع الأنسجة المحيطة بها، فإن تحديد حدودها بدقة أمر بالغ الأهمية. لقد تم تعليم النظام أن يولي اهتماماً إضافياً لهذه الحواف، لضمان أن يتطابق الخط الخارجي الذي يرسمه الكمبيوتر للنمو مع الشكل الحقيقي قدر الإمكان.
وعند اختبار النظام على صور من مستشفيات مختلفة لم يسبق له رؤيتها، تفوق "PolyDetect" على الأساليب الحالية. فقد نجح في تحديد الزوائد اللحمية في الصور الصعبة ومنخفضة الجودة التي فشلت فيها الأنظمة الأخرى أو توقفت عن العمل. ووجد الباحثون أن الجزء الأهم في تصميمهم هو مكون "تحسين الحواف"؛ فبدونه، تنخفض دقة النظام بشكل كبير. كما اكتشفوا أن طريقتهم في تعديل الصورة بناءً على الجودة كانت فعالة للغاية، حيث حسنت النتائج للصور الأسوأ مع ترك الصور الجيدة دون تغيير. ويتميز النظام بالسرعة الكافية للعمل في الوقت الفعلي، حيث يعالج أكثر من خمسين صورة في الثانية على الأجهزة الطبية القياسية، مما يعني أنه يمكنه مساعدة الأطباء أثناء الإجراءات الحية دون إبطاء عملهم.
ورغم أن النتائج واعدة، إلا أن الباحثين يحرصون على ملاحظة أن نتائجهم تأتي من مجموعة محددة من الاختبارات، وأن هناك حاجة لمزيد من التحقق باستخدام بيانات متنوعة قبل اعتماد هذه التكنولوجيا على نطاق واسع في العيادات. وهم يؤكدون أن نهجهم لا يحل محل الطبيب، بل يعمل كأداة قوية للمساعدة في ضمان عدم تفويت أي زائدة لحمية بسبب جودة الصورة الضعيفة. ومن خلال الجمع بين طريقة ذكية لتقييم جودة الصورة وقدرة قوية على تحديد الحواف، يقدم هذا الإطار مساراً عملياً لجعل فحص سرطان القولون أكثر موثوقية، حتى عندما تكون الرؤية عبر الكاميرا بعيدة كل البعد عن المثالية.
ملخص تقني: PolyDetect
بيان المشكلة
يُعد سرطان القولون والمستقيم (CRC) سبباً رئيسياً للوفيات المرتبطة بالسرطان، حيث يمثل تنظير القولون وسيلة الفحص الأساسية. وبينما حققت نماذج التعلم العميق دقة تقسيم عالية في مجموعات البيانات المرجعية المنضبطة (مثل Kvasir-SEG)، فإن أداءها يتدهور بشكل كبير في البيئات السريرية الواقعية. فصور تنظير القولون في العالم الحقيقي غالباً ما تعاني من خمسة أنواع محددة من التدهور: ضبابية الحركة (motion blur)، والضجيج الغاوسي المضاف (additive Gaussian noise)، وانخفاض التباين (خاصة في السلائل المسطحة أو الجالسة)، وعيوب ضغط JPEG، وسوء الإضاءة.
تفتقر نماذج التقسيم الحالية المتطورة (مثل PraNet وSANet وPolyp-PVT) عموماً إلى آليات للتعامل صراحة مع حالات التدهور هذه. فهي عادةً ما تعامل جميع عينات التدريب بشكل موحد، بغض بغض النظر عن جودة الصورة، ولا تدمج تقييم جودة الصورة (IQA) في مسار التدريب أو الاستدلال. يؤدي هذا إلى فجوة في الأداء حيث تفشل النماذج المدربة على معايير نظيفة في التعميم على مجموعات البيانات المتدهورة والجديدة (zero-shot) مثل CVC-ColonDB وETIS-LaribPolypDB.
المنهجية: إطار عمل PolyDetect
يقترح المؤلفون PolyDetect، وهو إطار عمل هجين للتعلم العميق يعتمد على الجودة، مصمم لتقسيم السلائل (polyps) بمتانة في الصور المتدهورة. يدمج الإطار خمسة مكونات مترابطة وثيقة الصلة:
وحدة محاكاة التدهور (Degradation Simulation Module): أثناء التدريب، يتعرض النموذج لمحاكي تدهور خماسي الأنواع (الضبابية الغاوسية، الضجيج الغاوسي، انخفاض التباين، ضغط JPEG، وسوء الإضاءة) باحتمالية تطبيق تصل إلى 70%. يضمن ذلك أن تغطي توزيعات التدريب نطاقاً واقعياً من جودة الصور مع الاحتفاظ بعينات نظيفة.
وحدة تقييم جودة الصورة (IQA Module): تقوم وحدة ثنائية المسارات بحساب درجة جودة عددية q∈[0,1] لكل صورة.
مسار BRISQUE: يستخدم إحصائيات مقياس BRISQUE الكلاسيكي لتقييم جودة الصورة المكانية بدون مرجع.
مسار CNN خفيف الوزن: شبكة صغيرة (حوالي 16 ألف معلمة) تتعلم استرجاع ميزات الجودة.
الدمج: الدرجة النهائية هي متوسط مرجح بنسبة 50/50 لدرجة BRISQUE المعيارية ومخرجات الـ CNN.
خط أنابيب التحسين المتكيف الموجه بدرجة الجودة (Quality-Score-Gated Adaptive Enhancement Pipeline): بناءً على درجة IQA المتمثلة في q، يقوم النظام بتطبيق خط أنابيب تحسين ثلاثي المستويات بشكل انتقائي لتجنب المعالجة الزائدة للصور النظيفة:
ملاحظة: في التجارب المسجلة، تم استخدام DnCNN وفرع جودة الـ CNN مع تهيئة عشوائية (مرشحات ثابتة) بدلاً من التدريب المشترك، وذلك كإثبات لمفهوم آلية التوجيه (gating mechanism).
المُشفّر (Encoder): محول الرؤية الهرمي (PVT-v2-B2) مدرب مسبقاً على ImageNet-1K لالتقاط السياق العالمي.
المُفكك (Decoder): مُفكك من نوع U-Net يعتمد على الـ CNN مع اتصالات تخطي (skip connections) لاستعادة التفاصيل المكانية المحلية.
رأس صقل الحدود (Boundary Refinement Head): وحدة مخصصة مدربة على خرائط حواف مشتقة مورفولوجياً بسمك 1 بكسل لشحذ حدود السليلة، وهو أمر بالغ الأهمية لمقياس HD95.
خسارة مركبة مرجحة بالجودة (Quality-Weighted Composite Loss): تقوم دالة الخسارة بوزن مساهمة كل عينة بواسطة درجة جودتها q: L=mean[(LDice+LBCE+λb×LBoundary)×q] هذا يقلل من وزن العينات المتدهورة أثناء التدريب، مما يمنع النموذج من حفظ أنماط الضجيج.
المساهمات الرئيسية
حدد البحث ثلاث فجوات محددة في الأدبيات الحالية ويعالجها من خلال المساهمات التالية:
دمج IQA مباشر: أول إطار عمل لتقسيم السلائل يدمج إشارة IQA قابلة للتفاضل ومباشرة كمنظم للخسارة في وقت التدريب وآلية توجيه في وقت الاستدلال.
التحسين المتكيف: خط أنابيب مبتكر موجه بدرجة الجودة يمنع إدخال العيوب في الإطارات عالية الجودة عبر تطبيق التحسين فقط عند الضرورة.
التدريب المرجح بالجودة: مخطط لوزن الخسارة يقلل بشكل متناسب من مساهمة التدرج (gradient) للعينات المتدهورة.
البنية الهجينة: مزيج من السياق العالمي لـ PVT-v2 والتفاصيل المحلية للـ CNN، معزز برأس صقل حدود مورفولوجي.
اختبار متانة منهجي: بروتوكول تقييم لكل نوع من أنواع التدهور، مما كشف عن انخفاض الأداء في النماذج الحالية والتي لم تكن كمية سابقاً.
النتائج التجريبية
تم تدريب النموذج على 900 صورة من مجموعة بيانات Kvasir-SEG وتم تقييمه في وضع zero-shot على CVC-ColonDB (380 صورة) وETIS-LaribPolypDB (196 صورة).
الأداء: حقق PolyDetect أعلى متوسط لدرجة Dice (0.8066) وIoU (0.7262) عبر جميع مجموعات البيانات.
Kvasir-SEG: درجة Dice بلغت 0.9106 (متفوقاً على U-Net++ بنحو 11 نقطة مئوية).
CVC-ColonDB: درجة Dice بلغت 0.7543 (متفوقاً على SANet بنحو 0.9 نقطة مئوية).
ETIS-LaribPolypDB: درجة Dice بلغت 0.7548 (متفوقاً على SANet بنحو 5.8 نقطة مئوية).
الأهمية الإحصائية: كانت التحسينات مقارنة بالنماذج المرجعية القائمة على CNN (مثل U-Net وU-Net++) ذات دلالة إحصائية (p<10−10) عبر جميع مجموعات البيانات. وكانت التحسينات مقارنة بالنماذج المرجعية القائمة على الـ Transformer (مثل PraNet وSANet) ذات دلالة في بعض مقارنات zero-shot (على سبيل المثال، ETIS مقابل SANet، p=0.037) ولكنها لم تصمد أمام تصحيح Holm للتعددية في جميع الحالات.
المتانة: أظهر PolyDetect أفضل درجات Dice مطلقة عبر جميع أنواع التدهور الخمسة في CVC-ColonDB.
الكفاءة: يعمل النموذج بسرعة 53.62 إطاراً في الثانية (FPS) على وحدة معالجة رسومات Tesla T4 (بـ 27.35 مليون معلمة، و12.47 GFLOPs)، مما يلبي المتطلبات السريرية للوقت الفعلي (عادةً > 25 إطاراً في الثانية).
دراسات الاستئصال (Ablation Studies):
كان رأس صقل الحدود (Boundary Refinement Head) هو المكون الأكثر أهمية؛ حيث أدى إزالته إلى انخفاض قدره 6.47 نقطة مئوية في Dice.
ساهم خط أنابيب التحسين المتكيف بانخفاض قدره 2.39 نقطة مئوية عند إزالته.
ساهمت الخسارة المرجحة بالجودة بنقص قدره 0.75 نقطة مئوية.
أدت إزالة IQA والتحسين معاً إلى انخفاض قدره 3.62 نقطة مئوية.
الأهمية والادعاءات
يدعي البحث أن PolyDetect يوفر مساراً قابلاً للتطبيق لتقسيم السلائل بمتانة في صور تنظير القولون الواقعية والمتدهورة من خلال توحيد تقييم الجودة، والتحسين الموجه، والتدريب المرجح بالجودة في مسار واحد.
الأهمية السريرية: يحقق الإطار سرعات استدلال في الوقت الفعلي ويتفوق بشكل كبير على نماذج CNN القياسية في التعميم (zero-shot generalization)، مما يعالج فجوة "البيانات المرجعية المنضبطة مقابل النشر في العالم الحقيقي".
الادعاءات المتواضلة: يشير المؤلفون صراحةً إلى أنه بينما يعد الإطار واعداً، فإن النتائج الحالية تعتمد على بذرة عشوائية واحدة وبروتوكولات تقييم غير قياسية مقارنة ببعض طرق SOTA (التي تستخدم مجموعات تدريب مدمجة). ويذكرون أن الميزة مقارنة بالنماذج المرجعية القائمة على الـ Transformer (مثل SANet) ليست مثبتة تماماً دون التحقق من تعدد البذور (multi-seed validation)، وأن زمن التأخير النهائي (end-to-end latency) (بما في ذلك خطوات IQA والتحسين) يتطلب مزيداً من التحقق قبل النشر السريري.
العمل المستقبلي: يقترح البحث أن الإصدارات المستقبلية يجب أن تستخدم البروتوكولات القياسية، وتقسيمات البيانات المتعددة، والاستئصالات الكاملة، والاختبار الاستباقي مع بيانات سريرية خاصة للتحقق من هذه النتائج.