Multi-view deep learning for classification of maxillary canine impaction severity using CBCT-derived images
طورت هذه الدراسة وقيمت نموذج تعلم عميق من نوع (DenseNet-121) متعدد الرؤى باستخدام صور مشتقة من التصوير المقطعي المحوسب بحزمة مخروطية (CBCT) من أربعة منظورات لتصنيف شدة انطمار الناب العلوي بدقة، محققةً دقة إجمالية بلغت 91.2% ومبرهنةً على إمكاناته في دعم التدخل التقويمي المبكر.
المؤلفون الأصليون:Yujue Wang, Jason Lai, Andong Hua, Debbie Ferng, Jae Hyun Park, Yan Wang, Karolina Elżbieta Kaczor-Urbanowicz
في المشهد المعقد للأسنان البشرية، تحتل الأنياب العلوية مكانة فريدة وغالباً ما تكون مثيرة للمتاعب. فهذه الأسنان، الضرورية لتمزيق الطعام وتشكيل الابتسامة، هي ثاني أكثر الأسنان عرضة للانحشار بعد أضراس العقل. ولأنها تسلك مساراً طويلاً ومتعرجاً للوصول إلى مكانها النهائي، فإنها غالباً ما تُحاصر داخل عظم الفك أو أنسجة اللثة، وهي حالة تُعرف باسم "الانحشار". وعندما يحدث هذا، لا يستطيع السن البروز من تلقاء نفسه، وإذا تُرِك دون علاج، يمكن أن يتسبب في تكوّن أكياس، أو إلحاق الضرر بجذور الأسنان المجاورة، أو تعطيل اصطفاف القوس السني بأكمله. ولحل هذه المشكلة، يعتمد أخصائيو تقويم الأسنان على التصوير لرؤية مكان السن بدقة ومدى انحشاره. وبينما تُعد الأشعة السينية التقليدية ثنائية الأبعاد شائعة، فإن المسح الأكثر تفصيلاً ثلاثي الأبعاد، والذي يُسمى التصوير المقطعي المحوسب بالحزمة المخروطية (CBCT)، يوفر رؤية أوضح لموقع السن في الفراغ. ومع ذلك، فإن تفسير هذه المسوحات التفصيلية يتطلب وقتاً وخبرة كبيرة، كما أن الإشعاع المتضمن يعني ضرورة توخي الأطباء الحذر عند استخدامها.
لقد وضع فريق من الباحثين هدفاً يتمثل في معرفة ما إذا كان الذكاء الاصطناعي يمكنه المساعدة في اجتياز هذا التحدي التشخيصي. فقد طوروا نظاماً حاسوبياً مصمماً لفحص مسوحات (CBCT) وتحديد مدى شدة انحشار الناب تلقائياً. وبدلاً من محاولة معالجة الحجم ثلاثي الأبعاد الكامل للفك دفعة واحدة، وهو أمر مجهد حاسوبياً، اتبع الباحثون نهجاً مختلفاً؛ حيث قاموا بتقسيم المسح ثلاثي الأبعاد إلى أربعة مناظر مألوفة يستخدمها أطباء الأسنان بالفعل: منظر بانورامي للفك بأكمله، ومنظر أمامي من الأمام، ومنظر جانبي، ومقطع عرضي يمر عبر السن. ثم قاموا بتدريب نموذج تعلم عميق، وهو نوع من البرامج الحاسوبية المستوحاة من الدماغ البشري، للنظر إلى كل صورة من هذه الصور الأربع بشكل منفصل وتحديد ما إذا كان السن يبزغ بشكل طبيعي، أو منحشراً بشكل طفيف، أو منحشراً بشكل شديد.
ركزت الدراسة على 74 مريضاً، حيث فحصت 148 سناً من الأنياب العلوية في المجمل. ولكل سن، أنتج الباحثون 592 صورة متميزة عبر المناظر الأربعة المختلفة. قام خبراء بشريون أولاً بتصنيف هذه الصور، حيث صنفوا كل سن على أنه ذو بروز طبيعي، أو انحشار طفيف، أو انحشار شديد بناءً على زوايا وتداخلات محددة ظاهرة في المسوحات. ثم تم تعليم النموذج الحاسوبي كيفية التعرف على هذه الأنماط. وعندما اختبر الباحثون النموذج، وجدوا أن النظر إلى المناظر الأربعة معاً كان أكثر فعالية بكثير من النظر إلى منظر واحد فقط. فمن خلال دمج المعلومات من الصور البانورامية، والأمامية، والجانبية، والعرضية، نجح النظام في تصنيف شدة الانحشار بدقة بلغت 91.2% من المرات. وقد أثبت هذا النهج متعدد المناظر تفوقه على أي نوع منفرد من الصور؛ فعلى سبيل المثال، بينما كان المنظر البانورامي وحده جيداً جداً بدقة بلغت 88.5%، إلا أن المنظر الأمامي وحده واجه صعوبة، حيث حقق دقة 74.3% فقط.
أظهرت النتائج أن النظام كان موثوقاً بشكل خاص في تحديد الحالات القصوى: الأسنان التي تبرز بشكل طبيعي والأسنان المنحشرة بشدة. فقد حدد الحالات الطبيعية بشكل صحيح بنسبة 93.4% والحالات الشديدة بنسبة 91.5%. والأهم من ذلك، لم يرتكب النموذج الخطأ الخطير المتمثل في وصف سن منحشر بشدة بأنه "طبيعي" أو سن طبيعي بأنه "شديد". وكانت الفئة الأكثر صعوبة بالنسبة للحاسوب هي المنطقة الوسطى المتمثلة في الانحشار الطفيف، حيث كان صحيحاً في حوالي 77% من الحالات. ويرجع ذلك على الأرجح إلى أن الحالات الطفيفة تبدو مشابهة جداً للأسنان الطبيعية في الأشعة السينية، مما يجعل تمييزها صعباً حتى على البشر. وأشار الباحثون إلى أن النظام ركز على نفس الأجزاء التي يركز عليها المتخصص البشري، وتحديداً طرف الناب وجذور الأسنان المجاورة، مما يشير إلى أن الحاسوب كان يتعلم السمات الصحيحة بدلاً من التخمين.
يُظهر هذا العمل أن الذكاء الاصطناعي يمكن أن يعمل كمساعد قوي في تقويم الأسنان، قادراً على تركيب زوايا متعددة من المسح لتوفير تقييم ثابت وسريع لانحشار الأسنان. ورغم أن النموذج ليس بديلاً لطبيب الأسنان، إلا أنه يقدم وسيلة لفحص المرضى بكفاءة أكبر وتحديد الحالات التي تحتاج إلى اهتمام فوري. وقد أكد الباحثون أنه لكي يتم استخدام هذه الأداة في العيادات الواقعية، ستحتاج إلى اختبارها على مجموعات أكبر من الناس من مواقع مختلفة ومع أنواع مختلفة من أجهزة المسح. وحتى ذلك الحين، يظل النظام بمثابة إثبات مفهوم واعد، يوضح أنه من خلال تقسيم مشكلة معقدة ثلاثية الأبعاد إلى قطع ثنائية الأبعاد مألوفة، يمكن للحواسيب أن تتعلم رؤية المشكلات السنية بدرجة عالية من الدقة، مما قد يساعد في اكتشاف المشكلات مبكراً وتوجيه خطط علاجية أفضل.
بيان المشكلة يُعد انطمار الناب الفكي العلوي ثاني أكثر أنواع انطمار الأسنان شيوعاً، وغالاً ما يؤدي إلى مضاعفات مثل تكوّن الكيسات، وامتصاص جذور الأسنان المجاورة، وتضرر القوس السني إذا تُرك دون علاج. وبينما توفر التصوير المقطعي المحوسب بالحزمة المخروطية (CBCT) بيانات مكانية ثلاثية الأبعاد عالية الدقة ضرورية للحالات المعقدة، إلا أن استخدامه الروتيني محدود بسبب التكلفة والتعرض للإشعاع. وفي المقابل، تظل الصور ثنائية الأبعاد التقليدية (الأشعة البانورامية والأسنان الرأسية) هي الوسيلة الأولى المتاحة، لكنها تفتقر إلى التفاصيل الحجمية اللازمة للتقييم الدقيق للشدة. وقد ركزت معظم الأبحاث في مجال الذكاء الاصطناعي (AI) في تقويم الأسنان على اكتشاف العلامات والقياسات، مع تطبيق محدود على تصنيف شدة انطمار الأنياب باستخدام بيانات CBCT الحجمية، والتي تفرض تحديات حوسبية.
المنهجية طورت هذه الدراسة الاستعادية إطار عمل للتعلم العميق متعدد الرؤى لتصنيف شدة انطمار الناب الفكي العلوي (طبيعي، طفيف، شديد) باستخدام صور مشتقة من CBCT ثنائية الأبعاد.
الحصول على البيانات والمعالجة المسبقة: استخدمت الدراسة مسوحات CBCT لـ 74 مريضاً (148 ناباً فكياً علوياً) تم الحصول عليها عبر ماسح NewTom NT5G. أُعيد بناء بيانات DICOM الخام إلى أربع رؤى قياسية ثنائية الأبعاد باستخدام إعادة البناء متعدد المستويات (MPR): بانورامية، رأسية أمامية، رأسية جانبية، وشرائح مقطعية عرضية. تم قص كل رؤية إلى منطقة بمساحة 224 × 224 بكسل متمركزة حول الناب والقاطع المجاور.
التوسيم (Annotation): قام فاحصان مستقلان بقياس مواضع الأنياب، وحُلّت الخلافات بواسطة خبير ثالث. تم تعيين الملصقات بناءً على المعايير الإشعاعية:
البانورامية: مستوحاة من تصنيف Warford (القطاع I: طبيعي؛ القطاع II: طفيف؛ القطاعات III/IV: شديد).
الصور الرأسية الأمامية/الجانبية والمقاطع العرضية: تم تقييم الإزاحة المستعرضة، والزاوية، والموضع العمودي، والتداخل الدهليزي اللساني.
التوسيم النهائي: تم تطبيق "قاعدة تجميع الشدة القصوى" على مستوى السن؛ فإذا تعارضت الرؤى، فإن الملصق الأكثر شدة الملاحظ عبر الرؤى الأربع هو الذي يحدد الحقيقة الأرضية (Ground Truth).
بنية النموذج: استخدم النظام شبكة عصبية تلافيفية (CNN) من نوع DenseNet-121، مدربة مسبقاً على ImageNet وتم ضبطها بدقة لهذه المهمة.
استراتيجية التدريب: تم تدريب النماذج باستخدام مُحسن AdamW مع عينة مرجحة لمعالجة عدم توازن الفئات (تحديداً ندرة حالات الانطمار الطفيف). استُخدمت دالة فقد رتبيّة (CORAL) لاحترام الترتيب الطبيعي للشدة (طبيعي < طفيف < شديد).
دمج الرؤى المتعددة: تم إنشاء تنبؤات لكل رؤية بشكل مستقل، ثم جُمعت هذه المخرجات باستخدام مصنف Gaussian Naive Bayes (GNB) لإنتاج تشخيص نهائي على مستوى السن.
التقييم: تم تقييم الأداء باستخدام التحقق المتقاطع خماسي الطيات (five-fold cross-validation) المصنف حسب فئة الشدة. شملت المقاييس الدقة، والحساسية، والنوعية، والدقة التنبؤية، ومتوسط المساحة تحت المنحنى (AUC)، ومعامل كوهين كابا الموزون تربيعياً.
النتائج الرئيسية
الأداء العام: حقق النموذج متعدد الرؤى دقة على مستوى السن بلغت 91.2%، ومتوسط مساحة تحت المنحنى (AUC) قدره 0.94، ومعامل كوهين كبا الموزون تربيعياً قدره 0.95.
الرؤية الواحدة مقابل الرؤى المتعددة: تفوق دمج الرعدد من الرؤى بشكل كبير على الرؤى الفردية. كانت الرؤية البانورامية هي الوسيلة الأكثر إفادة (دقة 88.5%، AUC 0.94)، تلتها المقطعية العرضية (80.4%)، ثم الرأسية الجانبية (79.7%)، وأخيراً الرأسية الأمامية (74.3%).
الأداء حسب الفئة:
البزوغ الطبيعي: حساسية عالية (93.4%) ونوعية عالية (98.6%).
الانطمار الشديد: حساسية عالية (91.5%) ودقة تنبؤية عالية (96.4%). والأهم من ذلك، لم تسجل أي أخطاء تصنيف قصوى (لم يتم تصنيف الأنياب الطبيعية على أنها شديدة، ولا الشديدة على أنها طبيعية).
الانطمار الطفيف: كانت هذه الفئة هي الأكثر تحدياً، مع حساسية أقل (76.9%) ودقة تنبؤية أقل (50.0%)، ويُعزى ذلك إلى صغر حجم العينة (13 حالة) والتشابه الإشعاعي مع البزوغ الطبيعي.
تحليل الخطأ: تركزت أخطاء التصنيف بشكل أساسي في فئات الشدة المتجاورة. وأكدت خرائط التنشيط الطبقي المرجحة بالتدرج (Gradient-weighted class activation maps) أن النموذج ركز على السمات التشريحية ذات الصلة سريرياً، وتحديداً طرف تاج الناب وجذر القاطع المجاور.
المساهمات الرئيسية
استراتيجية الرؤية 2D متعددة النواحي: تقترح الدراسة مسار عمل فعال حوسبياً يستخرج رؤى 2D من أحجام CBCT ثلاثية الأبعاد، مستفيدة من الشبكات العصبية التلافيفية القياسية دون العبء الحوسبي الكبير للمعالجة ثلاثية الأبعاد الكاملة.
التصنيف المدرك للترتيب: من خلال استخدام دالة فقد CORAL، يأخذ النموذج في الاعتبار صراحةً الطبيعة المرتبة للشدة، حيث يعاقب على الأخطاء التصنيفية القصوى بشكل أكبر من الأخطاء بين الفئات المتجاورة.
التكامل مع سير العمل السريري: يجسد الإطار الفجوة بين الصور الإشعاعية السريرية ثنائية الأبعاد وبيانات CBCT ثلاثية الأبعاد، مما يوفر أداة يمكنها العمل على مجموعات بيانات CBCT وكذلك على الصور ثنائية الأبعاد المستقلة الشائعة في ممارسات تقويم الأسنان.
التطوير الشفاف: توضح الدراسة مسار عمل قابلاً لإعادة الإنتاج يتضمن تسميات محددة من قبل الخبراء وتعاوناً بين التخصصات، بهدف تقليل تصور "الصندوق الأسود" للذكاء الاصطناعي في طب الأسنان.
الأهمية والادعاءات يزعم المؤلفون أن نموذج الشبكة العصبية التلافيفية متعدد الرؤى هذا يعمل كملحق موثوق للكشف المبكر وتقييم شدة انطمار الناب الفكي العلوي. يُظهر النظام توافقاً عالياً مع التشخيص الخبير، لا سيما في التمييز بين البزوغ الطبيعي والانطمار الشديد، وهو أمر بالغ الأهمية للتدخل في الوقت المناسب.
تؤكد الورقة أن النموذج ليس بديلاً عن الخبرة السريرية، بل هو أداة لدعم القرار. وتسلط الضوء على إمكانية استخدام علماء الأسماك لهذا التنبيه الآلي للشدة في فرز الحالات، مما قد يقلل من الأعباء الجراحية التي يمكن تجنبها ويحسن نتائج العلاج. ومع ذلك، يحافظ المؤلفون على موقف متواضع، معترفين بالقيود مثل مجموعة البيانات أحادية المركز، وعدم توازن الفئات لحالات الانطمار الطفيف، والحاجة إلى تحقق مستقبلي متعدد المراكز قبل التطبيق السريري. ويؤكدون أن الإشراف السريري يظل ضرورياً، خاصة في الحالات الحدية وتفسير تصنيفات الانطمار الطفيف.