Insulator Defect Detection Based on Multi-Scale Perception and Context-Guided Feature Aggregation
لمعالجة تحديات تباين الحجم، وضعف الأنسجة، وتشابه الخلفية في الكشف عن عيوب العوازل باستخدام الطائرات بدون طيار، تقترح هذه الورقة شبكة تجميع السياق المدركة للمقياس (SACANet)، والتي تدمج تجميع المجال الاستقبالي المدرك للمقياس، وصقل الميزات ثنائي الاتجاه رباعي المقاييس، والتنبؤ متعدد المقاييس المتوافق مكانيًا لتحقيق أداء رائد على مجموعة بيانات FLOWID.
المؤلفون الأصليون:Dongqi Zhang, Xiaoxia Liu, Zainura Idrus, Shuai Liu
تحلق الطائرات المسيرة غير المأهولة عالياً فوق الأرض على طول الشبكات الواسعة لخطوط الطاقة التي تنقل الكهرباء إلى المدن والبلدات. وتتمثل مهمتها في رصد الأضرار في العوازل السيراميكية التي تثبت هذه الأسلاك الثقيلة في مكانها. وتعد هذه العوازل بالغة الأهمية؛ فإذا تشققت أو انكسرت، يمكن أن تنهار شبكة الطاقة، مما يؤدي إلى انقطاع التيار الكهربائي أو نشوب حرائق كهربائية خطيرة. ومع ذلك، فإن اكتشاف هذه العيوب أمر صعب للغاية بالنسبة للكمبيوتر للقيام به تلقائياً. فغالباً ما تلتقط الكاميرات الموجودة على الطائرات المسيرة صوراً من مسافات بعيدة، مما يجعل الشقوق الصغيرة تبدو وكأنها مجرد ذرات غبار. علاوة على ذلك، تكون الخلفية عادةً مزدحمة بالهيكل المعدي للبرج، والأسلاك نفسها، وأنسجة الأشجار والسماء، وكلها أشياء يمكن أن تبدو مشابهة بشكل مريب للعيب. وعندما يحاول الكمبيوتر تحليل هذه الصور، فإنه غالباً ما يبسط الصورة لتسهيل معالجتها، ولكن في القيام بذلك، فإنه يمحو عن طريق الخطأ الأدلة الباهتة جداً اللازمة لرصد قطعة مكسورة.
ولحل هذه المشكلة، طور فريق من الباحثين من جامعات في الصين وماليزيا نظام رؤية حاسوبية جديداً يسمى SACANet. وبدلاً من التعامل مع الصورة كصورة مسطحة واحدة، تم تصميم هذا النظام لينظر إلى الصورة في طبقات، تماماً مثل تقشير طبقات البصل لرؤية التفاصيل المخفية بداخلها. أدرك الباحثون أن الطرق القياسية غالباً ما تفقد العيوب الصغيرة ذات التباين المنخفض أثناء عملية تقليص حجم بيانات الصورة. ويحافظ نهجهم الجديد على هذه التفاصيل الدقيقة حية من خلال ضبط كيفية "رؤية" الكمبيوتر للصورة باستمرار. وهو يفعل ذلك عن طريق تغيير حجم المنطقة التي يركز عليها الكمبيوتر في أي لحظة، مما يسم يسمح له بالتقريب (الزوم) لرؤية الشقوق الصغيرة مع استيعاب السياق الأكبر للبرج والسماء في آن واحد. وهذا يضمن عدم الخلط بين عيب صغير وبين ظل أو قطعة من النباتات.
يعمل النظام من خلال بناء سلسلة مستمرة من الانتباه من اللحظة التي يتم فيها التقاط الصورة إلى اللحظة التي يتم فيها اتخاذ القرار. أولاً، ينظر إلى الصورة الخام ويضبط تركيزه لالتقاط الأشكال المحددة للعيوب، سواء كانت كسوراً كبيرة أو فجوات صغيرة. بعد ذلك، يجمع المعلومات من مستويات مختلفة من التفاصيل، حيث يأخذ الحواف الحادة من العرض القريب ويمزجها مع الفهم الأوسع للمشهد من العرض الأوسع. وأخيراً، قبل أن يعلن عن وجود عيب، يقوم بوزن كل هذه المستويات المختلفة من الدقة معاً عند كل نقطة في الصورة. وهذه الخطوة النهائية حاسمة لأنها تسمح للنظام بأن يقرر، على سبيل المثال، أن مجموعة معينة من البكسلات هي شق لأنها تطابق نمط عيب تم رصده على مقاييس تفصيل متعددة، وليس مجرد مقياس واحد فقط.
اختبر الباحثون هذا النظام الجديد على مجموعة من الصور الواقعية المأخوذة من عمليات تفتيش فعلية لخطوط الطاقة، والتي تضمنت 1,426 صورة تحتوي على إجمالي 1,632 حالة عيب محددة. وأظهرت النتائج أن النظام الجديد كان أفضل بكثير في العثور على هذه العيوب مقارنة بالطرق السابقة. فقد حدد موقع العيوب بدقة عالية، مما أدى إلى تحسين الدقة الإجمالية بهامش ملحوظ مقارنة بأفضل الأدوات الموجودة. وبشكل محدد، وجد المزيد من العيوب الصغيرة التي يصعب رؤيتها وكان أفضل بكثير في تجاهل ازدحام الخلفية المربك. وقد تمكن النظام من تحقيق هذه النتائج دون أن يصبح معقداً لدرجة تجعل من المستحيل تشغيله على المعدات القياسية، محققاً توازناً بين كونه ذكياً بما يكفي لإيجاد الضرر وفعالاً بما يكفي ليكون عملياً.
تشير الدراسة إلى أن مفتاح النجاح لم يكن مجرد إضافة المزيد من القدرة الحوسبية، بل في تنظيم كيفية معالجة الكمبيوتر للمعلومات. فمن خلال الحفاظ على التفاصيل الصغيرة من الضياع ومن خلال دمج الرؤى المختلفة للصورة بعناية، تعلم النظام رؤية ما فاتت الطرق الأخرى. وأشار الباحثون إلى أن التحسينات كانت أكثر دراماتيكية عند النظر إلى الأجسام الصغيرة أو المشاهد ذات الخلفيات المزدحمة جداً، وهي بالضبط الحالات التي تعاني فيها التكنولوجيا الحالية عادةً. وبينما تم اختبار النظام على مجموعة محددة من الصور، فإن النتائج تشير إلى أن هذا النهج المتمثل في الإدارة الدقيقة لكيفية دمج مستويات مختلفة من المعلومات يمكن أن يكون أداة قوية للحفاظ على سلامة وموثوقية شبكات الطاقة لدينا. إن هذا العمل يثبت أنه مع التصميم الصحيح، يمكن تعليم الحواسيب رؤية العلامات الدقيقة للتآكل والتهالك التي قد تخطئها العين البشرية من مسافة بعيدة، مما يوفر طريقة أكثر قابلية للتوسع لمراقبة البنية التحتية التي تدير عالمنا الحديث.
بيان المشكلة يواجه كشف عيوب العوازل في صور فحص الطائرات بدون طيار (UAV) ثلاثة تحديات رئيسية: التباينات الكبيرة في مقياس الأجسام بسبب مسافة التصوير، والحدود النسيجية الضعيفة عند المسافات البعلة، والتشابه البصري بين العيوب والهياكل الخلفية المعقدة (مثل شبكات الأبراج والغطاء النباتي). تتسبب هذه العوامل في إضعاف الإشارات القادمة من العيوب الصغيرة ومنخفضة التباين أثناء عمليات خفض العينة المتتالية وانتشار الميزات عبر المستويات. علاوة على ذلك، فإن الربط المباشر بين المستويات غالباً ما ينقل التداخلات الخلفية الهيكلية إلى مرحلة التنبؤ، مما يؤدي إلى نتائج إيجابية كاذبة أو فقدان في الكشف. إن الكواشف العامة الحالية، رغم فعاليتها في مجالات عديدة، تظل حساسة لهذه التباينات المحددة في المقياس والخلفية عند تطبيقها في فحص خطوط النقل.
المنهجية: SACANet يقترح المؤلفون شبكة تجميع السياق الواعية بالمقياس (SACANet)، وهي إطار عمل بأسلوب YOLO11 مصمم لإنشاء سلسلة مستمرة للتكيف مع المقياس عبر استخراج الميزات، والتجميع، والتنبؤ. تتكون البنية من ثلاث مراحل أساسية:
العمود الفقري: تجميع المجال الاستقبالي الواعي بالمقياس (SARFA) لمعالجة التباينات المحلية في المقياس، يدمج العمود الفقري تقنية SARFA ضمن إطار تجميع C3k2. تقوم SARFA بدمج التلافيف الانتباهية للمجال الاستقبالي (RFAConv) لإعادة وزن المواقع ديناميكياً داخل المجال الاستقبالي المحلي. وبدلاً من الاعتماد على جوار ثابت، تولد SARFA أوزانًا لكل موقع من ضمن k2 من المواقع في نواة تلافيفية، مما يسمح للشبكة بتعديل المجال الاستقبالي المحلي الفعال. يتيح ذلك للنموذج التقاط الفجوات الصغيرة، والأضرار المتصلة، والأشكال غير المنتظمة للعيوب بشكل أفضل قبل دخول الميزات في مسار تعدد المقاييس.
العنق: تجميع الإدراك متعدد المقاييس (MPA) يستخدم "العنق" مساراً ثنائي الاتجاه رباعي المقاييس (يمتد من النهج القياسي ثلاثي المقاييس) للحفاظ على التفاصيل الضحلة والدلالات العميقة.
تكرير الميزات الموجه بالسياق (CGFR): عند كل عقدة دمج، يتم دمج الميزات من مصادر متعددة على طول بُعد القنوات. بعد ذلك، تعالج CGFR هذه الميزات باستخدام استراتيجية فرع مزدوج: فرع يحافظ على الهوية يحتفظ بمجموعة فرعية من القنوات دون تلافيف مكاني، وفرع تحويل محلي يستخدم التلافيف الجزئي (PConv). يعمل هذا التصميم على تكرير الميزات المدمجة مع الحفاظ على معلومات الهوية وتقليل الحسابات المكانية الزائدة.
خفض العينة المنفصل مكانيًا وقنويًا (SCD): على طول المسار الصاعد، تقوم SCD بفصل رسم الخرائط القنوية (عبر تلافيف نقطي 1x1) عن خفض العينة المكاني (عبر تلافيف عميق ذو خطوة محددة). يستبدل هذا التصميم التلافيف ذات الخطوة المحددة لتقليل العبء الحسابي مع الحفاظ على محاذاة الميزات الصالحة للربط.
رأس الكشف: رأس الكشف الواعي بالمقياس (SADH) في مرحلة التنبؤ، يقوم SADH بإجراء محاذاة واختيار صريح عبر المقاييس. لكل مستوى مستهدف، يقوم بمحاذاة الميزات من جميع المقاييس الأربعة إلى شكل مشترك. ثم يطبق وزناً لكل موقع (مستوحى من ASFF) لتوليد أوزان طبيعية لكل مقياس في كل موقع مكاني. يتم تغذية هذه الميزات الموزونة إلى فروع التصنيف والانحدار المنفصلة مع اتصالات متبقية محلية. يسمح هذا للكاشف باختيار المعلومات الأكثر صلة لكل مقياس محدد لكل موقع مكاني قبل إجراء التنبؤ.
المساهمات الرئيسية
التكيف المستمر مع المقياس: يقدم البحث سلسلة معالجة موحدة تعالج اختلافات المقياس في الجوارات المحلية (عبر SARFA)، والانتشار بين المستويات (عبر MPA)، واتخاذ القرار في مرحلة التنبؤ (عبر SADH)، مستهدفاً بشكل خاص إضعاف الإشارات في العيوب الصغيرة ومنخفضة التباين.
نماذج معمارية مبتكرة:
SARFA: تقدم إعادة وزن مواضع المجال الاستقبالي في العمود الفقري لتعديل نطاق الاستجابة الفعال للجوارات التلافيفية.
MPA: تبني مساراً ثنائياً رباعي المقاييس يحافظ على قنوات متعددة المصادر قبل رسم خرائط الدمج، ويستخدم CGFR للتكرير المحلي والحفاظ على الهوية.
SADH: تربط الوزن الموزون لكل موقع في أربعة مقاييس بفروع التصنيف والانحدار المنفصلة، مما يتيح اختيار المقياس في مرحلة الكشف.
تقييم شامل: تتضمن الدراسة دراسات استئصال تدريجية، واختبارات استبدال النماذج، وتحليلات سيناريوهات طبقية لتقييم دقة الكشف، وقدرة التحديد، ومقايضات التعقيد.
النتائج التجريبية أُجريت التجارب على مجموعة بيانات FLOWID، وهي مجموعة مُعدة ذاتياً تضم 1,426 صورة من الطائرات بدون طيار تحتوي على أنواع عيوب "السقوط" و"التلف".
الأداء: حققت SACANet دقة 62.8% mAP، و 92.9% AP50، و 71.8% AP75 في مجموعة الاختبار.
المقارنات: تحت بروتوكول موحد، تفوقت SACANet على أفضل النماذج المرجعية الحالية القائمة على CNN و Transformer (بما في ذلك YOLOv5–YOLO11، و DAMO-YOLO، و GOLD-YOLO، و YOLO-MS، ومتغيرات RT-DETR) بنسبة 1.2% في mAP، و 0.3% في AP50، و 3.4% في AP75.
المكاسب الطبقية: أظهرت الطريقة تحسينات كبيرة في السيناريوهات الصعبة:
الأهداف الصغيرة: زيادة قدرها 5.4% في AP.
الخلفيات المعقدة: زيادة قدرها 5.3% في AP.
الاستدعاء (Recall): تحسن بمقدار 9.0 نقاط مئوية عن نموذج YOLO11-M الأساسي.
الكفاءة: مع 25.1 مليون معلمة و92.7 مليار عملية حسابية (FLOPs)، حققت SACANet توازناً ملائماً بين الدقة والتعقيد. مقارنة بأكثر النماذج المرجعية دقة من نوع Transformer (وهو RT-DETRv3-R50)، قللت SACANet عدد المعلمات بنسبة تقارب 40.2% والعمليات الحسابية (FLOPs) بنسبة 31.8%، مع الحفاظ على دقة أعلى.
الأهمية والادعاءات يزعم المؤلفون أن الأهمية الأساسية لـ SACANet تكمن في قدرتها على تخفيف فقدان الإشارات الدقيقة من العيوب الصغيرة ومنخفضة التباين من خلال عملية تنسيق مستمرة للتكيف مع المقياس. تشير النتائج إلى أن فوائد هذا النهج تكون أكثر وضوحاً في السيناريوهات التي تكون فيها تداخلات الخلفية قوية وتتفاوت مقاييس الأجسام بشكل كبير. وتؤكد الورقة أن الجمع بين إعادة وزن المجال الاستقبالي في العمود الفقري، وتجميع السياق رباعي المقاييس في العنق، والدمج التكيفي في مرحلة الكشف، يوفر آلية متكاملة لتحسين كل من دقة الكشف ودقة التحديد المكاني.
يحافظ المؤلفون على موقف متواضع فيما يتعلق بنطاق ادعاءاتهم، مشيرين إلى أن الاستنتاجات مستمدة حالياً من مجموعة بيانات واحدة (FLOWID) مع تقسيم ثابت للبيانات. كما يقرون بأن التعميم عبر المناطق المختلفة، والمواسم، والظروف الجوية القاسية يتطلب مزيداً من التحقق. ويقترح العمل المستقبلي تضمين التحقق عبر المناطق، وإعادة التدريب لقياس العشوائية، وقياس استهلاك الطاقة على المنصات منخفضة الطاقة.