YOLO-RCD: A Lightweight Pavement Damage Detector Validated by Controlled Multi-Seed Reproduction and Measured Edge Deployment
تقدم هذه الورقة YOLO-RCD، وهو كاشف خفيف الوزن لأضرار رصف الطرق يحقق دقة فائقة وكفاءة في استهلاك الطاقة على أجهزة الحافة مقارنة بالنماذج المرجعية الرائدة، وتم التحقق من ذلك من خلال بروتوكول ضبط صارم متعدد البذور وتعزيزه عبر تعزيز وقت الاختبار للتخفيف من تكاليف نقل التعلم الصفري.
المؤلفون الأصليون:Aihemaitijiang Tuerhong, Shuo Wang, Aximu Yuemaier, Xiaopeng Gu, Jie Liu, Naman Maimaiti
تُعد الطرق شرايين المجتمع الحديث، فهي تحمل تدفق التجارة والحياة اليومية، لكنها تتعرض باستمرار لهجمات من العوامل الطبيوية وحركة المرور الكثيفة. ومع مرور الوقت، تظهر في الأسفلت شقوق وحفر وأنماط متعرجة، والتي إذا تُركت دون معالجة، يمكن أن تلحق الضرر بالمركبات وتعرّض السائقين للخطر. لعقود من الزمن، اعتمد اكتشاف هذه المشكلات على المفتشين البشر الذين يقودون ببطء على طول الرصيف، وهي طريقة بطيئة ومكلفة وغير متسقة في كثير من الأحيان. وفي السنوات الأخيرة، اتجه المهندسون إلى استخدام الكاميرات المثبتة على الطائرات بدون طيار (الدرونز) والمركبات، مقترنة ببرمجيات الرؤية الحاسوبية، لأتمتة عملية التفتيش هذه. تستخدم هذه الأنظمة الذكاء الاصطناعي لمسح الطريق ورصد الأضراء فوراً. ومع ذلك، ثمة مشكلة مستمرة لاحقت هذا المجال: فغالباً ما يزعم الباحثون أن برامجهم الجديدة أفضل من سابقتها، ولكن لأنهم يختبرون برامجهم بطرق مختلفة، وعلى أجهزة كمبيوتر مختلفة، ومع إعدادات عشوائية مختلفة، فإنه من المستحيل تقريباً معرفة ما إذا كان التحسن المسجل حقيقياً أم مجرد صدفة سعيدة.
وضع فريق من الباحثين من جامعة كاشي ومؤسسات أخرى هدفاً لحل هذا الارتباك، وذلك عبر التعامل مع اكتشاف أضرار الطرق ليس مجرد تحدٍ برمجي، بل كتجربة علمية صارمة. ركزوا على نوع محدد من نماذج الذكاء الاصطناعي يُعرف باسم YOLO، وهو مشهور بسرعته وقدرته على رصد الأشياء في الوقت الفعلي. أنشأ الفريق نسختين جديدتين وأخف وزناً من هذا النموذج، صُممتا خصيصاً للعثور على الشقوق والحفر. ولضمان موثوقية نتائجهم، لم يكتفوا بتشغيل اختباراتهم لمرة واحدة فقط؛ بل قاموا بتدريب نماذجهم سبع مرات، وفي كل مرة يبدأون بإعداد عشوائي مختلف قليلاً، وقارنوا النتائج بأربعة تصميمات أخرى شائعة نُشرت مؤخراً. كما اختبروا مدى كفاءة عمل هذه النماذج عند نقلها من نوع كاميرا إلى آخر، محاكيين بذلك سيناريو من الواقع حيث يُطلب من نظام تم تدريبه على صور جوية من طائرة بدون طيار أن ينظر إلى الطريق من فوق دراجة نارية. وأخيراً، قاموا بتثبيت البرنامج على كمبيوتر صغير وقوي مصمم للمركبات لمعرفة مقدار الطاقة التي سيستهلكها وسرعة تشغيله في بيئة تطبيق حقيقية.
كشفت نتائج هذا الاختبار الدقيق والمتعدد الطبقات عن صورة واضحة لما ينجح وما لا ينجح. فعندما قارن الباحثون نماذجهم الجديدة بالنماذج الأخرى باستخدام نفس القواعد الصارمة، تفوق تصميمهما الجديد باستمرار على المنافسين. لقد حققا دقة في الكشف تزيد بنحو أربع إلى خمس نقاط مئوية عن النموذج المعياري الأساسي، مع استخدام موارد حوسبة أقل بكثير. وهذا يعد مكسباً ذا معنى في مجال تُقاس فيه التحسينات غالباً بأجزاء ضئيلة جداً. ومع ذلك، كشفت الدراسة أيضاً عن واقع صادم حول كيفية سلوك هذه الأنظمة في العالم الحقيقي؛ فعندما تم اختبار النماذج التي تدربت على صور الدرون من ارتفاع عالٍ على صور دراجات نارية من مستوى الأرض، انخفضت دقتها بشكل حاد، حيث لم تحتفظ إلا بنحو ثلاثين بالمائة من فعاليتها الأصلية. يشير هذا الانخفاض الهائل إلى أن الطريقة التي ترى بها الكاميرا الطريق من السماء تختلف جوهرياً عن الطريقة التي تراه بها من الأرض، وأن جعل البرمجيات "أكثر ذكاءً" في رصد الشقوق لا يعالج هذه الفجوة تلقائياً.
وجد الباحثون طريقة عملية لسد هذه الفجوة دون الحاجة إلى إعادة تدريب البرمجيات أو جمع بيانات جديدة. فمن خلال استخدام تقنية تسمى "تعزيز وقت الاختبار" (test-time augmentation)، والتي تعتمد أساساً على عرض صورة الكاميرا على الكمبيوتر من زوايا ومقاييس مختلفة قليلاً في لحظة التفتيش نفسها، تمكنوا من استعادة جزء كبير من الدقة المفقودة. نجحت هذه الطريقة مع كل النماذج التي اختبروها، مما يثبت أن التعديل البسيط والمجاني عند الاستخدام أكثر فعالية من التغييرات الهيكلية المعقدة عند التعامل مع وجهات نظر مختلفة. علاوة على ذلك، أثبت الفريق أن هذه الأنظمة يمكن أن تعمل بكفاءة على أجهزة الكمبيوتر الصغيرة الموجودة في المركبات. ففي جهاز طرفي (edge device) محدد، عالجت النماذج الصور بمعدل يزيد عن 400 إطار في الثانية مع استهلاك ضئيل جداً للطاقة الإضافية، مما يجعل المراقبة المستمرة للطرق في الوقت الفعلي أمراً ممكناً للإعدادات التي تعمل بالبطاريات أو الطاقة الشمسية.
كان أحد أهم النتائج الجوهرية للدراسة هو التحذير من كيفية تقييم هذه التقنيات عادةً. فقد أظهر الباحثون أنه إذا اختبرت نموذجاً لمرة واحدة فقط، فقد تحصل على نتيجة مضللة. ففي حالة محددة، أشارت دورة اختبار واحدة إلى أن تصميمهم الجديد يتفوق بشكل هائل على النموذج المعياري، ولكن عندما أجروا الاختبار سبع مرات، اختفى هذا التفوق الكبير، مما كشف أن النتيجة الأولية كانت مجرد ضربة حظ ناتجة عن ظروف البداية العشوائية. يسلط هذا الاكتشاف الضوء على خلل في كيفية إجراء العديد من الدراسات المماثلة اليوم، حيث تُقدم نتائج التشغيل الواحد غالباً كاختراقات حاسمة. ويجادل الفريق بأنه لكي يتقدم هذا المجال، يجب على الباحثين التوقف عن الاعتماد على الاختبارات الفردية، وبدلاً من ذلك، تقديم متوسط الأداء عبر عمليات تشغيل متعددة، جنباً إلى جنب مع نطاق التباين. ومن خلال القيام بذلك، يمكنهم التمييز بين التحسينات الحقيقية والضوضاء العشوائية، لضمان أن الأدوات المستخدمة للحفاظ على سلامة طرقنا موثوقة حقاً.
تخلص الدراسة إلى أنه بينما تعد نماذجهما الجديدة هي الأكثر فعالية من بين الكواشف خفيفة الوزن المتاحة حالياً لهذه المهمة المحددة، فإن التحدي الأكبر يظل متمثلاً في الفرق بين الرؤية الجوية والرؤية الأرضية. وتقترح الدراسة أن المسار الأفضل للمضي قدماً لا يكمسا فقط في بناء برمجيات أكثر تعقيداً، بل في اعتماد معايير اختبار أكثر صرامة تأخذ في الاعتبار العشوائية وتغير وجهات النظر. وتوصي بأن تتضمن الأنظمة المستقبلية التعديل البسيط الذي لا يتطلب تدريباً والذي اكتشفوه للتعامل مع زوايا الكاميرا المختلفة. وبالنسبة للمهندسين الذين يتطلعون لنشر هذه الأنظمة على المركبات، تشير الدراسة إلى تكوين واحد محدد كأفضل خيار متوازن، حيث يوفر أفضل مزيج من الدقة والسرعة وكفاءة الطاقة. وفي نهاية المطاف، يوفر هذا العمل خارطة طريق لكيفية بناء أنظمة تفتيش الطرق التي لا تكون سريعة ودقيقة في المختبر فحسب، بل أيضاً قوية وموثوقة عندما تخرج إلى الطريق.
ملخص تقني: YOLO-RCD: كاشف خفيف الوزن لتلف الرصف تم التحقق من صحته عبر إعادة إنتاج مضبوطة متعددة البذور ونشر حافة مقاس
بيان المشكلة بينما تُعتمد كواشف عائلة YOLO على نطاق واسع للكشف الآلي عن تلف الرصف، تعاني الأدبيات من ثلاث فجوات تقييمية حرجة تعيق المقارنة الموثوقة والنشر:
الافتقار إلى التحقق الإحصائي متعدد البذور: تسجل معظم الدراسات نتائج تشغيل واحد دون التحكم في البذرة العشوائية، أو اختبار الدلالة، أو فترات الثقة. ونظرًا لصغر حجم مجموعات التحقق من الرصف (على سبيل المثال، 216 صورة في RDD2022 China Drone) والتحسينات المتواضعة المزعومة (1-4 نقاط مئوية)، فإن نتائج التشغيل الواحد غالبًا ما تخلط بين المكاسب المعمارية والتباين الناتج عن التهيئة العشوائية.
غياب التعميم عبر وجهات النظر المختلفة: يتم تدريب النماذج وتقييمها عادةً على منظور مستشعر واحد (مثل الطائرات بدون طيار الجوية). ويتطلب النشر في العالم الحقيقي غالبًا نقل النماذج إلى وجهات نظر مختلفة جذريًا (مثل كاميرات الدراجات النارية على مستوى الأرض) دون إعادة تدريب، وهو سيناريو نادرًا ما يتم قياسه تحت بروتوكولات صارمة لتعلم الصفر (zero-shot).
عدم توصيف حساسية التكميم عند الحافة: يعد تكميم INT8 بعد التدريب معيارًا للنشر عند الحافة، ولكن فقدان الدقة المرتبط به يُبلغ عنه غالبًا كخاصية ثابتة للهندسة المعمارية بناءً على تشغيل تدريب واحد. ولا تزال حساسية فقدان التكميم تجاه البذور العشوائية وأجيال الأجهزة غير مقاسة إلى حد كبير في هذا المجال.
المنهجية يقترح المؤلفون YOLO-RCD، وهو كاشف خفيف الوزن يعتمد على YOLOv11n، ويقومون بتقييمه من خلال بروتوكول صارم ومضبوط على مجموعة بيانات RDD2022 China Drone (المصدر) و China MotorBike (الهدف).
البنى المعمارية للنماذج: تم تقديم متغيرين:
YOLO-RCD-Star: يستبدل كتل الظهر C3k2 القياسية بـ C3k2 Star (باستخدام الضرب العنصري للإسقاطات المتوازية) ويعدل الظهر باستبدال SPPF بـ SPPELAN، وإزالة C2PSA، وإدراج كتلة BasicRFB.
YOLO-RCD-MPDIoU: يتشارك في تعديلات الظهر مع متغير Star، ولكنه يحتفظ بكتل C3k2 القياسية. ويستبدل خسارة CIoU القياسية بصيغة MPDIoU صارمة، حيث يتم تطبيع عقوبة المسافة بين الزوايا بواسطة مقياس مساحة صورة ثابت (6402+6402) بدلاً من قطر محيط متقلب يعتمد على الزوج، بهدف استقرار التدريب للشقوق الصغيرة والمستطيلة.
بروتوكول التدريب المضبوط:
البذور: تم تدريب النماذج الأساسية عبر سبع بذور عشوائية ({42, 123, 456, 789, 1024, 2024, 3141}). كما تمت إعادة إنتاج النماذج المنافسة باستخدام مجموعة فرعية مطابقة مكونة من ثلاث بذور.
البيئة: تستخدم جميع النماذج معاملات تشغيل متطابقة (300 حقبة، SGD، جدول معدل تعلم محدد)، وحزمة برمجية مثبتة (PyTorch 2.0, Ultralytics 8.3.172)، ويتم تدريبها من الصفر (بدون تدريب مسبق على COCO).
التحليل الإحصائي: تستخدم المقارنات اختبارات t لـ Welch، وحجم تأثير Cohen's d، وفترات الثقة 95%، وتصحيح Benjamini–Hochberg لمعدل الخطأ في الاكتشاف (FDR).
بروتوكولات التقييم:
داخل النطاق: مجموعة التحقق RDD2022 China Drone.
التعميم عبر وجهات النظر (Zero-Shot): التقييم المباشر على RDD2022 China MotorBike دون ضبط دقيق.
تعزيز وقت الاختبار (TTA): تم تطبيقه عند الاستنتاج لتقييم استعادة التعميم النطاقي دون إعادة تدريب.
النشر عند الحافة: تم تصدير النماذج إلى TensorRT 10.3 (FP32, FP16, INT8) وتم تقييمها على Jetson AGX Orin و NVIDIA V100 لقياس زمن الانتقال، واستهلاك الطاقة، وحساسية INT8 عبر البذور وأجيال الأجهزة.
المساهمات الرئيسية
بروتوكول إعادة الإنتاج متعدد البذور: تؤسس الدراسة معيارًا مضبوطًا حيث تتم إعادة تدريب أربعة تصميمات منافسة متزامنة (بما في ذلك YOLO-ROC، و Star-YOLO11، و YOLO11-MBC، و YOLOv11n-ATL) تحت ظروف متطابقة.
معيار التعميم عبر وجهات النظر (Zero-Shot): تحدد الدراسة الفجوة النطاقية (من جوي إلى أرضي) تحت بروتوكول صارم لعدم التكيف، مما يضع خط أساس لأبحاث التعميم النطاقي المستقبلية.
توصيف التكميم المعتمد على البذرة: توضح الدراسة أن فقدان التكميم INT8 حساس للغاية للبذور العشوائية وأن هذه الحساسية تنتقل عبر أجيال وحدات معالجة الرسومات، بينما يظل حجم التباين معتمدًا على الجهاز.
النتائج
الأداء داخل النطاق: في ظل مقارنة المنافسين ذات الثلاث بذور، تحقق المتغيرات المقترحة 74.4–74.6% mAP@0.5، متفوقة على نموذج YOLOv11n الأساسي بنسبة +4.3 إلى +4.4 نقطة مئوية (pp). في المقابل، يتجاوز أفضل منافس تمت إعادة إنتاجه (Star-YOLO11) النموذج الأساسي بـ +0.52 pp فقط، ولم تستعد أي من التصميمات المعاد إنتاجها هوامشها المنشورة أصلاً.
ملاحظة: تحت بروتوكول السبع بذور الكامل، تبلغ المتوسطات داخل النطاق 70.95% (Star) و 71.64% (MPDIoU) مقابل 69.90% (الأساسي). وهذه الاختلافات ليست ذات دلالة إحصائية بعد تصحيح FDR، مما يشير إلى أن ادعاءات الربح في التشغيل الواحد قد تكون ناتجة عن اختيار البذرة.
التعميم عبر وجهات النظر: تعاني جميع النماذج من انخفاض هائل في الدقة (48–51 pp) عند الانتقال من المنظور الجوي إلى الأرضي، حيث تحتفظ فقط بـ 28–32% من دقتها داخل النطاق.
يتفوق YOLO-RCD-MPDIoU على YOLO-RCD-Star بمقدار 2.30 pp في إعداد Zero-Shot (حجم تأثير Cohen's d=1.22)، رغم أن هذا يظل "تلميحيًا" وليس تأكيديًا بعد تصحيح FDR.
يستعيد تعزيز وقت الاختبار (TTA) ما بين 3.8–4.5 pp عبر جميع النماذج دون إعادة تدريب. وهذه هي المقارنة الوحيدة في الدراسة التي تظل ذات دلالة إحصائية بعد تصحيح FDR، مما يثبت أن TTA هو خط أساس قوي ومتين للتعرف عبر وجهات النظر دون تدريب.
النشر عند الحافة والتكميم:
على Jetson AGX Orin، تحافظ الكواشف على 434–484 إطارًا في الثانية (FPS) بتكلفة طاقة تبلغ 13–15 مللي جول/صورة وزيادة في طاقة الاستنتاج تبلغ ~1.1 واط فوق حالة الخمول.
حساسية INT8: اقترح اختبار تجريبي أحادي البذرة (البذرة 42) ميزة قدرها 11.47 pp لمتغير Star على النموذج الأساسي. ومع ذلك، قللت تقييمات السبع بذور هذه الميزة إلى 2.58 pp غير ذات دلالة.
انتقال الأجهزة: ترتبط أنماط فقدان INT8 لكل بذرة بشكل كبير عبر V100 و Orin (r=0.59)، لكن الانتشار (التباين) في الفقد يعتمد على الجهاز. فعلى سبيل المثال، كان للنموذج الأساسي أوسع انتشار على V100 ولكنه كان الأضيق على Orin.
الأهمية والادعاءات تجادل الورقة بأن أدبيات اكتشاف الرصف الحالية تعتمد على تقييمات التشغيل الواحد التي لا يمكنها التمييز بين التحسينات المعمارية وتباين البذرة العشوائية. ومن خلال تقديم بروتوكول إعادة إنتاج مضبوط ومتعدد البذور، يوضح المؤلفون أن:
المكاسب المبلغ عنها غالبًا ما تكون غير قابلة للنقل: فشلت النماذج المنافسة التي ادعت تحسينات كبيرة في أوراقها الأصلية في إعادة إنتاج تلك الهوامش تحت بروتوكول مضبوط.
الفجوات عبر وجهات النظر شديدة والتغييرات المعمارية وحدها غير كافية: التعديلات المعمارية القياسية لا تسد الفجوة بين المنظور الجوي والأرضي بشكل كبير؛ ويعد TTA (بدون إعادة تدريب) حاليًا أكثر الوسائل فعالية للتخفيف من ذلك.
قرارات النشر تتطلب التحقق متعدد البذور: إن اختيار بنية معينة بناءً على بذرة واحدة (مثل أداء INT8) يمكن أن يؤدي إلى استنتاجات خاطئة. يوصي المؤلفون باستخدام YOLO-RCD-MPDIoU للنشر نظرًا لمتوسط الـ Zero-shot الأعلى، وأقل عدد من المعلمات (2.19 مليون)، وأكبر ربح من TTA، رغم اتساع تباين INT8 الخاص به على أجهزة معينة.
تخلص الدراسة إلى اقتراح معيار أدنى للتقرير في هذا المجال: التقييم متعدد البذور (3-5 بذور)، والتبليغ عن حجم التأثير، والإفصاح الكامل عن معاملات التشغيل، وتثبيت حزمة البرمجيات لضمان قابلية إعادة الإنتاج.