A Structural Preservation Framework for Denoiser Selection in YOLO-Based Pedestrian Detection under Sensor Noise
تقدم هذه الورقة "درجة الحفاظ على البنية" (SPS) لتقييم فعالية مزيل الضجيج في كشف المشاة القائم على نموذج YOLO، كاشفةً أنه بينما يمكن لمتغيرات محددة مثل ارتباط مقدار التدرج أن ترتب مزيلات الضجيج ضمن مستويات ضجيج معروفة، لا يوجد مقياس واحد على مستوى الصورة يمكنه التنبؤ عالمياً بأداء الكشف عبر مزيلات الضجيج أو ظروف الضجيج غير المرئية بسبب العوامل غير الخطية والاعتمادية على البنية المعمارية.
في عالم التكنولوجيا الحديثة، تُعد الكاميرات هي عيون الآلات. فمن السيارات ذاتية القيادة التي تتنقل في شوارع المدن إلى أنظمة الأمن التي تراقب الساحات العامة، تعتمد هذه الأجهزة على الذكاء الاصطناعي للتعرف على الأشخاص والأشياء فوراً. لسنوات طويلة، درب المهندسون هذه الأنظمة لتكون حادة للغاية، وعلموها كيفية رصد التفاصيل في صور واضحة ومثالية. ومع ذلك، فإن العالم الحقيقي نادراً ما يكون مثالياً؛ إذ غالباً ما تعاني الكاميرات عندما تكون الإضاءة خافتة، أو الطقس سيئاً، أو عندما يكون المستشعر نفسه غير مثالي، مما يؤدي إلى صور تبدو محببة أو مليئة بالتشويش (الستاتيك). هذا الضجيج يمكن أن يربك الآلة، مما يتسبب في عدم قدرتها على رصد أحد المشاة أو الخلط بين تمثال عرض ملابس (مانيكان) وشخص حقيقي. ولإصلاح ذلك، تبرز غريزة هندسية شائعة تتمثل في إضافة خطوة "تنظيف" قبل أن تنظر الآلة إلى الصورة، على أمل أن تؤدي الصورة الأكثر وضوحاً إلى قرار أكثر ذكاءً.
لكن دراسة جديدة تشير إلى أن هذه الغريزة غالباً ما تكون خاطئة. فقد اكتشف الباحثون أن مجرد جعل الصورة تبدو "أنظف" للعين البشرية لا يساعد بالضرورة الآلة على الرؤية بشكل أفضل. في الواقع، بعض الطرق التي تنتج صوراً أكثر جمالاً ونعومة يمكن أن تعمي الكاشف عن التفاصيل الدقة التي يحتاجها لأداء وظيفته. وقد وضع الفريق هدفاً يتمثل في إيجاد طريقة للتنبؤ بأي طريقة تنظيف ستساعد الآلة فعلياً على رؤية شخص ما، بدلاً من مجرد جعل الصورة تبدو جميلة. قاموا باختبار تقنيات تنظيف متنوعة على مجموعة بيانات لصور مشاة، تتراوح من الصور الواضحة إلى تلك المشوهة بشدة بفعل الضجيج، وقاسوا مدى كفاءة النسخ المختلفة من نظام كشف شائع بعد ذلك.
وجد الباحثون أن العلاقة بين جودة الصورة ورؤية الآلة أكثر تعقيداً مما كان يُعتقد سابقاً. لقد طوروا طريقة جديدة لقياس الصورة لا تركز على مدى نعومتها، بل على مدى قدرتها على الحفاظ على الحواف والأنماط الحادة التي تستخدمها الآلة لتحديد الأشكال. وعندما طبقوا هذا المقياس الجديد في اختباراتهم، وجدوا أن بعض طرق التنظيف التقليدية، التي كانت مغمورة إلى حد كبير بالأدوات الحديثة الأكثر تعقيداً والمدعومة بالذكاء الاصطناعي، كانت في الواقع أفضل في الحفاظ على هذه التفاصيل الحرجة. إحدى الطرق القديمة، التي تعمل من خلال مقارنة كتل صغيرة من الصورة لإيجاد الأنماط، حافظت على الهيكل الأساسي للمشهد سليماً. وفي المقابل، فإن العديد من أدوات التعلم العميق الحديثة، التي يتم تدريبها لتقليل الأخطاء بكسل بكسل، نزعت نحو تنعيم الصورة أكثر من اللازم. لقد أزالت هذه الأدوات الضجيج، ولكنها في طريقها فعلت ذلك، مسحت أيضاً الخطوط الدقيقة والأنماط التي احتاجتها الآلة لتحديد موقع الشخص، مما أدى إلى انخفاض دقتها بشكل كبير.
كشفت الدراسة عن حقيقة مفاجئة حول كيفية تعلم هذه الأنظمة. فأدوات الكشف الحديثة مدربة بالفعل على التعامل مع قدر معين من الفوضى. وعندما أعاد الباحثون تدريب الكواشف على الصور المشوشة، تعلمت الآلات كيفية التعامل مع الضجيج بمفردها. في هذا السيناريو، غالباً ما لا تقدم خطوة التنظيف أي فائدة، بل قد تجعل الأمور أسوأ أحياناً إذا قام "المنظف" بإزالة الكثير من التفاصيل. ومع ذلك، في سيناريو أكثر واقعية حيث تكون الآلة مدربة بالفعل ولا يمكن إعادة تدريبها، تصبح خطوة التنظيف حيوية. هنا، يعتمد اختيار "المنظف" بشكل هائل على مستوى الضجيج. اكتشف الباحثون أنه عند مستويات الضجيج المنخفضة، يمكن لمقياس محدد لمدى حفاظ الصورة على حوافها أن يتنبأ بقوة بأي منظف سيكون الأفضل. ولكن إذا تم دمج جميع مستويات الضجيج معاً، فإن التنبؤ يفشل تماماً، لأن شدة الضجيج نفسها تصبح هي العامل المهيمن.
ولعل النتيجة الأكثر أهمية هي أنه لا توجد قاعدة واحدة عالمية لاختيار "المنظف". حاول الباحثون بناء نموذج يمكنه التنبؤ بأداء طريقة تنظيف لم يسبق لهم رؤيتها، بناءً على أدائها في الطرق التي اختبروها. فشلت هذه المحاولة. إن العلاقة بين الجودة الهيكلية للصورة ونجاح الآلة كانت مرتبطة بنوع المنظف المستخدم. فالطريقة التي نجحت جيداً مع نوع معين من الخوارزميات لم تتنبأ بالضرورة بالنجاح مع نوع آخر. وهذا يعني أنه بينما لا توجد صيغة سحرية لاختيار المنظف المثالي لأي موقف، إلا أن هناك مساراً واضحاً أمام المهندسين؛ إذ يمكنهم استخدام هذا القياس الهيكلي الجديد لترتيب قائمة قصيرة من أدوات التنظيف المعروفة لكاميرا ومستوى ضجيج محددين، لكن لا يمكنهم الاعتماد عليه لتخمين أداء أداة جديدة تماماً.
يؤكد هذا العمل وجود تحول جوهري في كيفية تفكيرنا في معالجة الصور للآلات. فالهدف ليس إنشاء صورة تبدو مثالية للإنسان، بل الحفاظ على الإشارات الهيكلية المحددة التي تعتمد عليها الآلة. وتظهر الدراسة أن أفضل "منظف" ليس دائماً هو الذي يحقق أعلى درجة في مخططات الجودة القياسية، ولا هو دائماً النموذج الأكثر تقدماً في الذكاء الاصطناعي. فأحياناً، تكون الطريقة الأبسط والأقدم، التي تحترم الحواف الطبيعية للمشهد، هي الخيار الأكثر فعالية. ومن خلال فهم أن الآلات ترى العالم من خلال عدسة الهيكل والنسيج بدلاً من النعومة، يمكن للمهندسين اتخاذ قرارات أفضل بشأن كيفية إعداد الصور للمهام الحرجة المتعلقة بالسلامة، مما يضمن بقاء عيون الآلة حادة حتى عندما يكون العالم من حولها مليئاً بالضجيج.
ملخص تقني: إطار عمل للحفاظ على البنية لاختيار أداة إزالة الضجيج في كشف المشاة القائم على YOLO تحت تأثير ضجيج المستشعر
1. بيان المشكلة
تحقق كواشف الأجسام العميقة الحديثة، ولا سيما عائلة YOLO، دقة عالية في المعايير المرجعية المختارة بعناية، لكنها تعاني من تدهور كبير في الموثوقية عندما تنحرف الصور المدخلة عن ظروف التدريب "النظيفة" بسبب ضجيج المستشعر (مثل قيود CMOS/CCD، أو الالتقاط في الإضاءة المنخفضة). الاستجابة الهندسية الشائعة هي إدراج مرحلة إزالة ضجيج (denoising) قبل الكاشف بناءً على افتراض أن "جودة الصورة الأفضل تؤدي إلى كشف أفضل". ومع ذلك، يثبت هذا البحث أن هذا الافتراض يفشل بشكل منهجي مع كواشف YOLO.
تتضمن متغيرات YOLO الحالية تعزيزات بيانات هجومية (mosaic، حقن الضجيج، التلاعب الضوئي)، مما يمنحها قدرة داخلية على تحمل التدهور الطفيف. وبناءً على ذلك، فإن القيمة الهامشية لمرحلة إزالة الضجيج لا تعتمد على التخلص من الضجيج على مستوى البكسل، بل على ما إذا كانت أداة إزالة الضجيج تحافظ على السمات البنيوية المحددة (الحواف، التدرجات، النسيج عالي التردد) التي يعتمد عليها الكاشف أو تدمرها. تفتقر الأدبيات إلى إطار عمل للتنبؤ بأي طرق إزالة الضجيج ستساعد عملية الكشف اللاحقة أو لتشخيص سبب فشل غيرها، مما يجبر الممارسين على إعادة تدريب وتقييم كل زوج مرشح من (أداة إزالة الضجيج-الكاشف) بشكل استقصائي—وهي مهمة مكلفة حوسبياً (180 عملية تشغيل في هذه الدراسة). علاوة على ذلك، ترتبط مقاييس جودة الصورة القياسية مثل PSNR وSSIM بشكل ضعيف مع أداء المهمة اللاحقة لأنها مصممة لتناسب الإدراك البشري بدلاً من رؤى الآلة.
2. المنهجية
قدم المؤلفون درجة الحفاظ على البنية (SPS)، وهي عائلة مرجعية من ثلاثة متغيرات قابلة للحساب، صُممت لقياس مدى أمانة أداة إزالة الضجيج في الحفاظ على البنية ذات الصلة بالكاشف. يعمل إطار العمل دون الحاجة إلى كاشف مدرب، ويتم تقييمه على مجموعة بيانات PnPLO/Karthy للمشاة (944 صورة تدريب، 160 صورة تحقق، 235 صورة اختبار) عبر تصميم تجريبي عاملي:
الكواشف: خمسة متغيرات متوسطة من YOLO (من v8m إلى v12m).
مستويات الضجيج: ستة مستويات من الضجيج الغاوسي (σ∈{0,1,5,10,20,30}).
ظروف المعالجة: خمس طرق لإزالة الضجيج (Gaussian, BM3D, DnCNN, Autoencoder, CAE+PSO) بالإضافة إلى خط أساس ضجيجي.
إجمالي عمليات التشغيل: 180 عملية تدريب وتقييم شاملة.
متغيرات SPS الثلاثة:
المتغير A (تداخل الحواف): يقيس التداخل بين خرائط حواف Canny للصور النظيفة والمزالة للضجيج، مما يلتقط بقاء حدود الأجسام.
المتغير B (ارتباط مقدار التدرج): يحسب ارتباط بيرسون لمقادير تدرج Sobel بين الصور النظيفة والمزالة للضجيج. هذا يلتقط الحفاظ على أنماط التباين المحلي، حتى لو انزاحت الحواف بمقدار فرعي للبكسل.
المتغير C (الاحتفاظ بالطاقة عالية التردد): يقيس الاحتفاظ بالطاقة الطيفية في منطقة التردد العالي (القطع الشعاعي rc=0.5rmax) عبر تحويل فوريه ثنائي الأبعاد (2D FFT). هذا يحدد ما إذا كان يتم كبح النسيج دقيق النطاق (الإفراط في التنعيم) أو حقن محتوى عالي التردد زائف.
بروتوكولات التقييم:
بروتوكول إعادة التدريب: يتم إعادة تدريب الكواشف لكل حالة (الطريقة، مستوى الضجيج) لقياس تحول أداء الكشف (ΔF1) بالنسبة للخط الأساسي الضجيجي.
بروتوكول الكاشف المجمد: يتم تدريب الكواشف مرة واحدة على بيانات نظيفة وتظل ثابتة؛ حيث تُطبق أدوات إزالة الضجيج فقط عند الاستنتاج لمحاكاة سيناريوهات النشر.
التحقق المتبادل: يختبر بروتوكول "ترك طريقة واحدة خارج المجموعة" (LOOCV) ما إذا كانت العلاقة بين SPS وΔF1 تعمم على طرق إزالة الضجيج غير المرئية.
3. المساهمات الرئيسية
إطار عمل SPS: صياغة عائلة مقاييس مرجعية ذات أدوار تنبؤية (المتغيران A وB) وتشخيصية (المتغير C) منفصلة بوضوح، متجاوزة لوحات تصنيف PSNR/SSIM التقليدية.
الدليل التجريبي: تقديم نتائج من 180 عملية تشغيل منهجية. في حالة إعادة التدريب، كان المتغير B (ارتباط مقدار التدرج) هو المقياس الوحيد من بين PSNR وSSIM ومتغيرات SPS الثلاثة الذي وصل إلى دلالة إحصائية غير معدلة ضد ΔF1 (r=+0.418,p=0.038). حجم تأثيره يضاهي PSNR ويتجاوز SSIM بشكل كبير. ومن بين المقاييس الإدراكية الواعية للبنية، وحده GMSD يطابق أداء المتغير B.
الآلية التشخيصية: يكشف تحليل الطاقة عالية التردد (المتغير C) أن نماذج الترميز التلقائي (autoencoders) المدربة باستخدام MSE تحتفظ بـ 16-21% فقط من طاقة الصورة النظيفة عالية التردد عند σ=20، مقارنة بـ 87% لـ BM3D. هذا يحدد كمياً "انهيار الإفراط في التنعيم" للنماذج المدربة بـ MSE. وعلى العكس من ذلك، يحتفظ DnCNN بـ 277% من الطاقة عالية التردد، مما يشير إلى حقن زائف (ringing) بدلاً من الإفراط في التنعيم، وهو ما يتحمله الكاشف بشكل أفضل من فقدان البنية.
حدود التعميم: ينتج عن التحقق المتبادل (LOOCV) قيم R2 سالبة (متوسط R2=−1.443)، مما يثبت أن العلاقة الخطية بين SPS وΔF1لا تتعمم عبر عائلات طرق إزالة الضجيج المختلفة. الحفاظ على البنية هو شرط ضروري ولكنه ليس كافيًا للتنبؤ بالأداء عبر المشغلات غير المرئية.
4. النتائج الرئيسية
الارتباط مع تحول الكشف: في نظام إزالة الضجيج النشط (σ≥1)، يرتبط المتغير B بـ ΔF1 (r=+0.418). لم يصمد أي مقياس أمام تصحيح التعددية (Holm/Benjamini-Hochberg)، لكن حجم التأثير قوي. الارتباط يعتمد على الكاشف، حيث يصل إلى الدلالة فقط لـ YOLOv9m وYOLOv10m، ويرجع ذلك على الأرجح إلى ميزات بنيتها المحددة الحافظة للتدرج (مسار PGI، ورؤوس NMS-free).
ديناميكيات الكاشف المجمد: عندما تكون الكواشف مجمدة (سيناريو النشر)، فإن التجميع عبر مستويات الضجيج يخفي العلاقة تمامًا (r≈0). ومع ذلك، ضمن مستويات الضوضاء الفردية، يقوم المتغير B بتصنيف أدوات إزالة الضجيج بقوة (r≥+0.93 عند σ≤10). هذا يحدد مستوى الضجيج كعامل مربك؛ إذ يجب أن يتحكم الاختيار القائم على المقاييس في مستوى الضجيء التشغيلي.
أداء الطرق:
BM3D: يحافظ باستمرار على البنية (احتفاظ بالتردد العالي بنسبة 87%) ويوفر أكثر ΔF1 استقراراً، سواء كان إيجابياً طفيفاً أو محايداً في أنظمة الضجيج العالية.
MSE Autoencoders: ضارة فعلياً في أنظمة إعادة التدريب، حيث تسبب انهيارات مطلقة في F1 (على سبيل المثال، ΔF1≈−0.075 عند σ=20) بسبب الإفراط في التنعيم.
DnCNN: ينتج بقايا عالية التردد زائفة ولكنه يظل قريباً من الخط الأساسي الضجيجي، مما يشير إلى أن الكواشف تتحمل الضجيج المتبقي بشكل أفضل من فقدان البنية.
التحقق من ANOVA: عند σ=20، يعد اختيار طريقة إزالة الضجيج عاملاً ذا دلالة إحصائية (p=0.0033)، مع إظهار التباينات الزوجية أن الطرق الحافظة للبنية (BM3D, DnCNN) تتفوق على طرق الإفراط في التنعيم (Autoencoder)، رغم أن الأزواج الفردية لم تصمد أمام التصحيح العائلي.
5. الأهمية والادعاءات
يدعي البحث أن الحفاظ على البنية هو شرط ضروري ولكنه ليس كافيًا لكي تقوم أداة إزالة الضجيج بتحسين أداء كشف الأجسام. يذكر المؤلفون صراحة أنه لا ينبغي النظر إلى SPS كمتنبئ عالمي مستقل عن الكاشف لأي مشغل إزالة ضجيج عشوائي. بدلاً من ذلك، تكمن أهميته في دوره كـ أداة مساعدة منخفضة التكلفة حوسبياً ومنضبطة إحصائياً لتصنيف المرشحين من أدوات إزالة الضنف ضمن قائمة مختصرة مختارة ومعايرة عند مستوى ضجيج معروف.
يفند البحث الافتراض القائل بأن "جودة الصورة الأفضل" (حسب PSNR/SSIM) تعني كشفًا أفضل. وقد أثبت أن:
الحفاظ على مقدار التدرج هو ارتباط أقوى لأداء الكشف من المقاييس التقليدية.
أدوات إزالة الضجيج المدربة بـ MSE تضر الكشف بشكل منهجي عن طريق كبح السمات البنيوية عالية التردد.
العلاقة بين مقاييس جودة الصورة وأداء الكشف غير خطية وتعتمد على البنية، مما يمنع الاستقراء البسيط للمناهج غير المرئية.
يخلص المؤلفون إلى أنه بينما لا يمكن لـ SPS أن يحل محل التقييم الشامل (end-to-end)، فإنه يمكنه تقليل مساحة البحث لاختيار أداة إزالة الضجيج بمقدار عشرة أضعاف، بشرط استخدامه كـ "رأي ثانٍ" ضمن مجموعة مرشحين محكومة بدلاً من اعتباره درجة عالمية قائمة بذاتها.