A Lightweight Small Object Detection Framework Based on Enhanced BiFPN and Attention Mechanisms
تقترح هذه الورقة البحثية إطار عمل ESW-YOLO، وهو إطار خفيف الوزن للكشف عن الأجسام الصغيرة يعتمد على YOLO11n ويدمج التلافيف الثعبانية الديناميكية (Dynamic Snake Convolution)، وشبكة BiFPN محسنة مع رأس إضافي عالي الدقة وانتباه iEMA، وفقدان WIoU لتحسين دقة الكشف بشكل كبير على الأهداف الصغيرة والمستطيلة مع الحفاظ على عدد معاملات مماثل.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في المشهد الواسع لرؤية الحاسوب، حيث تتعلم الآلات رؤية العالم، يبرز تحدٍ مستمر وعنيد: رصد الأشياء الصغيرة للغاية. فبينما تستطيع الأنظمة الحديثة تحديد سيارة أو شخص في صورة بسهولة، فإنها غالبًا ما تتعثر عندما يكون الهدف عبارة عن ذرة غبار، أو شق شعري، أو طائرة بعيدة. ينبع هذا الصعوبة من كون أنظمة التعلم العميق، التي تحاكي قدرة الدماغ البشري على التعرف على الأنماط، تعمل من خلال تقليص الصور تدريجيًا للعثور على الأشكال العريضة. وفي عملية التبسيط هذه، غالبًا ما تتلاشى البكسلات القليلة التي تشكل جسمًا صغيرًا أو تصبح باهتة جدًا بحيث لا تكون مفيدة. علاوة على على ذلك، فإن القواعد الرياضية التي تستخدمها هذه الأنظمة للحكم على مدى جودة عثورها على جسم ما، غالبًا ما تكون مضبوطة للأشكال الأكبر والأكثر انتظامًا، مما يجعلها غير موثوقة عندما يكون الهدف عبارة عن نقطة صغيرة ومستطيلة. إن حل هذه المشكلة أمر بالغ الأهمية للسلامة والكفاءة في العالم الحقيقي، بدءًا من ضمان السلامة الهيكلية للوحات الدوائر المصنعة وصولاً إلى مراقبة المناظر الطبيعية النائية بحثًا عن المخاطر.
اقترح الباحثان كونبينج فينغ ووي هوا باو من جامعة شنغهاي للكهرباء نهجًا جديدًا لهذه المشكلة، حيث ابتكروا نظامًا أطلقوا عليه اسم ESW-YOLO. بُني هذا النظام على إطار عمل شهير وفعال للكشف يُعرف باسم YOLO11، وصُمم عملهما خصيصًا لالتقاط هذه الأجسام الصغيرة المراوغة دون الحاجة إلى قدرة حوسبة هائلة. لم يكتفِ الفريق بمجرد تعديل الإعدادات الموجودة، بل أعادوا تصور ثلاثة أجزاء أساسية من "رؤية" الآلة لتناسب الطبيعة الفريدة للأهداف الصغيرة بشكل أفضل. أولًا، استبدلوا الطريقة القياسية التي يمسح بها النظام الصورة بتقنية تسمى "التلاف المتموج الديناميكي" (Dynamic Snake Convolution). وخلافًا لعدسة الكاميرا التقليدية التي تنظر إلى شبكة ثابتة من البكسلات، تسمح هذه الطة الجديدة للنظام بليونة وثني تركيزه، متتبعًا خطوط الجسم مثل ثعبان يتبع مسارًا. وهذا مفيد بشكل خاص للعيوب الصغيرة والنحيفة التي قد يتم إغفالها بواسطة المسح الصلب الذي يشبه الصندوق.
ثانيًا، أعاد الباحثون تصميم الشبكة الداخلية التي تدمج الطبقات المختلفة من المعلومات المرئية. في الأنظمة القياسية، غالبًا ما تُدمج التفاصيل عالية المستوى مع التفاصيل منخفضة المستوى بطريقة يمكن أن تؤدي إلى غسل الإشارات الباهتة للأجسام الصغيرة. قدم الفريق هيكلًا جديدًا أطلقوا عليه اسم EBPN، والذي يضيف طبقة عرض مخصصة عالية الدقة خصيصًا للأهداف الصغيرة. وتترافق هذه الطبقة مع آلية انتباه متخصصة تعمل مثل كشاف الضوء، مما يجبر النظام على إيلاء اهتمام أكبر للميزات الأكثر صلة مع تجاهل ضوضاء الخلفية. وأخيرًا، قاموا بتغيير نظام تسجيل النقاط الذي تستخدمه الآلة للتعلم من أخطائها. استخدم النظام الأصلي قاعدة تعاقب الأخطاء بناءً على نسب الشكل، وهي قاعدة غالبًا ما تربك الآلة عند التعامل مع الأجسام الصغيرة والممتدة. استبدل الباحثون ذلك بطريقة جديدة لتسجيل النقاط تركز على مدى بعد الجسم المكتشف عن مركزه الحقيقي، مما يوفر دليلًا أكثر وضوحًا واستقرارًا لتحسين دقة النظام.
عند اختبار النظام على مجموعتين مختلفتين من الصور — إحداهما تضم عيوبًا مجهرية في لوحات الدوائر والأخرى تحتوي على أجسام صغيرة من صنع الإنسان في صور الاستشعار عن بعد الجوية — أظهر النظام الجديد قفزة نوعية في الأداء. ففي مجموعة بيانات لوحات الدوائر، حيث كانت العيوب غالبًا لا يتجاوز حجمها اثني عشر بكسلًا، حسّن النموذج الجديد قدرته على تحديد الأجسام بشكل صحيح بنسبة 12.7 نقطة مئوية مقارنة بالنسخة القياسية التي استند إليها. ويمثل هذا تحسنًا نسبيًا يزيد عن 20 بالمائة، وهو مكسب كبير في مجال غالبًا ما يُقاس فيه التقدم بأجزاء من المائة. كما حافظ النظام على عدد مماثل من المعلمات الداخلية، مما يعني أنه لم يصبح أثقل أو أكثر تعقيدًا للتشغيل، رغم أنه تطلب قدرًا أكبر قليلاً من قدرة الحوسبة لمعالجة التفاصيل الإضافية عالية الدقة.
وكشفت الدراسة كذلك أن هذه التحسينات لم تكن مجرد نتيجة لإضافة المزيد من الأجزاء، بل لكيفية عمل تلك الأجزاء معًا. فعندما اختبر الباحثون المكونات بشكل فردي، وجدوا أن طريقة تسجيل النقاط الجديدة وحدها لم تقدم سوى دفعة طفيفة، وأن طريقة المسح المرنة أدت أداءً أسوأ في الواقع بدون التحديثات الأخرى. وفقط عندما تم الجمع بين المسح المرن، وطبقة العرض عالية الدقة، وطريقة تسجيل النقاط الجديدة، تفوق النظام حقًا، متفوقًا حتى على النماذج الأكبر والأكثر تعقيدًا التي تمتلك ثلاثة إلى أربعة أضعاف عدد المعلمات الداخلية. وفي اختبارات الاستشعار عن بعد، أثبت النظام براعة خاصة في تحديد الملاعب في الصور الجوية، وهي فئة تفوق فيها على أقرب منافسيه بفارق كبير، ويرجع ذلك على الأرجح إلى قدرته على التعامل مع الأنسجة والأشكال المتنوعة الموجودة في مثل هذه البيئات.
وبينما يقدم الإطار الجديد حلاً قويًا للعثور على الأجسام الصغيرة، يقر الباحثون بوجود مقايضة. إذ أدت إضافة طبقة العرض عالية الدقة إلى زيادة التكلفة الحسابية، مما جعل النظام أبطأ قليلاً في التشغيل على الأجهزة ذات الموارد المحدودة مثل الهواتف المحمولة أو الطائرات بدون طيار. ومع ذلك، تشير النتائج إلى أنه في التطبيقات التي قد يكون فيها تفويت عيب صغير مكلفًا أو خطيرًا، فإن هذه التكلفة الإضافية هي استثمار يستحق العناء. يوفر هذا العمل مسارًا واضحًا للمضي قدمًا في جعل رؤية الآلة أكثر حساسية للتفاصيل الصغيرة المهمة، مما يثبت أنه من خلال تكييف كيفية نظر النظام إلى العالم، يمكننا رؤية أشياء كانت غير مرئية سابقًا.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.