Joint Enhancement of Multi-Scale Features and Adaptive Loss for YOLOv5
تقترح هذه الورقة إطار عمل لتعزيز التعاون متعدد الأبعاد لنموذج YOLOv5 يدمج تقنية CLAHE في فضاء LAB، وطبقة كشف P2 عالية الدقة مع فقدان Varifocal، والالتفاف القابل للتشوه مع انتباه القنوات لمعالجة تحديات الإضاءة المنخفضة، والأهداف الصغيرة، والتشوه الهندسي بفعالية في الفحص البصري الصناعي، محققاً أداءً متفوقاً على الكواشف السائدة على مجموعة بيانات متخصصة لأكياس التعبئة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في عالم الأتمتة الصناعية، تعتمد الآلات على الكاميرات لترى ما يراه البشر، لكنها غالباً ما تعاني من نفس المشكلات البصرية التي تواجهنا في الغرف خافتة الإضاءة. فعندما تكون أرضية المصنع سيئة الإضاءة، أو عندما يكون المنتج مجعداً، أو مطوياً، أو صغيراً جداً، يمكن لأنظمة الرؤية الحاسوبية القياسية أن تفقد طريقها. فقد تغفل عن تمزق صغير في كيس أو تفشل في تحديد موقع جزء تالف لأن الصورة مظلمة للغاية أو لأن الجسم مشوه بشكل كبير. وهنا يأتي دور مجال "كشف الأشياء" (object detection)، وهو فرع من فروع الذكاء الاصطناعي المصمم لتعليم الحواسيب كيفية تحديد وتحديد مواقع العناصر داخل الصورة. وبينما تعد الأنظمة الحديثة قوية، إلا أنها غالباً ما تتعثر عندما تواجه الواقع الفوضوي للمستودعات: الإضاءة المنخفضة، والعيوب الصغيرة، والأجسام التي ليست ذات أشكال مثالية. ويسعى الباحثون باستمرار لبناء أنظمة يمكنها التعامل مع هذه الظروف الصعبة دون إبطاء الوتيرة السريعة للعمل الصناعي.
لقد نجح فريق من الباحثين من جامعة تايوان للعلوم والتكنولوجيا وشركة تايوان فورتكي لمعدات وتكنولوجيا اللوجستيات المحدودة في معالجة هذه التحديات المحددة من خلال تحسين نظام كشف شهير يُعرف باسم YOLOv5. وقد ركزوا عملهم على مهمة صعبة بشكل خاص: فحص أكياس الطن الصناعية، وهي أكياس منسوجة كبيرة تُستخدم لنقل المواد السائبة. تمثل هذه الأكياس "عاصفة مثالية" من الصعوبات أمام الكاميرا؛ ففي ظروف الإضاءة المنخفضة، يصبح من الصعب تمييز النسيج المنسوج للكيس، كما أن أي ضرر، مثل ثقب صغير أو تمزق، غالباً ما يكون أصغر من أن يُرى بوضوح. علاوة على ذلك، ومع تكديس هذه الأكياس وتحريكها، فإنها تتجعد وتلتوي، مما يغير شكلها بطرق تربك الكاميرات القياسية. وقد سعى الباحثون لإنشاء حل واحد يمكنه التعامل مع الظلام، وإيجاد العيوب الصغيرة، والتكيف مع الأشكال المتغيرة للأكياس في آن واحد.
ولحل مشكلة ضعف الإضاءة، قدم الفريق طريقة تعمل مثل "مصباح يدوي ذكي" لعين الكمبيوتر. فبدلاً من مجرد تفتيح الصورة بأكملها، وهو ما قد يؤدي إلى طمس التفاصيل أو خلق بقع ساطعة باهرة، استخدموا تقنية تعمل على ضبط التباين في مناطق محلية صغيرة. تخيل أنك تنظر إلى غرفة مظلمة حيث تكون بعض الزوايا شديدة السواد وأخرى مضاءة قليلاً؛ فإن أداة التفتيح البسيطة ستجعل الغرفة بأكملها بيضاء وتفقد الظلال. الطريقة المستخدمة هنا، والمعروفة باسم CLAHE، تنظر إلى قطع صغيرة من الصورة وتعزز التباين فقط حيث تشتد الحاجة إليه. وهذا يسمح للكمبيوتر برؤية النسيج الدقيق للكيس والاختلافات الطفيفة التي تشير إلى وجود تمزق، حتى في الزوايا المظلمة جداً، مع الحفاظ على التحكم في الضجيج وحبيبات الصورة. تضمن هذه الخطوة تلقي الكمبيوتر لصورة واضحة ومفصلة قبل أن يبدأ حتى في البحث عن العيوب.
بمجرد أن تصبح الصورة واضحة، يحتاج النظام إلى العثور على المناطق المتضررة الصغيرة، والتي غالباً ما تكون بعرض بضعة بكسلات فقط. غالباً ما تفشل أنظمة الكشف القياسية في رصد هذه الأهداف الصغيرة لأنها تعالج الصور في طبقات تتقلص فيها الصورة تدريجياً، مما يتسبب في اختفاء التفاصيل الصغيرة. وقد أضاف الباحثون طبقة جديدة للنظام تحافظ على عرض عالي الدقة للصورة، مما يسمح لها برصد هذه العيوب الدقيقة دون فقدانها في الضبابية. كما قاموا بتغيير الطريقة التي يتعلم بها النظام من أخطائه؛ فبدلاً من معاملة كل خطأ على حدة، يولي الأسلوب الجديد اهتماماً إضافياً بالأجسام الصغيرة التي يصعب العثون عليها وتلك التي يشك النظام في دقتها. هذا الجمع بين الحفاظ على رؤية حادة وقريبة وبين التعلم بعناية أكبر من الأمثلة الصعبة، حسن بشكل كبير قدرة النظام على إيجاد التمزقات والثقوب الصغيرة التي كان سيتجاهلها سابقاً.
التحدي الأخير كان التعامل مع الأكياس وهي تلتوي وتطوى. ترى عدسة الكاميرا القياسية العالم في شبكة صلبة، وهو ما يعمل جيداً مع الخطوط المستقيمة ولكنه يعاني عندما ينحني الجسم أو يتمدد. ولإصلاح ذلك، منح الباحثون النظام طريقة مرنة للنظر إلى الصورة؛ حيث أضافوا آلية تسمح للكمبيوتر بتغيير نقاط تركيزه قليلاً، ليتكيف منظوره مع تجاعيد وانحناءات الكيس. ويقترن ذلك بنظام يتعلم أي أجزاء من الصورة هي الأكثر أهمية، مما يخبر الكمبيوتر فعلياً بتجاهل ضجيج الخلفية والتركيز على شكل الضرر. ومن خلال الجمع بين هذه الرؤية المرنة والتركيز على الميزات الأكثر صلة، أصبح النظام أفضل بكثير في التعرف على الأكياس التالفة حتى عندما تكون مجعدة أو مائلة بطرق غريبة.
عندما اختبر الباحثون نظامهم المحسن على مجموعة من صور أكياس الطن الواقعية، كانت النتائج مذهلة. ففي ظروف الإضاءة المنخفضة، قفزت قدرة النظام على اكتشاف الضرر من 65.1% إلى 78.4%، وهي قفزة كبيرة تعني وجود عيوب فائتة أقل بكثير. وبالنسبة للأهداف الأصغر حجماً، ارتفع معدل الكشف إلى 85.2%، وبالنسبة للأكيما المشوهة، وصل إلى 74.3%. وبشكل عام، حقق النظام الجديد دقة بلغت 86.7%، متفوقاً على نماذج كشف رائدة أخرى مثل YOLOv7 وYOLOv8، اللذين سجلا 75.8% و78.6% على التوالي. وتثبت هذه الدراسة أنه من خلال معالجة الإضاءة والمقياس والشكل في وقت واحد، يمكن إنشاء أداة فحص قوية تعمل بموثوقية في البيئة المعقدة وغير المثالية للمستودعات الصناعية. ويقدم هذا النهج مساراً عملياً لضمان مراقبة الجودة في الخدمات اللوجستية والتصنيع، حيث يمكن أن يؤدي تفويت عيب صغير إلى مشاكل كبيرة لاحقاً.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.