← أحدث الأبحاث
💻 computer science

Efficient Residual YOLOv12-L Atrous Squeeze LightGBM Optimized Fuzzy CatBoost Network for Vehicle Identification in Traffic Environments

تقترح هذه الورقة إطار عمل RYAS-LOFCN، الذي يدمج شبكة الانتباه بالضغط والاتساع المتبقي (Residual Atrous Squeeze Attention Network) مع هيكل FPN وشبكة Fuzzy CatBoost المحسنة بواسطة LightGBM والقائمة على نموذج YOLOv12-L، للتغلب على القيود في اكتشاف الأجسام المرورية البعيدة والمتشابهة بصرياً، محققاً دقة بنسبة 98.63% وإحكاماً بنسبة 98.56% في تحديد المركبات.

المؤلفون الأصليون: R Kiranmai, R Deeptha

نُشر 2026-09-23
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: R Kiranmai, R Deeptha

البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تراقب كاميرات المرور حركة العالم، حيث تلتقط تدفقاً مستمراً من المركبات والمشاة وراكبي الدراجات وهم يتخللون شوارع المدن والطرق السريعة. ولكي تتمكن الحواسيب من فهم هذا المشهد، يجب عليها أولاً فصل الأجسام المتحركة عن الخلفية الثابتة، وهي عملية تسمى "التجزئة" (segmentation)، ومن ثم تحديد ماهية كل جسم بدقة. تصبح هذه المهمة صعبة للغاية عندما يكون المنظر مزدحماً، أو عندما تتغير الإضاءة من الشمس الساطعة إلى الظلال العميقة، أو عندما تكون الأجسام بعيدة. في تلك البقاع البعيدة، تظهر السيارات والأشخاص صغيرة ومنضغطة، وتتلاشى تفاصيلها بسبب المسافة الشاسعة وتعقيد الطريق من حولهم. وغالباً ما تعاني أنظمة الرؤية الحاسوبية التقليدية هنا، حيث تفقد تتبع الأشكال الصغيرة أو تدمج أشخاصاً منفصلين في كتلة واحدة مشوشة. كما أنها تتعثر عند تغير الضوء، مما يخلق ظلالاً تبدو وكأنها أجزاء من شخص أو مركبة، أو عندما تكون الخلفية مجزأة ومفككة.

ولحل هذه المشكلات المستمرة، طور باحثون في معهد SRM للعلوم والتكنولوجيا في تشيناي، الهند، نظاماً جديداً صُمم ليرى حركة المرور بوضوح أكبر من أي وقت مضى. يعتمد نهجهم، الموصوف في دراسة حديثة، على دمج مرحلتين قويتين: الأولى تقوم بقص أشكال الأجسام بعناية من الخلفية، والثانية تحدد ماهية تلك الأشكال. لقد بنى الفريق نظاماً يولي اهتماماً خاصاً بالتفاصيل الدقيقة والبعيدة التي تغفل عنها الطرق الأخرى، بينما يتعلم أيضاً تجاهل الضجيج المربك الناتج عن الظلال والشوارع المزدحمة. ومن خلال اختبار ابتكارهم على مجموعة كبيرة من فيديوهات المرور الواقعية، وجدوا أن طريقتهم يمكنها التمييز بين سيارة، أو شخص يسير، أو راكب دراجة بدقة ملحوظة، حتى عندما كانت الظروف بعيدة كل البعد عن المثالية.

يكمن جوهر هذا النظام الجديد في كيفية تعامله مع المعلومات المرئية حتى قبل أن يحاول تسمية الأجسام. فقد أدرك الباحثون أن الطرق القياسية غالباً ما تفشل في رؤية الأجسام البعيدة لأن عملية تبسيط الصورة تؤدي إلى طمس التفاصيل الباهتة للأشياء البعيدة. ولحل هذه المشكلة، قدموا تقنية توسع "رؤية" الكاميرا دون فقدان حدة الصورة. تخيل أنك تنظر إلى سلسلة جبال بعيدة؛ قد تجعل العدسة القياسية القمم ضبابية، لكن هذه الطريقة الجديدة تحافظ على حواف القمم حادة مع استيعاب المساحة الشاسعة من حولها في آن واحد. وهذا يسمح للنظام برصد أحد المشاة في نهاية الطريق بنفس الوضوح الذي يرصد به شاحنة أمام الكاميرا مباشرة. علاوة على ذلك، يستخدم النظام نهجاً متعدد الطبقات للنظر في المشهد بأحجام مختلفة في وقت واحد، مما يضمن منح كل من دراجة صغيرة وحافلة كبيرة الاهتمام اللازم. كما يستخدم آلية تصفية تتعلم تجاهل الفوضى في الخلفية، مثل الأشجار أو علامات الطريق، والتركيز فقط على الأجزاء المتحركة المهمة.

بمجرد أن ينجح النظام في فصل الأجسام عن الخلفية، ينتقل إلى المرحلة الثانية: التحديد. وهنا يواجه النظام تحديه التالي، حيث يتسبب ازدحام المرور غالباً في تلامس أو تداخل الخطوط الخارجية لأشخاص أو مركبات مختلفة، مما يجعل من الصعب معرفة أين ينتهي أحدهم ويبدأ الآخر. يعالج النموذج الجديد هذا الأمر باستخدام سلسلة من الفحوصات الذكية التي تنظر في شكل وبنية الأجسام المكتشفة. يمكنه التمييز بين شخص وراكب دراجة حتى عندما يبدوان متشابهين جداً، ويمكنه التعامل مع الارتباك الناتج عن الظلال التي قد تجعل الشخص يبدو وكأنه كيانان منفصلان. كما يتكيف النظام مع تغيرات الضوء، مما يضمن التعرف الصحيح على مركبة تخرج من نفق إلى ضوء الشمس. ومن خلال الجمع بين هذه الفحوصات المتقدمة، يتجنب النموذج الخطأ الشائع المتمثل في تجميع أشخاص منفصلين في كتلة واحدة أو فقدان جسم صغير تماماً.

عندما اختبر الباحثون نظامهم على مجموعة بيانات تحتوي على مئات سيناريوهات المرور، بما في ذلك الحشود الكثيفة وظروف الطقس المتغيرة، كانت النتائج مذهلة. ففي عمليات المحاكاة، حقق النموذج معدل دقة بلغ 98.63%، مما يعني أنه حدد مكان الأجسام وصنفها بشكل صحيح في الغالبية العظمى من السيارات والمشاة وراكبي الدراجات. كما حافظ أيضاً على مستوى عالٍ من الإحكام، حيث سجل درجة 98.56%، مما يشير إلى أنه نادراً ما يخطئ في اعتبار ظلٍ شخصاً أو شجرةً سيارة. وقد كان أداء النظام أفضل في العثور على الأجسام الموجودة بالفعل، حيث بلغت نسبة الاستدعاء (recall) 9%98.6، مما يظهر أنه لم يفتِ سوى القليل جداً من الأهداف. وكانت هذه الأرقاء أعلى بكثير من تلك التي حققتها النماذج الرائدة الأخرى المستخدمة حالياً، والتي غالباً ما تعاني من نفس الظروف المعقدة. كما أثبت النظام الجديد كفاءته، حيث يتطلب قدرة حوسبية أقل من منافسيه، مما يشير إلى إمكانية تشغيله مستقبلاً على أجهزة أصغر وأسرع مثل تلك الموجودة في السيارات ذاتية القيادة أو محطات مراقبة المرور.

تسلط الدراسة الضوء على أن مفتاح هذا النجاح لم يكن مجرد استخدام أداة واحدة قوية، بل في نسج عدة تقنيات متخصصة تعمل معاً لتغطية نقاط ضعف بعضها البعض. إن قدرة النظام على التعامل مع "انضغاط المنظور" للأجسام البعيدة و"اندماج الأقنعة" في المشاهد المزدحمة تمثل خطوة كبيرة للأمام في كيفية إدراك الآلات لحركة المرور. وبينما يشير الباحثون إلى أن عملهم تم من خلال عمليات المحاكاة وأن النشر في العالم الحقيقي على الأجهزة الطرفية هو هدف مستقبلي، فإن النتائج توفر أساساً قوياً لمراقبة مرورية أكثر موثوقية. ومن خلال جعل من الممكن للحواسيب رؤية التفاصيل الصغيرة في بيئة فوضوية، يقربنا هذا العمل من مستقبل يمكن فيه لأنظمة المرور الاستجابة فورياً وبدقة لتدفق الناس والمركبات المعقد في طرقنا.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →