← أحدث الأبحاث
💻 computer science

A Comparative Study of Faster R-CNN, Mask R-CNN, and YOLOv8 for Object Detection and Instance Segmentation, with a Custom-Class Transfer-Learning Case Study

تقدم هذه الورقة تحليلاً مقارناً نظرياً ونوعياً لنماذج Faster R-CNN وMask R-CNN وYOLOv8 للكشف عن الأشياء وتجزئة المثيلات، حيث تثبت من خلال دراسة حالة مخصصة لمركبة عسكرية أن الكواشف أحادية المرحلة خفيفة الوزن يمكنها التكيف بفعالية مع الفئات الجديدة عبر التعلم بنقل الخبرة مع التفوق على النماذج ثنائية المرحلة المدربة حصراً على مجموعات بيانات عامة، وكل ذلك في سياق بنيات الكشف المتطورة في الوقت الفعلي.

المؤلفون الأصليون: Muhammad Usman Aslam

نُشر 2026-09-21✓ Author reviewed ⓘ
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Muhammad Usman Aslam

البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في عالم الرؤية الحاسوبية، تتعلم الآلات رؤية العالم ليس فقط كمجموعة من الألوان والأشكال، بل كمشهد مليء بالأجسام المتميزة. هذا المجال، المعروف باسم "كشف الأجسام" (object detection)، هو التقنية التي تسمح للسيارة ذاتية القيادة بالتعرف على أحد المشاة، أو لكاميرا المراقبة برصد متسلل، أو لآلة المسح الطبي بتحديد ورم. ولكي تقوم الآلة بذلك، يجب عليها تنفيذ مهمتين صعبتين في آن واحد: يجب أن تجد مكان وجود الجسم داخل الصورة، ويجب أن تقرر بالضبط ماهية هذا الجسم. لسنوات، ناقش الباحثون أفضل طريقة لتعليم الكمبيوتر القيام بذلك. بعض الأساليب تعمل مثل "المفتش الدقيق"، حيث تمسح الصورة ببطء ومنهجية لضمان دقة كل تفصيل، بينما تعمل أساليب أخرى مثل "النظرة الخاطفة"، حيث تعالج المشهد بأكمله في تمريرة واحدة لإعطاء الأولوية للسرعة. السؤال الجوهي للمهندسين هو كيفية موازنة هذه المقايضة بين أن تكون دقيقاً تماماً وبين أن تكون سريعاً بما يكفي للعمل في الوقت الفعلي.

تستكشف دراسة حديثة أجراها محمد عثمان أسلم من جامعة غرب فلوريدا هذه الموازنة من خلال اختبار ثلاثة أنظمة حاسوبية مختلفة مصممة لرؤية العالم. تقارن البحث بين طريقتين راسختين تعملان على مراحل، إحداهما يمكنها أيضاً رسم خطوط تحديد دقيقة حول الأجسام، مقابل طريقة أحدث وأسرع تعالج الصور دفعة واحدة. لا تكتفي الدراسة بمجرد مقارنة هذه الأنظمة باستخدام صور اختبار قياسية؛ بل تتناول مشكلة عملية غالباً ما تغفل عنها الاختبارات القياسية: ماذا يحدث عندما تواجه الآلة جسماً لم يسبق لها أن تعلمت التعرف عليه؟ وللإجابة على ذلك، قام الباحث بتدريب نظام حديث وسريع للتعرف على المركبات العسكرية المدرعة، وهي فئة من الأجسام لا توجد في المكتبة القياسية للصور المستخدمة لتدريب معظم نماذج الرؤية الحاسوبية.

بدأ الاستقصاء بفحص كيفية بناء هذه الأنظمة الثلاثة، المعروفة باسم Faster R-CNN و Mask R-CNN و YOLOv8. يعمل النظامان الأولان كعملية مكونة من خطوتين؛ أولاً، يقومان بمسح الصورة للعثور على المناطق التي قد تحتوي على جسم، ثم يحللان تلك المناطق المحددة لتحديد ماهية الجسم وحدوده. ويضيف نظام Mask R-CNN خطوة ثالثة، مما يسمح له برسم تحديد دقيق للغاية (بكسل مثالي) حول كل جسم، مما يفصله عن الخلفية وعن الأجسام المتداخلة الأخرى. تُعرف هذه الأساليب بدقتها العالية ولكنها تتطلب قوة حوسبة ووقتاً أكبر. أما النظام الثالث، YOLOv8، فيتبع نهجاً مختلفاً؛ فهو ينظر إلى الصورة بأكملها في تمريرة واحدة، متنبئاً بموقع ونوع كل جسم في آن واحد. هذا التصميم مبني من أجل السرعة، مما يجعله مثالياً للتطبيقات في الوقت الفعلي مثل مراقبة الفيديو، رغم أنه تاريخياً كان يُعتبر أقل دقة قليلاً في التعامل مع الأجسام الصغيرة جداً أو المزدحمة.

لاختبار هذه الأنظمة في العالم الحقيقي، استخدم الباحث مجموعة قياسية من الصور التي تحتوي على عناصر شائعة مثل البشر والسيارات والحيوانات لمعرفة مدى جودة أداء الأنظمة المدربة مسبقاً. عندما عُرضت صور لـ "الخنافس" على نظام Faster R-CNN، تعرف عليها بشكل صحيح، لكنه أنتج أيضاً تخمينات إضافية منخفضة الثقة لـ "الحشرات" في نفس المواضع، مما أظهر أن النظام يعاني أحياناً عندما تتداخل فئات مختلفة من الأجسام أو تبدو متشابهة جداً. وعندما عُرضت عليه صورة لطائر، تردد النظام بين تسميته "طائراً" أو "حيواناً" أو نوعاً محدداً من الطيور، مما كشف أن مفرداته محدودة بالفئات الثمانين المحددة التي تعلمها في الأصل. وقد قدم نظام Mask R-CNN أداءً مثيراً للإعجاب على الصور القياسية، حيث نجح في فصل الحمر الوحشية والناس المتداخلين في حشد بحدود دقيقة، لكنه تطلب موارد حوسبة أكبر بكثير للقيام بذلك.

ومع ذلك، كان الجزء الأكثر أهمية في الدراسة هو محاولة تعليم هذه الأنظمة رؤية شيء لم تره من قبل: الدبابات. أنظمة الرؤية الحاسوبية القياسية هي أنظمة "مغلقة المفردات"، مما يعني أنها يمكنها فقط التعرف على القائمة المحددة من الأجسام التي تدربت عليها. فعندما عرض الباحث على نماذج Faster R-CNN و Mask R-CNN القياسية صوراً لمركبات عسكرية مدرعة، فشلت الآلات في تحديدها كدبابات. بدلاً من ذلك، قامت بفرض الصور على أقرب الفئات التي تعرفها، حيث صنفت الدبابات على أنها "شاحنات" أو "سيارات". لم يكن هذا فشلاً في قدرة الآلة على رؤية شكل المركبة، بل كان قصوراً في مفرداتها؛ فهي ببساطة لم تكن تملك كلمة "دبابة" في قاموسها.

ولحل هذه المشكلة، لجأ الباحث إلى نظام YOLOv8 واستخدم تقنية تسمى "تعلم النقل" (transfer learning). فبدلاً من البدء من الصفر، تم تزويد النظام بمجموعة بيانات صغيرة ومخصصة تتكون من عشرين صورة فقط للدبابات، والتي تم تصنيفها يدوياً بواسطة إنسان. ثم تم ضبط النظام بدقة (fine-tuning) بناءً على هذه المجموعة الصغيرة من الصور. كانت النتيجة مذهلة؛ فقد نجح نظام YOLOv8، الذي تم تكييفه مع هذه الفئة الجديدة، في التعرف على الدبابات في معروضات المتاحف والصور الخارجية بثقة عالية. حتى أنه تعرّف على مركبة مدرعة متحركة في حقل، رغم الضبابية والمسافة، مما أثبت أن نظاماً خفيفاً وسريعاً يمكن تكييفه بسرعة للقيام بمهمة جديدة ومحددة بجهد ضئيل من البيانات.

تخلص الدراسة إلى أنه بينما تظل الأنظمة القديمة ذات المرحلتين ممتازة للمهام العامة حيث تكون الدقة العالية مطلوبة للأجسام المعروفة، إلا أنها تتسم بالجمود عندما يتعلق الأمر بالفئات الجديدة؛ فهي لا تستطيع التعرف على ما لم يتم تعليمها إياه صراحة. وفي المقابل، أظهر نظام YOLOv8 أحادي المرحلة مرونة ذات قيمة عالية للتطبيقات العملية؛ فقد أظهر أنه مع قدر ضئيل من الجهد البشري لتصنيف عدد قليل من الصور الجديدة، يمكن توسيع نطاق الكاشف السريع ليتعرف على أنواع جديدة تماماً من الأجسام. وهذا يشير إلى أنه بالنسبة للعديد من مشكلات العالم الحقيقي، حيث يكون الهدف هو اكتشاف عناصر محددة ومخصصة بدلاً من مجرد فئات عامة، فإن سرعة وقدرة نظام المرحلة الواحدة على التكيف قد تكون أكثر فائدة من الدقة الخام للأساليب الأقدم والأبطأ. كما تشير الدراسة إلى أن المجال يتحرك بسرعة، مع ظهور نماذج أحدث تهدف إلى الجمع بين سرعة أنظمة المرحلة الواحدة ودقة الأنظمة القديمة، لكن الدرس الأساسي يظل واضحاً: الأداة الأفضل تعتمد على ما إذا كنت بحاجة إلى آلة تعرف كل شيء عن العالم، أو آلة يمكنها التعلم بسرعة لرؤية شيء جديد.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →