← أحدث الأبحاث
💻 computer science

YOLO26: A Comprehensive Architecture Overview and Key Improvements

تقدم هذه الورقة أول تحليل معماري شامل لنموذج YOLO26 المبتكر، والذي يفصل ابتكاراته الرئيسية — بما في ذلك الاستدلال الخالي من NMS، وProgLoss، ومحسن MuSGD — التي تتيح مجتمعةً زيادة في سرعة المعالج (CPU) بنسبة 43% وتعزيز الأداء عبر مختلف مهام الرؤية الحاسوبية.

المؤلفون الأصليون: Priyanto Hidayatullah, Refdinal Tubagus

نُشر 2026-02-17
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Priyanto Hidayatullah, Refdinal Tubagus

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك حارس أمن فائق الذكاء يُدعى YOLO (أنت تنظر مرة واحدة فقط). طوال العقد الماضي، كان هذا الحارس هو الأفضل في رصد الأشياء وسط الحشود، سواء كانت شخصاً، أو سيارة، أو قطة. وكل بضع سنوات، يحصل الحارس على ترقية تدريبية ليصبح أسرع وأكثر حدة.

هذه الورقة البحثية تتحدث عن أحدث ترقية، YOLO26، التي صدرت في أوائل عام 2026. المؤلفون، الذين يشبهون المحققين الذين يدرسون دليل تدريب الحارس وكوده البرمجي، يريدون شرح كيف يعمل هذا الإصدار الجديد بالضبط لكي يتمكن المطورون الآخرون من بناء حراس أفضل في المستقبل.

إليك تفاصيل YOLO26 بكلمات بسيطة، باستخدام بعض التشبيهات من الحياة اليومية:

1. الهدف الكبير: "صُمم ليعمل على الأجهزة الطرفية"

تخيل أن لديك كاميرا أمنية عالية التقنية، لكنها تعمل على كمبيوتر محمول صغير ورخيص في غابة نائية (جهاز طرفي/Edge Device) بدون بطاقة رسوميات قوية. كانت إصدارات YOLO السابقة مثل سيارات السباق التي تحتاج إلى خزان وقود ضخم (وحدة معالجة رسوميات GPU قوية) لتعمل بسرعة.

YOLO26 يشبه سيارة هجينة مصممة لتعمل بنفس السرعة على بطارية صغيرة. يزعم المؤلفون أنه أسرع بنسبة 43% على الحواسيب العادية (CPUs). وهذا يعني أنه يمكنك تشغيل هذا الذكاء الاصطناوي الفائق على هاتفك، أو طائرة بدون طيار (درون)، أو كمبيوتر محمول رخيص دون الحاجة إلى كمبيوتر خارق.

2. نظام "بلا فلتر" الجديد (NMS-Free)

الطريقة القديمة:
تخيل أن الحارس رصد 10 كلاب مختلفة في صورة ما. قام برسم 10 مربعات حولها. ثم يأتي شخص ثانٍ (يُسمى NMS أو تقليص الحد الأقصى غير المتماثل) لينظر إلى جميع المربعات العشرة ويقول: "حسناً، هذه المربعات الثلاثة هي لنفس الكلب، لذا سنرمي الباقي ونحتفظ بالأفضل فقط". هذه الخطوة الثانية تستغرق وقتاً ويمكن أن تؤدي أحياناً إلى رمي كلب حقيقي بالخطأ.

طريقة YOLO26:
تم تدريب YOLO26 ليكون أذكى منذ البداية. هو لا يرسم 10 مربعات ثم يقوم بتنظيفها، بل يتعلم رسم المربع الأفضل والوحيد مباشرة.

  • التشبيه: الأمر يشبه طباخاً لا يتذوق 10 أنواع مختلفة من الحساء ليختار الأفضل، بل يتعلم كيف يطبخ الحساء المثالي من المحاولة الأولى. هذا يلغي الحاجة إلى "فريق التنظيف"، مما يجعل العملية أسرع وأكثر سلاسة.

3. القوة الخارقة للأجسام الصغيرة (STAL)

المشكلة:
في الإصدارات السابقة، إذا كان هناك طائر صغير يطير في زاوية صورة ضخمة، فقد يتجاهله الحارس لأنه صغير جداً لدرجة لا تهم. كان نظام التدريب يقول: "هذا مجرد نقطة؛ دعنا نركز على السيارات الكبيرة".

الحل (STAL):
يحتوي YOLO26 على قاعدة جديدة تسمى تعيين الملصقات الواعي للأهداف الصغيرة (Small-Target-Aware Label Assignment).

  • التشبيه: الأمر يشبه معلماً يخبر طالبه: "لا تنظر فقط إلى الأشجار الكبيرة في الغابة؛ بل انظر بدقة أيضاً إلى الزهور الصغيرة على الأرض". أصبح النظام الآن مُجبراً على الانتباه للأشياء الصغيرة (مثل نقطة بحجم 4×4 بكسل)، مما يضمن عدم تفويت أي شيء مهما كان صغيراً.

4. المُحسِّن الذكي (MuSGD)

المشكلة:
تدريب الذكاء الاصطناعي يشبه تعليم طالب حل مسألة رياضية. أحياناً يعلق الطالب، أو يدور في حلقات مفرغة، أو يتعلم ببطء شديد.

الحل (MuSGD):
يستخدم YOLO26 طريقة تدريس جديدة تسمى MuSGD.

  • التشبيه: تخيل مدرباً يتنقل بين أسلوبين للتدريب. أحياناً يستخدم تدريباً قياسياً (SGD)، وأحياناً يستخدم تقنية متطورة مستعارة من تدريب عقول الذكاء الاصطناعي العملاقة (Muon). من خلال دمج هذين الأسلوبين، يتعلم الطالب (الذكاء الاصطناعي) بشكل أسرع، ويتعثر أقل، ويصل إلى خط النهاية بسلاسة أكبر.

5. التدريب "التدريجي" (ProgLoss)

المشكلة:
عندما تبدأ في تعلم مهارة جديدة، تحتاج إلى الكثير من المساعدة. ومع تحسن مستواك، تحتاج إلى مساعدة أقل واستقلالية أكبر. إذا استمر المعلم في معاملتك كمبتدئ، فلن تتعلم أبداً كيف تفكر بنفسك.

الحل (ProgLoss):
يستخدم YOLO26 الخسارة التدريجية (Progressive Loss).

  • التشبيه: فكر في عجلات التدريب في الدراجة.
    • في بداية التدريب: يمتلك الحارس عجلات تدريب (نظام "واحد إلى كثير") تساعده على رؤية احتمالات عديدة والبقاء مستقراً.
    • في نهاية التدريب: مع اكتساب الحارس للثقة، يتم إزالة عجلات التدريب ببطء، وينتقل إلى نظام "واحد إلى واحد" (التنبؤ النهائي والنظيف). هذا يضمن أن يتعلم الحارس الأساسيات جيداً، لكنه ينهي المسار وهو مستعد للعمل بمفرده.

6. البنية الهيكلية: مصنع منظم جيداً

ترسم الورقة أيضاً خريطة لكيفية بناء YOLO26. فكر في الأمر كمصنع تجميع:

  • العمود الفقري (Backbone): تدخل المواد الخام (الصورة) ويتم تقطيعها ومعالجتها إلى أجزاء مفيدة.
  • الرقبة (Neck): هذا هو مركز الفرز. يستخدم "اختصاراً" جديداً (SPPF) للتأكد من تدفق المعلومات بسرعة دون انسداد. كما يضيف وحدة "الانتباه الذاتي" (Self-attention)، وهي تشبه مديراً يتراجع للخلف لينظر إلى أرض المصنع بأكملها لفهم الصورة الكبيرة، وليس فقط آلة واحدة.
  • الرأس (Head): هنا يتم اتخاذ القرار النهائي. يحتوي YOLO26 على ثلاث محطات متخصصة: واحدة للأجسام الصغيرة، وواحدة للمتوسطة، وواحدة للكبيرة.

لماذا يهم هذا؟

كتب المؤلفون هذه الورقة لأنه حتى الآن لم يكن لدى أحد خريطة واضحة وبسيطة لكيفية عمل YOLO26 من الداخل. لقد تعمقوا في الكود البرمجي للعثور على الأسرار.

الخلاصة:
YOLO26 ليس إعادة اختراع كاملة للعجلة؛ بل هو نسخة مصقولة وعالية الأداء من النموذج السابق. إنه أسرع، ويرى الأشياء الصغيرة بشكل أفضل، ولا يحتاج إلى "فريق تنظيف" (NMS)، ويمكنه العمل على الأجهزة الرخيصة. وهذا يجعله تغييراً جذرياً لأي شخص يريد وضع ذكاء اصطناعي ذكي في أجهزة العالم الحقيقي مثل الطائرات بدون طيار، والروبوتات، والهواتف الذكية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →