← أحدث الأبحاث
💻 computer science

RiO-DETR: DETR for Real-time Oriented Object Detection

يُعد RiO-DETR أول محول (transformer) للكشف عن الأجسام الموجهة في الوقت الفعلي يعالج تحديات تقدير الزاوية، والدورية، والتقارب من خلال تصميمات مبتكرة مثل تقدير الزاوية المدفوع بالمحتوى والتحسين الدوري المنفصل، محققاً توازناً جديداً بين السرعة والدقة في مجموعات بيانات الاختبار.

المؤلفون الأصليون: Zhangchi Hu, Yifan Zhao, Yansong Peng, Wenzhang Sun, Xiangchen Yin, Jie Chen, Peixi Wu, Hebei Li, Xinghao Wang, Dongsheng Jiang, Xiaoyan Sun

نُشر 2026-03-11
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zhangchi Hu, Yifan Zhao, Yansong Peng, Wenzhang Sun, Xiangchen Yin, Jie Chen, Peixi Wu, Hebei Li, Xinghao Wang, Dongsheng Jiang, Xiaoyan Sun

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول العثور على أشياء محددة في صورة فوتوغرافية ضخمة وعالية الارتفاع لمدينة أو منظر طبيعي. في الصور العادية، تكون السيارات والقوارب عادةً في وضع عمودي. ولكن في الصور الجوية (مثل تلك الملتقطة بواسطة طائرة بدون طيار أو قمر صناعي)، قد تكون السيارة مركونة بزاوية 45 درجة، أو قد يكون القارب يبحر بشكل مائل، أو قد يكون المبنى مائلًا.

للعثور على هذه الأشياء، تحتاج إلى رسم صندوق حولها. الصندوق القياسي هو مجرد مستطيل (عرض وارتفاع). ولكن بالنسبة للأجسام المائلة، فأنت بحاجة إلى صندوق إحاطة موجه (OBB) — وهو مستطيل يمكنه الدوران ليتناسب مع الزاوية الدقيقة للجسم.

تقدم هذه الورقة البحثية نموذج RiO-DETR، وهو نموذج ذكاء اصطناعي جديد مصمم للعثور على هذه الأجسام المائلة بسرعة فائقة (في الوقت الفعلي) مع دقة مذهلة.

إليك تفصيل ما قاموا به، باستخدام تشبيهات بسيطة:

المشكلة: "الطريقة القديمة" كانت بطيئة جدًا أو غير دقيقة

سابقًا، كان هناك نوعان من المحققين بالذكاء الاصطناعي:

  1. العداؤون (الشبكات العصبية التلافيفية مثل YOLO): هؤلاء يشبهون العدائين السريعين. هم سريعون جدًا ولكنهم أحيانًا يفتقرون إلى التفاصيل الدقيقة لكيفية دوران الجسم بالضبط.
  2. المفكرون (نماذج DETR): هؤلاء يشبهون أساتذة الشطرنج. هم أذكياء جدًا ودقيقون في العثور على الأجسام المائلة، لكنهم يستغرقون وقتًا طويلًا في التفكير. إنهم بطيئون جدًا بالنسبة للتطبيقات التي تتطلب استجابة فورية (مثل طائرة بدون طيار تتجنب العوائق).

سأل الباحثون: هل يمكننا بناء "مفكر" يعمل بسرعة "العداء"؟

الحل: RiO-DETR

RiO-DETR هو أول نموذج ينجح في الجمع بين الدقة العالية لـ "المفكرين" مع سرعة "العدائين" للأجسام المائلة. ولتحقيق ذلك، كان عليهم إصلاح ثلاثة "أخطاء تقنية" تحدث عند محاولة تعليم الذكاء الاصطناعي كيفية الدوران.

1. مشكلة "البوصلة مقابل الخريطة" (تقدير الزاوية القائم على المحتوى)

  • الخلل: في النماذج القديمة، كان الذكاء الاصطناعي يحاول تعلم الموقع (أين يوجد الجسم) والزاوية (الاتجاه الذي يواجهه) في نفس الوقت، باستخدام نفس البيانات. كان الأمر يشبه محاولة قراءة خريطة وبوصلة في آن واحد وأنت معصوب العينين. ارتبك الذكاء الاصطناعي لأن الزاوية تعتمد على شكل الجسم (نسيجه، شكله) وليس فقط مكانه.
  • الإصلاح: قاموا بفصل المهمتين.
    • الخريطة: يستخدم الذكاء الاصطناعي بيانات الموقع فقط ليقول: "هناك سيارة هنا".
    • البوصلة: ينظر الذكاء الاصطناعي إلى المحتوى (البكسلات، النسيج) ليعرف: "آه، السيارة تواجه الشمال الشرقي".
    • تشبيه: تخيل محققًا ينظر إلى مسرح جريمة. بدلًا من تخمين اتجاه المشتبه به بناءً على مكان وقوفه، ينظر المحقق إلى آثار الأقدام واتجاه الرياح (المحتوى) لتحديد المسار. هذا يجعل التخمين أكثر دقة بكثير.

2. مشكلة "دائرة الارتباك" (التحسين الدوري المنفصل)

  • الخلل: الزوايا دائرية. 0 درجة هي نفسها 360 درجة (أو 180 درجة للمستطيلات). إذا كان الجسم عند 179 درجة وخمن الذكاء الاصطناعي أنها 1 درجة، فإن الصيغة الرياضية القياسية ستعتبر الفرق بينهما 178 درجة (خطأ هائل). لكن في الواقع، هما متقاربان جدًا! هذا يجعل الذكاء الاصطناعي يصاب بالذعر ويقوم بتخمينات عشوائية.
  • الإصلاح: علموا الذكاء الاصطناعي أن الزوايا عبارة عن دائرة، وليست خطًا مستقيمًا.
    • تشبيه: تخيل ساعة. إذا كان عقرب الساعة عند 11:59 وتحرك إلى 12:01، فقد تحرك دقيقتين فقط. ولكن إذا عاملت الساعة كخط مستقيم، فقد تعتقد أنه تحرك 11 ساعة و58 دقيقة. تعلم RiO-DETR أخذ "أقصر طريق" حول وجه الساعة، حتى لا يرتبك بسبب عملية الالتفاف (wrap-around).

3. مشكلة "الطالب الممل" (التعلم الكثيف الموجه O2O)

  • الخلل: تعلم التنبؤ بالزوايا أمر صعب وبطيء. يصاب الذكاء الاصطناعي بالملل أو يتعثر لأنه لا يرى تنوعًا كافيًا في بيانات التدريب.
  • الإصلاح: ابتكروا خدعة تدريب خاصة حيث يأخذون صورة واحدة، ويقسمونها إلى أربعة أجزاء، ويدور كل جزء منها بزاوية مختلفة، ثم يعيدون تجميعها.
    • تشبيه: تخيل طالبًا يتعلم التعرف على السيارات. إذا رأى فقط سيارات تسير شمالًا، فقد يرتبك عندما تسير سيارة شرقًا. طريقة تدريب RiO-DETR تجبر الطالب على رؤية نفس السيارة وهي تسير شمالاً، وجنوباً، وشرقاً، وغرباً، جميعها في صورة واحدة في آن واحد. هذا يجعل الطالب يتعلم مفهوم "السيارة" بشكل أسرع بكثير، بغض النظر عن الاتجاه.

النتيجة: المحقق الخارق

النتيجة هي نموذج يتميز بـ:

  • السرعة: يمكنه معالجة الصور في أجزاء من الثانية (الوقت الفعلي)، مما يجعله صالحًا للاستخدام في الطائرات بدون طيار، والسيارات ذاتية القيادة، وبث الفيديو المباشر.
  • الدقة: يتفوق على جميع النماذج السابقة في الدقة في مجموعات البيانات الرئيسية (مثل مجموعة بيانات DOTA).
  • الكفاءة: لا يحتاج إلى حاسوب خارق للعمل؛ بل يعمل بكفاءة على الأجهزة القياسية.

باخت fact: RiO-DETR يشبه ترقية أمين مكتبة بطيء ومشتت الذهن إلى حارس أمن سريع وحاد البصر، يمكنه رصد جسم مائل في الحشود فورًا، ومعرفة الاتجاه الذي يواجهه بدقة، دون بذل أي مجهود إضافي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →