RiO-DETR: DETR for Real-time Oriented Object Detection
يُعد RiO-DETR أول محول (transformer) للكشف عن الأجسام الموجهة في الوقت الفعلي يعالج تحديات تقدير الزاوية، والدورية، والتقارب من خلال تصميمات مبتكرة مثل تقدير الزاوية المدفوع بالمحتوى والتحسين الدوري المنفصل، محققاً توازناً جديداً بين السرعة والدقة في مجموعات بيانات الاختبار.
تخيل أنك تحاول العثور على أشياء محددة في صورة فوتوغرافية ضخمة وعالية الارتفاع لمدينة أو منظر طبيعي. في الصور العادية، تكون السيارات والقوارب عادةً في وضع عمودي. ولكن في الصور الجوية (مثل تلك الملتقطة بواسطة طائرة بدون طيار أو قمر صناعي)، قد تكون السيارة مركونة بزاوية 45 درجة، أو قد يكون القارب يبحر بشكل مائل، أو قد يكون المبنى مائلًا.
للعثور على هذه الأشياء، تحتاج إلى رسم صندوق حولها. الصندوق القياسي هو مجرد مستطيل (عرض وارتفاع). ولكن بالنسبة للأجسام المائلة، فأنت بحاجة إلى صندوق إحاطة موجه (OBB) — وهو مستطيل يمكنه الدوران ليتناسب مع الزاوية الدقيقة للجسم.
تقدم هذه الورقة البحثية نموذج RiO-DETR، وهو نموذج ذكاء اصطناعي جديد مصمم للعثور على هذه الأجسام المائلة بسرعة فائقة (في الوقت الفعلي) مع دقة مذهلة.
إليك تفصيل ما قاموا به، باستخدام تشبيهات بسيطة:
المشكلة: "الطريقة القديمة" كانت بطيئة جدًا أو غير دقيقة
سابقًا، كان هناك نوعان من المحققين بالذكاء الاصطناعي:
العداؤون (الشبكات العصبية التلافيفية مثل YOLO): هؤلاء يشبهون العدائين السريعين. هم سريعون جدًا ولكنهم أحيانًا يفتقرون إلى التفاصيل الدقيقة لكيفية دوران الجسم بالضبط.
المفكرون (نماذج DETR): هؤلاء يشبهون أساتذة الشطرنج. هم أذكياء جدًا ودقيقون في العثور على الأجسام المائلة، لكنهم يستغرقون وقتًا طويلًا في التفكير. إنهم بطيئون جدًا بالنسبة للتطبيقات التي تتطلب استجابة فورية (مثل طائرة بدون طيار تتجنب العوائق).
سأل الباحثون: هل يمكننا بناء "مفكر" يعمل بسرعة "العداء"؟
الحل: RiO-DETR
RiO-DETR هو أول نموذج ينجح في الجمع بين الدقة العالية لـ "المفكرين" مع سرعة "العدائين" للأجسام المائلة. ولتحقيق ذلك، كان عليهم إصلاح ثلاثة "أخطاء تقنية" تحدث عند محاولة تعليم الذكاء الاصطناعي كيفية الدوران.
1. مشكلة "البوصلة مقابل الخريطة" (تقدير الزاوية القائم على المحتوى)
الخلل: في النماذج القديمة، كان الذكاء الاصطناعي يحاول تعلم الموقع (أين يوجد الجسم) والزاوية (الاتجاه الذي يواجهه) في نفس الوقت، باستخدام نفس البيانات. كان الأمر يشبه محاولة قراءة خريطة وبوصلة في آن واحد وأنت معصوب العينين. ارتبك الذكاء الاصطناعي لأن الزاوية تعتمد على شكل الجسم (نسيجه، شكله) وليس فقط مكانه.
الإصلاح: قاموا بفصل المهمتين.
الخريطة: يستخدم الذكاء الاصطناعي بيانات الموقع فقط ليقول: "هناك سيارة هنا".
البوصلة: ينظر الذكاء الاصطناعي إلى المحتوى (البكسلات، النسيج) ليعرف: "آه، السيارة تواجه الشمال الشرقي".
تشبيه: تخيل محققًا ينظر إلى مسرح جريمة. بدلًا من تخمين اتجاه المشتبه به بناءً على مكان وقوفه، ينظر المحقق إلى آثار الأقدام واتجاه الرياح (المحتوى) لتحديد المسار. هذا يجعل التخمين أكثر دقة بكثير.
2. مشكلة "دائرة الارتباك" (التحسين الدوري المنفصل)
الخلل: الزوايا دائرية. 0 درجة هي نفسها 360 درجة (أو 180 درجة للمستطيلات). إذا كان الجسم عند 179 درجة وخمن الذكاء الاصطناعي أنها 1 درجة، فإن الصيغة الرياضية القياسية ستعتبر الفرق بينهما 178 درجة (خطأ هائل). لكن في الواقع، هما متقاربان جدًا! هذا يجعل الذكاء الاصطناعي يصاب بالذعر ويقوم بتخمينات عشوائية.
الإصلاح: علموا الذكاء الاصطناعي أن الزوايا عبارة عن دائرة، وليست خطًا مستقيمًا.
تشبيه: تخيل ساعة. إذا كان عقرب الساعة عند 11:59 وتحرك إلى 12:01، فقد تحرك دقيقتين فقط. ولكن إذا عاملت الساعة كخط مستقيم، فقد تعتقد أنه تحرك 11 ساعة و58 دقيقة. تعلم RiO-DETR أخذ "أقصر طريق" حول وجه الساعة، حتى لا يرتبك بسبب عملية الالتفاف (wrap-around).
3. مشكلة "الطالب الممل" (التعلم الكثيف الموجه O2O)
الخلل: تعلم التنبؤ بالزوايا أمر صعب وبطيء. يصاب الذكاء الاصطناعي بالملل أو يتعثر لأنه لا يرى تنوعًا كافيًا في بيانات التدريب.
الإصلاح: ابتكروا خدعة تدريب خاصة حيث يأخذون صورة واحدة، ويقسمونها إلى أربعة أجزاء، ويدور كل جزء منها بزاوية مختلفة، ثم يعيدون تجميعها.
تشبيه: تخيل طالبًا يتعلم التعرف على السيارات. إذا رأى فقط سيارات تسير شمالًا، فقد يرتبك عندما تسير سيارة شرقًا. طريقة تدريب RiO-DETR تجبر الطالب على رؤية نفس السيارة وهي تسير شمالاً، وجنوباً، وشرقاً، وغرباً، جميعها في صورة واحدة في آن واحد. هذا يجعل الطالب يتعلم مفهوم "السيارة" بشكل أسرع بكثير، بغض النظر عن الاتجاه.
النتيجة: المحقق الخارق
النتيجة هي نموذج يتميز بـ:
السرعة: يمكنه معالجة الصور في أجزاء من الثانية (الوقت الفعلي)، مما يجعله صالحًا للاستخدام في الطائرات بدون طيار، والسيارات ذاتية القيادة، وبث الفيديو المباشر.
الدقة: يتفوق على جميع النماذج السابقة في الدقة في مجموعات البيانات الرئيسية (مثل مجموعة بيانات DOTA).
الكفاءة: لا يحتاج إلى حاسوب خارق للعمل؛ بل يعمل بكفاءة على الأجهزة القياسية.
باخت fact: RiO-DETR يشبه ترقية أمين مكتبة بطيء ومشتت الذهن إلى حارس أمن سريع وحاد البصر، يمكنه رصد جسم مائل في الحشود فورًا، ومعرفة الاتجاه الذي يواجهه بدقة، دون بذل أي مجهود إضافي.
إليك ملخص تقني مفصل لورقة البحث بعنوان "RiO-DETR: DETR للكشف عن الأجسام الموجهة في الوقت الفعلي".
1. بيان المشكلة
يعد الكشف عن الأجسام الموجهة (OBB) أمراً بالغ الأهمية لتطبيقات مثل التصوير الجوي، والاستشعار عن بعد، وفهم النصوص في المشاهد، حيث تمتلك الأجسام دورات عشوائية. وبينما حققت الكواشف القائمة على الشبكات العصبية التلافيفية (CNN) (مثل متغيرات YOLO) أداءً في الوقت الفعلي، إلا أن الكواشف من نوع (DETR-style) تخلفت تاريخياً في السرعة بسبب آليات الانتباه الثقيلة وبطء التقارب.
تواجه المحاولات الحالية لتكييف DETR مع الأجسام الموجهة (OBBs) ثلاث عقبات أساسية تمنعها من تحقيق كفاءة الوقت الفعلي:
الاقتران الدلالي-الهندسي وانهيار الميزات: إن معاملة التوجيه (θ) كإحداثي هندسي مماثل للموقع (x,y) والحجم (w,h) في استعلامات الموضع يؤدي إلى إدخال الضوضاء. فالتوجيه غالباً ما يكون مدفوعاً بقرائن دلالية (النسيج، الاتجاه) وليس بالهندسة البحتة. علاوة على ذلك، فإن محاذاة جميع رؤوس الانتباه مع المحور الرئيسي للجسم تسبب "انهيار الميزات"، مما يتجاهل المعلومات الهيكلية الجانبية.
عدم تطابق الدورية في التحسين: تستخدم فكوك (decoders) الـ DETR القياسية تحديثات إقليدية إضافية (مثل الـ inverse-sigmoid). وهذا يفشل بالنسبة للزوايا لأن المجال دوري (0≡π). تؤدي التحديثات الإقليدية المباشرة إلى عدم الاستمرارية عند الحدود، مما يؤدي إلى تدرجات غير مستقرة وتحسينات غير موثوقة.
بطء التقارب في مساحة البحث الموسعة: تؤدي إضافة بُعد الزاوية إلى توسيع مساحة البحث بشكل كبير لعملية المطابقة ثنائية الأطراف. وتفتقر استراتيجيات الإشراف الكثيف المستخدمة في الكشف الأفقي إلى التنوع الزاوي الكافي لتسريع تعلم الزاوية، مما يؤدي إلى بطء التقارب.
2. المنهجية: RiO-DETR
يقترح المؤلفون RiO-DETR، وهو أول ترانسفورمر للكشف الموجه في الوقت الفعلي. بدلاً من مجرد إضافة فرع زاوية إلى البنى الموجودة، قاموا بإعادة تصميم المكونات الأساسية للتعامل مع الهندسة الموجهة بشكل أصيل. يتكون الإطار من ثلاثة ابتكارات رئيسية:
أ. تقدير الزاوية المدفوع بالمحتوى
لفصل القرائن الدلالية عن الأولويات الهندسية:
ترميز الاستعلام منزوع الهندسة: يقتصر استعلام الموضع (Qpos) بصرامة على الإحداثيات المكانية (cx,cy,w,h)، مستبعداً صراحةً الزاوية θ. ويتم استنتاج الزاوية بدلاً من ذلك من استعلام المحتوى القابل للتعلم (Qcontent)، مما يجبر النموذج على الاعتماد على الميزات الدلالية (تدفق النسيج، اتجاه الجسم) للتنبؤ بالتوجيه.
الانتباه المتعامد المصحح دورانياً: لمنع انهيار الميزات، يتم تقسيم آلية الانتباه متعدد الرؤوس إلى مجموعتين. بالنسبة لزاوية متوقعة θ، يقوم النصف الأول من الرؤوس بأخذ عينات من الميزات المحاذية لـ θ، بينما يأخذ النصف الثاني عينات متعامدة (θ+π/2). وهذا يلتقط القرائن الهيكلية الطولية والجانبية دون زيادة العبء الحسابي.
ب. التحسين الدوري المنفصل
لمعالجة الطبيعة الدورية للزوايا:
التحديث من الخشن إلى الناعم المحدود: بدلاً من التحديثات الإقليدية غير المحدودة، يستخدم تحسين الزاوية آلية محدودة مع عامل اضمحلال طبقي (αi). تقوم الطبقات المبكرة بإجراء تصحيحات خشنة، بينما تقوم الطبقات اللاحقة بالضبط الدقيق، مما يضمن الاستقرار.
خسارة الدورية لأقصر مسار: تم استبدال خسارة L1 القياسية بـ خسارة Shortest-Path Periodic L1. تقيس هذه المعلمة المسافة الجيوديسية على الدائرة، مما يضمن أن التدرجات تتبع دائماً أقصر مسار بين الزاوية المتوقعة والزاوية الحقيقية، حتى عبر حدود 0/π.
ج. O2O الكثيف الموجه
لتسريع التقارب:
بناءً على استراتيجية "Dense O2O" (التي تقوم بربط أرباع الصورة لزيادة كثافة الحقيقة الأرضية)، قدم المؤلفون Oriented Dense O2O.
قبل الربط، يتم تدوير كل ربع بشكل مستقل بزاوية عشوائية من {0∘,90∘,180∘,270∘}.
هذا يثري اصطناعياً التنوع الزاوي داخل صورة التدريب الواحدة، مما يجبر النموذج على تعلم تنبؤات زاوية قوية عبر توجهات مختلفة دون تكلفة حسابية إضافية.
3. المساهمات الرئيسية
أول DETR موجه في الوقت الفعلي: يسد RiO-DETR الفجوة بين الدقة العالية لنماذج DETR والكمون المنخفض المطلوب لتطبيقات الوقت الفعلي.
إعادة تصميم بنيوية متوافقة مع المهمة: توضح الورقة أن مجرد نقل تقنيات DETR الأفقية إلى OBBs ليس كافياً. وتقترح حلولاً محددة ومتوافقة مع المهمة لتقدير الزاوية، والتحسين الدوري، والإشراف التدريبي.
الكفاءة دون مقايضة الدقة: تعمل الطرق المقترحة (خاصة الانتباه المتعامد وخسارة الدورية) على تحسين الدقة والاستقرار دون زيادة المعلمات، أو عمليات الفاصلة العائمة (FLOPs)، أو زمن الاستدلال.
تقييم شامل: أظهرت التجارب المكثفة على DOTA-1.0 و DIOR-R و FAIR-1M-2.0 أداءً هو الأفضل في فئته (SOTA).
4. النتائج التجريبية
تم تقييم النموذج على مجموعات بيانات الاستشعار عن بعد القياسية باستخدام بروتوكولات المقياس الواحد والمقياس المتعدد.
DOTA-1.0 (مقياس واحد):
RiO-DETR-n: يحقق 78.4 AP50 مع زمن استجابة قدره 2.7 ms فقط (TensorRT FP16 على T4)، متفوقاً على YOLO26n-obb (77.7 AP50, 2.8 ms).
RiO-DETR-x: يحقق 81.8 AP50 عند 29.9 ms، متفوقاً على متغيرات DETR الثقيلة مثل RHINO-DETR (79.4 AP50, 242.6 ms) و YOLO26x-obb (80.4 AP50, 30.5 ms).
DIOR-R: يصل RiO-DETR-x إلى 77.43 AP50 عند 17.31 ms، متجاوزاً YOLO26x-obb (76.48%) عند سرعات مماثلة.
FAIR-1M-2.0: يضع معياراً جديداً للأفضل في فئته بـ 47.4 AP50 (مقياس متعدد)، متفوقاً على YOLO26x-obb (46.7%) و LSKNet-S (46.3%).
الكفاءة: يحافظ RiO-DETR على زمن استجابة مماثل لمتغيرات YOLO26 عبر جميع المقاييس (من n إلى x)، مما يغلق فجوة الكفاءة طويلة الأمد بين نماذج Transformer و CNN في الكشف الموجه.
5. الأهمية
يمثل RiO-DETR تحولاً جذرياً في الكشف عن الأجسام الموجهة. فهو يثبت أن الترانسفورمرات ذات النهاية إلى النهاية (end-to-end) يمكن أن تكون عالية الكفاءة للكشف الموجه (OBB) في الوقت الفعلي، مما يتحدى هيمنة البنى القائمة على CNN في هذا المجال. ومن خلال حل التحديات الهندسية والتحسينية المحددة للكشف الموجه (الدورية، الاقتران الدلالي-الهندسي، وسرعة التقارب)، توفر الورقة إطاراً قوياً وعملياً يحقق أفضل مقايضة بين السرعة والدقة. يفتح هذا العمل الباب لنشر نماذج كشف عالية الدقة ومستقلة عن الدوران في سيناريوهات الحوسبة الطرفية الحساسة لزمن الاستجابة.