RF-DETR: Neural Architecture Search for Real-Time Detection Transformers
يقدم RF-DETR إطار عمل للبحث عن بنية عصبية خفيفة الوزن وتعتمد على مشاركة الأوزان، يكتشف بكفاءة المقايضات المثلى بين الدقة وزمن الاستجابة للكشف عن الأشياء في الوقت الفعلي، متفوقاً بشكل كبير على الأساليب الحالية الرائدة في أعلى مستوياتها على كل من معايير COCO وRoboflow100-VL.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك شيفاً ماهراً بارعاً في طهي طبق معين، مثل البيتزا المثالية. لقد تدرب هذا الشيف على ملايين من قطع البيتزا (مرحلة "ما قبل التدريب"). ومع ذلك، إذا طلبت منه طهي طبق مختلف تماماً، مثل لفافة السوشي أو التاكو، فقد يعاني لأن تدريبه كان مركزاً جداً على البيتزا.
هذه هي المشكلة التي تواجهها العديد من أنظمة "كشف الأجسام" في الذكاء الاصطناعي الحديث (البرامج التي تجد الأشياء في الصور). فهي بارعة في العثور على السيارات والأشخاص في مجموعات البيانات القياسية، لكنها غالباً ما تفشل عندما تعرض عليها صوراً غريبة من العالم الحقيقي لم ترها من قبل.
إليك RF-DETR، وهو نظام ذكاء اصطناعي جديد موصوف في هذه الورقة البحثية. لا تنظر إليه كشيف واحد، بل كـ مطبخ فائق المرونة يمكنه إعادة تشكيل نفسه فوراً لطهي الوجبة المثالية لأي مطعم محدد، دون الحاجة إلى توظيف شيف جديد أو إعادة تدريب الفريق بأكمله.
إليك كيف يعمل، مقسماً إلى مفاهيم بسيطة:
1. المطبخ "الذي يناسب الجميع" (البحث عن البنية العصبية مع مشاركة الأوزان - Weight-Sharing NAS)
عادةً، إذا أردت أن يكون الذكاء الاصطناعي أسرع، يجب عليك بناء نسخة أصغر وأبسط. وإذا أردت أن يكون أكثر دقة، فستبني نسخة أكبر وأبطأ. وهذا يعني عادةً ضرورة تدريب نموذج جديد تماماً لكل حجم تحتاجه.
يستخدم RF-DETR حيلة تسمى البحث عن البنية العصبية (NAS). تخيل مجموعة ضخمة من قطع "الليغو" حيث تبني هيكلاً واحداً ضخماً يحتوي بداخله على كل النسخ الممكنة من النموذج.
- السحر: بدلاً من تدريب آلاف النماذج المختلفة بشكل منفصل، يقوم RF-DETR بتدريب هذا "النموذج الخارق" الضخم الواحد دفعة واحدة.
- النتيجة: بمجرد تدريبه، يمكنك "فصل" أجزاء من النموذج فوراً لجعله صغيراً وسريعاً (للهاتف المحمول) أو ضخماً وبطيئاً (للخادم)، وسيظل يعمل بشكل مثالي. لست بحاجة لإعادة تدريبه لكل حجم جديد. الأمر يشبه امتلاك درع واحد يمكنه التقلص فوراً ليناسب طفلاً أو التوسع ليناسب عملاقاً، وهو بالفعل مختبر ومجرب في كلا الحجمين.
2. "المقابض القابلة للضبط"
تصف الورقة البحثية عدة "مقابض" يمكن للنظام تحريكها لإيجاد التوازن المثالي بين السرعة والدقة لوظيفة معينة. فكر في هذه المقابض مثل الإعدادات في كاميرا عالية الجودة:
- الدقة (الزوم/التكبير): يمكنك رفع جودة الصورة إلى عالية الدقة (أبطأ ولكنها ترى التفاصيل الصغيرة) أو خفضها إلى دقة منخفضة (أسرع ولكنها تفقد الأشياء الصغيرة).
- حجم الرقعة (كتل البكسل): تخيل أنك تنظر إلى صورة من خلال شبكة. يمكنك جعل مربعات الشبكة صغيرة جداً (تفاصيل أكثر، أبطأ) أو كبيرة (تفاصيل أقل، أسرع).
- طبقات فك التشفير (عمق الدماغ): يمكنك إخبار الذكاء الاصطناعي بأن يفكر عبر خطوتين أو 10 خطوات. الخطوات الأكثر تعني دقة أفضل ولكنها تستغرق وقتاً أطول.
- رموز الاستعلام (قائمة البحث): لدى الذكاء الاصطناعي قائمة بـ "الأشياء التي يبحث عنها". يمكنك تقليص القائمة للعثور على أشياء أقل بسرعة، أو إبقاؤها طويلة للعثور على كل شيء.
يحاول النظام آلاف التوليفات من هذه المقابض أثناء التدريب للعثور على "جبهة باريتو" (Pareto Frontier). وباللغة البسيطة، هذا هو المنحنى المثالي حيث تحصل على أكبر قدر من الدقة مقابل أقل قدر من الوقت.
3. التعلم من "الإنترنت" (النماذج التأسيسية)
معظم نماذج الذكاء الاصطناعي يتم تدريبها على مجموعات بيانات محددة وصغيرة. يبدأ RF-DETR بـ "نموذج تأسيسي" يسمى DINOv2، والذي تم تدريبه على الإنترنت بأكمله.
- التشبيه: بد instead من تعليم طالب مسائل رياضية من كتاب مدرسي واحد فقط، أنت تعطيه مكتبة تضم كل كتاب كُتب على الإطلاق. عندما يجلس أخيراً لخوض اختبار في موضوع معين، سيكون قد فهم العالم بشكل أفضل من أي شخص آخر.
- هذا يسمح لـ RF-DETR بالتعميم بشكل أفضل بكثير على البيانات الغريبة من العالم الحقيقي (مثل مجموعة بيانات Roboflow100-VL) مقارنة بالنماذج السابقة التي تم الإفراط في تدريبها على مجموعة واحدة قياسية (COCO).
4. مشكلة "اختناق الطاقة" (توحيد معايير السرعة)
تشير الورقة البحثية أيضاً إلى مشكلة مضحكة في عالم الذكاء الاصطناعي: وهي كيفية قياس سرعة هذه النماذج.
- المشكلة: عندما تقوم بتشغيل برنامج كمبيوتر بسرعة كبيرة، يسخن الكمبيوتر. ولحماية نفسه، يقوم الكمبيوتر بإبطاء السرعة (الاختناق/Throttling). يقيس الباحثون المختلفون السرعة في أوقات مختلفة، لذا تبدو بعض النماذج أسرع لمجرد أنه تم اختبارها عندما كان الكمبيوتر أبرد.
- الحل: يقترح المؤلفون قاعدة بسيطة: انتظر 200 مللي ثانية بين الاختبارات. هذا يسمح للكمبيوتر بالتبريد، مما يضمن قياس السرعة بشكل عادل من قبل الجميع. بدون ذلك، ستكون أرقام السرعة مجرد كذبة.
ماذا حققوا؟
- السرعة مقابل الدقة: في اختبار COCO القياسي، كانت أصغر نسخة من نموذجهم (Nano) أكثر دقة بمقدار 5.3 نقطة من أفضل نموذج "سريع" سابق (D-FINE) عند نفس السرعة.
- الأداء في العالم الحقيقي: في اختبار صعب من العالم الحقيقي (Robofpiow100-VL)، كان نموذجهم الكبير أسرع بـ 20 مرة من نموذج "مفتوح المفردات" ضخم (GroundingDINO) بينما كان في الواقع أكثر دقة.
- رقم قياسي جديد: هم أول كاشف يعمل في الوقت الفعلي يكسر حاجز 60 AP (درجة الدقة) في مجموعة بيانات COCO.
الملخص
RF-DETR يشبه المحول العالمي. إنه يأخذ عقلاً قوياً مدرباً على الإنترنت ويستخدم نظام بحث ذكي لتشكيل نفسه فوراً في الشكل المثالي لأي مهمة محددة، سواء كنت تحتاج لأن يكون فائق السرعة أو فائق الدقة. إنه يحل مشكلة "نموذج واحد يناسب الجميع" عبر إنشاء نموذج واحد يمكنه أن يناسب كل شيء دون الحاجة لإعادة تدريبه في كل مرة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.