Curriculum Reinforcement Learning for Quadrotor Racing with Random Obstacles
تقترح هذه الورقة إطار عمل جديد للتعلم التعزيزي القائم على الرؤية يعتمد على المنهج التعليمي المتدرج، والذي يجمع بين التعلم المنهجي متعدد المراحل، وعشوائية النطاق، والتحديث متعدد المشاهد لتمكين سباقات الكوادتورور (الطائرات بدون طيار رباعية المراوح) عالية السرعة والمتينة عبر عوائق عشوائية غير مرئية، متفوقةً بذلك على الأساليب الحالية في كل من التجارب المحاكاتية والواقعية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تعلم طفلاً صغيراً ركوب الدراجة.
إذا وضعت الطفل على دراجة في مدينة مزدحمة بالسيارات والمشاة والحفر فوراً، فمن المرجح أن يصطدم. ولكن إذا بدأت به في موقف سيارات فارغ، ثم انتقلت به إلى زقاق هادئ، ثم أخذته إلى منتزه به بعض الأشخاص الذين يتحركون ببطء، فسوف يتعلم في النهاية كيفية ركوب الدراجة بأمان وبسرعة.
هذه الورقة البحثية تتحدث عن تعليم روبوت طائر صغير (درون رباعي المراوح) كيف يتسابق عبر مسار مليء بالعقبات الفوضوية بسرعات عالية، باستخدام نفس المنطق "خطوة بخوة".
إليك تفصيل حلهم، مشروحاً ببساًطة:
1. المشكلة: "السلاح ذو الحدين"
في سباقات الدرون، الهدف هو الطيران بأسرع ما يمكن عبر سلسلة من الحلقات (البوابات).
- الصراع: لكي يطير الدرون بسرعة، يحتاج إلى التحرك بشكل مستقيم وهجومي. ولكن لتجنب الاصطدام بالعقبات العشوائية (مثل الأشجار أو الأعمدة)، يحتاج إلى أن يكون حذراً ويقلل سرعته.
- الالتواء: الحلقات نفسها تبدو كأنها عقبات بالنسبة لكاميرا الدرون. إذا كان الدرون خائفاً جداً من العقبات، فسيطير حول الحلقات بدلاً من المرور من خلالها. وإذا كان هجومياً جداً، فسيصطدم بالجدران.
- الطريقة القديمة: كانت طرق الذكاء الاصطناعي السابقة تشبه الطلاب الذين يحفظون اختباراً واحداً محدداً. إذا تغير الاختبار ولو قليلاً (تغيير أماكن العقبات)، فإنهم يفشلون. لم يكن بإمكانهم التعامل مع "العالم الحقيقي".
2. الحل: "التعلم المنهجي" (النظام المدرسي)
لم يلقِ المؤلفون بالدرون في العمق مباشرة. بل بنوا مدرسة تدريب مكونة من ثلاثة مستويات من الصعوبة:
- المستوى 1 (الملعب): يتعلم الدرون الطيران عبر حلقات فارغة. لا توجد عقبات. يتعلم هنا أساسيات السرعة والتوجيه.
- المستوى 2 (مضمار العقبات): يضيفون بعض العقبات العشوائية، لكن الدرون يطير ببطء. يتعلم كيف يتفادى الأشياء دون ذعر.
- المستوى 3 (دوري المحترفين): يزيلون حدود السرعة ويملؤون المسار بعقبات كثيفة وعشوائية. الآن يجب على الدرون دمج كل شيء: الطيران بسرعة، واجتياز الحلقات، وتفادي الفوضى.
يسمى هذا "التعلم التعزيزي المنهجي" (Curriculum Reinforcement Learning). تماماً كما يتدرب الرياضي البشري على جهاز المشي قبل الجري في ماراثون، يتدرب الدرون على مهام سهلة قبل مواجهة المهام الصعبة.
3. السر الخفي: "التدريب متعدد المشاهد"
تخيل معلماً يحاول تعليم 100 طالب.
- الطريقة القديمة: يعرض المعلم نفس المسألة الرياضية لجميع الطلاب الـ 100 في نفس الوقت. إذا حفظ الطلاب هذه المسألة الواحدة، فسيفشلون في الاختبار.
- طريقة هذه الورقة: يقسم المعلم الطلاب الـ 100 إلى مجموعات. المجموعة (أ) تحصل على مسألة صعبة، والمجموعة (ب) على مسألة متوسطة، والمجموعة (ج) على مسألة سهلة. يتعلم الجميع أشياء مختلفة ويتشاركون ما تعلموه.
استخدم الباحثون استراتيجية "التحديث متعدد المشاهد". لقد دربوا الذكاء الاصطناعي على العديد من تصميمات المسارات المختلفة في وقت واحد. هذا منع الدرون من "الغش" عبر حفظ مسار واحد محدد. بدلاً من ذلك، تعلم "مفهوم" السباق، مما جعله قابلاً للتكيف مع أي مسار جديد يراه.
4. "نظام المكافآت" (لوحة النتائج)
في تدريب الذكاء الاصطناعي، يحصل الدرون على "نقاط" (مكافآت) للسلوك الجيد ويفقد نقاطاً للسلوك السيئ. الجزء الصعب كان موازنة النتيجة:
- الفخ: إذا أعطيت نقاطاً فقط لتجنب العقبات، فسيظل الدرون يحلق في زاوية آمنة ولن يتسابق أبداً. وإذا أعطيت نقاطاً للسرعة فقط، فسيصطدم.
- الإصلاح: صمم المؤلفون لوحة نتائج معقدة.
- نقاط لـ: التحرك للأمام، واجتياز مركز الحلقة، والحفاظ على مسار طيران سلس.
- جزاءات لـ: الاصطدام بجدار، أو الطيران بسرعة كبيرة بالنسبة للوضع الحالي، أو القيام بحركات مفاجئة/مضطربة.
- السحر: لقد قاموا بضبط النقاط خصيصاً بحيث يدرك الدرون: "يمكنني الطيران بسرعة، ولكن يجب أن أنحرف قليلاً لتفادي ذلك العمود، ثم أعود بسرعة نحو الحلقة".
5. النتيجة: من المحاكاة إلى الواقع
قاموا بتدريب الدرون بالكامل في محاكاة حاسوبية (عالم ألعاب فيديو) باستخدام كاميرا ترى العمق (مثل العين البشرية).
- "النقل من الصفر" (Zero-Shot Transfer): عادةً، الذكاء الاصطناعي الذي يتم تدريبه في لعبة يصطدم عندما يوضع في العالم الحقيقي لأن الفيزياء مختلفة. ولكن لأنهم استخدموا "عشوائية النطاق" (تغيير الإضاءة، وزن الدرون، ومواقع العقبات عشوائياً أثناء التدريب)، فقد تعلم الدرون أن يكون قوياً ومتيناً.
- الاختبار في العالم الحقيقي: وضعوا الذكاء الاصطناعي على كمبيوتر صغير (Raspberry Pi) مثبت على درون حقيقي.
- السرعة: طار بسرعة 8 أمتار في الثانية (حوالي 18 ميلاً في الساعة).
- معدل النجاح: أكمل 100% من السباقات دون اصطدام، حتى عندما وضعت العقبات في أماكن عشوائية وغير مرئية مسبقاً.
- المقارنة: كان أسرع وأكثر موثوقية بكثير من الطرق السابقة.
الصورة الكبيرة
فكر في هذه الورقة كأنها تعلم روبوتاً كيف يكون سائق فورمولا 1 وفي نفس الوقت نينجا.
- جزء الفورمولا 1: يحتاج إلى أن يكون سريعاً ودقيقاً للغاية.
- جزء النينجا: يحتاج إلى تفادي الشوريكين الطائرة (العقبات) دون النظر إلى خريطة.
من خلال استخدام منهج تدريبي خطوة بخطوة ونظام مكافآت ذكي، علم المؤلفون الدرون كيف يكون كلاهما. إنها خطوة كبيرة نحو درونات يمكنها السباق ذاتياً، أو توصيل الطرود، أو القيام بمهام البحث والإنقاذ في بيئات فوضوية وغير متوقعة دون مساعدة بشرية.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.