Track-Guided Hierarchical Reinforcement Learning for Autonomous Vehicle Drifting with Minimum-Lap-Time Planning
تقترح هذه الورقة إطار عمل للتعلم التعزيزي الهرمي الموجه بالمسار، والذي يستفيد من مسارات التخطيط لزمن اللفة الأدنى لتدريب وحدة تحكم مركبة ذاتية القيادة تدريجياً من أجل التفحيط المستقر والفعال زمنياً على الأسطح الرخوة.
تخيل عالماً لا تكتفي فيه السيارات بالقيادة فحسب، بل ترقص أيضاً. في ساحة فورمولا 1 عالية المخاطر، يلتصق السائقون بالخط الداخلي، متمسكين بإطاراتهم بالطريق للذهاب بأقصى سرعة ممكنة. ولكن في سباقات الرالي، على الحصى المتناثر أو الثلج، يفعل أمهر السائقين شيئاً جنونياً: يتعمدون فقدان التماسك. إنهم يجعلون السيارة تدور بشكل جانبي، وتنزلق عبر المنعطفات مثل متزلج فني على الجليد. يُسمى هذا "التفحيط" (Drifting). يبدو الأمر خطيراً، وهو كذلك بالفعل، لأن السيارة تصارع قوانين الفيزياء الخاصة بها. ولكن عندما يتم تنفيذه بشكل صحيح، فإنه يساعد السيارة فعلياً على الدوران بشكل أسرع وإنهاء السباق في وقت أقل.
إن جعل الكمبيوتر يقوم بذلك يمثل كابوساً للمهندسين. عادةً، تعلم روبوتاً كيف يقود من خلال إظهار ما يجب فعله بالضبط، أو عبر إعطائه مجموعة صارمة من القواعد. لكن التفحيط عملية فوضوية؛ فالإطارات تنزلق، وتوجيه السيارة يصبح غريباً، والفيزياء غير قابعة للتنبؤ بشكل جامح. إذا قلت للكمبيوتر فقط "اجعل السيارة تنزلق"، فقد يدور حول نفسه ويتحطم. وإذا حاولت كتابة صيغة رياضية مثالية لكل انزلاق محتمل، فسيصاب الكمبيوتر بالارتباك لأن العالم الحقيقي معقد للغاية. لذا، لجأ العلماء إلى حيلة مختلفة: "التعلم التعزيزي" (Reinforcement Learning). فكر في الأمر كتعليم شخصية في لعبة فيديو من خلال تركها تلعب آلاف المرات، وتموت مراراً وتكراراً، حتى تكتشف أخيراً كيف تفوز. المشكلة هي أن تعليم روبوت كيفية التفحيط من الصفر يشبه تعليم طفل صغير القيام بشقلبة خلفية ثلاثية؛ فعادة ما يسقط على وجهه أولاً.
تقدم هذه الورقة طريقة جديدة وذكية لتعليم سيارة ذاتية القيادة كيفية التفحيط والفوز بالسباقات، باستخدام طريقة تسمى "التعلم التعزيزي الهرمي الموجه بالمسار" (Track-Guided Hierarchical Reinforcement Learning). أدرك المؤلف، شينغ تشاو وفريقه، أنه بدلاً من إلقاء الروبوت في العمق مباشرة، يجب عليهم تعليمه على مراحل، مثل لعبة فيديو تحتوي على مستويات. أولاً، استخدموا نموذجاً رياضياً فائق الدقة لحساب المسار المثالي والأسرع الممكن حول المضمار، حتى لو كان هذا المسار يتضمن انزلاقات جامحة. أطلقوا على هذا المخطط اسم "خطة الحد الأدنى لزمن اللفة" (Minimum-Lap-Time). يعمل هذا المخطط كمرجع أو خريطة للروبوت.
بعد ذلك، تركوا الروبوت يتعلم. لكنهم لم يكتفوا بقول "انطلق". لقد استخدموا نهجاً "موجهاً بالمسار". في المرحلة الأولى، يتعلم الروبوت على خط مستقيم، حيث يحاول فقط معرفة كيفية جعل السيارة تنزلق دون الاصطدام. في المرحلة الثانية، يتعلم التفحيط حول المنعطفات الحادة جداً. وأخيراً، في المرحلة الثالثة، يجمع كل ذلك في مضمار سباق كامل ليرى مدى السرعة التي يمكنه الوصول إليها. يحصل الروبوت على نقاط للبقاء على المسار، والانزلاق بالزاوية الصحيحة، والإنهاء بسرعة. تُظهر نتائج عمليات المحاكاة الحاسوبية أن هذه الطريقة التدريجية تعمل بشكل أفضل بكثير من محاولة تعلم كل شيء دفعة واحدة. لقد تعلم الروبوت التفحيط بفعالية، مع الحفاظ على استقرار السيارة أثناء الانزلاق، وتمكن من إكمال لفات أسرع بكثير من طرق الذكاء الاصطناعي الأخرى التي اختبروها. وبينما تم اختبار كل هذا في محاكاة حاسوبية وليس على سيارة حقيقية في مضمار حقيقي بعد، إلا أن هذا يشير إلى أنه مع وجود دليل تدريب صحيح، يمكن للروبوتات قريباً أن تتفحط عبر المنعطفات تماماً مثل سائقي الرالي المحترفين.
ملخص تقني: التعلم التعزيزي الهرمي الموجه بالمسار للتحكم في الانزلاق (Drifting) للمركبات ذاتية القيادة مع تخطيط الحد الأدنى من زمن اللفة
بيان المشكلة يمثل انزلاق المركبات ذاتية القيادة (Drifting) تحدياً مزدوج الأهداف ومعقداً في التحكم: استقرار ديناميكيات الانزلاق غير الخطية للغاية مع تقليل زمن اللفة بدقة. وخلافاً لسباقات الفورمولا 1، حيث يحسن السائقون خطوط السباق ضمن حدود تماسك الإطارات، فإن سباقات الرالي على الأسطح المفككة أو منخفضة الالتصاق غالباً ما تتطلب كسر التماسك عمداً للقيام بالانزلاق. وتتوافق هذه المناورة مع اتجاه المركبة عند الخروج من المنعطفات، مما يقلل زمن اللفة ولكنه يفرض صعوبات تحكم كبيرة بسبب اللاخطية القوية في ديناميكيات الإطارات والهيكل. تواجه نهج التعلم التعزيزي (RL) الحالية عقبتين رئيسيتين: (1) الاعتماد الكبير على مجموعات بيانات تجريبية مكلفة خاصة بالمركبة للإشراف على مستوى الإجراءات، و(2) الافتقار إلى آليات مهيكلة لتوجيه الوكلاء نحو استراتيجيات انزلاق ذات معنى فيزيائي خلال مراحل التدريب المبكرة، مما يؤدي غالباً إلى سياسات دون المستوى أو غير آمنة.
المنهجية يقترح البحث إطار عمل للتخطيط للحد الأدنى من زمن اللفة (MLT) والتعلم التعزيزي الموجه بالمسار (TgRL). يدمج هذا النهج مخطط مسار يعتمد على النموذج مع متحكم تعلم تعزيزي عميق لمعالجة ندرة بيانات الخبراء وصعوبة تعلم الديناميكيات القصوى بشكل مباشر.
1. تخطيط الانزلاق للحد الأدنى من زمن اللفة (MLT):
يتم صياغة مسألة التحكم الأمثل (OCP) باستخدام نموذج مركبة عالي الدقة بـ 3 درجات حرية (3-DoF) ونموذج إطار "ماجيك فورمولا" (Magic Formula) لمحاكاة ظروف الانزلاق المشترك.
الهدف هو تقليل زمن اللفة عن طريق توليد مسارات مرجعية عدوانية وقابلة للتنفيذ ديناميكياً تشمل موقع المركبة، والوضعية، وزاوية الانزفاف الجانبي (sideslip angle)، ومعدل الانحراف (yaw rate).
تشمل القيود حدود الطريق، وحدود الحالة (مثل زاوية الانزفاف الجانبي β∈[−π/6,π/6])، وحدود مدخلات التحكم.
تعمل المسارات الناتجة كبيانات مرجعية عالية الجودة (مسارات مرجعية) لمتحكم التعلم التعزيزي، مما يلغي الحاجة إلى تجارب الخبراء البشرية.
2. التعلم التعزيزي الموجه بالمسار (TgRL):
الخوارزمية: يستخدم المؤلفون خوارزمية (Soft Actor-Critic - SAC)، وهي طريقة "actor-critic" غير سياسية (off-policy) ومنظمة بالاعتلاج (entropy-regularized) مناسبة للتحكم المستمر.
التعلم المنهجي (Curriculum Learning): للتغلب على صعوبة تعلم الديناميكيات القصوى مع زوايا الانزفاف الجانبي الكبيرة مباشرة، تم تنفيذ استراتيجية تدريب تصاعدية مكونة من ثلاث مراحل:
المرحلة 1 (السياسة الأساسية): التدريب على مسار مستقيم مبسط لتعلم التحكم الأساسي في الانزلاق (تحفيز انزلاق الإطارات وإدارة زوايا الانزفاف الجانبي الكبيرة).
المرحلة 2 (سياسة المنعطف): التدريب على منحنيات حادة (hairpin curves) لتعلم الانزلاق في المنعطفات، مع التركيز على بدء الانزلاق، والحفاظ على زوايا الانزفاف، وتنفيذ مخارج سلسة.
المرحلة 3 (سياسة السباق): التدريب على حلبة سباق مغلقة كاملة (Lkarting) لدمج المهارات لتقليل زمن اللفة مع الحفاظ على الاستقرار.
فضاء الإجراءات: يتضمن زاوية التوجيه المستمرة ومدخلات الخانق، والتي يتم تنعيمها عبر استراتيجية تنعيم الإجراءات التكيفية (AAS) لمنع الانقلاب عند السرعات العالية.
دالة المكافأة: تجمع دالة مكافأة متعددة الأهداف بين:
المكافآت اللحظية: تعاقب الأخطاء في الانحراف الجانبي، والاتجاه، والانزفاف الجانبي، والسرعة. كما يوجد حد مرجح بالسرعة لتشجيع الانعطاف عالي السرعة.
مكافآت النهاية: مكافآت منفصلة تُصدر عند انتهاء الحلقة (episode). يتم قياس المكافآت الإيجابية بناءً على مدى قرب زمن اللفة من الحد الأمثل لتخطيط MLT؛ وتُطبق المكافآت السلبية في حالات الاصطدام أو الانقلاب، وتكون عكسية بالنسبة لوقت البقاء.
المساهمات الرئيسية
إطار عمل مبتكر: يقدم البحث إطار عمل هرمي للتخطيط والتحكم (MLT-TgRL) يدمج بسلاسة بين توليد المسارات القائم على التحكم الأمثل والتعلم التعزيزي العميق، مما يمكن الوكلاء المستقلين من تنفيذ مناورات الانزلاق القصوى دون الحاجة لبيانات خبراء.
تخطيط MLT للانزلاق: تم تطوير صياغة محددة لمسألة التحكم الأمثل (OCP) لتوليد مسارات انزلاق عدوانية وقابلة للتنفيذ ديناميكياً تعمل كمعلومات مسبقة (priors) لوكيل التعلم التعزيزي، مما يحل محل الحاجة إلى تجارب بشرية عالية التكلفة.
منهجية التدريب التصاعدي: تم تقديم نهج مبتكر للتعلم المنهجي حيث يتم تدريب الوكيل خطوة بختق بعد أخرى (من التحكم الأساسي في الانزلاق إلى الانعطاف، ثم السباق الكامل). يتم توجيه ذلك عبر معلومات المسار ويتم تعزيزه بواسطة دالة مكافأة متخصصة تجمع بين مصطلحات التتبع اللحظية ومكافآت النهاية المشتقة من MLT.
النتائج تم التحقق من صحة إطار العمل باستخدام محاكي CARLA عبر ثلاثة مسارات: Lkarting، وWillow Springs، وNelson Ledges.
الأداء مقابل النماذج المرجعية: حقق متحكم MLT+TgRL المقترح باستمرار أزمنة لفة متفوقة مقارنة بنموذج SAC القياسي ومتحكم انزلاق سابق قائم على التعلم التعزيزي (Cai et al.). في مسار Lkarting، حقق إطار MLT+TgRL متوسط زمن لفة قدره 45.4 ثانية، متفوقاً على نموذج Cai_DRIFT البالغ (51.2 ثانية) بنسبة تقارب 11%.
المقارنة مع التخطيط: بينما حقق مخطط MLT الحد الأدنى النظري (أقل زمن لفة قدره 33.1 ثانية في Lkarting)، حقق متحكم TgRL نتائج تنافسية بحد أدنى لزمن اللفة قدره 37.2 ثانية ومتوسط قدره 45.4 ثانية، مما يثبت القدرة على تقريب المسارات المثلى في بيئة تحكم في الوقت الفعلي.
الاستقرار والديناميكيات: نجح الوكيل في الحفاظ على زوايا انزفاف جانبي كبيرة (بمتوسط 15.9 درجة في Lkarting، مقارنة بـ 10.4 درجة للسائق البشري و16.3 درجة للنموذج المرجعي)، مما يؤكد القدرة على الحفاظ على حالات الانزلاق. كما حافظ المتحكم على أخطاء تتبع منخفضة لزاوية الانحراف (yaw angle) وتقلبات دنيا في الإزاحة الجانبية.
دراسات الاستئصال (Ablation Studies): أدى إزالة توجيه MLT (باستخدام مراجع خط المنتصف بدلاً منها) أو المنهج التدريبي التصاعدي إلى تدهور الأداء بشكل كبير، مما يؤكد ضرورة كل من المعلومات المسبقة القائمة على النموذج ونهج التدريب المرحلي. كما أدى تضمين مكافآت النهاية وتنعيم الإجراءات التكيفي إلى تحسين اتساق زمن اللفة ودقة الانزلاق.
الأهمية والادعاءات يدعي البحث أن أهميته الرئيسية تكمن في سد الفجوة بين التخطيط الأمثل نظرياً والتنفيذ العملي للانزلاق. من خلال الاستفادة من المخططين القائمين على النماذج لتوفير مراجع قابلة للتنفيذ ديناميكياً، ومتحكمات التعلم التعزيزي للتكيف مع الديناميكيات غير المنمذجة وتأخيرات التشغيل، يحقق الأسلوب مناورات انزلاق عدوانية مع تحسين الاستقرار والتكرارية. يضع هذا العمل أساساً لاستخدام التعلم التعزيزي في أنظمة السباق ذاتية القيادة في العالم الحقيقي من خلال إثبات أن التدريب المنهجي الموجه بالمسارات المثلى يمكن أن يتغلب على تحديات ندرة البيانات والاستكشاف المتأصلة في تعلم الديناميكيات القصوى للمركبات. يشير المؤلفون إلى أنه بينما يعد النهج الحالي فعالاً، فإن العمل المستقبلي سيركز على تعميم المتحكم عبر نماذج مركبات وظروف طرق مختلفة، وتنفيذ تجارب "الحلقة في الحلقة" (HIL) للأجهزة.