← أحدث الأبحاث
💻 computer science

Track-Guided Hierarchical Reinforcement Learning for Autonomous Vehicle Drifting with Minimum-Lap-Time Planning

تقترح هذه الورقة إطار عمل للتعلم التعزيزي الهرمي الموجه بالمسار، والذي يستفيد من مسارات التخطيط لزمن اللفة الأدنى لتدريب وحدة تحكم مركبة ذاتية القيادة تدريجياً من أجل التفحيط المستقر والفعال زمنياً على الأسطح الرخوة.

المؤلفون الأصليون: Sheng Zhao, Bolin Zhao, Xiaodong Wu, Chen Lv

نُشر 2026-08-04
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Sheng Zhao, Bolin Zhao, Xiaodong Wu, Chen Lv

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل عالماً لا تكتفي فيه السيارات بالقيادة فحسب، بل ترقص أيضاً. في ساحة فورمولا 1 عالية المخاطر، يلتصق السائقون بالخط الداخلي، متمسكين بإطاراتهم بالطريق للذهاب بأقصى سرعة ممكنة. ولكن في سباقات الرالي، على الحصى المتناثر أو الثلج، يفعل أمهر السائقين شيئاً جنونياً: يتعمدون فقدان التماسك. إنهم يجعلون السيارة تدور بشكل جانبي، وتنزلق عبر المنعطفات مثل متزلج فني على الجليد. يُسمى هذا "التفحيط" (Drifting). يبدو الأمر خطيراً، وهو كذلك بالفعل، لأن السيارة تصارع قوانين الفيزياء الخاصة بها. ولكن عندما يتم تنفيذه بشكل صحيح، فإنه يساعد السيارة فعلياً على الدوران بشكل أسرع وإنهاء السباق في وقت أقل.

إن جعل الكمبيوتر يقوم بذلك يمثل كابوساً للمهندسين. عادةً، تعلم روبوتاً كيف يقود من خلال إظهار ما يجب فعله بالضبط، أو عبر إعطائه مجموعة صارمة من القواعد. لكن التفحيط عملية فوضوية؛ فالإطارات تنزلق، وتوجيه السيارة يصبح غريباً، والفيزياء غير قابعة للتنبؤ بشكل جامح. إذا قلت للكمبيوتر فقط "اجعل السيارة تنزلق"، فقد يدور حول نفسه ويتحطم. وإذا حاولت كتابة صيغة رياضية مثالية لكل انزلاق محتمل، فسيصاب الكمبيوتر بالارتباك لأن العالم الحقيقي معقد للغاية. لذا، لجأ العلماء إلى حيلة مختلفة: "التعلم التعزيزي" (Reinforcement Learning). فكر في الأمر كتعليم شخصية في لعبة فيديو من خلال تركها تلعب آلاف المرات، وتموت مراراً وتكراراً، حتى تكتشف أخيراً كيف تفوز. المشكلة هي أن تعليم روبوت كيفية التفحيط من الصفر يشبه تعليم طفل صغير القيام بشقلبة خلفية ثلاثية؛ فعادة ما يسقط على وجهه أولاً.

تقدم هذه الورقة طريقة جديدة وذكية لتعليم سيارة ذاتية القيادة كيفية التفحيط والفوز بالسباقات، باستخدام طريقة تسمى "التعلم التعزيزي الهرمي الموجه بالمسار" (Track-Guided Hierarchical Reinforcement Learning). أدرك المؤلف، شينغ تشاو وفريقه، أنه بدلاً من إلقاء الروبوت في العمق مباشرة، يجب عليهم تعليمه على مراحل، مثل لعبة فيديو تحتوي على مستويات. أولاً، استخدموا نموذجاً رياضياً فائق الدقة لحساب المسار المثالي والأسرع الممكن حول المضمار، حتى لو كان هذا المسار يتضمن انزلاقات جامحة. أطلقوا على هذا المخطط اسم "خطة الحد الأدنى لزمن اللفة" (Minimum-Lap-Time). يعمل هذا المخطط كمرجع أو خريطة للروبوت.

بعد ذلك، تركوا الروبوت يتعلم. لكنهم لم يكتفوا بقول "انطلق". لقد استخدموا نهجاً "موجهاً بالمسار". في المرحلة الأولى، يتعلم الروبوت على خط مستقيم، حيث يحاول فقط معرفة كيفية جعل السيارة تنزلق دون الاصطدام. في المرحلة الثانية، يتعلم التفحيط حول المنعطفات الحادة جداً. وأخيراً، في المرحلة الثالثة، يجمع كل ذلك في مضمار سباق كامل ليرى مدى السرعة التي يمكنه الوصول إليها. يحصل الروبوت على نقاط للبقاء على المسار، والانزلاق بالزاوية الصحيحة، والإنهاء بسرعة. تُظهر نتائج عمليات المحاكاة الحاسوبية أن هذه الطريقة التدريجية تعمل بشكل أفضل بكثير من محاولة تعلم كل شيء دفعة واحدة. لقد تعلم الروبوت التفحيط بفعالية، مع الحفاظ على استقرار السيارة أثناء الانزلاق، وتمكن من إكمال لفات أسرع بكثير من طرق الذكاء الاصطناعي الأخرى التي اختبروها. وبينما تم اختبار كل هذا في محاكاة حاسوبية وليس على سيارة حقيقية في مضمار حقيقي بعد، إلا أن هذا يشير إلى أنه مع وجود دليل تدريب صحيح، يمكن للروبوتات قريباً أن تتفحط عبر المنعطفات تماماً مثل سائقي الرالي المحترفين.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →