Addressing the Waypoint-Action Gap in End-to-End Autonomous Driving via Vehicle Motion Models
تقترح هذه الورقة إطار عمل تفاضلي لحركة المركبات يسد الفجوة بين القيادة الذاتية من طرف إلى طرف القائمة على نقاط المسار وتلك القائمة على الأفعال، وذلك من خلال تمكين السياسات القائمة على الأفعال من التدريب والتقييم ضمن معايير القياس القياسية القائمة على نقاط المسار، محققةً أداءً هو الأفضل في فئته على منصة NAVSIM.
المؤلفون الأصليون:Jorge Daniel Rodríguez-Vidal, Gabriel Villalonga, Diego Porres, Antonio M. López Peña
تخيل أنك تعلم روبوتاً كيف يقود سيارة. هناك طريقتان رئيستان لإخبار الروبوت بما يجب فعله:
طريقة "عجلة القيادة" (القائمة على الأفعال): أنت تقول للروبوت، "أدر العجلة 5 درجات لليسار، واضغط على دواسة الوقود قليلاً، ولا تضغط على المكابح". هذا يشبه إعطاء طيار أوامر محددة ومنخفضة المستوى.
طريقة "مسار الخريطة" (القائمة على نقاط المسار): أنت تقول للروبوت، "قُد إلى هذه النقطة المحددة على الخريطة، ثم إلى تلك النقطة، ثم إلى التالية". هذا يشبه إعطاء جهاز GPS قائمة بالوجهات التي يجب الوصول إليها.
المشكلة: حاجز اللغة لفترة طويلة، أصبحت طريقة "مسار الخريطة" هي المعيار الذهبي. معظم الاختبارات، والمسابقات، وبرامج التدريب للسيارات ذاتية القيادة مصممة للتحقق مما إذا كان الروبوت سيصل إلى نقاط المسار (نقاط المسار) المحددة تلك.
ومع ذلك، يفضل العديد من الباحثين طريقة "عجلة القيادة" لأنها أكثر مرونة ولا تحتاج إلى خرائط GPS مثالية (وهذا رائع للمناطق الريفية). المشكلة هي أنك لا تستطيع اختبار روبوت "عجلة القيادة" بسهولة في مسابقة "مسار الخريطة". الأمر يشبه محاولة دخول بطولة شطرنج بينما أنت لا تعرف سوى لعب الداما؛ القواعد لا تتوافق مع حركاتك. هذا خلق "فجوة" حيث لم تستطع روبوتات "عجلة القيادة" الجيدة إثبات كفاءتها لأن الاختبارات صُممت لروبوتات "مسار الخريطة".
الحل: "المترجم العالمي" بنى مؤلفو هذه الورقة البحثية "مترجماً" ذكياً أو جسراً لإصلاح هذا الأمر.
لقد أنشأوا أداة خاصة تعتمد على الرياضيات (تسمى نموذج مركبة قابل للتفاضل) تعمل كأنها محاكي داخل عملية التدريب. وإليك كيف تعمل:
المدخلات: يعطي الروبوت أوامر "عجلة القيقة" الخاصة به (التوجيه، الوقود، المكابح).
المحاكاة: تقوم الأداة فوراً بحساب: "إذا فعلت السيارة ما قلته بالضبط، فأين ستكون بعد ثانية واحدة؟ وأين ستكون بعد ثانيتين؟" إنها تحول تلك الأوامر منخفضة المستوى إلى قائمة من نقاط المسار (نقاط المسار).
التحقق: يقوم النظام بعد ذلك بالتحقق مما إذا كانت نقاط المسار المحسوبة هذه تطابق المسار "الصحيح".
التعلم: إذا خرج الروبوت عن المسار، يرسل النظام "إشارة تصحيح" عبر المحاكي إلى الروبوت، ليعلمه كيفية ضبط التوجيه والوقود للوصول إلى نقاط الهدف.
لماذا هذا أمر رائع؟
ساحة لعب عادلة: الآن، يمكن للروبوت الذي يفكر بأوامر "عجلة القيادة" أن يتنافس في بطولات "مسار الخريطة" دون تغيير قواعد اللعبة.
المرونة: اختبر المؤلفون نوعين من "المترجمين":
نموذج الدراجة (KBM): تخيل أن السيارة هي دراجة. إنها طريقة بسيطة وسريعة لتخمين أين ستذهب السيارة.
نموذج المنحنى السلس (CCPP): تخيل أن السيارة ترسم شريطاً مثالياً وناعماً على الأرض. هذا النموذج أكثر تعقيداً ولكنه يتعامل مع المنعطفات الحادة والمنحنيات بشكل أفضل، تماماً مثل سائق سيارات سباق محترف.
نتائج أفضل: عندما استخدموا هذا الجسر، أدت روبوتات "عجلة القيادة" بشكل يضاهي، أو حتى يتفوق على، روبوتات "مسار الخريطة" في اختبارات القيادة الصعبة.
الخلاصة تظهر الورقة البحثية أنه ليس عليك الاختيار بين تعليم الروبوت القيادة عن طريق التوجيه أو عن طريق اتباع خريطة. يمكنك تعليمه التوجيه، واستخدام هذا "الجسر الرياضي" ليتظاهر بأنه يتبع خريطة لأغراض الاختبار والتقييم. هذا يسمح بمقارنة أفضل أساليب القيادة بشكل عادل، مما يؤدي إلى سيارات ذاتية القيادة أكثر أماناً وذكاءً.
ما لم يدّعوه:
لم يدّعوا أن هذا يحل جميع مشاكل القيادة الذاتية (مثل التلال ثلاثية الأبعاد أو اهتزازات نظام التعليق).
لم يدّعوا أن هذه أداة طبية أو تطبيق مستقبلي محدد؛ إنها مجرد طريقة لتحسين كيفية تدريب واختبار برمجيات القيادة في الوقت الحالي.
ملخص تقني: معالجة الفجوة بين المسار والنقطة المرجعية (Waypoint) والعمل (Action) في القيادة الذاتية من الطرف إلى الطرف عبر نماذج حركة المركبات
1. بيان المشكلة
تنقسم أنظمة القيادة الذاتية من الطرف إلى الطرف (E2E-AD) حاليًا إلى نموذجين بناءً على مخرجاتها: نماذج تعتمد على المسارات (Waypoints)، والتي تتنبأ بالمسارات المستقبلية، ونماذج تعتمد على الأفعال (Actions)، والتي تخرج مباشرة عناصر التحكم منخفضة المستوى (مثل التسارع، التوجيه، والفرملة). وبينما توفر السياسات القائمة على الأفعال مزايا مثل تقليل الاعتماد على نظام تحديد المواقع العالمي (GPS) عالي الدقة وتحسين الملاءمة للمناطق الريفية ذات الاتصال الضعيف، إلا أن مجتمع البحث يميل بشكل متزايد نحو النهج القائم على المسارات.
وقد أدى هذا التحول إلى خلق "فجوة بين المسار والفعل". فمعظم المعايير المرجعية الحديثة (مثل NAVSIM وBench2Drive) ومسارات التدريب مصممة حصريًا لمخرجات المسارات. وبناءً على ذلك، لا يمكن تدريب أو تقييم السياسات القائمة على الأفعال مباشرة ضمن هذه الأطر دون إدخال واجهات غير قياسية (مثل تقسيم مساحات التحكم إلى فئات منفصلة). ويعيق هذا عدم التوازن المقارنة العادلة والتقدم في الأساليب القائمة على الأفعال. تهدف الورقة إلى سد هذه الفجوة من خلال تمكين البنى القائمة على الأفعال من التدريب والتقييم ضمن المعايير المرجعية القائمة على المسارات دون تعديل بروتوكولات التقييم.
2. المنهجية
يقترح المؤلفون إطار عمل نموذج مركبة قابل للتفاضل يعمل كجسر تحليلي بين تمثيلات الفعل والمسار. الآلية الأساسية هي مشغل الرفع (Lifting Operator) (Fϕ) الذي يقوم بتمرير تسلسلات الأفعال المتوقعة لتتحول إلى مسارات مسار (Waypoints) في إطار المركبة. وهذا يسمح للنظام بالإشراف على السياسات القائمة على الأفعال باستخدام دالات خسارة (Loss Functions) في مساحة المسارات.
المكونات الرئيسية:
مشغل الرفع (Fϕ): يأخذ هذا المشغل تسلسل الأفعال منخفضة المستوى (at) والحالة الأولية للمركبة (st) لإنتاج تسلسل من المسارات (wt). وهو يتكون من ثلاثة مكونات نمطية قابلة للتفاضل:
تنشيط التحكم (ψϕ): يربط مخرجات الشبكة الخام بعناصر التحكم الفيزيائية المحدودة (على سبيل المثال، باستخدام sigmoid/tanh للتسارع والتوجيه).
تمرير الديناميكيات (fϕ): ينشر الحالة الكينماتيكية للأمام عبر الزمن باستخدام ديناميكيات المركبة.
إسقاط الوضعية (h): يستخرج الموقع المستوي (x,y) من متجه الحالة الكامل.
نماذج التطبيق: يتم تطبيق الإطار باستخدام نموذجين محددين للمركبة:
نموذج الدراجة الكينماتيكي (KBM): نموذج أحادي المسار يلتقط القيود غير الهولونومية، ويتم دمجه عبر طرق Euler أو Runge-Kutta (RK4).
مخطط المسار ذو الانحناء المستمر (CCPP): نموذج يولد مسارات سلسة باستخدام أقواس كلوثويد (clothoid arcs) لضمان استمرارية الانحناء، وتجنب انقطاعات التوجيه الناتجة عن المسارات الدائرية المستقيمة.
خط الأساس MLP: يتم استخدام "المدرك متعدد الطبقات" (MLP) أيضًا كمشغل رفع قائم على البيانات للمقارنة مع النماذج القائمة على الفيزياء.
مسار التدريب: تتنبأ شبكة السياسة (Nθ) بالأفعال من الملاحظات والأوامر. تمر هذه الأفعال عبر مشغل الرفع القابل للتفاضل لتوليد المسارات المتوقعة. يتم حساب خسارة L1 الموزونة بين المسارات المتوقعة والمسارات الحقيقية (Ground-truth). تتدفق التدرجات عبر مشغل الرفع لتحديث معاملات السياسة، بينما تظل معاملات نموذج المركبة ثابتة.
3. المساهمات الرئيسية
تحدد الورقة ثلاث مساهمات رئيسية:
هدف تدريب قائم على المسارات لسياسات الأفعال: يوضح المؤلفون أن ربط سياسات الأفعال بإطار عملها والإشراف عليها باستخدام خسارة في مساحة المسارات يؤدي إلى تقييم أكثر استقرارًا، وأداء أعلى في الحلقة المغلقة (closed-loop)، وارتباط أقوى مع نتائج القيادة مقارنة بأهداف مساحة الفعل القياسية.
إطار عمل حتمي وقابل للتفاضل: يقدم هذا العمل لأول مرة إطار عمل ديناميكيات مركبة حتمي وقابل للتفاضل مصمم خصيصًا لرفع الأفعال منخفضة المستوى إلى مسارات، مما يسمح باستخدامها في المعايير المرجعية القياسية.
مقارنة موحدة عبر النماذج: من خلال تطبيق الإطار باستخدام KBM وCCPP، يمكّن المؤلفون السياسات القائمة على الأفعال والقائمة على المسارات من التدريب والتقييم تحت نفس بروتوكول المسار دون تغيير واجهات المعايير المرجعية الحالية.
4. النتائج التجريبية
تم تقييم الإطار عبر أربعة معايير مرجعية صعبة: NAVSIM navtest، وNAVSIM navhard، وBench2Drive، وبروتوكول قائم على CARLA.
NAVSIM navhard (التفاعلي): حقق النهج أداءً رائدًا (SOTA) بين النماذج القائمة على الرؤية فقط. وتحديدًا، حقق نموذج MILE المقترن بمشغل الرفع CCPP درجة (EPDMS) قدرها 29.5، متفوقًا على أقوى نموذج أساسي يعتمد على الرؤية (Latent TransFuser).
NAVSIM navtest (غير التفاعلي): سمح الإطار للسياسات القائمة على الأفعال بمطابقة أو الاقتراب بشدة من النماذج المرجعية القائمة على المسارات. حقق نموذج CIL++ مع KBM درجة (PDMS) قدرها 83.3، وهي ضمن نطاق 1.5% من نموذج LAW القائم على المسارات فقط.
Bench2Drive (الحلقة المغلقة): حسن الإطار الأداء في الحلقة المغلقة بشكل كبير. بالنسبة لنموذج CIL++ الأساسي، تحسن "درجة القيادة" (DS) بنسبة تصل إلى 61.1% (من 43.6 إلى 66.9 مع CCPP)، وتحسن "إكمال المسار" (RC) بأكثر من 30%.
استقرار التدريب: أدى استخدام تكامل RK4 (خاصة مع CCPP) إلى تقليل التباين في ديناميكيات التدريب بشكل كبير مقارنة بتكامل Euler، مما أدى إلى اختيار نماذج أكثر قوة.
دراسة الارتباط: وجدت الورقة أن أخطاء مستوى المسار الناتجة عن الإطار (KBM/CCP) ترتبط ارتباطًا أقوى بمعدلات النجاح في الحلقة المغلقة مقارنة بأخطاء مساحة الفعل الخام، مما يشير إلى أن الإشراف على مستوى المسار هو مؤشر أفضل للأداء في العالم الحقيقي.
5. الأهمية والادعاءات
تدعي الورقة أن إطار عملها يجسّر بفعالية الانقسام المنهجي بين القيادة الذاتية القائمة على الأفعال وتلك القائمة على المسارات. ومن خلال السماح للسياسات القائمة على الأفعال بالتدريب والتقييم ضمن النظام البيئي السائد للمعايير المرجعية التي تركز على المسارات، يزيل هذا العمل حاجزًا كبيرًا أمام تطوير ومقارنة النهج القائمة على التحكم.
يؤكد المؤلفون أن طريقتهم لا تتطلب تعديل بروتوكولات المعايير المرجعية الحالية، مما يجعلها آلية عامة لتكييف السياسات القائمة على الأفعال. ويشيرون إلى أنه بينما يفترض الإطار حركة مستوية (R2) ويتجاهل التأثيرات ثلاثية الأبعاد مثل الميل أو نظام التعليق، فإنه ينجح في الاستفادة من نماذج المركبات الفيزيائية لتحسين استقرار وأداء التعلم من الطرف إلى الطرف. ويشير العمل إلى أن دمج البنية الكينماتيكية عبر الرفع القابل للتفاضل مفيد، خاصة في البيئات التفاعلية حيث تتراكم الأخطاء بمرور الوقت.