NavOL: Navigation Policy with Online Imitation Learning
إنّ NavOL هو إطار عمل للتعلم بالتقليد عبر الإنترنت يستفيد من سياسة انتشار مدربة مسبقاً ومخطط عالمي لجمع والتعلم من مسارات الخبراء بشكل تكراري داخل محاكي، مما يؤدي إلى القضاء على هندسة المكافآت، وتخفيف انزياح التوزيع، وتحقيق أداء قوي في الملاحة البصرية في كل من بيئات المحاكاة والبيئات الواقعية.
تخيل أنك تعلم روبوتاً كيف يمشي عبر منزل فوضوي دون الاصطدام بالأثاث. هذا هو التحدي الجوهري الذي تعالجه ورقة بحث NavOL.
إليك قصة كيف حلوا هذه المشكلة، باستخدام تشبيهات بسيطة:
المشكلة: "الكتاب المدرسي" مقابل "العالم الحقيقي"
كان تدريب الملاحة للروبوتات سابقاً يشبه الدراسة لاختبار قيادة باستخدام كتاب مدرسي ثابت فقط.
التعلم غير المتصل (الطريقة القديمة): كان الباحثون يسجلون آلاف مسارات القيادة المثالية في محاكي، ويحفظونها في قرص صلب، ثم يعلمون الروبوت حفظها.
العيب: إذا ارتكب الروبوت خطأً بسيطاً في العالم الحقيقي (مثل تدوير المقود قبل أوانه بجزء من الثانية)، فإنه ينحرف عن "المسار المثالي" الذي حفظه. وبما أنه لم يتدرب أبداً على إصلاح الأخطاء، فإنه يصاب بالارتباك، ويصطدم، ثم يستسلم. وهذا ما يسمى بمشكلة "انزياح التوزيع" (distribution shift).
التعلم التعزيزي (طريقة التجربة والخطأ): هناك طريقة أخرى تسمح للروبوت بمجرد "التجربة والفشل" ملايين المرات، على أمل أن يتعلم في النهاية.
العيب: هذه الطريقة بطيئة للغاية وغير فعالة. إنها تشبه محاولة تعلم القيادة عبر الاصطدام بالجدر walls حتى تكتشف بالصدفة كيفية التوقف. كما يتعين عليك ابتكار نظام "نقاط" (مكافآت) معقد لكل فعل، وهو أمر يصعب ضبطه بدقة.
الحل: NavOL (نظام "المعلم الخصوصي المباشر")
ابتكر المؤلفون NavOL، وهو يشبه إعطاء الروبوت معلماً خصوصياً يمشي بجانبه في عالم افتراضي، ليصحح أخطاءه في الوقت الفعلي.
إليك كيف يعمل النظام، خطوة بخوة:
الملعب الافتراضي: بنوا عالماً افتراضياً ضخماً وعالي السرعة (باستخدام أداة تسمى IsaacLab) حيث يمكنهم تشغيل 256 روبوتاً في نفس الوقت. إنه يشبه وجود فصل دراسي به 256 طالباً يتدربون على القيادة في آن واحد.
المعلم "المتميز": داخل هذا العالم الافتراضي، يوجد مخطط بـ "وضع الإله" (God-mode planner). هذا المعلم يعرف الخريطة بأكملها بشكل مثالي (الجدران، الأثاث، الأهداف) ويمكنه رؤية أفضل مسار للوصول إلى الهدف. الروبوت لا يمكنه رؤية هذه الخريطة في العالم الحقيقي، لكن المعلم يستخدمها أثناء التدريب.
حلقة "التنفيذ والتحديث" (جلسة التدريب):
الخطوة أ (المحاولة): يحاول الروبوت التنقل في الغرفة بمفرده.
الخطوة ب (التصحيح): عند كل خطوة، يتحقق معلم "وضع الإله": "لو كان الروبوت مثالياً، أين يجب أن يكون الآن؟"
الخطوة ج (الدرس): يقارن الروبوت بين ما فعله وبين ما قال المعلم إنه يجب فعله. ويتعلم فوراً من هذا الفرق.
الخطوة د (التحديث): يتم تحديث عقل الروبوت (شبكته العصبية) فوراً بهذا الدرس الجديد قبل أن يحاول الخطوة التالية.
التشبيه: تخيل تعلم ركوب الدراجة.
الطريقة القديمة: تشاهد فيديو لشخص يركب الدراجة بشكل مثالي، ثم تحاول تقليده. إذا تمايلت، ستسقط لأنك لم تتعلم أبداً كيفية تصحيح هذا التمايل.
طريقة NavOL: أنت تركب دراجة، وهناك مدرب يركض بجانبك تماماً. في كل مرة تميل فيها كثيراً نحو اليسار، يدفعك المدرب بلطف لتعود إلى المنتصف بينما لا تزال تتحرك. أنت تتعلم التوازن من خلال تصحيح أخطائك بنفسك في الوقت الفعلي، وليس من خلال حفظ فيديو.
لماذا هذا الأمر مميز؟
لا تخمين لـ "المكافأة": لا يحتاج الروبوت إلى نظام تسجيل نقاط معقد. هو فقط يحاول تقليد المعلم الخبير.
إصلاح الأخطاء: لأن الروبوت يتدرب على تصحيح انحرافه أثناء التدريب، فإنه لا يصاب بالذعر عندما يرتكب خطأ في العالم الحقيقي.
السرعة: استخدموا 8 بطاقات رسوميات قوية (RTX 4090s) لجمع أكثر من 2,000 تجربة تعلم (مسارات) كل ساعة. هذا يشبه طالباً يقرأ مكتبة كاملة من أدلة القيادة في يوم واحد.
النتائج: من المحاكاة إلى الواقع
اختبر الفريق ذلك بطريقتين:
الاختبارات الافتراضية: وضعوا NavOL في مواجهة أفضل طرق ملاحة الروبوتات الأخرى في غرف افتراضية معقدة ومزدحمة. فاز NavOL في كل مرة تقريباً، حيث وصل إلى الأهداف بشكل أسرع وأكثر أماناً.
الاختبارات الواقعية: أخذوا الروبوت الذي تدرب في العالم الافتراضي ووضعوه على روبوت حقيقي (روبوت الكلب Unitree Go2) في مكاتب وصالات رياضية وممرات حقيقية.
النتيجة: نجح الروبوت الذي تدرب باستخدام NavOL في التنقل في هذه الغرف الحقيقية الفوضوية. بينما تعثرت الطرق القديمة (NavDP) أو اصطدمت.
"السحر": تم تدريب الروبوت على روبوت افتراضي من نوع "Dingo" ولكنه عمل بشكل مثالي على روبوت حقيقي من نوع "Go2". وهذا يثبت أن التعلم كان يتعلق بـ كيفية التنقل، وليس مجرد حفظ شكل روبوت معين.
باختالاختصار
NavOL هو طريقة جديدة لتعليم الروبوتات الحركة. بدلاً من حفظ خريطة ثابتة أو التخمين من خلال التجربة والخطأ، فإنه يستخدم "معلماً خصوصياً" في محاكي افتراضي سريع لتصحيح مسار الروبوت في الوقت الفعلي. هذا يجعل الروبوت أكثر ذكاءً، وأكثر أماناً، وقادراً على التعامل مع البيئات الحقيقية الفوضوية التي لم يسبق له رؤيتها من قبل.
ملخص تقني: NavOL – سياسة الملاحة مع التعلم التقليدي عبر الإنترنت
بيان المشكلة
لا تزال الملاحة البصرية الروبوتية في البيئات المفتوحة، والديناميكية، والمزدحمة تشكل تحديًا كبيرًا. تواجه الأساليب الحالية قيودًا متميزة:
التعلم التقليدي غير المتصل (Offline Imitation Learning): على الرغم من كفاءتها، تعاني هذه الطرق من انزياح التوزيع وتراكم الأخطاء أثناء التشغيل لأنها تعتمد على مجموعات بيانات ثابتة تم جمعها مسبقًا، والتي قد لا تغطي الحالات التي يواجهها الوكيل أثناء النشر.
التعلم التعزيزي (RL): على الرغم من أن التعلم التعزيزي يسمم بالتفاعل مع البيئة، إلا أنه يعتمد بشدة على دوال مكافأة مصممة بعناية، وغالبًا ما يواجه مكافآت نادرة، ويعاني من انخفاض كفاءة العينات، مما يجعل التدريب واسع النطاق في البيئات المعقدة أمرًا صعبًا.
ندرة البيانات: يعد جمع مسارات واقعية عالية الجودة واسعة النطاق أمرًا مكلفًا ويحد من قدرة النموذج. ومن ناحية أخرى، فإن توليد البيانات الاصطناعية البحتة (مثل NavDP) يحسن الكفاءة، ولكنه يظل مسارًا غير متصل لا يمكنه التصحيح للانجراف التوزيعي أثناء التدريب.
العائق الأساسي هو غياب نموذج قابل للتوسع يجمع بين كفاءة العينات في التعلم التقليدي والفوائد التفاعلية للتعلم عبر الإنترنت (Online Learning) للتخفيف من انزياح التوزيع دون الحاجة إلى هندسة المكافآت.
المنهجية: NavOL
يقترح NavOL نموذج تعلم تقليدي عبر الإنترنت يسد الفجوة بين التعلم التقليدي غير المتصل والتعلم التعزيزي عبر الإنترنت. وهو يعمل ضمن إطار عمل التشغيل–التحديث (rollout–update) في حلقة مغلقة باستخدام محاكي IsaacLab.
1. بنية النموذج
يعتمد NavOL على سياسة انتشار متعددة الوسائط مدربة مسبقًا (تحديدًا من NavDP) ويتكون من مكونين متعاونين:
مولد المسارات (f): وهو محول انتشار (Diffusion Transformer - DiT) يقوم برسم خرائط لملاحظات RGB-D وتعليمات الهدف إلى تسلسل قصير الأمد من نقاط المسار النسبية. يستخدم هياكل عصبية من نوع (DepthAnythingV2 ViT) للترميز البصري ومفكك ترانسفورمر لدمج الميزات.
شبكة الناقد (V): تشارك الرموز البصرية وهيكل DiT مع المولد. تقوم بتقييم المسارات المرشحة من حيث السلامة والجدوى، وتخرج درجة سلامة عددية. يتيح ذلك للنظام ترتيب المسارات التي تم أخذ عينات منها وتنفيذ المسار الأكثر أمانًا.
2. مسار التعلم التقليدي عبر الإنترنت
تتأرجح عملية التدريب بين مرحلتين:
مرحلة التشغيل (Rollout Stage):
يتنقل الوكيل في المحاكي باستخدام السياسة الحالية.
الإشراف الخبير: يقوم مخطط عالمي يتمتع بوصول متميز إلى خريطة البيئة (NavMesh) بحساب المسار الأمثل من الوضع الحالي إلى الهدف. يتم تكثيف هذا المسار وتنعيمه ليعمل كملصقات مسار حقيقية (ground-truth).
تجميع البيانات: في كل خطوة، ينفذ الوكيل إجراء السياسة باحتمالية ρ أو إجراء الخبير باحتمالية 1−ρ. يضمن هذا التفاعل (على نمط DAAger) أن تتعلم السياسة من الحالات التي تزورها بالفعل، مما يخفف من انزياح المتغيرات.
وسم السلامة: يتم اشتقاق درجة سلامة مستهدفة بناءً على المسافة إلى العوائق، للإشراف على شبكة الناقد.
مرحلة التحديث (Update Stage):
يتم تدريب سياسة الانتشار والناقد على أزواج الملاحظات-المسارات التي تم جمعها حديثًا.
يتم تحسين السياسة باستخدام هدف تقليل الضجيج القياسي (MSE بين الضجيج المتوقع والمستهدف) مشروطًا بالملاحظات، والأهداف، والمسارات الخبيرة.
يتم تحسين الناقد باستخدام خسارة MSE مقابل درجات السلامة المستهدفة.
من الضروري أن النظام يتخلص من البيانات من التكرارات السابقة، حيث يتدرب فقط على أحدث تشغيل لزيادة كفاءة التحديث.
3. التنفيذ والتوسع
المحاكاة: مبني على IsaacLab مع رندر عالي الدقة (إضاءة عالمية، انعكاسات، ظلال) وعشوائية النطاق (وضعية الكاميرا، الإضاءة، أبعاد الوكيل).
الكفاءة: يعمل النظام على 50 مشهدًا بالتوازي على 8 وحدات معالجة رسومية من نوع RTX 4090، حيث يجمع أكثر من 2,000 مسار جديد في الساعة (بمتوسط 400+ خطوة لكل منها).
التهيئة: يتم تهيئة السياسة بأوزان من نموذج NavDP لتوفير سابقة سلوكية قوية، رغم أن دراسات الاستئصال (ablation studies) تظهر إمكانية تدريبها من الصفر مع أداء منخفض.
المساهمات الرئيسية
إطار عمل NavOL: إطار عمل جديد للتعلم التقليدي عبر الإنترنت للملاحة يقوم بتحديث السياسة بشكل تكراري باستخدام عروض الخبراء التي يتم جمعها عبر الإنترنت، مما يلغي الحاجة إلى هندسة المكافآت.
مسار قابل للتوسع: مسار تشغيل–تحديث عالي التوازي قادر على جمع والتعلم من آلاف المسارات عالية الجودة في كل ساعة عبر مشاهد ثلاثية الأبعاد متنوعة.
معيار مرجعي جديد: تقديم معيار مرجعي للملاحة البصرية الداخلية يعتمد على مجموعة بيانات 3D-Front، ويتميز بـ 8 مشاهد خارج النطاق مع أزواج (بداية-هدف) محددة مسبقًا لتقييم التعميم الصفري بدقة.
التحقق التجريبي: تجارب واسعة النطاق تظهر مكاسب أداء ثابتة مقارنة بالنماذج المرجعية المتطورة في كل من المحاكاة والنشر الواقعي الصفري.
النتائج
معايلات المحاكاة
معيار NavDP: يتفوق NavOL على النماذج المرجعية (DD-PPO, iPlanner, ViPlanner, و NavDP الأصلي) عبر جميع المقاييس. يحقق متوسط معدل نجاح (mSR) بنسبة 80.4% ومتوسط طول مسار مرجح بالنجاح (mSPL) بنسبة 76.3%، متجاوزًا NavDP (77.8% SR, 74.8% SPL).
معيار NavOL: في المعيار الجديد الأكثر تحديًا، يحقق NavOL نسبة mSR تبلغ 69.0% ونسبة mSPL تبلغ 63.7%. وهذا يتفوق بشكل كبير على أقوى نموذج مرجعي، NavDP (42.2% SR, 37.7% SPL)، وطرق أخرى مثل ViPlanner (33.0% SR) و iPlanner (18.7% SR).
الاستقرار: يظهر التحليل النوعي أن NavOL يولد مسارات مستقرة وخالية من الاصطدامات حتى بالقرب من العوائق، بينما يظهر NavDP تباينًا عاليًا وسلوكيات اهتزاز تؤدي إلى الفشل.
النشر في العالم الحقيقي
النقل من المحاكاة إلى الواقع (Sim-to-Real) الصفري: تم نشر السياسة، التي تدربت على روبوت Dingo في المحاكاة، على روبوت Unitree Go2 مجهز بكاميرا RealSense D435i.
الأداء: في ثلاثة سيناريوهات واقعية مزدحمة (مكتب، صالة رياضية، ممر)، حقق NavOL معدلات نجاح بلغت 80%، 70%، و 100% على التوالي. في المقابل، حقق NavDP فقط 40%، 20%، و 20%.
تعدد الهياكل: تظهر النتائج تعميمًا قويًا عبر هياكل الروبوتات المختلفة، مما يؤكد قوة التمثيلات المكانية المتعلمة.
تحليل الكفاءة
تطلب NavOL المهيأ من NavDP حوالي 16 يومًا من وحدة المعالجة الرسومية (8 وحدات RTX 4090 لمدة يومين) لتحقيق mSR بنسبة 69.0%.
بالمقار المقارنة، تطلب NavDP الأصلي حوالي 1,024 يومًا من وحدة المعالجة الرسومية (32 وحدة A100 لمدة 32 يومًا) لتحقيق mSR بنسبة 42.2%.
حتى نسخة "من الصفر" من NavOL (16 يومًا من وحدة المعالجة الرسومية) تفوقت على NavDP الأصلي، مما يسلط الضوء على كفاءة البيانات في نهج الإشراف عبر الإنترنت.
الأهمية والادعاءات
يدعي البحث أن NavOL يعالج بنجاح قيود كل من التعلم التقليدي غير المتصل والتعلم التعزيزي من خلال:
التخفيف من انزياح التوزيع: من خلال التدريب على عمليات التشغيل التي يستكشفها الوكيل نفسه ودمج تصحيحات الخبير (على نمط DAgger)، تمنع الطريقة الأخطاء المتراكمة التي تعاني منها السياسات غير المتصلة.
إلغاء هندسة المكافآت: توفر المخططات العالمية ذات الامتياز إشرافًا مباشرًا على المسار، مما يلغي الحاجة إلى دوال مكافأة نادرة أو مصممة يدويًا.
القابلية للتوسع: يسمح التكامل مع IsaacLab بالتوازي الهائل، مما يجعل التدريب عبر الإنترنت عالي الدقة أمرًا ممكنًا وفعالًا.
المتانة: ينتج إطار العمل سياسات تتعمم جيدًا على بيئات وهياكل روبوتية غير مرئية، كما هو موضح في تجارب الواقع الصفري.
يخلص المؤلفون إلى أن دمج إشراف المخطط عبر الإنترنت في التعلم التقليدي يعزز بشكل كبير أداء الملاحة، مما يوفر مسارًا أكثر كفاءة في البيانات وقابلية للتوسع نحو وكلاء مجسدين (embodied agents) أقوياء.