← أحدث الأبحاث
💻 computer science

NavOL: Navigation Policy with Online Imitation Learning

إنّ NavOL هو إطار عمل للتعلم بالتقليد عبر الإنترنت يستفيد من سياسة انتشار مدربة مسبقاً ومخطط عالمي لجمع والتعلم من مسارات الخبراء بشكل تكراري داخل محاكي، مما يؤدي إلى القضاء على هندسة المكافآت، وتخفيف انزياح التوزيع، وتحقيق أداء قوي في الملاحة البصرية في كل من بيئات المحاكاة والبيئات الواقعية.

المؤلفون الأصليون: Xiaofei Wei, Chun Gu, Li Zhang

نُشر 2026-05-13
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Xiaofei Wei, Chun Gu, Li Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتاً كيف يمشي عبر منزل فوضوي دون الاصطدام بالأثاث. هذا هو التحدي الجوهري الذي تعالجه ورقة بحث NavOL.

إليك قصة كيف حلوا هذه المشكلة، باستخدام تشبيهات بسيطة:

المشكلة: "الكتاب المدرسي" مقابل "العالم الحقيقي"

كان تدريب الملاحة للروبوتات سابقاً يشبه الدراسة لاختبار قيادة باستخدام كتاب مدرسي ثابت فقط.

  • التعلم غير المتصل (الطريقة القديمة): كان الباحثون يسجلون آلاف مسارات القيادة المثالية في محاكي، ويحفظونها في قرص صلب، ثم يعلمون الروبوت حفظها.
    • العيب: إذا ارتكب الروبوت خطأً بسيطاً في العالم الحقيقي (مثل تدوير المقود قبل أوانه بجزء من الثانية)، فإنه ينحرف عن "المسار المثالي" الذي حفظه. وبما أنه لم يتدرب أبداً على إصلاح الأخطاء، فإنه يصاب بالارتباك، ويصطدم، ثم يستسلم. وهذا ما يسمى بمشكلة "انزياح التوزيع" (distribution shift).
  • التعلم التعزيزي (طريقة التجربة والخطأ): هناك طريقة أخرى تسمح للروبوت بمجرد "التجربة والفشل" ملايين المرات، على أمل أن يتعلم في النهاية.
    • العيب: هذه الطريقة بطيئة للغاية وغير فعالة. إنها تشبه محاولة تعلم القيادة عبر الاصطدام بالجدر walls حتى تكتشف بالصدفة كيفية التوقف. كما يتعين عليك ابتكار نظام "نقاط" (مكافآت) معقد لكل فعل، وهو أمر يصعب ضبطه بدقة.

الحل: NavOL (نظام "المعلم الخصوصي المباشر")

ابتكر المؤلفون NavOL، وهو يشبه إعطاء الروبوت معلماً خصوصياً يمشي بجانبه في عالم افتراضي، ليصحح أخطاءه في الوقت الفعلي.

إليك كيف يعمل النظام، خطوة بخوة:

  1. الملعب الافتراضي: بنوا عالماً افتراضياً ضخماً وعالي السرعة (باستخدام أداة تسمى IsaacLab) حيث يمكنهم تشغيل 256 روبوتاً في نفس الوقت. إنه يشبه وجود فصل دراسي به 256 طالباً يتدربون على القيادة في آن واحد.
  2. المعلم "المتميز": داخل هذا العالم الافتراضي، يوجد مخطط بـ "وضع الإله" (God-mode planner). هذا المعلم يعرف الخريطة بأكملها بشكل مثالي (الجدران، الأثاث، الأهداف) ويمكنه رؤية أفضل مسار للوصول إلى الهدف. الروبوت لا يمكنه رؤية هذه الخريطة في العالم الحقيقي، لكن المعلم يستخدمها أثناء التدريب.
  3. حلقة "التنفيذ والتحديث" (جلسة التدريب):
    • الخطوة أ (المحاولة): يحاول الروبوت التنقل في الغرفة بمفرده.
    • الخطوة ب (التصحيح): عند كل خطوة، يتحقق معلم "وضع الإله": "لو كان الروبوت مثالياً، أين يجب أن يكون الآن؟"
    • الخطوة ج (الدرس): يقارن الروبوت بين ما فعله وبين ما قال المعلم إنه يجب فعله. ويتعلم فوراً من هذا الفرق.
    • الخطوة د (التحديث): يتم تحديث عقل الروبوت (شبكته العصبية) فوراً بهذا الدرس الجديد قبل أن يحاول الخطوة التالية.

التشبيه: تخيل تعلم ركوب الدراجة.

  • الطريقة القديمة: تشاهد فيديو لشخص يركب الدراجة بشكل مثالي، ثم تحاول تقليده. إذا تمايلت، ستسقط لأنك لم تتعلم أبداً كيفية تصحيح هذا التمايل.
  • طريقة NavOL: أنت تركب دراجة، وهناك مدرب يركض بجانبك تماماً. في كل مرة تميل فيها كثيراً نحو اليسار، يدفعك المدرب بلطف لتعود إلى المنتصف بينما لا تزال تتحرك. أنت تتعلم التوازن من خلال تصحيح أخطائك بنفسك في الوقت الفعلي، وليس من خلال حفظ فيديو.

لماذا هذا الأمر مميز؟

  • لا تخمين لـ "المكافأة": لا يحتاج الروبوت إلى نظام تسجيل نقاط معقد. هو فقط يحاول تقليد المعلم الخبير.
  • إصلاح الأخطاء: لأن الروبوت يتدرب على تصحيح انحرافه أثناء التدريب، فإنه لا يصاب بالذعر عندما يرتكب خطأ في العالم الحقيقي.
  • السرعة: استخدموا 8 بطاقات رسوميات قوية (RTX 4090s) لجمع أكثر من 2,000 تجربة تعلم (مسارات) كل ساعة. هذا يشبه طالباً يقرأ مكتبة كاملة من أدلة القيادة في يوم واحد.

النتائج: من المحاكاة إلى الواقع

اختبر الفريق ذلك بطريقتين:

  1. الاختبارات الافتراضية: وضعوا NavOL في مواجهة أفضل طرق ملاحة الروبوتات الأخرى في غرف افتراضية معقدة ومزدحمة. فاز NavOL في كل مرة تقريباً، حيث وصل إلى الأهداف بشكل أسرع وأكثر أماناً.
  2. الاختبارات الواقعية: أخذوا الروبوت الذي تدرب في العالم الافتراضي ووضعوه على روبوت حقيقي (روبوت الكلب Unitree Go2) في مكاتب وصالات رياضية وممرات حقيقية.
    • النتيجة: نجح الروبوت الذي تدرب باستخدام NavOL في التنقل في هذه الغرف الحقيقية الفوضوية. بينما تعثرت الطرق القديمة (NavDP) أو اصطدمت.
    • "السحر": تم تدريب الروبوت على روبوت افتراضي من نوع "Dingo" ولكنه عمل بشكل مثالي على روبوت حقيقي من نوع "Go2". وهذا يثبت أن التعلم كان يتعلق بـ كيفية التنقل، وليس مجرد حفظ شكل روبوت معين.

باختالاختصار

NavOL هو طريقة جديدة لتعليم الروبوتات الحركة. بدلاً من حفظ خريطة ثابتة أو التخمين من خلال التجربة والخطأ، فإنه يستخدم "معلماً خصوصياً" في محاكي افتراضي سريع لتصحيح مسار الروبوت في الوقت الفعلي. هذا يجعل الروبوت أكثر ذكاءً، وأكثر أماناً، وقادراً على التعامل مع البيئات الحقيقية الفوضوية التي لم يسبق له رؤيتها من قبل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →