← أحدث الأبحاث
⚡ electrical engineering

Terrain Consistent Reference-Guided RL for Humanoid Navigation Autonomy

تقدم هذه الورقة طريقة تعلّم تعزيزي موجهة بمرجع تعمل على تعديل مسارات التدريب لتتطابق مع هندسة التضاريس، مما يمكّن روبوت "يونيتري جي 1" (Unitree G1) البشري من تحقيق ملاحة ذاتية قوية وطويلة المدى فوق التضاريس الوعرة والسلالم باستخدام الاستشعار والحوسبة المدمجة فقط.

المؤلفون الأصليون: William D. Compton, Zachary Olkin, Aaron D. Ames

نُشر 2026-05-18
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: William D. Compton, Zachary Olkin, Aaron D. Ames

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتًا كيف يمشي في عالم فوضوي وغير متوقع — مثل موقع بناء يحتوي على سلالم، وأرض غير مستوية، ومداخل ضيقة. عادةً، يكون أمامك خياران: إما تعليم الروبوت كيف "يتحسس" طريقه باستخدام الكاميرات (وهو أمر قد يكون متعثرًا)، أو إعطاؤه "نصًا" مثاليًا مكتوبًا مسبقًا يحدد بدقة كيفية تحريك أرجله (وهذا النص سيفشل إذا تغيرت طبيعة الأرض).

تقدم هذه الورقة البحثية حلاً وسطًا ذكيًا: روبوت يتعلم المشي من خلال اتباع "نص ذكي" يغير نفسه في الوقت الفعلي ليتناسب مع شكل الأرض.

إليك كيف فعلوا ذلك، مقسمًا إلى مفاهيم بسيطة:

١. المشكلة: النص "الأعمى" مقابل الكاميرا "المتعثرة"

  • الطريقة القديمة (الموجهة بالمرجع): تخيل أنك تعطي راقصًا نصًا يقول: "تقدم خطوة للأمام بمقدار متر واحد". إذا كانت الأرض مستوية، سيخطو مترًا واحدًا. أما إذا كان هناك حفرة أو درجة مرتفعة، فقد يتعثر لأن النص لا يعلم أن الأرض قد تغيرت.
  • الطريقة القديمة الأخرى (التعلم المعزز الإدراكي): تخيل أنك تعلم روبوتًا عبر عرض آلاف الفيديوهات للمشي عليه، وتتركه يكتشف قوانين الفيزياء بنفسه. هذا يعمل جيدًا، لكن من الصعب ربطه بنظام "GPS" يخبر الروبوت أين يذهب. قد يكون الروبوت بارعًا في المشي، لكنه سيء جدًا في اتباع خريطة.

٢. الحل: النص "متغير الشكل"

ابتكر المؤلفون نظامًا يتعلم فيه الروبوت المشي من خلال اتباع مسار مرجعي (نص)، ولكن هذا النص يتم "تشكيله" ليتناسب مع التضاريس قبل أن يحاول الروبوت اتباعه.

فكر في الأمر كالتالي:

  • لدى الروبوت "عقل" (سياسة الذكاء الاصطناعي) يريد اتباع مسار محدد.
  • قبل أن يتحرك الروبوت، يعمل نموذج رياضي سريع (يسمى البندول المعكوس الخطي) كأنه طابعة ثلاثية الأبعاد للمسار.
  • إذا رأى الروبوت درجًا، فإن "الطابعة" تقوم فورًا بإعادة تشكيل أمر "تقدم خطوة متر واحد" إلى "تقدم خطوة متر واحد، ولكن ارفع قدمك عاليًا وزاوية قدمك لتناسب الدرجة".
  • يتعلم الروبوت بعد ذلك اتباع هذا النص المعدل. ولأن النص معدل بالفعل ليكون مثاليًا للتضاريس، فإن الروبوت يتعلم المشي بشكل أسرع وأكثر استقرارًا.

٣. واجهة "SE(2)": جهاز التحكم الشامل

أحد أكبر العوائق في علم الروبوتات هو جعل "العقل" (الذي يمشي) يتواصل مع "الملاح" (نظام الـ GPS أو المخطط).

  • عادةً، يتحدث هذان النظامان لغتين مختلفتين. الملاح يقول "اذهب إلى المطبخ"، لكن الروبوت يحتاج لمعرفة كيفية تحريك كل مفصل بدقة.
  • تمنح هذه الورقة الروبوت جهاز تحكم عن بعد شامل. الملاح يرسل فقط أوامر بسيطة مثل "امشِ للأمام بسرعة متر واحد في الثانية" أو "انعطف يسارًا".
  • يأخذ النظام الداخلي للروبوت هذا الأمر البسيط، وينظر إلى الأرض، ويعيد تشكيل "النص" (المرجع)، ثم ينفذ حركات الأرجل المعقدة تلقائيًا. هذا يجعل من السهل دمج هذا الروبوت اللاهث في برامج الملاحة القياسية.

٤. النتائج: المشي ببراعة

اختبر الفريق هذا النظام على روبوت بشري من نوع Unitree G1 (روبوت ثنائي الأرجل يشبه البشر).

  • في المحاكي: أظهروا أنه عندما يستخدم الروبوت النص "المُشكل"، فإنه يتتبع المسار بشكل أفضل بكثير مما لو حاول اتباع نص ثابت لا يتغير.
  • في العالم الحقيقي: وضعوا الروبوت في مبنى حقيقي وفي الخارج.
    • مشى الروبوت أكثر من ٧٠ مترًا (حوالي طول ملعب كرة قدم) بشكل مستقل.
    • صعد طابقين من السلالم وتنقل فوق أرض وعرة وغير مستوية.
    • فعل كل ذلك مع حدوث كل عمليات "التفكير" و"الاستشعار" داخل الروبوت نفسه، دون أن يكون مرتبطًا بجهاز كمبيوتر خارجي.

ملخص تشبيهي

تخيل أنك تتعلم قيادة السيارة.

  • الطريقة (أ) (الطريقة القديمة): لديك نظام GPS يخبرك بزاوية التوجيه الدقيقة وضغط دواسة الوقود لطريق معين. إذا سلكت طريقًا فرعيًا، ستكون التعليمات خاطئة، فتقوم بالاصطدام.
  • الطريقة (ب) (الطريقة القديمة): يتم إلقاؤك في سيارة بدون أي تعليمات ويُطلب منك "أن تفهم الأمر بنفسك". قد تتعلم، لكن الأمر يستغرق وقتًا طويلاً، ولا يمكنك بسهولة إخبار السيارة "اذهبي إلى المتجر".
  • طريقة هذه الورقة: لديك نظام GPS يخبرك "اذهب إلى المتجر". وبينما تقود، يقوم مساعد ذكي بإعادة كتابة تعليمات "التوجيه والوقود" فورًا بناءً على الحفر والمنعطفات التي تراها في تلك اللحظة. أنت تتبع هذه التعليمات المثالية والفورية، مما يسمح لك بالقيادة في أي مكان بأمان وكفاءة.

تثبت هذه الورقة أنه من خلال جعل "التعليمات" تتكيف مع التضاريس في الوقت الفعلي، يمكنك تعليم روبوت بشري كيف يمشي عبر البيئات البشرية المعقدة (مثل السلالم والأرض الوعرة) ودمجه في نظام ملاحة كامل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →