← أحدث الأبحاث
💻 computer science

Chasing Autonomy: Dynamic Retargeting and Control Guided RL for Performant and Controllable Humanoid Running

تقدم هذه الورقة البحثية خط إنتاج للتعلم التعزيزي يعتمد على إعادة الاستهداف الديناميكي والتوجيه بالتحكم، مما يمكّن الروبوت البشري Unitree G1 من تحقيق الجري عالي السرعة والتحمل بسرعة تصل إلى 3.3 م/ث مع تجنب العوائق ذاتياً في بيئات العالم الحقيقي.

المؤلفون الأصليون: Zachary Olkin, William D. Compton, Ryan M. Bena, Aaron D. Ames

نُشر 2026-03-30
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zachary Olkin, William D. Compton, Ryan M. Bena, Aaron D. Ames

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتاً كيف يركض مثل البشر. يبدو الأمر بسيطاً، ولكن بالنسبة لآلة مصنوعة من المعدن والمحركات، فإن الركض يشبه محاولة موازنة عصا مكنسة على يدك أثناء الركض وسط إعصار. إذا انزلق الروبوت، فسوف يسقط. وإذا حاول الالتفاف بسرعة كبيرة، فسيصطدم.

هذه الورقة البحثية تتحدث عن "معسكر تدريبي" جديد يعلم روبوتاً بشري الهيئة (تحديداً طراز Unitree G1) كيف يركض بسرعة، ويحافظ على توازنه، ويستمع فعلياً إلى "مديره" البشري عندما يُطلب منه تسريع الخطى، أو الإبطاء، أو تفادي شجرة.

إليك قصة كيف فعلوا ذلك، مقسمة إلى ثلاث خطوات بسيطة:

1. "المدرب الصارم" (إعادة الاستهداف الديناميكي - Dynamic Retargeting)

عادةً، عندما يريد العلماء جعل الروبوت يتعلم حركة بشرية، يقومون فقط بنسخ فيديو لشخص ما إطاراً تلو الآخر. فكر في هذا كطالب يحاول تقليد خط يد معلمه عبر تتبع الحروف. سيبدو الأمر جيداً، ولكن إذا حاول الروبوت الركض بسرعة مختلفة أو على سطح مختلف، فإن عملية التتبع هذه ستنهار لأن جسم الروبوت يختلف عن جسم الإنسان.

الابتكار: بدلاً من مجرد التتبع، تصرف المؤلفون كـ مدرب فيزياء صارم. لقد أخذوا فيديو لإنسان يركض ومرروه عبر محاكاة رياضية معقدة (تحسين/optimization) تسأل: "هل هذا ممكن فيزيائياً لروبوت؟"

  • التشبيه: تخيل أن لديك وصفة لكعكة مخصصة لفرن صغير. إذا حاولت خبزها في فرن صناعي ضخم، فستحترق. "المدرب الصارم" يعيد كتابة الوصفة خصيصاً للفرن الضخم، حيث يعدل درجة الحرارة والوقت بحيث تخرج الكعكة مثالية في كل مرة.
  • النتيجة: لقد أنشأوا "مكتبة" من أساليب الركض. بدلاً من مجرد فيديو واحد جامد، أصبح لديهم مجموعة مرنة من التعليمات التي يمكن للروبوت تنفيذها بالفعل دون السقوط، حتى عند السرعات العالية.

2. "نظام المكافأة الذكي" (التعلم المعزز الموجه بالتحكم - Control-Guided RL)

بمجرد حصول الروبوت على تعليمات "المدرب الصارم"، فإنه يحتاج إلى تعلم كيفية اتباعها. يتم ذلك باستخدام التعلم المعزز (RL)، وهو يشبه تدريب كلب باستخدام المكافآت.

  • الطريقة القديمة (التقليد - Mimic): يحصل الروبوت على مكافأة في كل مرة يبدو فيها شبيهاً نوعاً ما بالفيديو البشري. يشبه هذا قولك لكلب: "ولد مطيع، أنت تقف على أرجلك الخلفية!" حتى لو كان يتأرجح وعلى وشك السقوط.
  • الطريقة الجديدة (الموجهة بالتحكم/CLF): أضاف المؤلفون "حارس سلامة" إلى التدريب. لم يكافئوا الروبوت فقط لأنه يبدو مثل الإنسان، بل كافأوه أيضاً على الحفاظ على استقراره.
  • التشبيه: تخيل تعليم طفل صغير ركوب الدراجة.
    • التقليد: "عمل رائع في التبديل!" (حتى لو كان على وشك الاصطدام).
    • الموجه بالتحكم: "عمل رائع في التبديل، وأيضاً عمل رائع في الحفاظ على توازنك حتى لا تسقط!"
      هذا "الحارس" (المبني على دالات ليابونوف للتحكم، وهو مفهوم رياضي متطور للاستقرار) يضمن أن يتعلم الروبوت الركض بأمان بينما يكون سريعاً.

3. "نظام الملاحة (GPS)" (حزمة الاستقلالية - Autonomy Stack)

كان الاختبار النهائي هو: هل يمكن لهذا الروبوت أن يركض بمفرده في العالم الحقيقي؟
قاموا بربط الروبوت الراكض بـ "عقل" يمكنه رؤية العقبات (باستخدام تقنية LiDAR، مثل سونار الخفاش).

  • التشبيه: فكر في أرجل الروبوت كمحرك سيارة سباق (وحدة التحكم في الركض) و"العقل" كالسائق. يخبر السائق المحرك: "انطلق بسرعة 20 ميلاً في الساعة"، "انعطف يساراً"، أو "فرمل!".
  • النتيجة: لم يركض الروبوت في خط مستقيم فحسب، بل ركض في الخارج لمئات الأمتار، وتفادى العقبات في الوقت الفعلي، وحتى غير اتجاهه دون تعثر. لقد وصل إلى سرعات تصل إلى 3.3 متر في الثانية (حوالي 7.4 ميل في الساعة)، وهي سرعة هرولة جيدة للإنسان.

لماذا يهم هذا؟

قبل هذا، كان بإمكان الروبوتات إما الركض بسرعة ولكن دون القدرة على التحكم بها، أو يمكن التحكم بها ولكنها تتحرك مثل الزومبي البطيئين والخرقاء.

هذه الورقة تسد الفجوة. فهي توضح أنه إذا قمت بـ:

  1. تنقية البيانات البشرية لتصبح منطقية للروبوت (المدرب الصارم).
  2. مكافأة الروبوت على استقراره، وليس فقط على مظهره الجذاب (حارس السلامة).
  3. ربط النظام بنظام ملاحة (الـ GPS).

... فستحصل على روبوت يمكنه الركض مثل البشر، والاستماع للأوامر، والتنقل في بيئة حقيقية مليئة بالفوضى دون السقوط. إنها خطوة كبيرة نحو روبوتات يمكنها حقاً مساعدتنا في العالم الحقيقي، بدلاً من مجرد الظهور بمظهر رائع في المختبر.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →