← أحدث الأبحاث
🤖 machine learning

SCDP: Learning Humanoid Locomotion from Partial Observations via Mixed-Observation Distillation

تقدم الورقة البحثية سياسات الانتشار المشروطة بالمستشعرات (SCDP)، وهو إطار عمل مبتكر يتيح حركة بشرية قوية باستخدام المستشعرات الموجودة على متن الروبوت فقط، وذلك من خلال تقطير المعرفة الكاملة للجسم المتميزة عبر تدريب الملاحظات المختلطة وتقنيات إزالة الضجيج المتخصصة، محققةً بنجاح أداءً يقارب الكمال في المحاكاة والانتشار في العالم الحقيقي على روبوت G1 دون تقدير صريح للحالة.

المؤلفون الأصليون: Milo Carroll, Tianhu Peng, Lingfan Bao, Chengxu Zhou, Zhibin Li

نُشر 2026-03-11
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Milo Carroll, Tianhu Peng, Lingfan Bao, Chengxu Zhou, Zhibin Li

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت كيف يمشي مثل البشر. عادةً، للقيام بذلك، تمنح الروبوت "قوة خارقة": رؤية مثالية ومطلقة للعالم. أنت تخبره بالضبط أين توجد قدماه، ومدى سرعة حركته، واتجاهه الدقيق في الفضاء. هذا يشبه امتلاك الروبوت لجهاز تحديد مواقع (GPS)، وعداد سرعة، وجيروسكوب مدمجين في عقل واحد مثالي.

المشكلة:
في العالم الحقيقي، لا تمتلك الروبات هذه القوى الخارقة. هي تمتلك فقط "مستشعرات داخلية" — ببساطة، يمكنها الشعور بحركة مفاصلها واستشعار الجاذبية، لكنها لا تستطيع "رؤية" سرعتها أو موقعها الدقيق دون كاميرات خارجية باهظة الثمن. إذا سحبت "الرؤية ذات القوة الخارقة" من متحكمات الروبوت الحالية، فإنها عادة ما تسقط فوراً. الأمر يشبه محاولة قيادة سيارة وأنت مغمض العينين، معتمداً فقط على الإحساس بعجلة القيادة.

الحل: SCDP (سياسات الانتشار المشروطة بالمستشعرات)
ابتكر الباحثون في جامعة UCL طريقة جديدة تسمى SCDP. فكر في الأمر كأنه "خدعة سحرية" لتعليم الروبوتات كيف تمشي باستخدام حواسها الداخلية فقط، دون الحاجة إلى تلك الرؤية الخارجية المثالية.

إليك كيف فعلوا ذلك، مقسماً إلى تشبيهات بسيطة:

1. لعبة "المعلم السري" (تقطير الملاحظات المختلطة)

تخيل أنك تتعلم لعب لعبة فيديو معقدة.

  • الطريقة القديمة: أنت تتدرب باستخدام ورقة غش تظهر لك موقع العدو وسرعته بدقة. عندما تحاول اللعب بدون ورقة الغش، تفشل لأنك لم تتعلم أبداً كيف تخمن مكان العدو.
  • طريقة SCDP: يلعب الروبوت لعبة حيث لا يرى سوى يديه وقدميه (المستشعرات). ومع ذلك، فإن "المعلم" (خوارزمية التدريب) يقيمه سراً بناءً على ورقة غش تُظهر بالفعل موقع العدو.
  • النتيجة: يُجبر الروبوت على النظر إلى رؤيته المحدودة (اليدين والقدمين) واستنتاج: "إذا كانت قدمي اليسرى تتحرك بهذه الطريقة وأشعر بهذا القدر من الرياح، فلا بد أنني أتحرك بسرعة مترين في الثانية". إنه يتعلم كيف يستنتج المعلومات المخفية (السرعة والموقع) بمجرد النظر إلى القرائن التي يمتلكها. يصبح محققاً في حركته الخاصة.

2. "الركض مع عصب العينين" (إزالة الضجيج المقيد)

أحد القرائن التي يعتمد عليها الروبوتات عادة هو "ما مدى سرعتي؟" (السرعة المتجهة). لكن الروبوتات الحقيقية سيئة في قياس سرعتها الخاصة بدقة.

  • الخدعة: أثناء التدريب، أخبر الباحثون الروبوت: "سأخبرك أين يجب أن تذهب، لكني سأقوم بإخفاء رقم السرعة من مدخلاتك".
  • التشبيه: تخيل أنك تركض في سباق وأنت معصوب العينين. يصرخ مدربك: "أسرع!"، لكنه لا يخبرك سرعتك الحالية. عليك أن تشعر بالرياح وعضلات ساقيك لتخمن مدى سرعة ركضك وتعدل مسارك بناءً على ذلك.
  • النتيجة: يتعلم الروبوت تقدير سرعته الخاصة من خلال "إحساس" حركته فقط، مما يجعله قوياً حتى لو كانت مستشعراته مشوشة أو غير مثالية.

3. "ذاكرة السفر عبر الزمن" (محاذاة توزيع السياق)

عند تعليم الروبوت، كان على الباحثين أن يكونوا حذرين حتى لا يخدعوه.

  • المشكلة: إذا دربت الروبوت باستخدام بيانات "مشوشة" (فوضوية) ثم تركته يعمل على بيانات "نظيفة" في العالم الحقيقي، فسيصاب بالارتباك. الأمر يشبه التدرب على كرة السلة بكرة زلقة، ثم محاولة اللعب بكرة جافة.
  • الحل: تأكدوا من أن الروبوت يتدرب بطريقة تطابق العالم الحقيقي تماماً. كما منحوا الروبوت "نافذة ذاكرة" (سياق) حيث يمكنه النظر إلى تاريخه القريب لفهم الحاضر.
  • التشبيه: بدلاً من النظر إلى إطار واحد مجمد من فيلم، يشاهد الروبوت الثواني القليلة الماضية من الفيلم لفهم الحبكة. هذا يساعده على التنبؤ بما سيحدث بعد ذلك، حتى لو لم يستطع رؤية المستقبل بأكمله.

النتائج: من المحاكاة إلى الحياة الواقعية

اختبر الفريق هذه الطريقة على Unitree G1، وهو روبوت بشري حقيقي يبدو كإنسان من المستقبل.

  • في الكمبيوتر: تعلم الروبوت المشي، والدوران، والتعافي من الدفع بنجاح يقترب من 100%، مطابِقاً الروبوتات التي تمتلك "قوى خارقة" (مستشعرات مثالية).
  • في العالم الحقيقي: وضعوا الروبوت في غرفة حقيقية. بدون أي كاميرات خارجية أو بدلات التقاط حركة، مشى الروبوت في الغرفة 50 مرة في الثانية (50 هرتز)، متفاعلاً مع الدفع واتباع الأوامر بسلاسة.

لماذا هذا مهم؟

قبل هذا، إذا أردت أن تجعل روبوتاً يمشي مثل البشر، كنت بحاجة إلى مختبر مليء بالكاميرات الباهظة لتتبع كل حركة له. SCDP يغير قواعد اللعبة. فهو يثبت أن الروبوت يمكنه تعلم كيف يكون "واعياً بذاته" أثناء المشي، حيث يستنتج سرعته وموقعه بمجرد الشعور بجسده، تماماً كما يفعل البشر عندما يغمضون أعينهم ويمشون.

باختصار: لقد علموا الروبوت كيف "يشعر" بطريقه في العالم، محولين آلة متعثرة وعمياء إلى ماشٍ واثق وواعٍ بذاته، باستخدام لعبة تدريب ذكية حيث كان عليه تخمين القواعد المخفية للفيزياء.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →