← أحدث الأبحاث
💻 computer science

Now You See That: Learning End-to-End Humanoid Locomotion from Raw Pixels

تقدم هذه الورقة إطار عمل متكاملًا للتنقل القوي للبشر الآليين (humanoid) القائم على الرؤية، والذي يتغلب على فجوات المحاكاة إلى الواقع من خلال محاكاة العمق عالية الدقة وتقطير السلوك، مع تمكين التكيف المتنوع مع التضاريس عبر تشكيل المكافآت المتخصص والتعلم متعدد الشبكات.

المؤلفون الأصليون: Wandong Sun, Yongbo Su, Leoric Huang, Alex Zhang, Dwyane Wei, Mu San, Daniel Tian, Ellie Cao, Baoshi Cao, Yang Liu, Finn Yan, Ethan Xie, Zongwu Xie

نُشر 2026-05-12
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Wandong Sun, Yongbo Su, Leoric Huang, Alex Zhang, Dwyane Wei, Mu San, Daniel Tian, Ellie Cao, Baoshi Cao, Yang Liu, Finn Yan, Ethan Xie, Zongwu Xie

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتاً كيف يمشي مثل البشر. قد يبدو الأمر بسيطاً، لكن بالنسبة للروبوت، العالم عبارة عن حقل ألغام من المعلومات المربكة. إذا أعطيت الروبوت خريطة مثالية للسطح تم إنشاؤها بواسطة الكمبيوتر، فيمكنه المشي بسهولة. ولكن في العالم الحقيقي، تكون "عيناه" (الكاميرات) فوضوية؛ فهي تصبح ضبابية، وتفقد بعض النقاط، وتخطئ في تقدير المسافات.

هذه الورقة البحثية، بعنوان "الآن أنت ترى ذلك" (Now You See That)، تتحدث عن تعليم روبوت بشري الشكل (humanoid) كيف يمشي بثقة باستخدام عيون كاميراته الواقعية الفوضوية فقط، دون الحاجة إلى خريطة مثالية أو يد بشرية تمسك بيده.

إليك كيف فعلوا ذلك، مشروحاً عبر تشبيهات بسيطة:

1. المشكلة: "الطالب المثالي" مقابل "العالم الحقيقي"

عادةً، يقوم مهندسو الروبوتات بتدريب الروبوتات في لعبة فيديو (محاكاة) حيث يكون العالم مثالياً. يتعلم الروبوت المشي على درج رقمي نقي، ولكن عندما يضعون ذلك الروبوت في العالم الحقيقي، يتعثر ويسقط. لماذا؟ لأن الكاميرا الحقيقية بها "أعطال" (ضجيج، ثقوب في الصورة، إضاءة سيئة) لم تكن موجودة في لعبة الفيديو.

الأمر يشبه تدريب طيار على جهاز محاكك طيران في طقس مثالي، ثم إسقاطه في عاصفة حقيقية. سيصاب بالذعر لأن العاصفة الحقيقية تبدو مختلفة.

2. الحل (أ): مصنع "الأعطال الوهمية"

لإصلاح ذلك، بنى الباحثون "مصنع أعطال فائق الواقعية" داخل حاسوبهم.

بدلاً من عرض صورة نظيفة للروبوت، قاموا بتخريب الصور عمداً لتبدو تماماً كما تراها كاميرا رخيصة وحقيقية. أضافوا:

  • الثقوب: مثل عندما لا تستطيع الكاميرا رؤية جدار بلا ملامح (محاكاة لعيوب مطابقة الصور ثلاثية الأبعاد).
  • التشويش (Static): مثل "ثلج التلفاز" الذي يزداد سوءاً كلما ابتعدت المسافة.
  • التشويه: مثل النظر عبر مرآة ملاهي مشوهة.

التشبيه: تخيل أنك تتعلم القيادة. بدلاً من التدرب على مضمار مثالي وفارغ، تضع مدرسة القيت الخاصة بك في سيارة ذات زجاج أمامي ضبابي، وكاميرا مهتزة، ونظام GPS يكذب أحياناً. بحلول الوقت الذي تخوض فيه اختبار القيادة الحقيقي، ستكون خبيراً في القيادة خلال أي فوضى. هذا هو ما فعله "مصنع الأعطال" هذا للروبوت.

3. الحل (ب): فريق "المدربين المتخصصين"

المشي على تلة ملساء يختلف عن المشي على درج شديد الانحدار، والذي يختلف عن القفز فوق فجوة. غالباً ما يرتبك "مدرب" واحد (عقل ذكاء اصطناعي قياسي) عند محاولة تعلم كل هذه المهارات المختلفة في وقت واحد. الأمر يشبه محاولة تعليم طالب السباحة، وتسلق الصخور، والجري في الماراثون، وكل ذلك في ساعة واحدة.

أعطى الباحثون الروبوت ثلاثة مدربين متخصصين يعملون معاً:

  • المدرب 1: متخصص في السلالم والمنصات.
  • المدرب 2: متخصص في القفز فوق الفجوات.
  • المدرب 3: متخصص في الأرض الوعرة والصخرية.

التشبيه: بدلاً من معلم عام، يمتلك الروبوت "فريق أحلام". عندما يرى الروبوت سلالم، فإنه يستمع للمدرب الأول. وعندما يرى فجوة، فإنه يستمع للمدرب الثاني. هذا يمنع الروبوت من الارتباك ومحاولة "القفز" في وقت يجب أن "يخطو" فيه.

4. الحل (ج): عملية التسليم بين "المعلم والطالب"

يتعلم الروبوت في مرحلتين، مثل طاهٍ ماهر يعلم متدرباً.

  • المرحلة 1 (المعلم): يتعلم الروبوت أولاً المشي باستخدام "رؤية عين الله" (بيانات مثالية ونظيفة). هو يعرف مكان كل خطوة بدقة. هذا هو المعلم.
  • المرحلة 2 (المتدرب): يتعين على الروبوت بعد ذلك تعلم المشي باستخدام صور الكاميرا الفوضوية والمشوشة فقط. هذا هو الطالب.

يحاول الطالب تقليد حركات المعلم، لكن المعلم ينظر إلى خريطة نظيفة بينما ينظر الطالب إلى صورة ضبابية. لمساعدة الطالب، أضاف الباحثون قاعدة خاصة: "حتى لو كانت الصورة ضبابية، يجب أن يتطابق شعورك الداخلي بالأرض مع شعور المعلم الواضح."

التشبيه: تخيل عازف بيانو ماهر (المعلم) يعزف مقطوعة بشكل مثالي. الطالب (الروبوت) يرتدي سماعات عازلة للضوضاء تصدر صوتاً مشوشاً. يجب على الطالب تعلم عزف نفس المقطوعة من خلال الشعور بالإيقونة ومراقبة حركات يد المعلم، متجاهلاً التشويش في أذنيه. لقد علم الباحثون الروبوت كيف يتجاهل التشويش ويركز على الحركة الجوهرية.

النتائج: ماذا فعل الروبوت بالفعل؟

اختبر الباحثون هذا الروبوت على اثنين من الروبوتات البشرية المختلفة. لم يمشوا فقط على أرضيات مسطحة؛ بل واجهوا تحديات من نوع "الباركور":

  • السلالم الطويلة: صعود ونزول سلالم طويلة (في الاتجاهين).
  • المنصات العالية: الصعود إلى صناديق مرتفعة.
  • الفجوات: القفز فوق حفر واسعة في الأرض.
  • الحطام: المشي فوق أكوام من الخردة والصخور غير المستوية.

النتيجة:
نجح الروبوت في 98.9% من محاولاته. مشى بسلاسة، ولم يسقط، واستخدم الطاقة بكفاءة. والأهم من ذلك، فعل كل هذا دون أي تدخل بشري بعد خروجه من الكمبيوتر. لقد تعلم في المحاكاة "المشوشة" وعمل بشكل مثالي في العالم الحقيقي فوراً.

قصور صغير واحد

تشير الورقة البحثية إلى نقطة ضعف محددة: نزول السلالم.
بينما كان الروبوت مثالياً في صعود السلالم، كان أقل كمالاً قليلاً عند النزول منها.

  • لماذا؟ عندما تنزل، تسحبك الجاذبية للأمام. إذا ارتكبت خطأً طفيفاً، فمن الصعب التعافي مقارنة بالصعود. أيضاً، غالباً ما تحجب قدم الروبوت رؤيته للدرجة التالية، مما يجعل الكاميرا "المشوشة" أكثر ارتباكاً.

الملخص

تقدم الورقة طريقة جديدة لتعليم الروبوتات المشي من خلال:

  1. تزييف أخطاء الكاميرا في العالم الحقيقي أثناء التدريب حتى لا يتفاجأ الروبوت.
  2. توظيف مدربين متخصصين لأنواع مختلفة من التضاريس.
  3. استخدام نظام المعلم والطالب لنقل المعرفة من البيانات المثالية إلى البيانات الفوضوية.

النتيجة هي روبوت يمكنه النظر إلى بيئة فوضوية في العالم الحقيقي والمشي بثقة فوق السلالم، والفجوات، والصخور، تماماً كما يفعل البشر.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →