← أحدث الأبحاث
🤖 AI

ZeroWBC: Learning Natural Visuomotor Humanoid Control Directly from Human Egocentric Video

يُعد ZeroWBC إطار عمل مبتكر يتيح تحكماً طبيعياً ومتعدد الاستخدامات في كامل الجسم للروبوتات البشرية من خلال تعلم سياسات الحركة البصرية الحركية مباشرة من فيديوهات بشرية بمنظور الشخص الأول، مما يلغي الحاجة إلى جمع بيانات التحكم عن بُعد المكلفة والمستهلكة للوقت.

المؤلفون الأصليون: Haoran Yang, Jiacheng Bao, Yucheng Xin, Haoming Song, Yuyang Tian, Bin Zhao, Dong Wang, Xuelong Li

نُشر 2026-03-11
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Haoran Yang, Jiacheng Bao, Yucheng Xin, Haoming Song, Yuyang Tian, Bin Zhao, Dong Wang, Xuelong Li

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تريد تعليم روبوت كيف يتصرف كالبشر. تقليديًا، كان الأمر يشبه محاولة تعليم طفل صغير ركوب الدراجة عن طريق وضع كاميرا على رأسه، وتسجيل كل تعثر، ثم تحريك أذرع وأرجل الروبوت يدويًا ليطابق ذلك التسجيل لساعات طويلة. هذا الأمر مكلف، بطيء، وغالبًا ما ينتهي الأمر بالروبوت وهو يتحرك مثل دمية خشبية متصلبة ومضحكة.

ZeroWBC هو طريقة أذكى للقيام بذلك. فكر فيه كأنه "درس رقص من خطوتين" يعلم الروبوت كيف يتحرك بشكل طبيعي بمجرد مشاهدة البشر عبر الفيديو، دون الحاجة إلى إنسان يتحكم في الروبوت فعليًا بمجرد البدء.

إليك كيف يعمل، مقسمًا إلى مفاهيم بسيطة:

1. المشكلة: عقبة "التحكم عن بُعد" (Teleoperation)

عادةً، لتعليم روبوت كيف يجلس على أريكة أو يركل كرة، يتعين على المهندسين ارتداء بدلة خاصة وتحريك مفاصل الروبوت فعليًا لتوضيح الحركة. هذا ما يسمى التحكم عن بُعد (Teleoperation).

  • التشبيه: الأمر يشبه محاولة تعلم لغة جديدة من خلال جعل المعلم يهمس بكل كلمة في أذنك بينما تقوم أنت بكتابتها. إنه أمر مرهق وبطيء، ولا يمكنك تعلم سوى ما لدى المعلم الوقت لإظهاره لك.
  • النتيجة: تنتهي الرواية بامتلاك الروبوتات لمفردات حركية محدودة جدًا، وتجد صعولة في التكيف مع المواقف الجديدة (مثل أريكة في غرفة مختلفة).

2. الحل: ZeroWBC (نهج "فيديو الإنسان")

أدرك المؤلفون أن البشر قد سجلوا بالفعل مليارات الساعات من الفيديوهات التي تظهرنا ونحن نفعل بالضبط ما نريد من الروبوتات فعله: المشي، الجلوس، الركل، وتجنب العقبات. يستخدم ZeroWBC هذه الفيديوهات بدلًا من عروض توضيحية بشرية مكلفة.

يعمل النظام في مرحلتين، مثل المخرج وممثل الدوبلير:

المرحلة 1: "المخرج الخيالي" (توليد الحركة متعدد الوسائط)

أولاً، يحتاج الروبوت إلى معرفة ماذا سيفعل.

  • كيف يعمل: تعطي الروبوت أمرًا نصيًا (مثل "ركل الكرة") وبث فيديو مباشر مما تراه عيناه (ما يراه).
  • السحر: يستخدم الروبوت ذكاءً اصطناعيًا فائق الذكاء (نموذج لغوي بصري - Vision-Language Model) تم تدريبه على ملايين الفيديوهات البشرية. إنه يعمل مثل مخرج سينمائي. عندما تقول له "ركل الكرة"، لا يفكر المخرج في الأرجل فحسب؛ بل يتخيل الجسم بأكمله: الاقتراب، التأرجح، المتابعة، وكيف تتبع العين الكرة.
  • المخرج: لا يعطي المخرج أوامر للعضلات بعد. بدلاً من ذلك، يكتب "سيناريو" لحركات بشرية (سلسلة من رموز الحركة).

المرحلة 2: "بديل المشاهد" أو "الدوبلير" (تتبع الحركة العام)

الآن يحتاج الروبوت إلى تنفيذ الحركة فعليًا.

  • كيف يعمل: يأخذ الروبوت "السيناريو" من المخرج ويحاول تقليده.
  • السحـر: هنا يأتي دور تتبع الحركة العام (General Motion Tracking). تخيل بديل مشاهد (Stunt Double) ماهر للغاية وقد تدرب على آلاف الحركات الراقصة، وفنون القتال، والمشيات المختلفة. هذا البديل ماهر جدًا لدرجة أنه مهما طلب منه المخرج، يمكنه التقليد بدقة.
  • التدريب: تم تدريب هذا البديل باستخدام "منهج دراسي" (مثل المدرسة). بدأ بمهام سهلة (المشي)، ثم انتقل إلى مهام متوسطة (الجري)، وأخيرًا مهام صعبة (الرقص أو التدحرج). هذا يضمن عدم شعور الروبوت بالإرهاق وتعلمه أن يكون مستقرًا.

3. لماذا يعد هذا أمرًا هامًا؟

  • لا مزيد من "التحكم عن بُعد للروبوت": لست بحاجة إلى إنسان يحرك الروبوت جسديًا لتعليمه كل مهمة. تحتاج فقط إلى كاميرا وإنسان يتحرك حول المكان.
  • حركة طبيعية: نظرًا لأن الروبوت يتعلم من الفيديوهات البشرية، فإنه يتحرك مثل البشر، وليس مثل آلة متصلبة. هو يعرف كيف يميل عند الدوران أو كيف ينقل وزنه عند الجلوس.
  • التعلم من الصفر (الخدعة السحرية): تُظهر الورقة البحثية الروبوت وهو يقوم بأشياء لم يتم تدريبه عليها صراحةً.
    • مثال: تم تدريب الروبوت على فيديوهات لأشخاص يجلسون على الأرائك. لم يُعرض عليه كرسي أبدًا. ولكن عندما طُلب منه "اجلس على الكرسي"، فقد استطاع فعل ذلك! لقد فهم مفهوم الجلوس وطبقه على جسم جديد. وذلك لأن ذكاء "المخرج" يفهم اللغة والمفاهيم، وليس مجرد إحداثيات محددة.

4. الاختبار في العالم الحقيقي

اختبر الفريق هذا النظام على روبوت Unitree G1 (روبوت بشري حقيقي).

  • طلبوا منه المشي، تجنب العقبات، ركل الكرة، والجلوس على أريكة.
  • النتيجة: قام الروبوت بكل ذلك بسلاسة. حتى أنه تعامل مع عقبات لم يسبق له رؤيتها، وجلس على كرسي لم يره من قبل.

ملخص التشبيه

فكر في ZeroWBC كأنك توظف ممثلًا بشريًا (النموذج اللغوي البصري) ليشاهد السيناريو ويتخيل المشهد، ثم توظف مُقلدًا محترفًا (سياسة التتبع) ليقلد حركات هذا الممثل بدقة.

  • الطريقة القديمة: تمسك بيدي الروبوت وتحركه لكل مهمة على حدة.
  • طريقة ZeroWBC: تعرض للروبوت فيلمًا لإنسان يقوم بالمهمة، ويتعلم الروبوت القيام بها بنفسه.

يفتح هذا النهج الباب أمام روبوتات يمكنها التعلم من المكتبة الهائلة لفيديوهات البشر على الإنترنت، مما يجعلها متعددة الاستخدامات، طبيعية، وجاهزة لمساعدتنا في عالمنا الحقيقي دون الحاجة إلى إنسان يمسك بيدها في كل خطوة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →