← أحدث الأبحاث
🤖 AI

DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos

يُعد DreamDojo نموذج عالم تأسيسي تم تدريبه على 44,000 ساعة من فيديوهات البشر بمنظور الشخص الأول، حيث يتعلم تفاعلات ماهرة متنوعة من خلال أفعال كامنة مستمرة، مما يتيح المحاكاة في الوقت الفعلي، والقدرة الدقيقة على التحكم في الأفعال، والتخطيط الفعال للسياسات للروبوتات العامة في بيئات العالم المفتوح الغنية بالتلامس.

المؤلفون الأصليون: Shenyuan Gao, William Liang, Kaiyuan Zheng, Ayaan Malik, Seonghyeon Ye, Sihyun Yu, Wei-Cheng Tseng, Yuzhu Dong, Kaichun Mo, Chen-Hsuan Lin, Qianli Ma, Seungjun Nah, Loic Magne, Jiannan Xiang, Yuqi Xie
نُشر 2026-02-09
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Shenyuan Gao, William Liang, Kaiyuan Zheng, Ayaan Malik, Seonghyeon Ye, Sihyun Yu, Wei-Cheng Tseng, Yuzhu Dong, Kaichun Mo, Chen-Hsuan Lin, Qianli Ma, Seungjun Nah, Loic Magne, Jiannan Xiang, Yuqi Xie, Ruijie Zheng, Dantong Niu, You Liang Tan, K. R. Zentner, George Kurian, Suneel Indupuru, Pooya Jannaty, Jinwei Gu, Jun Zhang, Jitendra Malik, Pieter Abbeel, Ming-Yu Liu, Yuke Zhu, Joel Jang, Linxi "Jim" Fan

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تريد تعليم روبوت كيف يفعل كل ما يستطيع الإنسان فعله: الطبخ، التنظيف، إصلاح الأشياء، واللعب بالألعاب. المشكلة هي أن الروبوتات باهظة الثمن، وتتعطل بسهولة، وليس لدينا ما يكفي من ساعات تصوير الروبوتات لتعليمها كل هذه المهارات.

DreamDojo هو "عقل" جديد للروبوتات يحل هذه المشكلة من خلال التعلم من فيديوهات البشر بدلاً من فيديوهات الروبوتات. فكر في الأمر كأنه روبوت يتعلم من خلال مشاهدة ملايين الساعات من الناس وهم يقومون بمهام يومية على يوتيوب وتيك توك، بدلاً من الحاجة لأن يقوم الروبوت نفسه بكل مهمة على حدة.

إليك كيف يعمل، مقسماً إلى مفاهيم بسيطة:

1. المكتبة الضخمة (البيانات)

عادةً ما تكون بيانات تدريب الروبوت مثل مكتبة صغيرة تحتوي على عدد قليل من الكتب حول "كيفية التقاط مكعب أحمر". مكتبة DreamDojo هي مكتبة ضخمة ولا نهائية تحتوي على 44,000 ساعة من فيديوهات البشر.

  • النطاق: الأمر يشبه مقارنة دفتر ملاحظات واحد بمكتبة الكونجرس بأكملها.
  • التنوع: تغطي كل شيء، من الطبخ في المطبخ إلى إصلاح سيارة في المرآب، وتتضمن آلاف الأشياء والمهارات المختلفة.
  • السر الخفي: بما أن هذه الفيديوهات لا تملك "تعليمات روبوتية" مرفقة بها، فقد ابتكر الفريق مترجماً خاصاً يسمى الأفعال الكامنة (Latent Actions). تخيل مشاهدة فيديو لشخص يفتح برطماناً. على الرغم من أن الروبوت لا يمكنه رؤية حركات العضلات الدقيقة، إلا أن هذا المترجم يستنتج النية والفيزياء لعملية "اللف والسحب" بمجرد النظر إلى كيفية تحرك البرطمان واليد. إنه يحول الفيديو إلى دليل تعليمات عالمي يمكن لأي روبوت فهمه.

2. المحاكي (نموذج العالم)

بمجرد أن يتعلم عقل الروبوت من هذه الفيديوهات، يصبح نموذج عالم (World Model).

  • التشبيه: فكر في "نموذج العالم" كأنه جهاز محاكاة طيران للطيار. قبل أن يطير الطيار بطائرة حقيقية، يتدرب في جهاز محاكاة؛ فإذا ارتكب خطأً في المحاكي، لا يتضرر أحد.
  • كيف يعمل DreamDojo: يمكنك أن تقول لـ DreamDojo: "تخيل أن الروبوت يمد يده نحو الكوب، لكنه يخطئ الهدف". سيقوم النموذج بعد ذلك بتوليد فيديو لما سيحدث تالياً. إنه يفهم الفيزياء: إذا دفعت كوباً، فإنه ينزلق؛ وإذا دفعته بقوة كبيرة، فإنه يسقط عن الطاولة. يمكنه محاكاة هذه النتائج فوراً، حتى للأشياء أو البيئات التي لم يرها من قبل.

3. تعزيز السرعة (التقطير - Distillation)

"العقل" الأصلي ذكي جداً ولكنه بطيء، مثل بروفيسور عبقري يستغرق 10 دقائق لحل مسألة رياضية. لكي يتحرك الروبوت في الوقت الفعلي، يحتاج للتفكير بسرعة الإنسان.

  • الحل: استخدم الفريق عملية تسمى التقطير (Distillation). لقد أخذوا ذلك البروفيسور البطيء والعبقري ودربوا "طالباً" سريعاً وشاباً (نموذج الطالب) ليحاكي أداءه.
  • النتيجة: أصبح بإمكان الطالب الآن التنبؤ بالمستقبل بسرعة 10.81 إطاراً في الثانية. هذه السرعة كافية للعمل في الوقت الفعلي. يمكنك التحكم في روبوت افتراضي باستخدام وحدة تحكم الواقع الافتراضي (VR)، وسوف يتحرك الروبوت ويتفاعل فوراً، تماماً مثل الشخص الحقيقي.

ماذا يمكنه أن يفعل؟ (بناءً على ادعاءات الورقة البحثية)

تسلط الورقة الضوء على ثلاث طرق رئيسية لاستخدام هذه التكنولوجيا:

  1. اختبار السياسات ( "محاكي الطيران" للروبوتات):
    قبل إرسال روبوت إلى العالم الحقيقي لتعبئة الفاكهة، يمكنك اختبار "عقله" في DreamDojo. تظهر الورقة أنه إذا نجحت استراتيجية الروبوت في محاكاة DreamDojo، فإنها ستنجح بالتأكد في العالم الحقيقي (ارتباط بنسبة 99.5%). هذا يوفر الوقت ويمنع الروبوتات من كسر الأشياء أثناء التعلم.

  2. التخطيط المسبق ( "لاعب الشطرنج"):
    عندما يتعين على الروبوت القيام بمهمة معقدة، يمكنه استخدام DreamDojo لـ "تخيل" نتائج مختلفة. يمكنه تجربة خمس طرق مختلفة للإمساك بتفاحة في عقله، ورؤية أي منها يؤدي إلى أفضل نتيجة، ثم تنفيذ تلك الحركة المحددة. هذا يجعل الروبوت أكثر ذكاءً ونجاحاً في المهام الصعبة.

  3. التحكم عن بُعد المباشر ( "التوأم الافتراضي"):
    بما أن النموذج سريع جداً، يمكن للإنسان ارتداء سماعة واقع افتراضي والتحكم في روبوت افتراضي في الوقت الفعلي. إذا حرك الإنسان يده، سيتحرك الروبوت الافتراضي فوراً. هذا يسمح للبشر بأن "يكونوا" هم الروبوت عن بُعد، وهو أمر مفيد للمهام التي تكون صعبة جداً أو خطيرة على البشر للقيام بها مباشرة.

الملخص

DreamDof هو جسر بين العالم الحقيقي المتنوع والمتغير، وبين عالم الروبوتات الدقيق. من خلال التعلم من النشاط البشري الهائل عبر الإنترنت واستخدام "مترجم" خاص لفهم الأفعال دون الحاجة إلى تسميات توضيحية، فإنه يخلق عقلاً للروبوت يمكنه تخيل المستقبل، واختبار الأفكار بأمان، والعمل في الوقت الفعلي. إنه يحول الروبوت من آلة جامدة تعرف فقط ما تم تعليمها إياه صراحة، إلى وكيل مرن يفهم كيف يعمل العالم.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →