← أحدث الأبحاث
🤖 machine learning

World Action Models are Zero-shot Policies

تقدم الورقة البحثية DreamZero، وهو نموذج عالمي للأفعال (World Action Model) يستفيد من نموذج انتشار فيديو (video diffusion backbone) مُدرب مسبقاً للتنبؤ بالحالات والأفعال المستقبلية، مما يتيح التحكم في حلقة مغلقة في الوقت الفعلي، وتعميماً فائقاً على المهام والبيئات غير المرئية مقارنة بنماذج الرؤية واللغة والأفعال (Vision-Language-Action models)، ونقلاً فعالاً عبر الأجساء المختلفة بأقل قدر من البيانات.

المؤلفون الأصليون: Seonghyeon Ye, Yunhao Ge, Kaiyuan Zheng, Shenyuan Gao, Sihyun Yu, George Kurian, Suneel Indupuru, You Liang Tan, Chuning Zhu, Jiannan Xiang, Ayaan Malik, Kyungmin Lee, William Liang, Nadun Ranawaka, J
نُشر 2026-02-19
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Seonghyeon Ye, Yunhao Ge, Kaiyuan Zheng, Shenyuan Gao, Sihyun Yu, George Kurian, Suneel Indupuru, You Liang Tan, Chuning Zhu, Jiannan Xiang, Ayaan Malik, Kyungmin Lee, William Liang, Nadun Ranawaka, Jiasheng Gu, Yinzhen Xu, Guanzhi Wang, Fengyuan Hu, Avnish Narayan, Johan Bjorck, Jing Wang, Gwanghyun Kim, Dantong Niu, Ruijie Zheng, Yuqi Xie, Jimmy Wu, Qi Wang, Ryan Julian, Danfei Xu, Yilun Du, Yevgen Chebotar, Scott Reed, Jan Kautz, Yuke Zhu, Linxi "Jim" Fan, Joel Jang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت كيفية القيام بالأعمال المنزلية.

الطريقة القديمة (نموذج "VLA"):
فكر في عقول الروبوتات الحالية (التي تسمى نماذج الرؤية واللغة والفعل - VLA) كأنها أمين مكتبة ذكي قرأ كل كتيبات التعليمات المكتوبة على الإطلاق. إذا قلت له: "انقل الكوب الأحمر إلى الطاولة الزرقاء"، سيعرف تماماً ما تعنيه هذه الكلمات، وسيمكنه العثوا على الكوب والطاولة.

لكن المشكلة هي أن هذا الأمين لم يقم قط بـ تحريك كوب من قبل. هو يعرف فقط الكلمات التي تصف الحركة. إذا طلبت منه "فك رباط حذاء" أو "طي قميص بطريقة معينة"، فإنه يتجمد. هو يعرف ما هو الحذاء، لكن ليس لديه "فيلم ذهني" لكيفية حركة الأربطة عند شدها. إنه بارع جداً في فهم اللغة، لكنه سيء جداً في فهم الفيزياء والحركة.

الطريقة الجديدة (DreamZero / نموذج "فعل العالم"):
قام الباحثون في NVIDIA ببناء نوع جديد من عقول الروبوتات يسمى DreamZero. بدلاً من أن يكون مجرد أمين مكتبة، فإن DreamZero يشبه مخرج هوليوود الذي يعمل أيضاً كبديل للممثل في مشاهد الأكشن (Stunt Double).

إليك كيف يعمل، باستخدام تشبيه بسيط:

1. خدعة "الفيلم الذهني"

عندما تقول لـ DreamZero: "ضع البرتقالة داخل اليقطينة"، فإنه لا يكتفي بالبحث عن البرتقالة واليقطينة فحسب. بل يتخيل أولاً فيلماً قصيراً للمستقبل.

يقول لنفسه: "حسناً، أنا أرى البرتقالة. أرى اليقطينة. الآن، دعني أشغل فيلماً في مخيلتي ليدي وهي تمسك البرتقالة، ترفعها، ثم تسقطها داخل اليقطينة".

بمجرد أن "يصور" هذا الفيلم المستقبلي في عقله، ينظر إلى الفيديو ويقول: "حسناً، لكي يحدث هذا الفيلم، يجب أن تتحرك ذراعي بهذه الطريقة".

هذا هو السحر. من خلال تعلم كيف سيبدو العالم في الخطوة التالية (الفيديو)، يتعلم الروبوت تلقائياً كيف يتحرك (الفعل) لجعل ذلك الفيديو حقيقياً. إنه يتعلم الفيزياء من خلال مراقبة تطور العالم، تماماً كما نتعلم نحن من خلال مراقبة كيف تسقط الأشياء أو تتدحرج.

2. التعلم من "الفوضى" بدلاً من "التكرار"

الروبوتات التقليدية تشبه الطلاب الذين يتعلمون فقط من خلال حل نفس المسألة الرياضية 1,000 مرة. إذا غيرت الأرقام قليلاً، يصابون بالارتباك.

أما DreamZero فهو مختلف. لقد تم تدريبه على 500 ساعة من الفيديوهات الواقعية الفوضوية. لقد شاهد روبوتات (وبشر) يقومون بآلاف المهام المختلفة وغير المتكررة في المطابخ والمكاتب والمتاجر.

  • التشبيه: تخيل تعلم القيادة.
    • الروبوت القديم: يقود في نفس المسار المغلق 1,000 مرة. إذا وضعت قمعاً في مكان جديد، فسيصطدم به.
    • DreamZero: يقود عبر مدينة مزدحمة، يتعامل مع حركة المرور، المطر، المشاة، وعلامات الطريق الغريبة. إنه يتعلم قواعد الطريق (الفيزياء) بدلاً من مجرد حفظ مسار معين.

ولأن تعليمه جاء من هذه "الفوضى"، يمكنه الدخول إلى غرفة جديدة لم يسبق له رؤيتها، ومع ذلك يظل قادراً على معرفة كيفية التقاط جسم غريب.

3. "المرآة السحرية" (التجسد المتقاطع - Cross-Embodiment)

من أروع الأشياء التي يمكن لـ DreamZero القيام بها هي التعلم من خلال مراقبة الآخرين، حتى لو كانوا يبدون مختلفين تماماً.

  • السيناريو: لديك روبوت بذراعين (AgiBot). تريد منه أن يتعلم خدعة جديدة.
  • الطريقة القديمة: تحتاج إلى إنسان يمسك بأذرع الروبوت ويوجه حركته جسدياً لساعات.
  • طريقة DreamZero: كل ما عليك فعله هو عرض فيديو مدته 12 دقيقة لإنسان وهو يؤدي المهمة.
    • التشبيه: الأمر يشبه مشاهدة فيديو لجمبازي يؤدي شقلبة خلفية. على الرغم من أنك تملك أرجل والجمبازي يملك جسداً مختلفاً، إلا أنه يمكنك استيعاب فيزياء الشقلبة. DreamZero يشاهد الفيديو، يفهم "فيلم" الشقلبة الخلفية، ثم يستنتج كيف يمكن لجسده الخاص القيام بذلك.
    • توضح الورقة البحثية أنه باستخدام 30 دقيقة فقط من بيانات "اللعب"، يمكن لـ DreamZero الانتقال إلى جسم روبوت مختلف تماماً ومع ذلك يعمل بشكل مثالي.

4. مشكلة السرعة (ترقية "الفلاش")

كان هناك عقبة واحدة كبيرة: DreamZero هو نموذج يحتوي على 14 مليار معلمة (parameter) ويقوم بتوليد الفيديو. عادةً، توليد الفيديو يكون بطيئاً (مثل رندرة فيلم). والروبوتات تحتاج للتحرك بسرعة (7 مرات في الثانية).

قام الفريق ببناء "وضع توربو" يسمى DreamZero-Flash.

  • التشبيه: تخيل أنك ترسم لوحة. عادةً، ترسم المشهد بأكمله، ثم السماء بأكملها، ثم الأرض بأكملها. هذا يستغرق وقتاً طويلاً.
  • الحل: يدرك DreamZero-Flash أنه بالنسبة لـ حركة الروبوت، فإنه لا يحتاج إلى فيلم عالي الدقة ومثالي. هو يحتاج فقط إلى "رسم تخطيطي" (sketch) للمستقبل ليعرف أين يتحرك تالياً. هو يتخطى خطوات "الدقة العالية" للفيديو ويركز على الفعل، مما يجعله أسرع بـ 38 مرة. الآن، يمكنه التفكير والتحرك في الوقت الفعلي.

الملخص

DreamZero هو عقل روبوت يتعلم من خلال تخيل المستقبل.

  • بدلاً من حفظ التعليمات، يقوم بمحاكاة أفلام لما سيحدث تالياً.
  • ولأنه يفهم "فيلم" الفيزياء، يمكنه التعامل مع مهام جديدة وبيئات جديدة دون الحاجة لإعادة تدريبه.
  • يمكنه التعلم من الفيديوهات للبشر أو الروبوتات الأخرى، متجاوزاً الحاجة لتدريب جسدي لساعات.
  • هو سريع بما يكفي للتحكم في روبوت حقيقي في الوقت الفعلي.

إنه الفرق بين روبوت يعرف التعريف القاموسي لـ "افتح الباب"، وروبوت يمكنه تخيل الباب وهو يفتح، ويعرف بالضبط مدى قوة الدفع المطلوبة للمقبض لجعل ذلك يحدث.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →