← أحدث الأبحاث
🤖 AI

World Simulation with Video Foundation Models for Physical AI

تقدم الورقة البحثية Cosmos-Predict2.5 وCosmos-Transfer2.5، وهي عائلة موحدة من النماذج التأسيسية للعالم التي تستفيد من بنيات التدفق والتعلم التعزيزي لتقديم توليد فيديو عالي الدقة ومتوافق مع التعليمات وترجمة للعالم، وذلك من أجل النهوض بالذكاء الاصطناعي الفيزيائي، والروبوتات، والذكاء المتجسد.

المؤلفون الأصليون: NVIDIA, :, Arslan Ali, Junjie Bai, Maciej Bala, Yogesh Balaji, Aaron Blakeman, Tiffany Cai, Jiaxin Cao, Tianshi Cao, Elizabeth Cha, Yu-Wei Chao, Prithvijit Chattopadhyay, Mike Chen, Yongxin Chen, Yu C
نُشر 2026-02-26
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: NVIDIA, :, Arslan Ali, Junjie Bai, Maciej Bala, Yogesh Balaji, Aaron Blakeman, Tiffany Cai, Jiaxin Cao, Tianshi Cao, Elizabeth Cha, Yu-Wei Chao, Prithvijit Chattopadhyay, Mike Chen, Yongxin Chen, Yu Chen, Shuai Cheng, Yin Cui, Jenna Diamond, Yifan Ding, Jiaojiao Fan, Linxi Fan, Liang Feng, Francesco Ferroni, Sanja Fidler, Xiao Fu, Ruiyuan Gao, Yunhao Ge, Jinwei Gu, Aryaman Gupta, Siddharth Gururani, Imad El Hanafi, Ali Hassani, Zekun Hao, Jacob Huffman, Joel Jang, Pooya Jannaty, Jan Kautz, Grace Lam, Xuan Li, Zhaoshuo Li, Maosheng Liao, Chen-Hsuan Lin, Tsung-Yi Lin, Yen-Chen Lin, Huan Ling, Ming-Yu Liu, Xian Liu, Yifan Lu, Alice Luo, Qianli Ma, Hanzi Mao, Kaichun Mo, Seungjun Nah, Yashraj Narang, Abhijeet Panaskar, Lindsey Pavao, Trung Pham, Morteza Ramezanali, Fitsum Reda, Scott Reed, Xuanchi Ren, Haonan Shao, Yue Shen, Stella Shi, Shuran Song, Bartosz Stefaniak, Shangkun Sun, Shitao Tang, Sameena Tasmeen, Lyne Tchapmi, Wei-Cheng Tseng, Jibin Varghese, Andrew Z. Wang, Hao Wang, Haoxiang Wang, Heng Wang, Ting-Chun Wang, Fangyin Wei, Jiashu Xu, Dinghao Yang, Xiaodong Yang, Haotian Ye, Seonghyeon Ye, Xiaohui Zeng, Jing Zhang, Qinsheng Zhang, Kaiwen Zheng, Andrew Zhu, Yuke Zhu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت كيفية صنع شطيرة، أو قيادة سيارة، أو السير عبر مدينة مزدحمة. إذا تركت الروبوت يتعلم من خلال القيام بهذه الأشياء في العالم الحقيقي، فقد يكسر محمصة الخبز، أو يصدم السيارة، أو يتعثر في قدميه. إن ذلك مكلف، وخطير، وبطيء للغاية.

تقدم هذه الورقة البحثية NVIDIA's Cosmos-Predict2.5، وهو نوع جديد من "التوأم الرقمي" للعالم المادي. فكر فيه ليس فقط كمولد للفيديو، بل كـ محرك ألعاب فيديو فائق الواقعية يعمل بالخيال الصرف.

إليك تفصيل لكيفية عمله ولماذا هو مهم، باستخدام تشبيهات بسيطة:

1. الفكرة الجوهرية: "آلة الأحلام"

كانت نماذج الذكاء الاصطناعي السابقة مثل طالب قرأ فقط كتاباً مدرسياً عن القيادة لكنه لم يجلس قط في سيارة. كان بإمكانهم التحدث عن إشارات المرور، لكن لم يكن بإمكانهم التنبؤ بما سيحدث إذا تدحرجت كرة في الشارع.

Cosmos-Predict2.5 يشبه طالباً شاهد 200 مليون ساعة من فيديوهات العالم الحقيقي. لقد رأى كل أنواع الطقس، وكل أنواع حركات أذرع الروبوتات، وكل حوادث السيارات. لقد تعلم "فيزياء" كيفية عمل العالم. الآن، يمكنك أن تسأله: "أرني ماذا يحدث إذا حاول روبوت التقاط تفاحة زلقة في مطبخ ممطر،" وسيقوم بإنشاء فيديو لهذا السيناريو بالضبط، مع مراعاة الانعكاسات الواقعية، والرشقات، والجاذبية.

2. السر الكامن: كيف تعلم؟

الفريق لم يقم فقط بصب فيديوهات عشوائية في الكمبيوتر. بل بنوا مصنع تصفية آلي ضخم:

  • المصفاة: تخيل غربالاً يلتقط فقط المقاطع الأفضل والأكثر إثارة للاهتمام. لقد استبعدوا الفيديوهات الضبابية، والرسوم المتحركة، والأشياء التي تبدو مزيفة. واحتفظوا فقط بـ "الأشياء الجيدة" (مثل الروبوتات الحقيقية وهي تحرك أشياء حقيقية).
  • المعلم (Cosmos-Reason1): أضافوا ذكاءً اصطناعياً "معلماً" ذكياً يقرأ النصوص المكتوبة. إذا قلت "الروبوت يسقط الكوب"، يتأكد المعلم أن الذكاء الاصطناعي يفهم تماماً كيف يبدو "السقوط"، بدلاً من مجرد جعل الكوب يختفي.
  • التدريب (التعلم التعزيزي): بعد أن يقوم الذكاء الاصطناعي بتوليد فيديو، جعلوه "يقيّم" نفسه بناءً على التفضيلات البشرية. إذا بدا الفيديو غريباً أو كانت الفيزياء فيه خاطئة، يحصل الذكاء الاصطناعي على "درجة سيئة" ويضطر للمحاولة مرة أخرى. هذا يشبه طالباً يؤدي اختبارات تجريبية حتى يجتاز الامتحان النهائي بتفوق.

3. الأداتان الرئيسيتان

تقدم الورقة البحثية أداتين رئيسيتين في هذه العائلة الجديدة:

أ. Cosmos-Predict2.5 (المحاكي)

  • ماذا يفعل: ينشئ عوالم جديدة من الصفر بناءً على تعليماتك.
  • التشبيه: إنه يشبه مخرجاً يمكنه تصوير أي فيلم يمكنك تخيله، لكن الفيلم هو محاكاة للواقع. يمكنك القول، "صور روبوتاً يمشي على المريخ،" وسيقوم بإنشاء الفيديو.
  • لماذا هو أفضل: إنه أسرع، وأكثر حدة، ويفهم التعليمات بشكل أفضل بكثير من الإصدار السابق. يمكنه التعامل مع 2 مليار أو 14 مليار "خلية دماغية" (بارامترات)، مما يجعله ذكياً للغاية.

ب. Cosmos-Transfer2.5 (المترجم)

  • ماذا يفعل: يأخذ رسماً تخطيطياً خشناً أو فيديو بسيطاً ويحوله إلى تحفة فنية واقعية للغاية.
  • التشبيه: تخيل أن لديك رسماً بالقلم التلويني لشارع ما. تعمل هذه الأداة مثل فنان سحري يأخذ ذلك الرسم ويحوله إلى فيديو 4K فائق الواقعية لذلك الشارع، مضيفاً السيارات والناس والظلال، مع الحفاظ على المخطط الدقيق الذي رسمته.
  • السحر: إنه أصغر بمقدار 3.5 مرة من الإصدار القديم ولكنه ينتج جودة أعلى. يمكنه أيضاً صنع فيديوهات طويلة دون أن تصبح الصورة ضبابية أو يفقد السياق منطقه (وهي مشكلة تسمى "تراكم الخطأ").

4. لماذا يهم هذا؟ (الأثر في العالم الحقيقي)

هذا ليس مجرد صنع فيديوهات رائعة؛ بل يتعلق بتدريب الروبوتات بأمان.

  • بالنسبة للروبوتات: بدلاً من كسر 1,000 ذراع روبوت حقيقية لتعلم كيفية طي الغسيل، يمكن للمهندسين تدريب الروبوت في محاكي "Cosmos". يرتكب الروبوت جميع أخطائه في العالم الرقمي، ويتعلم الحركات المثالية، ثم ينتقل إلى العالم الحقيقي وهو جاهز للعمل.
  • بالنسبة للسيارات ذاتية القيادة: لا يمكنك بسهولة اختبار سيارة ذاتية القيادة في عاصفة ثلجية في وسط الصحراء. مع Cosmos، يمكنك توليد عاصفة ثلجية في الصحراء فوراً. يمكنك اختبار ذكاء السيارة ضد ملايين سيناريوهات "ماذا لو" (مثلاً: "ماذا لو قفز غزال إلى الطريق؟") في ثوانٍ.
  • بالنسبة للبيانات: إنه ينشئ بيانات "زائفة" تبدو حقيقية لدرجة يصعب معها تمييزها عن الواقع. وهذا يساعد في تدريب نماذج ذكاء اصطناعي أخرى دون الحاجة لتصوير ملايين الساعات من اللقطات الحقيقية.

5. الصورة الكبيرة

تقوم NVIDIA بإصدار الكود المصدري والنماذج مجاناً (مفتوحة المصدر).

فكر في هذا كأن NVIDIA توزع المخططات والمواد الخام لمحرك محاكاة فائق القوة على العالم أجمع. إنهم يريدون من الباحثين والطلاب والشركات بناء "عوالمهم الرقمية" الخاصة لحل مشكلات العالم الحقيقي.

باختصار:
Cosmos-Predict2.5 هو آلة زمن ومولد للأكوان الموازية مدمجان معاً. إنه يسمح لنا بتسريع تدريب الروبوتات والسيارات ذاتية القيادة من خلال السماح لها بعيش آلاف الحيوات في جهاز كمبيوتر قبل أن تلمس العالم الحقيقي. إنه شبكة الأمان القصوى ومنصة التدريب المثالية لمستقبل الذكاء الاصطناعي المادي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →