World Simulation with Video Foundation Models for Physical AI
تقدم الورقة البحثية Cosmos-Predict2.5 وCosmos-Transfer2.5، وهي عائلة موحدة من النماذج التأسيسية للعالم التي تستفيد من بنيات التدفق والتعلم التعزيزي لتقديم توليد فيديو عالي الدقة ومتوافق مع التعليمات وترجمة للعالم، وذلك من أجل النهوض بالذكاء الاصطناعي الفيزيائي، والروبوتات، والذكاء المتجسد.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم روبوت كيفية صنع شطيرة، أو قيادة سيارة، أو السير عبر مدينة مزدحمة. إذا تركت الروبوت يتعلم من خلال القيام بهذه الأشياء في العالم الحقيقي، فقد يكسر محمصة الخبز، أو يصدم السيارة، أو يتعثر في قدميه. إن ذلك مكلف، وخطير، وبطيء للغاية.
تقدم هذه الورقة البحثية NVIDIA's Cosmos-Predict2.5، وهو نوع جديد من "التوأم الرقمي" للعالم المادي. فكر فيه ليس فقط كمولد للفيديو، بل كـ محرك ألعاب فيديو فائق الواقعية يعمل بالخيال الصرف.
إليك تفصيل لكيفية عمله ولماذا هو مهم، باستخدام تشبيهات بسيطة:
1. الفكرة الجوهرية: "آلة الأحلام"
كانت نماذج الذكاء الاصطناعي السابقة مثل طالب قرأ فقط كتاباً مدرسياً عن القيادة لكنه لم يجلس قط في سيارة. كان بإمكانهم التحدث عن إشارات المرور، لكن لم يكن بإمكانهم التنبؤ بما سيحدث إذا تدحرجت كرة في الشارع.
Cosmos-Predict2.5 يشبه طالباً شاهد 200 مليون ساعة من فيديوهات العالم الحقيقي. لقد رأى كل أنواع الطقس، وكل أنواع حركات أذرع الروبوتات، وكل حوادث السيارات. لقد تعلم "فيزياء" كيفية عمل العالم. الآن، يمكنك أن تسأله: "أرني ماذا يحدث إذا حاول روبوت التقاط تفاحة زلقة في مطبخ ممطر،" وسيقوم بإنشاء فيديو لهذا السيناريو بالضبط، مع مراعاة الانعكاسات الواقعية، والرشقات، والجاذبية.
2. السر الكامن: كيف تعلم؟
الفريق لم يقم فقط بصب فيديوهات عشوائية في الكمبيوتر. بل بنوا مصنع تصفية آلي ضخم:
- المصفاة: تخيل غربالاً يلتقط فقط المقاطع الأفضل والأكثر إثارة للاهتمام. لقد استبعدوا الفيديوهات الضبابية، والرسوم المتحركة، والأشياء التي تبدو مزيفة. واحتفظوا فقط بـ "الأشياء الجيدة" (مثل الروبوتات الحقيقية وهي تحرك أشياء حقيقية).
- المعلم (Cosmos-Reason1): أضافوا ذكاءً اصطناعياً "معلماً" ذكياً يقرأ النصوص المكتوبة. إذا قلت "الروبوت يسقط الكوب"، يتأكد المعلم أن الذكاء الاصطناعي يفهم تماماً كيف يبدو "السقوط"، بدلاً من مجرد جعل الكوب يختفي.
- التدريب (التعلم التعزيزي): بعد أن يقوم الذكاء الاصطناعي بتوليد فيديو، جعلوه "يقيّم" نفسه بناءً على التفضيلات البشرية. إذا بدا الفيديو غريباً أو كانت الفيزياء فيه خاطئة، يحصل الذكاء الاصطناعي على "درجة سيئة" ويضطر للمحاولة مرة أخرى. هذا يشبه طالباً يؤدي اختبارات تجريبية حتى يجتاز الامتحان النهائي بتفوق.
3. الأداتان الرئيسيتان
تقدم الورقة البحثية أداتين رئيسيتين في هذه العائلة الجديدة:
أ. Cosmos-Predict2.5 (المحاكي)
- ماذا يفعل: ينشئ عوالم جديدة من الصفر بناءً على تعليماتك.
- التشبيه: إنه يشبه مخرجاً يمكنه تصوير أي فيلم يمكنك تخيله، لكن الفيلم هو محاكاة للواقع. يمكنك القول، "صور روبوتاً يمشي على المريخ،" وسيقوم بإنشاء الفيديو.
- لماذا هو أفضل: إنه أسرع، وأكثر حدة، ويفهم التعليمات بشكل أفضل بكثير من الإصدار السابق. يمكنه التعامل مع 2 مليار أو 14 مليار "خلية دماغية" (بارامترات)، مما يجعله ذكياً للغاية.
ب. Cosmos-Transfer2.5 (المترجم)
- ماذا يفعل: يأخذ رسماً تخطيطياً خشناً أو فيديو بسيطاً ويحوله إلى تحفة فنية واقعية للغاية.
- التشبيه: تخيل أن لديك رسماً بالقلم التلويني لشارع ما. تعمل هذه الأداة مثل فنان سحري يأخذ ذلك الرسم ويحوله إلى فيديو 4K فائق الواقعية لذلك الشارع، مضيفاً السيارات والناس والظلال، مع الحفاظ على المخطط الدقيق الذي رسمته.
- السحر: إنه أصغر بمقدار 3.5 مرة من الإصدار القديم ولكنه ينتج جودة أعلى. يمكنه أيضاً صنع فيديوهات طويلة دون أن تصبح الصورة ضبابية أو يفقد السياق منطقه (وهي مشكلة تسمى "تراكم الخطأ").
4. لماذا يهم هذا؟ (الأثر في العالم الحقيقي)
هذا ليس مجرد صنع فيديوهات رائعة؛ بل يتعلق بتدريب الروبوتات بأمان.
- بالنسبة للروبوتات: بدلاً من كسر 1,000 ذراع روبوت حقيقية لتعلم كيفية طي الغسيل، يمكن للمهندسين تدريب الروبوت في محاكي "Cosmos". يرتكب الروبوت جميع أخطائه في العالم الرقمي، ويتعلم الحركات المثالية، ثم ينتقل إلى العالم الحقيقي وهو جاهز للعمل.
- بالنسبة للسيارات ذاتية القيادة: لا يمكنك بسهولة اختبار سيارة ذاتية القيادة في عاصفة ثلجية في وسط الصحراء. مع Cosmos، يمكنك توليد عاصفة ثلجية في الصحراء فوراً. يمكنك اختبار ذكاء السيارة ضد ملايين سيناريوهات "ماذا لو" (مثلاً: "ماذا لو قفز غزال إلى الطريق؟") في ثوانٍ.
- بالنسبة للبيانات: إنه ينشئ بيانات "زائفة" تبدو حقيقية لدرجة يصعب معها تمييزها عن الواقع. وهذا يساعد في تدريب نماذج ذكاء اصطناعي أخرى دون الحاجة لتصوير ملايين الساعات من اللقطات الحقيقية.
5. الصورة الكبيرة
تقوم NVIDIA بإصدار الكود المصدري والنماذج مجاناً (مفتوحة المصدر).
فكر في هذا كأن NVIDIA توزع المخططات والمواد الخام لمحرك محاكاة فائق القوة على العالم أجمع. إنهم يريدون من الباحثين والطلاب والشركات بناء "عوالمهم الرقمية" الخاصة لحل مشكلات العالم الحقيقي.
باختصار:
Cosmos-Predict2.5 هو آلة زمن ومولد للأكوان الموازية مدمجان معاً. إنه يسمح لنا بتسريع تدريب الروبوتات والسيارات ذاتية القيادة من خلال السماح لها بعيش آلاف الحيوات في جهاز كمبيوتر قبل أن تلمس العالم الحقيقي. إنه شبكة الأمان القصوى ومنصة التدريب المثالية لمستقبل الذكاء الاصطناعي المادي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.