← أحدث الأبحاث
💻 computer science

VideoWorld 2: Learning Transferable Knowledge from Real-world Videos

يقدم VideoWorld 2 نموذج ديناميكيات كامنة معززاً بالديناميكيات (dLDM) يعمل على فصل ديناميكيات الحركة عن المظهر البصري لتعلم معرفة قابلة للنقل ومرتبطة بالمهام مباشرة من فيديوهات واقعية خام، مما يحسن الأداء بشكل كبير في المهام اليدوية المعقدة والتحكم الروبوتي.

المؤلفون الأصليون: Zhongwei Ren, Yunchao Wei, Xiao Yu, Guixun Luo, Yao Zhao, Bingyi Kang, Jiashi Feng, Xiaojie Jin

نُشر 2026-02-11
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zhongwei Ren, Yunchao Wei, Xiao Yu, Guixun Luo, Yao Zhao, Bingyi Kang, Jiashi Feng, Xiaojie Jin

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم طفل كيفية طي طائرة ورقية. أنت لا تعطيه دليلاً يحتوي على 500 صفحة من معادلات الفيزياء؛ بل ببساطة تعرض عليه مقطع فيديو لشخص يقوم بذلك. يشاهد الطفل الفيديو، ويفهم "جوهر" الحركة — الطية، والكسرة، والثنية — ثم يذهب إلى غرفته الخاصة، ويحضر ورقة مختلفة، ويقوم بها بنفسه.

نماذج الذكاء الاصطناعي الحالية تشبه الطلاب "المهووسين بالتفاصيل أكثر من اللازم". إذا عرضت عليهم فيديو لشخص يطوي الورق على طاولة خشبية، فقد يعتقدون أن "المعرفة" بطي الورق تشمل ملمس الخشب أو الإضاءة المحددة في الغرفة. فإذا نقلت الورقة إلى مكتب أبيض، يصاب الذكاء الاصطناعي بالارتباك ويفشل، لأنه لم يتعلم كيفية "الطي"؛ بل تعلم كيفية "إعادة إنتاج ذلك الفيديو المحدد".

VideoWorld 2 هي طريقة جديدة لتعليم الذكاء الاصطناعي التركيز على "روح" الفعل بدلاً من "جلد" المشهد.

المشكلة: "الطالب شديد التفصيل"

تحاول معظم نماذج الذكاء الاصطناعي تعلم كل شيء في وقت واحد: حركة اليدين، لون الورقة، الظلال على الطاولة، والخلفية. ولأنها تحاول حفظ كل بكسل، فإنها تعاني من "تشابك المظهر" (Appearance Entanglement). الأمر يشبه محاولة تعلم الرقص، لكنك تشتت انتباهك بشدة بلون حذاء الراقص لدرجة أنك تنسى إيقاع الموسيقى. عندما يتغير لون الحذاء، تفقد الإيقاع.

الحل: "المخرج ومصمم الرقصات"

ابتكر الباحثون نظاماً يسمى dLDM (نموذج الديناميكيات الكامنة المعزز بالديناميكيات). لفهم كيفية عمله، تخيل إنتاج فيلم مقسم إلى دورين متخصصين:

  1. مصمم الرقصات (نموذج الديناميكيات الكامنة): هذا الجزء من الذكاء الاصطناعي "أعمى" عن الجمال. هو لا يهتم إذا كانت الورقة زرقاء، أو حمراء، أو منقطة. مهمته الوحيدة هي رسم "هيكل" الحركة. إنه يلتقط "رياضيات" الفعل: حرك اليد لليسار ← اضغط للأسفل ← اطوِ الزاوية. إنه ينشئ نسخة مبسطة "تشبه المسودة" للمهمة، تركز فقط على منطق الحركة.
  2. المخرج (نموذج انتشار الفيديو): هذا فنان ماهر شاهد ملايين الفيديوهات الجميلة. المخرج لا يعرف ما هي المهمة، لكنه يعرف كيف يجعل الأشياء تبدو واقعية. يأخذ "المسودة" التي قدمها مصمم الرقصات ويقول: "حسناً، أنا أرى الحركة؛ الآن دعني ألونها بأنسجة وإضاءة وألوان واقعية".

من خلال الفصل بينهما، يحقق الذكاء الاصطناعي شيئاً ساحراً: المعرفة القابلة للنقل.

لماذا يهم هذا: "اختبار العالم الحقيقي"

اختبر الباحثون هذا على اثنين من أصعب "الامتحانات النهائية":

  • اختبار الحرف اليدوية (Video-CraftBench): طلبوا من الذكاء الاصطناعي تعلم مهام معقدة متعددة الخطوات مثل طي طائرة ورقية أو بناء برج من المكعبات بمجرد مشاهدة الفيديوهات. ولأن الذكاء الاصطناعي تعلم منطق الطي بدلاً من مظهر الطاولة، فقد تمكن من طي الورق بنجاح في بيئات جديدة تماماً لم يسبق له رؤيتها. لقد حسن معدلات النجاح بنسبة تصل إلى 70% مقارنة بالطرق القديمة.
  • اختبار الروبوت (CALVIN): أخذوا المعرفة المتعلمة من مجموعات بيانات الفيديو الضخمة من الإنترنت ونقلوها إلى روبوت. الأمر يشبه شخصاً يشاهد فيديات الطبخ على يوتيوب ثم يستخدم مطبخاً حقيقياً بنجاح. تعلم الذكاء الاصطناعي كيفية التعامل مع الأشياء بطريقة تعمل عبر مختلف الأذرع الروبوتية والإعدادات.

الصورة الكبيرة

VideoWorld 2 هي خطوة نحو إنشاء ذكاء اصطناعي يدرك العالم بشكل يشبه البشر. فبدلاً من كونه مجرد آلة تصوير عالية التقنية تقلد البكسلات، فإنه يتحول إلى مراقب يستند إلى الاستنتاج — وكيل يمكنه مشاهدة العالم، وفهم "قواعد اللعبة"، وتطبيق تلك القواعد لحل مشكلات جديدة في العالم الحقيقي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →