← أحدث الأبحاث
🤖 AI

Learning to Generate Rigid Body Interactions with Video Diffusion Models

تقدم هذه الورقة KineMask، وهو إطار عمل جديد لتوليد الفيديو يستفيد من استراتيجية تدريب ثنائية المراحل باستخدام أقنعة الكائنات والدمج بين الحركة منخفضة المستوى والاشتراط النصي عالي المستوى لتمكين التفاعلات الفيزيائية المنطقية للأجسام الصلبة والتعميم على المشاهد الواقعية.

المؤلفون الأصليون: David Romero, Ariana Bermudez, Viacheslav Iablochnikov, Hao Li, Fabio Pizzati, Ivan Laptev

نُشر 2026-03-24
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: David Romero, Ariana Bermudez, Viacheslav Iablochnikov, Hao Li, Fabio Pizzati, Ivan Laptev

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك كاميرا سينمائية سحرية يمكنها تحويل صورة واحدة إلى فيديو. هذا هو بالضبط ما تفعله نماذج انتشار الفيديو (VDMs) الحديثة. إنها فنانة موهوبة للغاية، لكن لديها نقطة ضعف كبرى: فهي لا تفهم الفيزياء حقاً.

إذا طلبت من ذكاء اصطناعي قياسي صنع فيديو لكوب ينزلق عبر طاولة ويصطدم بمجموعة من الكتب، فقد يجعل الذكاء الاصطناعي الكوب يمر عبر الكتب كأنه شبح، أو يجعل الكتب تطير في الفضاء كأنها ضُربت بصاروخ. إنه عمل إبداعي، لكنه ليس واقعياً.

إليك KineMask، وهو "برنامج تدريبي" جديد لهذه الكاميرات التي تعمل بالذكاء الاصطناعي، يعلمها كيف تصبح أساتذة في الفيزياء.

إليك كيف يعمل KineMask، مشروحاً عبر تشبيهات بسيطة:

1. المشكلة: كاميرا "الشبح"

مولدات الفيديو الحالية بالذكاء الاصطناعي تشبه الممثلين الذين حفظوا النص لكنهم لا يفهمون الحبكة. هم يعرفون كيف يبدو "الاصطدام" في صورة، لكنهم لا يفهمون السبب والنتيجة. إذا دفعت كرة، فهم لا يعرفون أنه يجب أن تصطدم بالجدار وترتد؛ بل قد يجعلون الكرة تختفي ببساطة أو تتحول إلى زهرة.

2. الحل: "عجلات التدريب" (التدريب على مرحلتين)

يعلم KineMask الذكاء الاصطناعي باستخدام عملية ذكية مكونة من خطوتين، تشبه كيفية تعلم الطفل ركوب الدراجة.

  • المرحلة الأولى: عجلات التدريب (التوجيه الكامل)
    أولاً، يُعرض على الذكاء الاصطناعي آلاف الفيديوهات المصنوعة في محاكي كمبيوتر (مثل ألعاب الفيديو). في هذه الفيديوهات، يتم إعطاء الذكاء الاصطناعي "قناع تدريب" لكل إطار (frame) على حدى. هذا القناع يشبه الخط العريض المتوهج الذي يقول: "مهلاً، هذا الجسم يتحرك بهذه السرعة الآن". يتعلم الذكاء الاصطناعي تقليد هذه الحركات بدقة. الأمر يشبه ركوب الدراجة مع عجلات تدريب؛ حيث يعرف الذكاء الاصطناعي بالضبط أين يجب أن تذهب كل الأشياء.

  • المرحلة الثانية: نزع عجلات التدريب (الخدعة السحرية)
    هنا يكمل الجزء العبقري. يبدأ الباحثون في إخفاء أقنعة التدريب. يعرضون للذكاء الاصطناعي الإطار الأول مع القناع (الدفعة)، ثم يغطون الأقنعة لبقية الفيديو.

    • التحدي: يجب على الذكاء الاصطناعي تخمين ما سيحدث بعد ذلك. "أرى الكوب يتحرك لليسار... حسناً، بناءً على ما تعلمته في المرحلة الأولى، لا بد أنه سيصطدم بالجدار، ويتوقف، وربما يقلب كتاباً".
    • النتيجة: يتعلم الذكاء الاصطناعي التنبؤ بالمستقبل. يتوقف عن التقليد ويبدأ في الاستنتاج. يتعلم أنه إذا اصطدم الجسم (أ) بالجسم (ب)، فإن الجسم (ب) يجب أن يتحرك.

3. السر الخفي: "كاتب السيناريو" (الارتباط بالنص)

لا يستخدم KineMask الرياضيات فحسب؛ بل يستخدم "كاتب سيناريو" (ذكاء اصطناعي لغوي).

  • التحكم منخفض المستوى: ترسم سهماً على صورة لتقول: "حرك هذا الكوب إلى هنا". هذه هي التعليمات الفيزيائية.
  • التحكم عالي المستوى: يستخدم النظام ذكاءً اصطناعياً لغوياً لكتابة قصة قصيرة عما يجب أن يحدث. "ينزلق الكوب، يصطدم بالجدار، ويتفتت إلى قطع".
  • الدمج: يستخدم فيديو الذكاء الاصطناعي السهم ليعرف أين يتحرك، ويستخدم القصة ليعرف كيف يجب أن يبدو شكله عند التحطم. هذا يسمي بإنتاج تأثيرات معقدة مثل تناثر الماء أو تحطم الزجاج، وهي أمور عادة ما تكون مستحيلة لهذه النماذج.

4. النتيجة: محاكي للعالم

بمجرد تدريبه، يمكن لـ KineMask أن يأخذ صورة حقيقية من هاتفك (مثل سطح مطبخ فوضوي) ويسمح لك بالتفاعل معها.

  • أنت تقول: "ادفع كوب القهوة هذا إلى اليمين".
  • KineMask يولد: فيديو حيث ينزلق الكوب، يصطدم بمجموعة من الأطباق، وتترنح الأطبع وتسقط بشكل واقعي.
  • لماذا هذا مهم: هذا ليس مجرد صنع أفلام رائعة. هذه هي الخطوة الأولى نحو الروبوتات التي يمكنها التعلم من خلال مشاهدة الفيديوهات. إذا استطاع الروبوت محاكاة اصطدام في فيديو قبل تجربته في الواقع، فلن يكسر مزهريتك الثمينة.

ملخص التشبيه

فكر في مولدات فيديو الذكاء الاصطناعي القياسية كـ كوميديين ارتجاليين. هم مضحكون ومبدعون، ولكن إذا طلبت منهم تمثيل حادث سيارة، فقد يجعلون السيارات تتحول إلى فراشات.

KineMask يشبه توظيف منسق مشاهد خطيرة (Stunt Coordinator) ومدرس فيزياء لتدريب هؤلاء الكوميديين.

  1. يتدربون في موقع تصوير آمن وزائف (المحاكي).
  2. يُجبرون على التنبؤ بالنتيجة دون رؤية السيناريو (إخفاء القناع).
  3. يُعطون سيناريو يصف الفيزياء (النص الموجه).

الآن، عندما تطلب منهم تمثيل حادث، لن يحولوا السيارات إلى فراشات. بل سيجعلون السيارات تصطدم، وترتد، وتتناثر الحطام تماماً كما تقتضي قوانين الفيزياء.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →