← أحدث الأبحاث
🤖 AI

PhysVid: Physics Aware Local Conditioning for Generative Video Models

يقدم PhysVid مخططاً للتحكم المحلي المدرك للفيزياء يقوم بتوصيف كتل الإطارات المتصلة زمنياً بأوصاف واقعية، ويستخدم مطالبات فيزيائية سلبية لتعزيز المعقولية الفيزيائية لنماذج توليد الفيديو بشكل كبير.

المؤلفون الأصليون: Saurabh, Pathak, Elahe Arani, Mykola Pechenizkiy, Bahram Zonooz

نُشر 2026-03-30
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Saurabh, Pathak, Elahe Arani, Mykola Pechenizkiy, Bahram Zonooz

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتاً فناناً كيف يرسم لوحة متحركة (فيديو) بناءً على جملة بسيطة مثل: "سيارة تقود في شارع ممطر".

مولدات الفيديو الحالية بالذكاء الاصطناعي تشبه فنانين موهوبين للغاية ولكنهم يفتقرون إلى الدقة. يمكنهم جعل السيارة تبدو جميلة والمطر يبدو لامعاً، لكنهم غالباً ما يخطئون في الفيزياء. قد تجعل السيارة تطفو كأنها شبح، أو المطر يسقط للأعلى، أو العجلات تدور للخلف بينما تتحرك السيارة للأمام. إنهم يعرفون كيف تبدو الأشياء، لكنهم لا يفهمون حقاً كيف تعمل.

PhysVid هو أسلوب جديد يعلم الذكاء الاصطناعي ليكون "طالباً مجتهداً في الفيزياء"، حتى لا يكتفي بالتخمين، بل يفهم القواعد.

إليك كيف يعمل، مقسماً إلى مفاهيم بسيطة:

1. المشكلة: "العام" مقابل "المحلي"

تخيل أنك تخرج فيلماً.

  • الطريقة القديمة (الأمر العام - Global Prompt): تعطي المخرج تعليمات كبيرة واحدة للفيلم بأكüm: "اصنع فيلماً عن سيارة تقود في المطر".
    • المشكلة: يحصل المخرج على الانطباع العام، ولكن عندما يتعلق الأمر بلحظة محددة تصطدم فيها السيارة ببركة ماء، فقد ينسى قواعد الماء. قد يجعل الماء يتطاير للأعلى أو يجعل السيارة تنزلق جانبياً وكأنها على الجليد، حتى لو كان الطريق جافاً. كانت التعليمات واسعة جداً بحيث لم تلتقط التفاصيل الدقيقة في أجزاء من الثانية.
  • طريقة PhysVid (الاشتراط المحلي - Local Conditioning): بدلاً من أمر واحد كبير، يقوم PhysVid بتقسيم الفيلم إلى مقاطع صغيرة مدة كل منها ثانية واحدة. لكل مقطع، يعطي المخرج ملاحظة محددة تركز على الفيزياء.
    • المقطع 1: "السيارة تتحرك للأمام؛ العجلات تدور للأمام".
    • المقطع 2: "السيارة تصطدم ببركة ماء؛ الماء يتطاير للخارج وللأسفل بفعل الجاذبية".
    • المقطع 3: "المطر يسقط مستقيماً للأسفل؛ مساحات الزجاج تدفع الماء جانبياً".

من خلال التركيز على هذه الأجزاء الصغيرة، ينتبه الذكاء الاصطناعي للقواعد المحددة التي تنطبق في تلك اللحظة تحديداً، بدلاً من الاكتفاء بالموضوع العام.

2. السر الخفي: "مدرس الفيزياء" (VLM)

كيف يعرف الذكاء الاصطناعي ماهية تلك الملاحظات المحددة؟ إنه يستخدم نموذج لغة رؤية (VLM)، والذي يعمل بمثابة مدرس فيزياء.

  • أثناء التدريب: يشاهد الذكاء الاصطناعي آلاف الفيديوهات الحقيقية. ينظر "المدرس" إلى مقطع مدته ثانية واحدة ويقول: "حسناً، في هذه الثانية المحددة، الكرة تسقط بسبب الجاذبية، والظل يصبح أطول لأن الشمس تتحرك". ثم يكتب هذه القواعد كـ "أمر فيزيائي" خاص.
  • النتيجة: يتعلم الذكاء الاصطناعي ربط المشهد البصري للكرة الساقطة ليس فقط بكلمة "كرة"، بل بالقاعدة المحددة "الجاذبية تسحبها للأسفل".

3. خدعة "مضاد الجاذبية" (Counterfactuals)

هذا هو الجزء الأكثر ذكاءً. لتعليم الذكاء الاصطناعي ما يجب عدم فعله، يستخدم PhysVid أسلوب "محامي الشيطان".

  • الأمر الإيجابي: "الكرة تسقط للأسفل".
  • الأمر المضاد (السلبي): يُطلب من الذكاء الاصطناعي أيضاً تخيل النسخة الخاطئة: "الكرة تطفو للأعلى"، أو "الكرة تتحول إلى مربع أثناء سقوطها".

خلال عملية التوليد، يُقال للذكاء الاصطناعي: "اجعل الفيديو يبدو مثل الأمر الإيجابي، ولكن تأكد من أنه لا يشبه الأمر السلبي بتاتاً".

فكر في الأمر كمعلم يصحح لطالب: "لا ترسم السيارة وهي تطفو! ارسمها على الطريق!". من خلال إظهار ما تبدو عليه "الفيزياء السيئة" للذكاء الاصطناعي صراحةً، يتعلم الابتعاد عن تلك الأخطاء.

4. النتيجة: فنان أصغر وأذكى

تظهر الورقة البحثية أن PhysVid هو نموذج بـ 1.7 مليار معلمة (parameter). وللسياق، فإن النموذج العملاق الذي تتم مقارنته به (Wan-14B) يمتلك 14 مليار معلمة—أي أكبر بنحو 10 مرات.

  • التشبيه: تخيل موسوعة ضخمة (النموذج الكبير) تعرف كل شيء ولكنها بطيئة وتتشتت أحياناً في التفاصيل. PhysVid يشبه محققاً صغيراً وسريع البديهة يهتم فقط بقواعد الفيزياء.
  • النتيجة: على الرغم من أن PhysVid أصغر بكثير، إلا أنه يولد فيديوهات تلتزم بقوانين الفيزياء بشكل أفضل بنسبة 33% من النماذج الضخمة. الماء يتدفق بشكل صحيح، السيارات تقود بواقعية، والأشياء لا تختفي سحرياً أو يتغير شكلها.

الملخص

PhysVid يشبه إعطاء مولد الفيديو عدسة مكبرة وكتاب قواعد. بدلاً من النظر إلى الفيلم بأكمله دفعة واحدة، فإنه يكبر المشهد لكل ثانية، ويتحقق من قواعد الفيزياء الخاصة بتلك اللحظة، ويستخدم لعبة "ماذا لو" لتجنب الأخطاء السخيفة. النتيجة هي فيديو يبدو حقيقياً لأن الذكاء الاصطناعي يفهم أخيراً أن الجاذبية تسحب الأشياء للأسفل، وليس للأعلى.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →