← أحدث الأبحاث
💻 computer science

PhysVideo: Physically Plausible Video Generation with Cross-View Geometry Guidance

يقدم PhysVideo إطار عمل ثنائي المراحل يستفيد من مجموعة بيانات متعددة المشاهد تم إنشاؤها حديثًا (PhysMV) وتوجيه هندسي عبر المشاهد لتوليد فيديوهات معقولة فيزيائيًا ومتماسكة مكانيًا، وذلك عن طريق تخليق مقدمات صور متعامدة مدركة للفيزياء أولاً ثم دمجها مع سياقات الخلفية.

المؤلفون الأصليون: Cong Wang, Hanxin Zhu, Xiao Tang, Jiayi Luo, Xin Jin, Long Chen, Fei-Yue Wang, Zhibo Chen

نُشر 2026-03-20
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Cong Wang, Hanxin Zhu, Xiao Tang, Jiayi Luo, Xin Jin, Long Chen, Fei-Yue Wang, Zhibo Chen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم كمبيوتر كيف يصنع فيلماً. تعطي له صورة لخنزير لعبة وتقول له: "اجعله يسقط ويرتد".

معظم مولدات الفيديو بالذكاء الاصطناعي الحالية تشبه الرسامين الموهوبين ولكن المتعثرين. إنهم بارعون في نسخ "مظهر" الأشياء (الألوان، الملامس)، لكنهم لا يفهمون حقاً "كيفية" حركة الأشياء في العالم الحقيقي. إذا طلبت منهم جعل صخرة ثقيلة تسقط، فقد تجعلها تطفو مثل الريشة. وإذا طلبت منهم جعل كرة مطاطية ترتد، فقد يحولونها إلى زجاج يتشظى. إنهم يخمنون الحركة بناءً على الأنماط التي رأوها، وليس بناءً على قوانين الفيزياء.

PhysVideo هو نهج جديد يعمل مثل مخرج ذكي يستأجر خبيراً في الفيزياء. فبدلاً من مجرد التخمين، يقوم بتقسيم عملية صناعة الفيلم إلى خطوتين متميزتين لضمان أن يبدو كل شيء "واقعياً".

إليك كيف يعمل الأمر، باستخدام تشبيه بسيط:

المشكلة: الوهم "المسطح"

الحياة الواقعية تحدث في أبعاد ثلاثية (3D). عندما ترتد كرة، فإنها تتحرك بطريقة محددة تبدو متسقة سواء كنت تشاهدها من الأمام، أو الجانب، أو الخلف.
تحاول نماذج الذاء الاصطناعي الحالية عادةً توليد الفيديو من زاوية واحدة فقط (مثل النظر عبر عدسة كاميرا). ولأنها لا "ترى" الشكل ثلاثي الأبعاد، فإنها غالباً ما تخطئ في الفيزياء. قد يتشوه شكل الكرة، أو تبدو الارتدادات غريبة عندما تتغير زاوية الكنت الكاميرا.

الحل: مصنع "المرحلتين"

يحل PhysVideo هذه المشكلة عن طريق بناء الفيديو في مرحلتين، مثل استوديو رسوم متحركة متخصص.

المرحلة الأولى: "مختبر الفيزياء" (Phys4View)

قبل صنع الفيلم النهائي، يدخل الذكاء الاصطناعي إلى "مختبر الفيزياء".

  • الإعداد: تعطيه صورة الشيء، ووصفاً نصياً، و"قواعد فيزيائية" محددة (على سبيل المثال: "هذه كرة معدنية ثقيلة"، أو "هذا بطة مطاطية ناعمة").
  • الخدعة السحرية: بدلاً من صنع فيديو واحد فقط، تقوم هذه المرحلة بتوليد أربعة فيديوهات في نفس الوقت، تعرض الشيء من أربع زوايا مختلفة (الأمام، الخلف، اليسار، اليمين) بشكل متزامن.
  • "غراء" الرؤية المتقاطعة: تخيل أربعة أصدقاء يقفون في دائرة، وكل منهم يرسم نفس الكرة الساقطة. إذا رسم أحدهم الكرة وهي تتحرك لليسار، يجب على الآخرين أيضاً رسمها وهي تتحرك لليسار. يستخدم PhysVideo "غراءً" خاصاً (يسمى التوجيه الهندسي للرؤية المتقاطعة - Cross-View Geometry Guidance) لضمان بقاء الرسوم الأربعة متزامنة تماماً. إذا ارتدت الكرة في المنظر الأمامي، فسترتد أيضاً في المنظر الجانبي.
  • النتيجة: لديك الآن مجموعة من "الفيديوهات المتعامدة" (أربعة مناظر) حيث يتحرك الشيء بدقة وفقاً لقوانين الفيزياء (الجاذبية، المرونة، الكثافة).

المرحلة الثانية: "استوديو الأفلام" (VideoSyn)

الآن، بعد أن قام خبير الفيزياء بإنشاء الحركة المثالية والمتزامنة للشيء، تتولى المرحلة الثانية زمام الأمور.

  • المهمة: هذه المرحلة هي "الفنان". مهمتها هي أخذ الشيء المتحرك من المرحلة الأولى ورسم خلفية جميلة حوله (مثل غرفة، أو شارع، أو حديقة).
  • التوجيه: هي لا تخمن كيفية حركة الشيء. بل تستخدم فيديوهات "مختبر الفيزياء" كدليل صارم. هي تعرف بالضبط أين يوجد الشيء وكيف يتحرك، لذا يمكنها رسم الخلفية لتتفاعل معه بواقعية (على سبيل المثال، سقوط ظل الشيء، أو ارتداده عن الأرض).
  • النتيجة: فيديو كامل عالي الجودة حيث يتحرك الشيء بواقعية فيزيائية مثالية، وتبدو الخلفية طبيعية.

لماذا يعد هذا أمراً كبيراً؟

فكر في الأمر كفرق بين رسم كرتون وبين تصوير مشهد حقيقي.

  • الذكاء الاصطناعي القديم: يشبه رسم الكرتون. يبدو جيداً، ولكن إذا نظرت عن كثب، ستجد أن الفيزياء "كرتونية" (الأشياء تطفو، أو ترتد بشكل غريب، أو يتغير شكلها).
  • PhysVideo: يشبه تصوير مشهد حقيقي مع جسم حقيقي. ولأن النموذج ولد الحركة من أربع زوايا في وقت واحد باستخدام قواعد الفيزياء، فإن الحركة تكون متسقة بغض النظر عن كيفية النظر إليها.

"صالة التدريب" (PhysMV Dataset)

لتعليم الذكاء الاصطناعي القيام بذلك، بنى الباحثون "صالة رياضية" ضخمة تسمى PhysMV.

  • استخدموا محرك فيزياء (مثل محاكي ألعاب الفيديو) لإنشاء 40,000 مشهد مختلف.
  • لكل مشهد، سجلوا سقوط أو ارتداد أو تدحرج الجسم من أربع زوايا مختلفة في نفس الوقت.
  • منح هذا الذكاء الاصطناعي 160,000 مقطع فيديو لدراستها، مما علمه بالضبط كيف تتحرك كرة معدنية ثقيلة بشكل مختلف عن بطة مطاطية ناعمة، وكيف تبدو تلك الحركات من كل زاوية.

الملخص

PhysVideo يشبه إعطاء الذكاء الاصطناعي كتاباً مدرسياً في الفيزياء ومنصة كاميرات متعددة.

  1. يقوم أولاً بمحاكاة حركة الشيء من أربع زوايا لضمان أن تكون الفيزياء صحيحة بنسبة 100%.
  2. ثم يستخدم تلك الحركة المثالية لتوليد فيديو جميل وواقعي مع خلفية.

النتيجة؟ فيديوهات لا تبدو فيها الأشياء حقيقية فحسب؛ بل تتصرف كأنها حقيقية. إنها ترتد، وتسقط، وتتصادم تماماً كما تفعل في عالمنا الفيزيائي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →