← أحدث الأبحاث
💻 computer science

4Director: Controlling Video World Models with Rigid 3D Geometry

تقدم الورقة البحثية 4Director، وهو نموذج عالم فيديو يحقق تحكماً دقيقاً في الكاميرا والأجسام من خلال تكييف التوليد بناءً على هندسة صلبة رباعية الأبعاد (4D) ومحول حركة (Motion Adapter)، وقد تم التحقق من ذلك من خلال مجموعة بيانات ومقياس تقييم جديدين للتفوق على الأساليب الحالية في الجودة البصرية واتساق الحركة.

المؤلفون الأصليون: Wei Cao, Hao Zhang, Vikram Voleti, Yuqun Wu, Mallikarjun B R, Shimon Vainer, Mark Boss, Yaoyao Liu

نُشر 2026-10-02
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Wei Cao, Hao Zhang, Vikram Voleti, Yuqun Wu, Mallikarjun B R, Shimon Vainer, Mark Boss, Yaoyao Liu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل عالماً يمكن فيه للحاسوب أن يشاهد صورة فوتوغرافية واحدة، ثم يتخيل فيلماً ينساب من تلك اللحظة الساكنة. هذا هو الوعد الذي تقدمه نماذج عالم الفيديو (video world models)، وهو مجال متقدم بسرعة في الذكاء الاصطناعي حيث تتعلم الآلات التنبؤ بكيفية تغير المشهد بمرور الوقت. لسنوات، علم الباحثون هذه الأنظمة توليد صور متحركة عبر عرض آلاف الساعات من الفيديو عليها، آملين أن يتعلم الحاسوب قواعد الفيزياء والحركة من تلقاء نفسه. ومع ذلك، ظل هناك عائق كبير: فبينما أصبحت هذه الحواسيب أفضل في إنشاء حركة واقعية، إلا أنه من الصعب للغاية توجيهها. إذا أراد المستخدم أن يستدير جسم ما أو أن يلتف الكاميرا حول زاوية، فإن الحاسوب غالباً ما يتجاهل التعليمات أو ينتج نتيجة تبدو منطقية ولكنها خاطئة هندسياً؛ فقد يتقلص الجسم بدلاً من أن يبتعد، أو قد يتحول إلى بقعة ضبابية شبحية مع تحرك الكامل. كان التحدي الجوهري يكمن في سد الفجوة بين نية الإنسان الواضحة ثلاثية الأبعاد، وميل الحاسوب للتخمين بناءً على أنماط ثنائية الأبعاد مسطحة.

قدم فريق من الباحثين من "Stability AI" وجامعة إلينوي في أوربانا تشامبين نهجاً جديداً يسمى "4Director" لحل هذه المشكلة. فبدلاً من مطالبة الحاسوب بتخمين مسار الجسم، يمنح "4Director" الحاسوب خريطة كاملة ثلاثية الأبعاد للمشهد قبل بدء عملية توليد الفيديو حتى. في هذا النظام، يتم إعادة بناء كل جسم في الصورة الفوتوغرافية الأصلية كنموذج رقمي صلب ثلاثي الأبعاد، تماماً مثل نحات يصنع تمثالاً من الطين له مقدمة وخلفية وجوانب، حتى لو كانت الصورة الأصلية تظهر المقدمة فقط. كما يتم رفع الخلفية أيضاً إلى سحابة من النقاط في الفضاء. وبمجرد بناء هذا العالم الرقمي، يمكن للمستخدم رسم مسار للكاميرا ومسار للجسم، تماماً كما يخطط مخرج الفيلم للقطة. يقوم الحاسوب بعد ذلك بتحريك هذه النماذج ثلاثية الأبعاد الصلبة على طول المسارات المحددة بصلابة تامة، مما يضمن أنه إذا استدار جسم ما، فإنه يدور كوحدة واحدة متكاملة، وإذا تحركت الكاميرا، تتغير الخلفية بشكل صحيح.

يكمن الابتكار في كيفية استخدام هذا الهيكل الصلب لتوجيه الفيديو النهائي. يقوم النظام أولاً برسم خريطة عمق بسيطة باللونين الأبيض والأسود للمشهد، تظهر فقط مسافة كل سطح عن الكاميرا أثناء تحرك الأجسام على طول مساراتها. تعمل خريطة العمق هذه كدعامة صارمة، تحدد بالضبط مكان كل بكسل من حيث المكان والزمان. ثم يأخذ وحدة تدريب متخصصة، أطلق عليها الباحثون اسم "Motion Adapter" (مهايئ الحركة)، هذا الهيكل الصلب ويملأ التفاصيل المفقودة. فهو يتعلم رسم الأنسجة السطحية، والإضاءة، والحركات الدقيقة غير الصلبة — مثل تأرجح ذراع شخص أو رفرفة علم — فوق تلك البنية ثلاثية الأبعاد الثابتة. وهذا يضمن أن يتبع الفيديو النهائي تعليمات المستخدم بدقة فيما يتعلق بالوضعية والاتجاه، مع بقائه في الوقت ذات نفسه مشهداً طبيعياً وحياً.

لتعليم هذا النظام كيفية العمل، اضطر الباحثون إلى إنشاء مجموعة بيانات ضخمة جديدة لأن أي مجموعة فيديوهات موجودة لا تأتي مع الخرائط ثلاثية الأبعاد اللازمة. لقد بنوا مساراً مؤتمتاً أخذ أكثر من 20,000 مقطع فيديو وقام بهندستها عكسياً، محولاً كل منها إلى مشهد ثلاثي الأبعاد صلب مع مسار للكاميرا ومسارات للأجسام. هذه المجموعة من البيانات، التي سميت "RealCOD-Rigid"، سمحت لـ "Motion Adapter" بتعلم الفرق بين الحركة الصلبة لجسم صلب والحركة المرنة لتفاصيل العالم الحقيقي. وتظهر النتائج تحسناً ملحوظاً مقارنة بالطرق السابقة؛ ففي الاختبارات، تمكن "4Director" من الحفاظ على اتساق الأجسام وإمكانية التعرف عليها حتى عندما استدارت بالكامل أو خرجت من مجال رؤية الكاميرا ثم عادت، وهي مهمة فشلت فيها الأنظمة الأخرى عبر فقدان هوية الجسم أو دمجه في الخلفية.

كما طور الباحثون طريقة جديدة لقياس النجاح، مدركين أن مجرد التحقق مما إذا كان الجسم في مكانه الصحيح ليس كافياً إذا تغير الجسم نفسه إلى شيء آخر. يقيس مقياسهم الجديد كلاً من الموقع وهُوية الجسم، لضمان أن السيارة التي تنعطف عند زاوية لا تزال تبدو وكأنها نفس السيارة. وعند مقارنته بأدوات توليد الفيديو الرائدة الأخرى، أنتج "4Director" باستمرار فيديوهات ذات جودة بصرية أعلى وتحكماً أدق بكثير في كل من الكاميرا والأجسام داخل المشهد. يثبت النظام أنه من خلال منح الحاسوب فهماً واضحاً ثلاثي الأبعاد للعالم قبل أن يبدأ في توليد الفيديو، يمكن تحقيق مستوى من التحكم كان بعيد المنال سابقاً، مما يسمح للمستخدمين بتوجيه تدفق المشهد بدقة مخرج سينمائي محترف.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →