← أحدث الأبحاث
💻 computer science

Efficient Camera-Controlled Video Generation of Static Scenes via Sparse Diffusion and 3D Rendering

تقدم هذه الورقة البحثية SRENDER، وهي طريقة فعالة لتوليد الفيديو المتحكم به عبر الكاميرا للمشاهد الثابتة تحقق تسريعًا يتجاوز 40 ضعفًا من خلال توليد إطارات مفتاحية متفرقة عبر الانتشار وتخليق الفيديو الكامل عبر إعادة البناء ثلاثي الأبعاد، مع تحسين عدد الإطارات المفتاحية بشكل تكيفي بناءً على تعقيد مسار الكاميرا.

المؤلفون الأصليون: Jieying Chen, Jeffrey Hu, Joan Lasenby, Ayush Tewari

نُشر 2026-01-15
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jieying Chen, Jeffrey Hu, Joan Lasenby, Ayush Tewari

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تريد إنشاء فيلم حيث تطير الكاميرا بسلاسة عبر غرفة ثابتة (مثل غرفة معيشة أو مشهد شارع).

الطريقة القديمة (طريقة "القوة الغاشمة"):
مولدات الفيديو الحالية بالذكاء الاصطناعي تشبه فريقاً من الفنانين الموهوبين للغاية ولكنهم بطيئون جداً. لإنتاج فيديو مدته 20 ثانية، يحاولون رسم كل إطار على حد الله، واحداً تلو الآخر. وعلى الرغم من أن الغرفة لا تتغير، إلا أنهم يعيدون رسم الجدران والأثاث والأرضية لكل صورة. يستغرق هذا وقتاً هائلاً وقوة حوسبة ضخمة — وغالباً ما يستغرق دقائق من الحوسبة الثقيلة لإنتاج بضع ثوانٍ فقط. الأمر يشبه استئجار رسام لإعادة طلاء المنزل بأكره في كل مرة تخطو فيها خطوة واحدة للداخل.

الطريقة الجديدة (SRENDER):
ابتكر الباحثون في جامعة كامبريدج (جي يينغ تشن، جيفري هو، جوان لاسيني، وأيوش تيواري) استراتيجية أذكى تسمى SRENDER. بدلاً من رسم كل إطار، يستخدمون نهجاً "متفرقاً" (Sparse). فكر في الأمر كالتالي:

  1. مرحلة الرسم التخطيطي (الإطارات الرئيسية): يقوم الذكاء الاصطناعي برسم عدد قليل فقط من الصور "المفتاحية" (keyframes) على طول المسار الذي ستسلكه الكاميرا. إذا تحركت الكاميرا ببطء، فإنه يرسم صوراً قليلة جداً. وإذا دارت الكيرا بجنون، فإنه يرسم عدداً أكبر قليلاً. الأمر يشبه رساماً يرسم تخطيطات للغرفة من عدة زوايا مختلفة لضبط الأبعاد.
  2. مرحلة النموذج ثلاثي الأبعاد: بمجرد الانتهاء من تلك الرسومات القليلة، يستخدم النظام هذه الرسومات لبناء نموذج رقمي ثلاثي الأبعاد سريع للغرفة. إنه يشبه أخذ تلك الرسومات ثنائية الأبعاد ودمجها فوراً لتصبح نموذج واقع افتراضي.
  3. مرحلة الطيران عبر المشهد: الآن، بدلاً من مطالبة الفنان البطيء برسم صور جديدة، يقوم الكمبيوتر ببساطة بـ "تحليق" كاميرا افتراضية عبر هذا النموذج ثلاثي الأبعاد. ولأن النموذج موجود بالفعل، يمكن للكمبيوتر توليد الإطارات المفقودة بين الرسومات التخطيطية بشكل فوري تقريباً.

ميزة "الميزانية الذكية":
النظام ذكي أيضاً بشأن مقدار العمل الذي يقوم به. لديه "متنبئ" ينظر إلى مسار الكاميرا قبل البدء.

  • إذا كانت الكاميرا تنزلق بسلاسة في ممر، يقول النظام: "سهل، أحتاج فقط إلى 4 رسومات تخطيطية".
  • إذا كانت الكاميرا تقوم بدوران معقد حول زاوية، يقول: "حسناً، أحتاج إلى 30 رسماً تخطيطياً للتأكد من أن المظهر صحيح".
    هذا يضمن عدم إضاعة الوقت في رسم الكثير من الصور عندما لا يكون ذلك ضرورياً.

النتائج:

  • السرعة: هذه الطريقة أسرع بـ 43 مرة من أفضل الطرق السابقة. الفيديو الذي كان يستغرق دقائق لإنتاجه، يستغرق الآن حوالي 16 ثانية فقط. إنها سريعة بما يكفي لتكون "في الوقت الفعلي" (يمكنك توليد الفيديو بالسرعة التي تشاهده بها).
  • الجودة: على الرغم من أنه يتخطى رسم معظم الإطارات، إلا أن الفيديو يبدو بجودة مماثلة، إن لم يكن أفضل، من الطرق البطيئة. فهو يتجنب العيوب "المضطربة" أو "المتذبذبة" التي تحدث غالباً عندما يحاول الذكاء الاصطناعي تخمين كل إطار بمفرده.
  • الاتساق: نظرًا لأنه يبني نموذجاً ثلاثي الأبعاد أولاً، تظل الغرفة مستقرة. الجدران لا تتغير أو يتغير شكلها أثناء تحرك الكاميرا، وهو أمر شائع في أدوات الفيديو الأخرى بالذكاء الاصطناعي.

باختختصار:
بدلاً من محاولة رسم كل إطار من فيلم، يقوم SRENDER برسم بضعة إطارات رئيسية، ويبني عالماً ثلاثي الأبعاد منها، ثم يقوم ببساطة بتصوير حركة الكاميرا داخل هذا العالم. إنه الفرق بين رسم جدارية يدوياً لكل ثانية من الفيلم، وبين بناء ديكور وتصوير كاميرا تتحرك من خلاله.

ملاحظة: تركز الورقة البحثية تحديداً على المشاهد الثابتة (الغرف، المباني، المناظر الطبيعية التي لا تتحرك). وهي لا تدعي القدرة على التعامل مع الشخصيات المعقدة المتحركة أو مشاهد الحركة الديناميكية بعد، رغم أن المؤلفين يشيرون إلى أن هذا الأساس يمكن أن يساعد في ذلك مستقبلاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →