← नवीनतम पेपर
💻 computer science

Efficient Camera-Controlled Video Generation of Static Scenes via Sparse Diffusion and 3D Rendering

यह शोध पत्र SRENDER प्रस्तुत करता है, जो स्थिर दृश्यों के कैमरा-नियंत्रित वीडियो जनरेशन के लिए एक कुशल विधि है, जो डिफ्यूजन के माध्यम से विरल कीफ्रेम्स (sparse keyframes) उत्पन्न करके और 3D पुनर्निर्माण के माध्यम से पूर्ण वीडियो को संश्लेषित करके 40x से अधिक की गति वृद्धि प्राप्त करता है, जबकि कैमरा प्रक्षेपवक्र (camera trajectory) की जटिलता के आधार पर कीफ्रेम्स की संख्या को अनुकूल रूप से अनुकूलित करता है।

मूल लेखक: Jieying Chen, Jeffrey Hu, Joan Lasenby, Ayush Tewari

प्रकाशित 2026-01-15
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Jieying Chen, Jeffrey Hu, Joan Lasenby, Ayush Tewari

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक ऐसी फिल्म बनाना चाहते हैं जहाँ कैमरा एक स्थिर कमरे (जैसे कि लिविंग रूम या सड़क का दृश्य) के माध्यम से सुचारू रूप से उड़ता है।

पुराना तरीका ("ब्रूट फोर्स" विधि):
वर्तमान AI वीडियो जनरेटर बहुत प्रतिभाशाली लेकिन बहुत धीमे कलाकारों की एक टीम की तरह हैं। 20 सेकंड का वीडियो बनाने के लिए, वे हर एक फ्रेम को शुरू से, एक-एक करके बनाने की कोशिश करते हैं। भले ही कमरा नहीं बदल रहा हो, वे हर एक तस्वीर के लिए दीवारों, फर्नीचर और फर्श को फिर से पेंट करते हैं। इसमें बहुत अधिक समय और कंप्यूटर पावर लगता है—अक्सर कुछ सेकंड बनाने के लिए भी भारी कंप्यूटिंग के कई मिनट लग जाते हैं। यह घर के अंदर एक कदम भी रखने पर पूरे घर को फिर से पेंट करने के लिए एक पेंटर को काम पर रखने जैसा है।

नया तरीका (SRENDER):
कैम्ब्रिज यूनिवर्सिटी के शोधकर्ताओं (जीयिंग चेन, जेफरी हू, जोआन लासेनबी, और आयुष तेवारी) ने SRENDER नामक एक स्मार्ट रणनीति विकसित की है। हर फ्रेम को पेंट करने के बजाय, वे एक "स्पार्स" (sparse) दृष्टिकोण का उपयोग करते हैं। इसे इस प्रकार समझें:

  1. स्केच चरण (कीफ्रेम्स): AI केवल कुछ "मुख्य" तस्वीरें (कीफ्रेम्स) पेंट करता है जो उस पथ पर होती हैं जिस पर कैमरा चलेगा। यदि कैमरा धीरे चलता है, तो यह बहुत कम तस्वीरें पेंट करता है। यदि कैमरा तेजी से घूमता है, तो यह कुछ अधिक तस्वीरें पेंट करता है। यह एक कलाकार द्वारा लेआउट को सही ढंग से समझने के लिए कुछ अलग कोणों से कमरे का स्केच बनाने जैसा है।
  2. 3D मॉडल चरण: एक बार जब वे कुछ स्केच बन जाते हैं, तो सिस्टम उनका उपयोग करके कमरे का एक त्वरित, डिजिटल 3D मॉडल बनाता है। यह उन 2D स्केच को तुरंत एक वर्चुअल रियलिटी मॉडल में जोड़ने जैसा है।
  3. फ्लाई-थ्रू चरण: अब, धीमे कलाकार से नए चित्र बनाने के लिए कहने के बजाय, कंप्यूटर बस उस 3D मॉडल के माध्यम से एक वर्चुअल कैमरा को "उड़ाता" है। क्योंकि मॉडल पहले से मौजूद है, कंप्यूटर स्केच के बीच के छूटे हुए फ्रेमों को लगभग तुरंत बना सकता है।

"स्मार्ट बजट" फीचर:
यह सिस्टम इस बारे में भी स्मार्ट है कि वह कितना काम करता है। इसमें एक "प्रेडिक्टर" (predictor) है जो काम शुरू करने से पहले कैमरा पथ को देखता है।

  • यदि कैमरा बस एक गलियारे में सुचारू रूप से फिसलता है, तो सिस्टम कहता है, "आसान है, मुझे केवल 4 स्केच की आवश्यकता है।"
  • यदि कैमरा किसी कोने के चारों ओर जटिल स्पिन कर रहा है, तो यह कहता है, "ठीक है, मुझे यह सुनिश्चित करने के लिए कि यह सही दिखे, 30 स्केच की आवश्यकता है।"
    यह सुनिश्चित करता है कि जब इसकी आवश्यकता न हो, तो बहुत अधिक तस्वीरें पेंट करने में समय बर्बाद न हो।

परिणाम:

  • गति: यह विधि पिछले सर्वोत्तम तरीकों की तुलना में 43 गुना तेज़ है। एक वीडियो जिसे बनाने में मिनटों का समय लगता था, अब लगभग 16 सेकंड में बन जाता है। यह इतना तेज़ है कि इसे "रियल-टाइम" (आप इसे उतनी ही तेज़ी से जनरेट कर सकते हैं जितनी तेज़ी से आप इसे देख सकते हैं) बनाया जा सकता है।
  • गुणवत्ता: भले ही यह अधिकांश फ्रेमों को पेंट करना छोड़ देता है, फिर भी वीडियो उतना ही अच्छा, या उससे भी बेहतर दिखता है जितना कि धीमी विधियाँ। यह उन "ग्लिच" (glitchy) या "लड़खड़ाते" (wobbly) आर्टिफैक्ट्स से बचता है जो अक्सर तब होते हैं जब AI हर फ्रेम का अनुमान लगाने की कोशिश करता है।
  • निरंतरता (Consistency): क्योंकि यह पहले एक 3D मॉडल बनाता है, इसलिए कमरा स्थिर रहता है। जैसे-जैसे कैमरा चलता है, दीवारें अपना आकार नहीं बदलतीं या बदलती नहीं हैं, जो अन्य AI वीडियो टूल्स के साथ एक आम समस्या है।

संक्षेप में:
फिल्म के हर सेकंड के लिए एक म्यूरल (भित्ति चित्र) हाथ से पेंट करने के बजाय, SRENDER कुछ मुख्य फ्रेम बनाता है, उनसे एक 3D दुनिया बनाता है, और फिर बस उस दुनिया के माध्यम से कैमरे को चलते हुए फिल्माता है। यह एक सेट बनाने और फिर उसमें कैमरे को चलते हुए फिल्माने बनाम हर सेकंड के लिए एक म्यूरल को हाथ से पेंट करने के बीच का अंतर है।

नोट: यह पेपर विशेष रूप से स्थिर दृश्यों (कमरे, इमारतों, परिदृश्यों जो चलते नहीं हैं) पर केंद्रित है। यह दावा नहीं करता है कि यह जटिल चलते हुए पात्रों या गतिशील एक्शन दृश्यों को संभाल सकता है, हालांकि लेखकों का सुझाव है कि यह आधार भविष्य में उनके लिए मददगार हो सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →