← नवीनतम पेपर
💻 computer science

ConfCtrl: Enabling Precise Camera Control in Video Diffusion via Confidence-Aware Interpolation

कॉन्फिडेंस-अवेयर वीडियो इंटरपोलेशन फ्रेमवर्क कॉन्फिडेंस-कंट्रोल (ConfCtrl), कॉन्फिडेंस-वेटेड पॉइंट क्लाउड प्रोजेक्शन को कलमान-प्रेरित प्रेडिक्ट-अपडेट तंत्र के साथ जोड़कर, पोज़ गाइडेंस और ज्यामितीय निरंतरता के बीच संतुलन बनाते हुए और अनदेखे क्षेत्रों का पुनर्निर्माण करते हुए, नोवेल व्यू सिंथेसिस के लिए वीडियो डिफ्यूजन में सटीक कैमरा नियंत्रण सक्षम करता है।

मूल लेखक: Liudi Yang, George Eskandar, Fengyi Shen, Mohammad Altillawi, Yang Bai, Chi Zhang, Ziyuan Liu, Abhinav Valada

प्रकाशित 2026-03-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Liudi Yang, George Eskandar, Fengyi Shen, Mohammad Altillawi, Yang Bai, Chi Zhang, Ziyuan Liu, Abhinav Valada

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक 3D मूवी सीन को फिर से बनाने की कोशिश कर रहे हैं, लेकिन आपके पास केवल दो तस्वीरें हैं: एक बहुत बाईं ओर से ली गई और दूसरी बहुत दाईं ओर से। आपका लक्ष्य उनके बीच के सभी फ्रेम्स बनाना है, जैसे कि कैमरा बाईं से दाईं ओर सुचारू रूप से घूम रहा हो, जिससे कमरे के उन हिस्सों को दिखाया जा सके जिन्हें आपने पहले कभी नहीं देखा।

यह वह चुनौती है जिसे ConfCtrl पेपर हल करता है। यहाँ बताया गया है कि उन्होंने इसे कैसे हल किया, सरल शब्दों में:

समस्या: दो बुरे विकल्प

वर्तमान में, इसे करने के दो तरीके हैं, और दोनों में खामियां हैं:

  1. "कठोर वास्तुकार" (रिग्रेशन मेथड्स - Regression Methods): ये मॉडल एक कठोर वास्तुकार की तरह होते हैं। वे आपकी दो तस्वीरों के आधार पर कमरे के सटीक 3D आकार की गणना करने की कोशिश करते हैं।
    • खामी: यदि कमरे में आपकी तस्वीरों में किसी मेज के पीछे कुर्सी छिपी हुई है, तो वास्तुकार भ्रमित हो जाता है। वे उस कुर्सी की कल्पना नहीं कर सकते, इसलिए वे वीडियो में एक धुंधला छेद या अजीब गड़बड़ी छोड़ देते हैं। वे ज्यामिति (geometry) में अच्छे हैं लेकिन रचनात्मकता में कमजोर हैं।
  2. "कल्पनाशील कलाकार" (डिफ्यूजन मॉडल्स - Diffusion Models): ये लाखों वीडियो पर प्रशिक्षित शक्तिशाली AI कलाकार हैं। वे छिपी हुई कुर्सी कैसी दिखती है, इसकी कल्पना करने में माहिर हैं।
    • खामी: वे निर्देशों का पालन करने में बहुत खराब हैं। यदि आप उनसे कहते हैं, "कैमरा ठीक 5 फीट दाईं ओर ले जाएं," तो वे अपने रास्ते से भटक सकते हैं, कैमरे को अजीब तरह से झुका सकते हैं, या भूल सकते हैं कि उन्होंने कहाँ से शुरुआत की थी। वे रचनात्मक हैं लेकिन अनियंत्रित हैं।

समाधान: ConfCtrl (द "स्मार्ट नेविगेटर")

लेखकों ने ConfCtrl बनाया है, जो दोनों दुनियाओं के सर्वश्रेष्ठ गुणों को मिलाता है। इसे एक क्रिएटिव ड्राइवर को गाइड करने वाले स्मार्ट नेविगेटर के रूप में देखें।

यह तीन सरल चरणों में कैसे काम करता है, यहाँ दिया गया है:

1. "कॉन्फिडेंस मैप" (किस पर भरोसा करना है, यह जानना)

सिस्टम पहले आपकी दो तस्वीरों से मिलने वाले 3D डेटा को देखता है। लेकिन यह जानता है कि यह डेटा "नॉइजी" (noisy) है (जैसे कि एक GPS सिग्नल जो कभी-कभी उछलता रहता है)।

  • उपमा: कल्पना कीजिए कि आप एक मानचित्र के साथ हाइकिंग कर रहे हैं जिसमें कुछ धुंधले, अस्पष्ट क्षेत्र हैं। एक सामान्य हाइकर धुंध में खो सकता है। ConfCtrl एक ऐसे हाइकर की तरह है जो कॉन्फिडेंस मैप लेकर चलता है। यह कहता है, "मैं यहाँ के ट्रेल मार्कर्स पर भरोसा करता हूँ (उच्च विश्वास), लेकिन मैं इस दलदली क्षेत्र के बारे में निश्चित नहीं हूँ (कम विश्वास)।"
  • जादू: इस अस्थिर 3D मैप का अंधाधुंध पालन करने के बजाय, AI इस कॉन्फिडेंस मैप का उपयोग यह तय करने के लिए करता है कि ज्यामिति (geometry) पर कितना भरोसा करना है। यह ठोस हिस्सों पर निर्भर रहता है और अस्थिर हिस्सों को अनदेखा कर देता है।

2. "प्रेडिक्ट-अपडेट" लूप (कलमन फ़िल्टर - The Kalman Filter)

यह ऑपरेशन का मस्तिष्क है, जो इस बात से प्रेरित है कि कैसे पनडुब्बियाँ या सेल्फ-ड्राइविंग कारें नेविगेट करती हैं।

  • अनुमान (The Prediction): AI अनुमान लगाता है कि आपके निर्देशों (जैसे, "दाईं ओर बढ़ें") के आधार पर कैमरा अगली बार कहाँ होना चाहिए।
  • अपडेट (The Update): इसके बाद यह अपने "नॉइजी" 3D मैप की जांच करता है।
    • यदि मैप अनुमान के साथ सहमत है, तो बहुत अच्छा!
    • यदि मैप अस्थिर या गलत है (जैसे कि वह दलदली क्षेत्र), तो AI कहता है, "मैं देख रहा हूँ कि मैप भ्रमित है, इसलिए मैं अपनी मूल योजना के करीब रहूँगा।"
    • यदि मैप स्पष्ट है, तो यह कहता है, "ठीक है, मैप सही है, चलिए थोड़ा एडजस्ट करते हैं।"
  • परिणाम: यह "प्रेडिक्ट-अपडेट" नृत्य सुनिश्चित करता है कि कैमरा आपके द्वारा तय किए गए पथ पर ही रहे, बिना भटके।

3. "हेड स्टार्ट" के साथ शुरुआत (Initialization)

अधिकांश AI वीडियो जनरेटर शुद्ध स्टैटिक नॉइज़ (जैसे टीवी का शोर/snow) से शुरू होते हैं और उसे वीडियो में बदलने की कोशिश करते हैं। ConfClf इससे स्मार्ट है।

  • उपमा: दौड़ की शुरुआत बिल्कुल शून्य से करने के बजाय, ConfCtrl दौड़ को पहले से ही आधा रास्ता तय करके शुरू करता है। यह "कॉन्फिडेंस मैप" को शुरुआत में ही नॉइज़ के साथ मिला देता है।
  • यह क्यों मदद करता है: यह AI को तुरंत कमरे के आकार के बारे में एक मजबूत संकेत देता है, ताकि उसे अनुमान लगाने में बहुत अधिक मेहनत न करनी पड़े। यह एक कलाकार को मास्टरपीस बनाने के लिए कहने से पहले एक रफ स्केच देने जैसा है।

परिणाम

इस "स्मार्ट नेविगेटर" दृष्टिकोण का उपयोग करके, ConfCtrl यह कर सकता है:

  • निर्देशों का पूरी तरह से पालन करना: कैमरा ठीक वहीं चलता है जहाँ आप उसे बताते हैं, बिना भटके।
  • खाली जगहों को भरना: यह दृश्य के उन हिस्सों को "हैलुसिनेट" (कल्पना) कर सकता है जो आपने मूल तस्वीरों में नहीं देखे थे, जैसे कि कुर्सी का पिछला हिस्सा, उच्च गुणवत्ता के साथ।
  • कहीं भी काम करना: क्योंकि इसने एक विशाल वीडियो मॉडल से सीखा है, यह बिना दोबारा प्रशिक्षित हुए नए, अनदेखे वातावरण को संभाल सकता है।

संक्षेप में: ConfClff एक ऐसे GPS की तरह है जो जानता है कि कब सिग्नल खराब होता है और वह ग्लिच (glitches) को अनदेखा कर देता है, जिससे यह सुनिश्चित होता है कि आपकी रचनात्मक वीडियो यात्रा आपके द्वारा तय किए गए सटीक पथ पर बनी रहे, भले ही दृश्य जटिल हो जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →