← नवीनतम पेपर
💻 computer science

LooseControlVideo: Directorial Video Control using Spatial Blocking

LooseControlVideo एक नवीन फ्रेमवर्क है जो टेक्स्ट-टू-वीडियो जनरेशन में सहज और सटीक 3D स्थानिक नियंत्रण सक्षम करने के लिए विरल (sparse), उन्मुख (oriented) 3D बॉक्सों को एक "ब्लॉकिंग" प्रॉक्सी के रूप में उपयोग करता है, जो मौजूदा 2D-आधारित विधियों की तुलना में प्रक्षेपवक्र सटीकता (trajectory accuracy), गति निरंतरता और ऑक्लूजन हैंडलिंग में महत्वपूर्ण सुधार करता है।

मूल लेखक: Shariq Farooq Bhat, Niloy J. Mitra, Kalyan Sunkavalli

प्रकाशित 2026-06-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shariq Farooq Bhat, Niloy J. Mitra, Kalyan Sunkavalli

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल दृश्य फिल्माने की कोशिश कर रहे एक फिल्म निर्देशक हैं: जैसे एक बाज का नीचे झपट्टा मारकर खरगोश को पकड़ना, या एक घोड़े का बाड़ के ऊपर से कूदना। वास्तविक दुनिया में, आप अपने अभिनेताओं को हर पंख की फड़फड़ाहट का सटीक कोण या हर मांसपेशी के संकुचन के सटीक भौतिकी (physics) की गणना करने के लिए नहीं कहेंगे। इसके बजाय, आप "ब्लॉकिंग" (blocking) का उपयोग करेंगे। आप अभिनेताओं को कहेंगे, "यहाँ खड़े हो जाओ, वहाँ चलो, इस क्षण पर कूदो," यानी मंच तैयार करने के लिए सरल, मोटे तौर पर हलचल का उपयोग करना। अभिनेता (और कैमरा क्रू) फिर वास्तविक विवरण भरते हैं: पंखों का फड़फड़ाना, फर में हवा का अहसास, और छाया।

LooseControlVideo (LCV) एक नया AI टूल है जो कंप्यूटर-जनरेटेड वीडियो के लिए इस "निर्देशक की ब्लॉकिंग" की अवधारणा को लाता है। यह उपयोगकर्ताओं को सरल 3D बॉक्सों का उपयोग करके जटिल, मल्टी-ऑब्जेक्ट वीडियो को कोरियोग्राफ करने की अनुमति देता है, जबकि AI सभी चीजों को वास्तविक दिखने लायक बनाने का कठिन काम संभालता है।

यह कैसे काम करता है, इसका विवरण यहाँ दिया गया है, जिसमें रोजमर्रा के उदाहरणों का उपयोग किया गया है:

1. समस्या: "बहुत अधिक, बहुत कठिन" की दुविधा

वर्तमान AI वीडियो जनरेटर चीजें वास्तविक दिखाने में बहुत अच्छे हैं, लेकिन वे इस बारे में विशिष्ट निर्देशों का पालन करने में बहुत खराब हैं कि चीजें कहाँ चलती हैं।

  • टेक्स्ट (Text) बहुत अस्पष्ट है: यदि आप टाइप करते हैं "एक बाज खरगोश को पकड़ता है," तो AI बाज को गलत दिशा में उड़ा सकता है या वह खरगोश को पूरी तरह से मिस कर सकता है।
  • विस्तृत मानचित्र (Maps) बहुत कठिन हैं: यदि आप हर एक फ्रेम के लिए एक सटीक 3D मैप बनाने की कोशिश करते हैं (जैसे कि डेप्थ मैप), तो यह निर्देशक को फिल्म शुरू होने से पहले बाज के पंख का हर एक पंख बनाने के लिए कहने जैसा है। यह बहुत अधिक काम है और जटिल दृश्यों के लिए असंभव है।

2. समाधान: "3D प्रॉक्सी" (एक कच्चा मसौदा)

LCV इसे स्पार्स, ओरिएंटेड 3D बॉक्स (sparse, oriented 3D boxes) का उपयोग करके हल करता है।

  • उपमा: इन बॉक्सों को "स्टैंड-इन" या रिहर्सल में "डमी एक्टर्स" के रूप में सोचें। आपको उन्हें सजाने या उन्हें चेहरे देने की आवश्यकता नहीं है। आपको बस उन्हें यह बताना है: "यह बॉक्स (बाज) यहाँ से शुरू होता है, इस तरह घूमता है, और उस स्थान पर जाता है।"
  • जादू: आप उच्च-स्तरीय कोरियोग्राफी (पथ, समय, सामान्य आकार) प्रदान करते हैं, और AI निम्न-स्तरीय विवरण (पंख, मांसपेशियों का खिंचाव, वास्तविक छाया) भर देता है।

3. सीक्रेट सॉस: DNOCS (एक "रंग-कोडित मानचित्र")

सबसे बड़ी चुनौती यह है कि एक साधारण 3D बॉक्स AI को यह नहीं बताता कि वस्तु कितनी गहरी है या कैमरे के सापेक्ष उसका घुमाव (rotation) क्या है। इसे ठीक करने के लिए, शोधकर्ताओं ने इन बॉक्सों को रंगने का एक विशेष तरीका बनाया जिसे DNOCS कहा जाता है।

  • यह कैसे काम करता है: कल्पना करें कि आप 3D बॉक्सों को एक विशेष रंग कोड के साथ पेंट कर रहे हैं।
    • ह्यू (Hue - रंग): AI को बताता है कि वस्तु किस दिशा में देख रही है (एक दिशा सूचक यंत्र की तरह)।
      से ब्राइटनेस (Brightness - चमक): AI को बताता है कि वस्तु कितनी दूर है (चमकदार = करीब, गहरा = दूर)।
  • परिणाम: AI एक रंगीन, चमकता हुआ मानचित्र देखता है जो तुरंत 3D लेआउट, गहराई और ओरिएंटेशन को समझ जाता है बिना किसी अनुमान के। यह AI को एक "चीट शीट" देने जैसा है जो आपके कच्चे 3D बॉक्सों को उस भाषा में अनुवादित करती है जिसे वीडियो जनरेटर पूरी तरह से समझ सके।

4. यह क्या कर सकता है?

पेपर यह प्रदर्शित करता है कि यह विधि दो मुख्य कार्यों के लिए शक्तिशाली है:

  • नए वीडियो बनाना: आप ट्रैफिक के बीच से गुजरती हुई कार या कूदते हुए कुत्ते का एक मोटा पथ (path) बना सकते हैं, और AI एक फोटो-रियलिस्टिक वीडियो बनाता है जहाँ कार वास्तविक तरीके से ड्रिफ्ट करती है और कुत्ते के फर स्वाभाविक रूप से हिलते हैं।
  • मौजूदा वीडियो को एडिट करना: आप एक मौजूदा वीडियो (जैसे घोड़ा कूद रहा है) ले सकते हैं और इन 3D बॉक्सों का उपयोग करके घोड़े के पथ को बदल सकते हैं। यदि आप घोड़े को ऊँचा कूदने के लिए बॉक्स को हिलाते हैं, तो AI घोड़े के शरीर, छाया और बैकग्राउंड को एडजस्ट करता है ताकि नया जंप असली लगे।

5. परिणाम: प्रतियोगिता से बेहतर

शोधकर्ताओं ने अन्य विधियों के विरुद्ध परीक्षण किया जो 2D ड्राइंग या फ्लो मैप का उपयोग करती हैं।

  • उपमा: कल्पना करें कि आप एक शहर में नेविगेट करने की कोशिश कर रहे हैं। अन्य विधियाँ आपको एक सपाट 2D पेपर मैप देती हैं (जो भ्रमित करने वाला है जब आपको यह जानना हो कि कौन सी इमारत किसके सामने है)। LCV स्पष्ट डेप्थ मार्कर्स के साथ एक 3D मॉडल देता है।
  • परिणाम: LCV निम्नलिखित में काफी बेहतर था:
    • ट्रैजेक्टरी (Trajectory): वस्तुएं आपके द्वारा बनाए गए पथ पर बनी रहीं (1.2 से 3 गुना अधिक सटीक)।
    • ऑक्लूजन (Occlusion): वस्तुओं ने एक-दूसरे को सही ढंग से ब्लॉक किया (उदाहरण के लिए, एक पेड़ ने कार को पीछे से सही ढंग से छिपाया) जो पहले की तुलना में 1.5 से 2 गुना बेहतर था।
    • मोशन (Motion): गति अधिक स्थिर और सुसंगत महसूस हुई, जैसे वास्तविक भौतिकी (physics), न कि "डगमगाती" हुई।

सारांश

LooseControlVideo एक निर्देशक को एक दृश्य व्यवस्थित करने के लिए सरल 3D ब्लॉक्स का एक सेट देने जैसा है। निर्देशक कहानी और हलचल तय करता है, और AI एक स्पेशल इफेक्ट्स टीम के रूप में कार्य करता है, जो वास्तविक विवरण, छाया और भौतिकी को भर देता है। यह "मेरे पास एक रचनात्मक विचार है" और "मेरे पास एक पेशेवर दिखने वाला वीडियो है" के बीच के अंतर को पाटता है, बिना उपयोगकर्ता को 3D मॉडलिंग विशेषज्ञ बनाने के।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →