← नवीनतम पेपर
💻 computer science

MiVE: Multiscale Vision-language features for reference-guided video Editing

MiVE एक संदर्भ-निर्देशित वीडियो संपादन फ्रेमवर्क पेश करता है जो मोडैलिटी अंतराल और स्थानिक विवरण की हानि को दूर करने के लिए एक एकीकृत सेल्फ-अटेंशन डिफ्यूजन ट्रांसफॉर्मर के भीतर Qwen3-VL से पदानुक्रमित, मल्टीस्केल फीचर्स का लाभ उठाता है, जिससे गति को बनाए रखने और सटीक संपादन निष्पादित करने में अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Tong Wang, Meng Zou, Chengjing Wu, Xiaochao Qu, Luoqi Liu, Xiaolin Hu, Ting Liu

प्रकाशित 2026-05-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tong Wang, Meng Zou, Chengjing Wu, Xiaochao Qu, Luoqi Liu, Xiaolin Hu, Ting Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास अपने एक दोस्त के सड़क पर चलते हुए एक होम वीडियो है। आप उनके बालों का रंग बदलकर चमकीला गुलाबी करना चाहते हैं, लेकिन आप चाहते हैं कि उनकी चाल, बैकग्राउंड और बाकी सब कुछ बिल्कुल वैसा ही रहे। यही रेफरेंस-गाइडेड वीडियो एडिटिंग (Reference-Guided Video Editing) की चुनौती है।

यह शोध पत्र एक नया टूल पेश करता है जिसे MiVE (मल्टीस्केल विजन-लैंग्वेज फीचर्स फॉर रेफरेंस-गाइडेड वीडियो एडिटिंग) कहा जाता है, जो इस समस्या को वर्तमान तरीकों और महंगे कमर्शियल सिस्टम्स की तुलना में बेहतर तरीके से हल करता है।

MiVE कैसे काम करता है, इसे सरल उपमाओं (analogies) के माध्यम से समझाया गया है:

समस्या: "अनुवादक" बनाम "वास्तुकार" (The "Translator" vs. The "Architect")

वर्तमान वीडियो एडिटिंग टूल्स आमतौर पर दो चीजों को अलग-अलग करने की कोशिश करते हैं:

  1. अनुवादक (The Translator): एक सिस्टम जो आपके टेक्स्ट निर्देशों (जैसे, "बाल गुलाबी कर दो") को पढ़ता है।
  2. वास्तुकार (The Architect): एक सिस्टम जो वीडियो और रेफरेंस फोटो को देखता है ताकि यह समझ सके कि क्या बदलना है।

शोध पत्र का तर्क है कि ये दोनों सिस्टम अक्सर एक-दूसरे की बात नहीं समझ पाते। "अनुवादक" गुलाबी बालों के विचार को तो समझता है, लेकिन उसे ठीक से पता नहीं होता कि बाल कहाँ हैं। "वास्तुकार" बालों को तो देखता है, लेकिन वह विशिष्ट निर्देश को पूरी तरह से नहीं समझ पाता। जब वे प्रक्रिया के अंत में अपने काम को मिलाने की कोशिश करते हैं, तो परिणाम अक्सर धुंधला, असंगत या ऐसी चीजें बदल देता है जिन्हें आप नहीं बदलना चाहते थे।

समाधान: MiVE की "ऑल-हैंड्स मीटिंग" (MiVE's "All-Hands Meeting")

MiVE एक गेम चेंजर है क्योंकि यह सब कुछ एक साथ करने के लिए एक ही शक्तिशाली मस्तिष्क (एक विजन-लैंग्वेज मॉडल जिसे Qwen3-VL कहा जाता है) का उपयोग करता है। लेकिन इसका असली रहस्य यह है: MiVE उस मस्तिष्क के भीतर विभिन्न "आवाजों" को सुनता है।

लेखकों ने पाया कि डीप लर्निंग मॉडल्स में लेयर्स होती हैं, जैसे एक गगनचुंबी इमारत की मंजिलें:

  • निचली मंजिलें (प्रारंभिक लेयर्स - The Lower Floors): ये मैग्नीफाइंग ग्लास (आवर्धक लेंस) के साथ काम करने वाले वास्तुकारों की तरह हैं। वे सूक्ष्म, विशिष्ट विवरण देखते हैं: बालों के रेशे का सटीक आकार, शर्ट की बनावट, या छाया का किनारा।
  • ऊपरी मंजिल (अंतिम लेयर - The Top Floor): यह एक CEO की तरह है। वे बड़ी तस्वीर और अर्थ को समझते हैं: "यह एक व्यक्ति है," "यह गुलाबी बाल हैं," "यह एक धूप वाला दिन है।"

पुराने तरीके केवल CEO (अंतिम लेयर) की बात सुनते थे। वे जानते थे कि क्या करना है, लेकिन वे विवरणों को चूक जाते थे, जिससे परिणाम धुंधले हो जाते थे।
MiVE एक ऐसी मीटिंग आयोजित करता है जहाँ मैग्नीफाइंग ग्लास वाले वास्तुकार और CEO दोनों एक ही समय में बोलते हैं।

यह कैसे काम करता है: "एकीकृत मंच" (The "Unified Stage")

टेक्स्ट, रेफरेंस फोटो और वीडियो को एक जटिल रिले रेस (जिससे देरी और त्रुटियां होती हैं) के माध्यम से एक-दूसरे से बात करने देने के बजाय, MiVE उन्हें एक एकल मंच (single stage) पर रखता है।

  1. इनपुट: आप MiVE को मूल वीडियो, टेक्स्ट निर्देश और एक रेफरेंस फोटो (एक तस्वीर जो दिखाती है कि परिणाम कैसा दिखना चाहिए) देते हैं।
  2. मिश्रण: MiVE रेफरेंस और निर्देश से "मैग्नीफाइंग ग्लास" वाले विवरण और "बड़ी तस्वीर" वाला अर्थ लेता है।
  3. नृत्य (The Dance): यह इस सारी जानकारी को एक बड़े पूल में मिला देता है। वीडियो फ्रेम केवल निर्देशों को "सुनते" नहीं हैं; वे उनके साथ नृत्य करते हैं। यह सुनिश्चित करता है कि जब वीडियो बालों का रंग बदलता है, तो उसे पता होता है कि किन पिक्सेल को छूना है और किन्हें छोड़ देना है, जिससे मूल मूवमेंट पूरी तरह सुरक्षित रहता है।

परिणाम: यह क्यों जीतता है?

शोध पत्र ने MiVE का परीक्षण अन्य शीर्ष अकादमिक मॉडल्स और एक प्रसिद्ध कमर्शियल सिस्टम (Kling O1) के खिलाफ किया।

  • सरल परिदृश्यों में: MiVE किसी वस्तु का रंग बदल सकता था या बैकग्राउंड को धुंधला किए बिना किसी व्यक्ति को हटा सकता था।
  • जटिल परिदृश्यों में: जब वीडियो में तेज़ हलचल, छाया, या वस्तुओं के पीछे से लोग गुजर रहे थे, तब MiVE ही एकमात्र ऐसा मॉडल था जिसने व्यक्ति के चेहरे को पहचानने योग्य रखा और लाइटिंग को यथार्थवादी बनाए रखा।

लेखक कहते हैं कि MiVE सबसे अच्छा है क्योंकि यह केवल अनुमान नहीं लगाता; यह सटीकता सुनिश्चित करने के लिए बारीक विवरणों (प्रारंभिक लेयर्स से) और निर्देश का सही ढंग से पालन सुनिश्चित करने के लिए बड़े विचारों (अंतिम लेयर्स से) का उपयोग करता है।

सारांश

MiVE को एक मास्टर एडिटर के रूप में समझें जो केवल स्क्रिप्ट (टेक्स्ट) को पढ़ता है और फोटो (रेफरेंस) को अलग से नहीं देखता। इसके बजाय, MiVE के पास एक सुपरपावर है: यह पूरी फिल्म और पूरी स्क्रिप्ट को एक साथ देख सकता है, और व्यापक कहानी और सूक्ष्म विवरणों दोनों पर एक साथ ध्यान दे सकता है। यह इसे बदलावों को स्वाभाविक बनाने, निरंतरता बनाए रखने और आपके निर्देशों का पूरी तरह से पालन करने में सक्षम बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →