← नवीनतम पेपर
💻 computer science

VicEdit: Learning to Edit Videos from Visual In-Context Examples

यह शोध पत्र VicEdit को प्रस्तुत करता है, जो एक एकीकृत ढांचा है जो एक नए बड़े पैमाने के डेटासेट (VicEdit-400K) और बेहतर संपादन प्रदर्शन के लिए विज़ुअल इन-कॉन्टेक्स्ट उदाहरणों को टेक्स्टुअल निर्देशों के साथ प्रभावी ढंग से एकीकृत करने हेतु मोडैलिटी-एडेप्टिव सिमेंटिक डिस्टिलेशन और ड्यूल-कॉन्टेक्स्ट इंजेक्शन जैसी नवीन तकनीकों का लाभ उठाकर वीडियो संपादन को उन्नत करता है।

मूल लेखक: Yuji Wang, Teng Hu, Yuheng Chen, Ran Yi, Han Feng, Weijian Cao, Chengjie Wang, Lizhuang Ma, Jiangning Zhang

प्रकाशित 2026-08-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuji Wang, Teng Hu, Yuheng Chen, Ran Yi, Han Feng, Weijian Cao, Chengjie Wang, Lizhuang Ma, Jiangning Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

वर्षों से, वीडियो एडिट करने का सपना केवल कंप्यूटर को यह बताना रहा है कि क्या करना है। यदि आप किसी फिल्म के दृश्य में कार का रंग बदलना चाहते थे या बादलों वाले आसमान को सूर्यास्त से बदलना चाहते थे, तो आप "आसमान को नारंगी बना दो" जैसा एक वाक्य टाइप कर सकते थे, और सॉफ्टवेयर अपनी पूरी कोशिश करता। यह दृष्टिकोण, जिसे 'इंस्ट्रक्शन-बेस्ड एडिटिंग' (निर्देश-आधारित संपादन) कहा जाता है, ने उल्लेखनीय प्रगति की है। यह शक्तिशाली आर्टिफिशियल इंटेलिजेंस मॉडल्स पर निर्भर करता है जो भाषा को समझते हैं और शून्य से चित्र और वीडियो बना सकते हैं। हालाँकि, एक मौलिक समस्या बनी हुई है: शब्द अक्सर किसी दृश्य के विशिष्ट रूप और अहसास को पकड़ने के लिए बहुत अस्पष्ट होते हैं। एक टेक्स्ट विवरण "लाल कार" कह सकता है, लेकिन यह आसानी से लाल रंग के सटीक शेड, धातु पर पड़ने वाले प्रकाश के तरीके, या वाहन की विशिष्ट गति को व्यक्त नहीं कर सकता। जब कंप्यूटर केवल एक वाक्य से इन विवरणों का अनुमान लगाने की कोशिश करता है, तो परिणाम अक्सर गलत दिखता है, जिसमें रंग बदलते रहते हैं, वस्तुएं गलत जगह दिखाई देती हैं, या गतिविधियां कठोर और अप्राकृतिक महसूस होती हैं।

इसे हल करने के लिए, शोधकर्ताओं ने कंप्यूटर को सिखाने का एक अलग तरीका तलाशना शुरू कर दिया है: उन्हें केवल बताने के बजाय उन्हें उदाहरण दिखाना। यह अवधारणा, जिसे 'इन-कॉन्टेक्स्ट लर्निंग' (संदर्भ-आधारित सीखना) कहा जाता है, इस बात के समान है कि कैसे एक मानव प्रशिक्षु किसी शिल्प को सीखता है। एक दीवार को पेंट करने के तरीके पर मैनुअल पढ़ने के बजाय, प्रशिक्षु एक मास्टर पेंटर को एक विशिष्ट सतह पर एक विशिष्ट ब्रशस्ट्रोक लगाते हुए देखता है। मूल दीवार और तैयार परिणाम के बीच के संबंध को देखकर, प्रशिक्षु सटीक तकनीक सीखता है। वीडियो एडिटिंग की दुनिया में, इसका अर्थ है कंप्यूटर को विजुअल संदर्भ प्रदान करना—जैसे कि एक एकल छवि, छवियों का एक जोड़ा जो पहले और बाद की स्थिति दिखाता हो, या वांछित परिवर्तन का एक छोटा वीडियो क्लिप। चुनौती यह थी कि कोई भी एकल सिस्टम एक साथ इन सभी विभिन्न प्रकार के विजुअल संकेतों को नहीं संभाल सका, और कोई बड़ा संग्रह नहीं था जो सिस्टम को प्रभावी ढंग से उनका उपयोग करना सिखा सके।

शोधकर्ताओं के एक दल ने अब एक नया सिस्टम विकसित करके इस अंतर को पाट दिया है जिसे 'विकएडिट' (VicEdit) कहा जाता है। उनका कार्य केवल टेक्स्ट विवरणों पर निर्भर रहने के बजाय विजुअल उदाहरणों को प्राथमिक मार्गदर्शक के रूप में उपयोग करने की दिशा में एक महत्वपूर्ण बदलाव का प्रतिनिधित्व करता है। इस सिस्टम को बनाने के लिए, टीम ने सबसे पहले प्रशिक्षण डेटा का एक विशाल पुस्तकालय बनाया। उन्होंने 4,00,000 उच्च-गुणवत्ता वाले उदाहरण तैयार किए, एक डेटासेट जिसे उन्होंने 'विकएडिट-400के' (VicEdit-400K) नाम दिया। यह संग्रह अद्वितीय है क्योंकि यह दस अलग-अलग प्रकार के संपादन कार्यों को कवर करता है, जैसे कि पूरे दृश्य की शैली बदलना या विशिष्ट वस्तुओं को जोड़ना या हटाना। महत्वपूर्ण रूप से, इस लाइब्रेरी में से प्रत्येक उदाहरण को सही प्रकार के विजुअल संदर्भ के साथ जोड़ा गया है: स्टाइल परिवर्तन के लिए एक एकल छवि, स्थानिक परिवर्तनों के लिए छवियों का एक जोड़ा, या जटिल गति के लिए वीडियो का एक जोड़ा। इस विशाल लाइब्रेरी ने उन्हें कंप्यूटर को विजुअल संकेतों की व्याख्या करने का तरीका सिखाने की अनुमति दी, जो केवल टेक्स्ट द्वारा कभी भी प्रदान नहीं किया जा सकता था।

उनके नए सिस्टम का मूल एक ऐसी विधि है जो कंप्यूटर को यह अनुकूलित करने की अनुमति देती है कि वह प्राप्त विजुअल संकेत के आधार पर अपनी समझ को कैसे बदले। जब कंप्यूटर एक एकल छवि देखता है, तो वह बनावट (textures) और रंगों पर ध्यान केंद्रित करना सीखता है। जब वह छवियों का एक जोड़ा देखता है, तो वह यह समझने के लिए सीखता है कि वस्तुएं एक स्थिति से दूसरी स्थिति में कैसे चलती हैं। जब वह वीडियो का एक जोड़ा देखता है, तो वह समय और गति के प्रवाह का अनुसरण करना सीखता है। शोधकर्ताओं ने एक ऐसी प्रक्रिया डिजाइन की है जो इन विजुअल उदाहरणों से विशिष्ट सबक निकालती है और उन्हें लिखित निर्देशों के साथ जोड़ती है। यह सुनिश्चित करता है कि कंप्यूटर केवल टेक्स्ट का आँख मूंदकर पालन नहीं करता है, बल्कि परिवर्तनों को वास्तविकता में स्थापित करने के लिए विजुअल उदाहरणों का उपयोग करता है। उदाहरण के लिए, यदि कोई उपयोगकर्ता पानी की बोतल को चमकती हुई गैलेक्सी (आकाशगंगा) में बदलने के लिए कहता है, तो टेक्स्ट विचार प्रदान करता है, लेकिन एक चमकती हुई गैलेक्सी का विजुअल उदाहरण यह सुनिश्चित करता है कि कंप्यूटर जानता है कि वह वास्तव में कैसी दिखती है, जिससे एक सामान्य या विकृत परिणाम बनने से रोका जा सके।

इसके परिणाम आश्चर्यजनक हैं। मौजूदा तरीकों के मुकाबले परीक्षण किए जाने पर, नया सिस्टम लगातार उच्च-गुणवत्ता वाले वीडियो बनाता है जो उपयोगकर्ता के इरादे के प्रति अधिक वफादार होते हैं। उन कार्यों में जहाँ अन्य सिस्टम वस्तुओं को सही जगह रखने या सही शैली बनाए रखने में संघर्ष करते थे, यह नया तरीका सफल रहा। यह एक दृश्य में नई वस्तु को सहजता से मिला सकता था, अग्रभूमि (foreground) को विकृत किए बिना पृष्ठभूमि को बदल सकता था, या जटिल कलात्मक शैलियों को लागू कर सकता था जो स्वाभाविक और सुसंगत दिखते थे। सिस्टम ने यह सिद्ध किया कि कंप्यूटर को केवल बताने के बजाय उसे दिखाना कि क्या करना है, संपादन की गुणवत्ता में नाटकीय सुधार करता है। यह कार्य वीडियो एडिटिंग के लिए एक नया मानक स्थापित करता है, यह प्रदर्शित करता है कि विजुअल उदाहरण आर्टिफिशियल इंटेलिजेंस को निर्देशित करने के लिए एक शक्तिशाली और आवश्यक उपकरण हैं। शोधकर्ताओं ने अपने डेटासेट और सिस्टम को दूसरों के उपयोग के लिए उपलब्ध करा दिया है, जिससे भविष्य में अधिक सटीक और रचनात्मक वीडियो एडिटिंग टूल्स के द्वार खुल गए हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →