← नवीनतम पेपर
💻 computer science

Vorch-Omni: Multi-Task Orchestration of Sight and Sound

Vorch-Omni एक एकीकृत, स्केलेबल मल्टी-टास्क फ्रेमवर्क है जो लचीले टोकन-स्तरीय कंडीशनिंग और दोहरे विजुअल पाथवे के साथ एक सिंगल फ्लो-मैचिंग डिफ्यूजन ट्रांसफार्मर का लाभ उठाता है ताकि बिना किसी कार्य-विशिष्ट आर्किटेक्चरल बदलाव के 10 से अधिक विविध ऑडियो-विजुअल जनरेशन, एडिटिंग और एक्सटेंशन कार्यों को निर्बाध रूप से ऑर्केस्ट्रेट किया जा सके।

मूल लेखक: Vorch Team, Xiaoyu Chen, Yang Ding, Cong Han, Menglin Han, Yuxin Hong, Jiebo Hou, Zequn Jie, Xiang Li, Jing Liu, Qi Liu, Yulei Lu, Siyuan Luo, Lin Ma, Xin Ma, Yinlong Qian, Peng Shi, Fang Wan, Siqi Wa
प्रकाशित 2026-08-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Vorch Team, Xiaoyu Chen, Yang Ding, Cong Han, Menglin Han, Yuxin Hong, Jiebo Hou, Zequn Jie, Xiang Li, Jing Liu, Qi Liu, Yulei Lu, Siyuan Luo, Lin Ma, Xin Ma, Yinlong Qian, Peng Shi, Fang Wan, Siqi Wang, Yaohui Wang, Yaole Wang, Yidi Wu, Siqian Yang, Mingyu Yin, Haoran Yu, Gang Yue, Lisai Zhang, Yuting Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को मास्टर फिल्म निर्माता बनने के लिए सिखाने की कोशिश कर रहे हैं। अतीत में, आपको हर एक काम के लिए एक अलग रोबोट को काम पर रखना पड़ता: एक ऐसा रोबोट जो केवल शब्दों से चित्र बनाना जानता हो, दूसरा जो केवल किसी मूवी क्लिप को लंबा करना जानता हो, तीसरा जो किसी पात्र का चेहरा बदल सके, और चौथा जो साउंड इफेक्ट्स जोड़ सके। यह एक ऐसे टूलबॉक्स की तरह है जहाँ हर उपकरण एक अलग, भारी मशीन है जिसे आपको व्यक्तिगत रूप से ले जाना और प्लग इन करना पड़ता है। यह आज की "जनरेटिव एआई" (generative AI) की दुनिया है—एक ऐसा क्षेत्र जहाँ कंप्यूटर पुरानी चीजों की नकल करने के बजाय नई छवियां, वीडियो और ध्वनियाँ बनाना सीखते हैं।

बड़ी चुनौती यह रही है कि वैज्ञानिक इस बात से जूझ रहे थे कि ये अलग-अलग "रोबोट" आपस में ठीक से संवाद नहीं कर पाते। यदि आप एक ऐसा वीडियो चाहते हैं जहाँ एक पात्र गाना गा रहा हो और साथ ही बैकग्राउंड बदल रहा हो, तो आपको आमतौर पर तीन अलग-अलग मॉडल्स के परिणामों को आपस में जोड़ना पड़ता है, जिससे अक्सर गड़बड़ी, खराब टाइमिंग, या दिखने वाली चीज़ और सुनाई देने वाली आवाज़ के बीच अजीब सा तालमेल बिगड़ जाता है। सवाल हर किसी के मन में है: क्या हम एक एकल, अत्यंत बुद्धिमान "कंडक्टर" (संचालक) बना सकते हैं जो एक साथ इन सभी अलग-अलग कामों को समझ सके? क्या वह तय कर सकता है कि कब कुछ नया बनाना है, कब किसी चीज़ की हूबहू नकल करनी है, और कब बस एक छोटा सा विवरण बदलना है, और यह सब करते हुए भी ध्वनि और दृश्य को पूरी तरह से तालमेल में कैसे रखना है?

यहाँ Vorch-Omni आता है, एक नया प्रोजेक्ट जो सुझाव देता है कि इसका उत्तर "हाँ" हो सकता है। Vorch-Omni को अलग-अलग रोबोटों के संग्रह के रूप में नहीं, बल्कि एक एकल, अविश्वसनीय रूप से बहुमुखी ऑर्केस्ट्रा कंडक्टर के रूप में सोचें। संगीत के लिए एक वायलिन वादक और लय के लिए एक ड्रमर को काम पर रखने के बजाय, यह एक अकेला कंडक्टर पूरी सिम्फनी को निर्देशित कर सकता है। शोधकर्ताओं ने एक ऐसी प्रणाली बनाई है जो वीडियो और ऑडियो को एक एकल, एकीकृत भाषा के रूप में मानती है। चाहे आप टेक्स्ट विवरण से एक बिल्कुल नया दृश्य बनाना चाहें, एक समाप्त हो चुके वीडियो को आगे बढ़ाना चाहें, या किसी पात्र का चेहरा बदलते हुए उसके डांस मूव्स को बिल्कुल वैसा ही रखना चाहें, Vorch-Omni इन सभी कार्यों के लिए एक ही मुख्य मस्तिष्क का उपयोग करता है।

इसका असली रहस्य यह है कि यह प्रणाली इनपुट के बारे में कैसे "सोचती" है। कल्पना कीजिए कि आप एक शेफ (रसोइया) को निर्देश दे रहे हैं। कभी आप कहते हैं, "मेरे लिए शुरुआत से एक बर्गर बनाओ" (यह कुछ नया बनाना है)। कभी आप कहते हैं, "यह रहा एक बर्गर, बस इसमें चीज़ डाल दो" (यह एडिटिंग है)। कभी आप कहते हैं, "यहाँ एक बर्गर की फोटो है, इसे एक पेंटिंग जैसा बना दो" (यह रेफरेंसिंग है)। अतीत में, कंप्यूटर इन अलग-अलग अनुरोधों से भ्रमित हो जाते थे। Vorch-Omni इस समस्या को हल करने के लिए हर जानकारी को एक विशिष्ट "नाम टैग" और एक "सीट नंबर" देता है। यह ठीक जानता है कि इनपुट का कौन सा हिस्सा "टारगेट" (जिसे बनाया जाना है) है, कौन सा हिस्सा "सोर्स" (जिसे बरकरार रखा जाना है) है, और कौन सा हिस्सा केवल एक "रेफरेंस" (एक स्टाइल गाइड) है। यह मॉडल को 10 से अधिक प्रकार के कार्यों को संभालने की अनुमति देता है—जैसे टेक्स्ट से वीडियो बनाना, आवाज़ों की क्लोनिंग करना, या किसी फिल्म के विशिष्ट हिस्सों को एडिट करना—बिना प्रत्येक काम के लिए अपने आंतरिक वायरिंग को बदले।

पेपर सुझाव देता है कि यह दृष्टिकोण उल्लेखनीय रूप से अच्छा काम करता है, विशेष रूप से तब जब ध्वनि और वीडियो को सटीक तालमेल में रखने की बात आती है। जब शोधकर्ताओं ने अपने मॉडल का परीक्षण अन्य शीर्ष-स्तरीय प्रणालियों के विरुद्ध किया, तो उन्होंने पाया कि जबकि समग्र गुणवत्ता अक्सर समान थी, Vorch-Omnio वीडियो के साथ ऑडियो के मिलान (जैसे बोलने के साथ होंठों का हिलना) में काफी बेहतर था और यह किसी संदर्भ छवि या ध्वनि क्लिप के विशिष्ट विवरणों पर टिके रहने में भी अधिक सक्षम था। इसने केवल संबंध का "अनुमान" नहीं लगाया; इसने दृश्य और ध्वनि के बीच के संबंध को समझा।

हालाँकि, लेखक सावधानी बरतते हुए कहते हैं कि यह अभी कोई जादुई छड़ी नहीं है जो फिल्म निर्माण की हर समस्या को हल कर दे। हालाँकि मॉडल छोटे क्लिप और विशिष्ट संपादन के लिए बेहतरीन है, लेकिन यह बहुत लंबी, जटिल कहानियों के साथ संघर्ष करता है जिन्हें घंटों तक निरंतरता बनाए रखनी होती है। यह हर भाषा में भाषण उत्पन्न करने या अत्यंत सूक्ष्म संपादन को संभालने में भी पूर्ण नहीं है। लेकिन, पेपर सुझाव देता है कि यह "एकीकृत कंडक्टर" दृष्टिकोण एक बड़ा कदम है। यह साबित करके कि एक ही मॉडल बिना भ्रमित हुए इतने सारे भूमिकाओं को निभा सकता है, Vorch-Omni एक ऐसे भविष्य का द्वार खोलता है जहाँ उच्च-गुणवत्ता वाली, सिंक्रोनाइज़्ड ऑडियो-विजुअल सामग्री बनाना एक एकल, स्पष्ट निर्देश देने जितना सरल है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →