← नवीनतम पेपर
💻 computer science

Many-for-Many: Unify the Training of Multiple Video and Image Generation and Manipulation Tasks

यह शोध पत्र "मेनी-फॉर-मेनी" (Many-for-Many) प्रस्तुत करता है, जो एक एकीकृत ढांचा है जो हल्के एडेप्टर और एक संयुक्त इमेज-वीडियो लर्निंग रणनीति का उपयोग करता है ताकि एक एकल फाउंडेशन मॉडल को प्रशिक्षित किया जा सके जो दस से अधिक विविध विजुअल जनरेशन और मैनिपुलेशन कार्यों को करने में सक्षम है, जो कार्य-विशिष्ट प्रशिक्षण की उच्च लागत को दूर करने के लिए कई स्रोतों से डेटा का लाभ उठाते हुए प्रतिस्पर्धी प्रदर्शन प्राप्त करता है।

मूल लेखक: Ruibin Li, Tao Yang, Yangming Shi, Weiguo Feng, Shilei Wen, Bingyue Peng, Lei Zhang

प्रकाशित 2026-02-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ruibin Li, Tao Yang, Yangming Shi, Weiguo Feng, Shilei Wen, Bingyue Peng, Lei Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास कला बनाने के निर्देशों का एक विशाल पुस्तकालय है। कुछ निर्देश कहते हैं, "एक बिल्ली बनाओ," कुछ कहते हैं, "बिल्ली की इस फोटो को वीडियो में बदलें," और कुछ कहते हैं, "इस वीडियो के धुंधले हिस्सों को ठीक करें" या "इस ब्लैक-एंड-व्हाइट फिल्म को रंगीन करें।"

आमतौर पर, ये सभी काम करने के लिए, आपको हर एक काम के लिए एक अलग विशेषज्ञ की आवश्यकता होती है। आपको एक "टेक्स्ट-टू-वीडियो" शेफ, एक "इमेज-टू-वीडियो" शेफ और एक "वीडियो-एडिटिंग" शेफ की आवश्यकता होगी। इन प्रत्येक शेफ को शुरू से प्रशिक्षित करना अविश्वसनीय रूप से महंगा है और इसके लिए उच्च गुणवत्ता वाली सामग्री (डेटा) के विशाल मात्रा की आवश्यकता होती है।

"मेनी-फॉर-मेनी" (MfM) का आगमन।

लेखकों ने एक "सुपर-शेफ" बनाया है जो ये सभी काम एक साथ कर सकता है। दस अलग-अलग विशेषज्ञों को काम पर रखने के बजाय, उन्होंने एक एकल मॉडल प्रशिक्षित किया जो 10 से अधिक विभिन्न प्रकार के विजुअल कार्यों को संभाल सकता है, शून्य से वीडियो बनाने से लेकर मौजूदा वीडियो को एडिट करने तक।

उन्होंने यह कैसे किया, इसके सरल उदाहरण यहाँ दिए गए:

1. यूनिवर्सल एडाप्टर (द "स्विस आर्मी नाइफ" हैंडल)

विभिन्न कार्यों के लिए अलग-अलग "इनपुट" की आवश्यकता होती है।

  • टेक्स्ट-टू-वीडियो: आप इसे एक वाक्य देते हैं।
  • इमेज-टू-वीडियो: आप इसे एक तस्वीर देते हैं।
  • वीडियो एडिटिंग: आप एक वीडियो देते हैं जिसमें एक "मास्क" (एक स्टेंसिल जो यह दिखाता है कि किन हिस्सों को बदलना है) होता है।

आमतौर पर, ये इनपुट ऐसे पहेली के टुकड़ों की तरह होते हैं जो एक ही छेद में फिट नहीं होते। MfM टीम ने एक लाइटवेट एडाप्टर डिजाइन किया है। इसे एक यूनिवर्सल हैंडल या स्विस आर्मी नाइफ अटैचमेंट के रूप में सोचें। यह टेक्स्ट, इमेज, वीडियो, मास्क और यहाँ तक कि एक डेप्थ मैप (दृश्य का एक ब्लूप्रिंट, जैसे किसी दृश्य का टोपोग्राफिकल मैप) को लेता है और उन सभी को एक ही फॉर्मेट में ढाल देता है। यह मॉडल को किसी भी निर्देश को समझने में सक्षम बनाता है, चाहे वह किसी भी रूप में आए।

2. "जॉइंट लर्निंग" रणनीति (द "अपेंटिस" मेथड)

एक वीडियो AI को शुरू से प्रशिक्षित करना आमतौर पर किसी को चलने सीखने से पहले मैराथन दौड़ने के लिए सिखाने जैसा है। इसके लिए लाखों महंगे वीडियो उदाहरणों की आवश्यकता होती है।

MfM एक चतुर प्रशिक्षण तकनीक का उपयोग करता है जिसे जॉइंट इमेज-वीडियो लर्निंग कहा जाता है।

  • चरण 1: वे मॉडल को सरल "इमेज" कार्यों (जैसे टेक्स्ट से चित्र बनाना) के साथ सिखाना शुरू करते हैं। यह सस्ता और आसान है।
  • चरण 2: वे धीरे-धीरे "वीडियो" कार्यों को पेश करते हैं।
  • जादू: क्योंकि मॉडल ने इमेज से "विजुअल्स" की बुनियादी बातें सीख ली थीं, इसलिए उसे चीजें कैसे चलानी हैं यह सीखने के लिए बहुत कम महंगे वीडियो उदाहरणों की आवश्यकता होती है। यह एक प्रशिक्षु (अपेंटिस) की तरह है जो पहले सब्जियां काटना सीखता है; जब वह स्टू (वीडियो) बनाना शुरू करता है, तो उसे पहले से ही पता होता है कि सामग्री को कैसे संभालना है।

इसका मतलब है कि वे एक शक्तिशाली 8-बिलियन-पैरामीटर मॉडल को अन्य शीर्ष मॉडलों द्वारा उपयोग किए जाने वाले वीडियो डेटा के केवल 10% का उपयोग करके प्रशिक्षित कर सके।

3. "3D RoPE" (समय और स्थान के लिए GPS)

वीडियो को स्वाभाविक दिखाने के लिए, मॉडल को न केवल यह समझने की आवश्यकता है कि चीजें कहाँ हैं (बाएँ, दाएँ, ऊपर, नीचे) बल्कि यह भी कि वे कब होती हैं (पहला फ्रेम, अंतिम फ्रेम)।
टीम ने मॉडल के आंतरिक "जीपीएस" (जिसे 3D RoPE कहा जाता है) को अपग्रेड किया। केवल एक फ्लैट स्क्रीन पर पिक्सेल की स्थिति जानने के बजाय, मॉडल अब 3D स्पेस और समय के माध्यम से अपनी स्थिति को समझता है। यह मॉडल को झटकेदार, अस्वाभाविक गतियों के बजाय सुचारू और यथार्थवादी हलचल बनाने में मदद करता है।

4. परिणाम: एक मॉडल, कई सुपरपावर्स

टीम ने इस "सुपर-शेफ" का परीक्षण दो आकारों में किया: एक छोटा 2-बिलियन संस्करण और एक बड़ा 8-बिलियन संस्करण।

  • बहुमुखी प्रतिभा: मॉडल 10 से अधिक विभिन्न कार्य कर सकता है, जिनमें शामिल हैं:
    • निर्माण (Creation): टेक्स्ट को वीडियो में बदलना, या इमेज को वीडियो में बदलना।
    • विस्तार (Extension): एक छोटे क्लिप को लेकर उसे लंबा बनाना।
    • एडिटिंग (Editing): वस्तुओं को हटाना (इनपेंटिंग), नए दृश्य जोड़ना (आउटपेंटिंग), या रंगों को बदलना।
    • संवर्धन (Enhancement): धुंधले वीडियो को स्पष्ट बनाना (सुपर-रिज़ॉल्यूशन)।
  • प्रदर्शन: प्रसिद्ध मॉडलों (जैसे Wan2.1, Hunyuan, और यहाँ तक कि व्यावसायिक दिग्गजों जैसे Sora) के खिलाफ आमने-सामने के परीक्षणों में, MfM मॉडल अत्यधिक प्रतिस्पर्धी रहा। यह अक्सर निरंतरता और मोशन क्वालिटी में नंबर 1 या 2 स्थान पर रहा, बावजूद इसके कि इसने बहुत कम डेटा का उपयोग किया।

निचोड़

पेपर का दावा है कि प्रशिक्षण प्रक्रिया को एकीकृत करके और विभिन्न प्रकार के डेटा को मिलाने के लिए एक स्मार्ट "एडाप्टर" का उपयोग करके, उन्होंने एक एकल, कुशल मॉडल बनाया है जो उन विशिष्ट मॉडलों के समान या कभी-कभी उनसे बेहतर है जिन्हें केवल एक विशिष्ट कार्य के लिए प्रशिक्षित किया गया था। उन्होंने साबित किया कि यदि आप एक बहुमुखी उपकरण बनाते हैं जो विविध अनुभवों से सीखता है, तो आपको हर काम के लिए एक अलग उपकरण की आवश्यकता नहीं है।

पेपर क्या दावा नहीं करता है:
पेपर पूरी तरह से मॉडल के तकनीकी प्रशिक्षण और मानक बेंचमार्क पर इसके प्रदर्शन पर केंद्रित है। यह दावा नहीं करता है कि इसने विशिष्ट नैदानिक (clinical) समस्याओं को हल कर दिया है, और न ही यह ओपन-सोर्स कोड और मॉडल वेट्स के रिलीज के अलावा विशिष्ट भविष्य के वाणिज्यिक उत्पादों का विवरण देता है। यह एक मौलिक अनुसंधान कदम है, न कि एक तैयार उपभोक्ता ऐप।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →