Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation
यह शोध पत्र कांडिंस्की 5.0 (Kandinsky 5.0) का परिचय देता है, जो इमेज और वीडियो जनरेशन वेरिएंट्स वाला ओपन-सोर्स फाउंडेशन मॉडल्स का एक परिवार है जिसमें 19 बिलियन तक पैरामीटर्स हैं, जो अत्याधुनिक उच्च-रिज़ॉल्यूशन संश्लेषण और 10-सेकंड वीडियो जनरेशन प्राप्त करने के लिए एक व्यापक डेटा क्यूरेशन लाइफसाइकिल और उन्नत प्रशिक्षण तकनीकों का लाभ उठाते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ कांडिंस्की 5.0 (Kandinsky 5.0) पेपर का हिंदी अनुवाद दिया गया है:
एक बड़ी तस्वीर: डिजिटल कलाकारों का एक नया परिवार
कल्पना कीजिए कि एक डिजिटल आर्ट स्टूडियो ने अभी-अभी कलाकारों के एक पूरे नए परिवार को काम पर रखा है। यह परिवार, जिसे कांडिंस्की 5.0 (Kandinsky 5.0) कहा जाता है, आपके टेक्स्ट विवरणों को पढ़कर हाई-डेफिनिशन तस्वीरें और 10 सेकंड की फिल्में बनाने के लिए डिज़ाइन किया गया है।
यह पेपर इस परिवार के तीन विशिष्ट "भाई-बहनों" का परिचय देता है, जिनमें से प्रत्येक का अलग काम और कौशल स्तर है:
- कांडिंस्की 5.0 इमेज लाइट (6B कलाकार): यह उच्च-रिज़ॉल्यूशन वाली स्थिर चित्र (still images) बनाने और मौजूदा फोटो को एडिट करने में विशेषज्ञ है।
- कांडिंस्की 5.0 वीडियो लाइट (2B कलाकार): एक हल्का, तेज़ काम करने वाला, जो 10 सेकंड के छोटे क्लिप बना सकता है। इन्हें इस परिवार का "स्पीडस्टर" (तेज़ दौड़ने वाला) समझें।
- कांडिंस्की 5.0 वीडियो प्रो (19B कलाकार): यह भारी वजन वाला चैंपियन है। यह एक विशाल मॉडल है जो उच्चतम गुणवत्ता वाले, सबसे विस्तृत 10 सेकंड के वीडियो बनाता है।
इस रिपोर्ट का मुख्य लक्ष्य यह दिखाना है कि उन्होंने इन कलाकारों को कैसे बनाया, उन्हें कैसे प्रशिक्षित किया, और उन्होंने उन्हें इतना तेज़ कैसे बनाया कि उन्हें आपके लिविंग रूम में सुपरकंप्यूटर की आवश्यकता न पड़े।
1. ट्रेनिंग कैंप: उन्होंने रचना करना कैसे सीखा
आप एक रोबोट को केवल एक खाली कैनवास देकर मास्टरपीस की उम्मीद नहीं कर सकते। पेपर में तीन मुख्य चरणों वाले एक कठोर "ट्रेनिंग कैंप" का विवरण दिया गया है:
- चरण 1: प्री-ट्रेनिंग (द "वर्ल्ड टूर"):
कल्पना कीजिए कि मॉडल छात्र एक विशाल फील्ड ट्रिप पर जा रहे हैं। उन्हें इंटरनेट से करोड़ों चित्र और वीडियो दिखाए जाते हैं। वे बुनियादी बातें सीखते हैं: बिल्ली कैसी दिखती है, पानी कैसे चलता है, सूर्यास्त कैसा महसूस होता है। यहीं पर वे दृश्य दुनिया की "व्याकरण" सीखते हैं। - चरण 2: सुपरवाइज्ड फाइन-ट्यूनिंग (द "आर्ट स्कूल"):
फील्ड ट्रिप के बाद, वे एक सख्त आर्ट स्कूल में जाते हैं। यहाँ, मानव विशेषज्ञ कला के सबसे अच्छे, सबसे सुंदर उदाहरणों को हाथ से चुनते हैं। मॉडल इन आदर्श उदाहरणों पर अभ्यास करते हैं ताकि वे सीख सकें कि चीजों को केवल "ठीक-ठाक" के बजाय वास्तविक और सौंदर्यपूर्ण कैसे बनाया जाए। - चरण 3: "टेस्ट ऑफ टेस्ट" (RL पोस्ट-ट्रेनिंग):
यह एक चतुर तकनीक है। मॉडल दो चित्र बनाता है। एक "जज" (रिवॉर्ड मॉडल) उन्हें देखता है और कहता है, "मुझे पहला वाला ज्यादा पसंद आया।" मॉडल फिर वह बनाना सीखता है जो जज को पसंद आता है। यह एक शेफ की तरह है जो अपने ही सूप को चखता है और मसालों को तब तक एडजस्ट करता है जब तक कि वह एकदम सही न हो जाए।
2. सीक्रेट सॉस: नए उपकरण और ट्रिक्स
पेपर बताता है कि इन मॉडल्स को बनाने के पुराने तरीके बहुत धीमे और बोझिल थे। उन्होंने चीजों को तेज़ और अधिक स्पष्ट बनाने के लिए नए उपकरणों का आविष्कार किया:
- "स्मार्ट अटेंशन" मैकेनिज्म (NABLA):
- समस्या: 10 सेकंड का वीडियो देखना ऐसा है जैसे किसी फिल्म के हर एक फ्रेम को एक साथ याद रखने की कोशिश करना। कंप्यूटर के लिए, यह एक पन्ने को पढ़ते समय अपने दिमाग में किताबों के पुस्तकालय को रखने जैसा है। यह बहुत भारी पड़ता है।
- समाधान: उन्होंने NABLA नामक एक सिस्टम बनाया। कल्पना कीजिए कि एक लाइब्रेरियन आपके सवाल से संबंधित विशिष्ट अलमारियों को ही देखता है, न कि लाइब्रेरी की हर किताब को पढ़ता है। यह मॉडल को वीडियो के केवल महत्वपूर्ण हिस्सों पर ध्यान केंद्रित करने की अनुमति देता है, जिससे यह बिना गुणवत्ता खोए 2.7 गुना तेज़ हो जाता है।
- "डिस्टिलेशन" प्रक्रिया (स्पीड-अप):
- समस्या: उच्च-गुणवत्ता वाला वीडियो बनाने में आमतौर पर बहुत समय लगता है (जैसे शून्य से केक बनाना)।
- समाधान: उन्होंने अपने मॉडल्स के "फ्लैश" संस्करण बनाए। इसे एक मास्टर शेफ की रेसिपी लेकर उसका "माइक्रोवेव मील" संस्करण बनाने के रूप में सोचें। यह मूल की तरह बहुत जटिल नहीं है, लेकिन 90% उतना ही अच्छा है और बहुत कम समय में तैयार हो जाता है। उन्होंने एक वीडियो बनाने के लिए आवश्यक स्टेप्स की संख्या को 100 से घटाकर केवल 16 कर दिया।
3. डेटा: लाइब्रेरी की सफाई
इससे पहले कि मॉडल सीख पाते, टीम को उस "लाइब्रेरी" की सफाई करनी थी जिससे वे सीख रहे थे।
- फिल्टरिंग: उन्होंने धुंधली तस्वीरों, वॉटरमार्क वाले वीडियो और बहुत उबाऊ (स्थिर) या बहुत अराजक क्लिप्स को हटा दिया।
- सांस्कृतिक कोड: उन्होंने विशेष रूप से रूसी संस्कृति (वास्तुकला, इतिहास, प्रकृति) से संबंधित डेटा एकत्र किया ताकि यह सुनिश्चित हो सके कि मॉडल इन विशिष्ट दृश्य शैलियों को समझता है, जिन्हें अक्सर अन्य वैश्विक मॉडल मिस कर देते हैं।
- इंस्ट्रक्शन ट्यूनिंग: इमेज एडिटिंग मॉडल के लिए, उन्होंने "पहले और बाद के" (Before and After) जोड़ों का एक विशाल डेटासेट बनाया। यदि आपके पास कुत्ते की एक फोटो है और आप उसे बिल्ली में बदलना चाहते हैं, तो मॉडल ने बैकग्राउंड को समान रखते हुए फर को बदलने का सटीक तरीका सीखा।
4. परिणाम: वे कितने अच्छे हैं?
टीम ने केवल यह नहीं कहा कि "यह अच्छा है"; उन्होंने अन्य प्रसिद्ध मॉडल्स (जैसे Sora, Veo, और Wan) के खिलाफ इसका परीक्षण किया।
- "ब्लाइंड टेस्ट ऑफ टेस्ट": इंसानों को बिना यह जाने कि कौन सा वीडियो किस मॉडल ने बनाया है, दो वीडियो अगल-बगल दिखाए गए। उन्हें विजेता चुनने के लिए कहा गया।
- फैसला:
- विजुअल क्वालिटी और मोशन: कांडिंस्की 5.0 (विशेष रूप से प्रो वर्जन) अक्सर Veo 3 और Wan जैसे प्रतिस्पर्धियों के मुकाबले जीता। वीडियो अधिक वास्तविक दिखे, गतिविधियाँ अधिक सहज थीं, और उनमें कम "ग्लिच" (जैसे अजीब चेहरे पिघलना) थे।
- निर्देशों का पालन: पेपर स्वीकार करता है कि हालांकि कांडिंस्की चीजें वास्तविक दिखाने में बहुत अच्छा है, लेकिन कभी-कभी यह कुछ प्रतिस्पर्धियों (जैसे Veo 3) की तरह बहुत जटिल टेक्स्ट निर्देशों का पूरी तरह से पालन करने में संघर्ष करता है। यह एक ट्रेड-ऑफ है: बेहतर विजुअल्स, थोड़ा कम सटीक टेक्स्ट फॉलोइंग।
- गति: इसके "फ्लैश" संस्करण अविश्वसनीय रूप से तेज़ हैं, जो इन्हें रियल-टाइम अनुप्रयोगों के लिए उपयोगी बनाते हैं।
5. "ओपन डोर" पॉलिसी
उन कंपनियों के विपरीत जो अपने सर्वश्रेष्ठ मॉडल्स को गुप्त रखती हैं, कांडिंस्की टीम सब कुछ रिलीज़ कर रही है।
- वे कोड, ट्रेनिंग डेटा रेसिपी और अंतिम मॉडल्स को मुफ्त में (एक ओपन लाइसेंस के तहत) साझा कर रहे हैं।
- वे कोड के अंदर सख्त "गार्डरेल्स" (सीमाएं) नहीं लगा रहे हैं, क्योंकि उनका मानना है कि उपयोगकर्ता इस बात के लिए जिम्मेदार होने चाहिए कि वे टूल का उपयोग कैसे करते हैं। हालांकि, वे स्पष्ट रूप से चेतावनी देते हैं कि उपयोगकर्ताओं को इसका उपयोग हेट स्पीच, डीपफेक या अवैध गतिविधियों के लिए नहीं करना चाहिए।
सारांश
कांडिंस्की 5.0 AI कलाकारों का एक नया, ओपन-सोर्स परिवार है। वे वीडियो डेटा को देखने के लिए एक स्मार्ट तरीके का उपयोग करते हैं ताकि तेज़ हो सकें, दिखने में अधिक वास्तविक होने के लिए एक कठोर प्रशिक्षण प्रक्रिया का उपयोग करते हैं, और क्लिप्स को जल्दी जेनरेट करने के लिए एक "स्पीड-अप" तकनीक का उपयोग करते हैं। हालांकि वे अभी भी जटिल टेक्स्ट निर्देशों का पालन करने की अपनी क्षमता को बेहतर बनाने पर काम कर रहे हैं, उन्होंने साबित कर दिया है कि वे दुनिया के सर्वश्रेष्ठ क्लोज्ड-सोर्स सिस्टमों की टक्कर के शानदार, उच्च-गुणवत्ता वाले चित्र और 10 सेकंड के वीडियो बना सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।