← नवीनतम पेपर
🤖 machine learning

Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation

यह शोध पत्र कांडिंस्की 5.0 (Kandinsky 5.0) का परिचय देता है, जो इमेज और वीडियो जनरेशन वेरिएंट्स वाला ओपन-सोर्स फाउंडेशन मॉडल्स का एक परिवार है जिसमें 19 बिलियन तक पैरामीटर्स हैं, जो अत्याधुनिक उच्च-रिज़ॉल्यूशन संश्लेषण और 10-सेकंड वीडियो जनरेशन प्राप्त करने के लिए एक व्यापक डेटा क्यूरेशन लाइफसाइकिल और उन्नत प्रशिक्षण तकनीकों का लाभ उठाते हैं।

मूल लेखक: Vladimir Arkhipkin, Vladimir Korviakov, Nikolai Gerasimenko, Denis Parkhomenko, Viacheslav Vasilev, Alexey Letunovskiy, Nikolai Vaulin, Maria Kovaleva, Ivan Kirillov, Lev Novitskiy, Denis Koposov, Nik
प्रकाशित 2026-05-27
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Vladimir Arkhipkin, Vladimir Korviakov, Nikolai Gerasimenko, Denis Parkhomenko, Viacheslav Vasilev, Alexey Letunovskiy, Nikolai Vaulin, Maria Kovaleva, Ivan Kirillov, Lev Novitskiy, Denis Koposov, Nikita Kiselev, Alexander Varlamov, Dmitrii Mikhailov, Vladimir Polovnikov, Andrey Shutkin, Julia Agafonova, Ilya Vasiliev, Anastasiia Kargapoltseva, Anna Dmitrienko, Anastasia Maltseva, Anna Averchenkova, Olga Kim, Tatiana Nikulina, Denis Dimitrov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ कांडिंस्की 5.0 (Kandinsky 5.0) पेपर का हिंदी अनुवाद दिया गया है:

एक बड़ी तस्वीर: डिजिटल कलाकारों का एक नया परिवार

कल्पना कीजिए कि एक डिजिटल आर्ट स्टूडियो ने अभी-अभी कलाकारों के एक पूरे नए परिवार को काम पर रखा है। यह परिवार, जिसे कांडिंस्की 5.0 (Kandinsky 5.0) कहा जाता है, आपके टेक्स्ट विवरणों को पढ़कर हाई-डेफिनिशन तस्वीरें और 10 सेकंड की फिल्में बनाने के लिए डिज़ाइन किया गया है।

यह पेपर इस परिवार के तीन विशिष्ट "भाई-बहनों" का परिचय देता है, जिनमें से प्रत्येक का अलग काम और कौशल स्तर है:

  1. कांडिंस्की 5.0 इमेज लाइट (6B कलाकार): यह उच्च-रिज़ॉल्यूशन वाली स्थिर चित्र (still images) बनाने और मौजूदा फोटो को एडिट करने में विशेषज्ञ है।
  2. कांडिंस्की 5.0 वीडियो लाइट (2B कलाकार): एक हल्का, तेज़ काम करने वाला, जो 10 सेकंड के छोटे क्लिप बना सकता है। इन्हें इस परिवार का "स्पीडस्टर" (तेज़ दौड़ने वाला) समझें।
  3. कांडिंस्की 5.0 वीडियो प्रो (19B कलाकार): यह भारी वजन वाला चैंपियन है। यह एक विशाल मॉडल है जो उच्चतम गुणवत्ता वाले, सबसे विस्तृत 10 सेकंड के वीडियो बनाता है।

इस रिपोर्ट का मुख्य लक्ष्य यह दिखाना है कि उन्होंने इन कलाकारों को कैसे बनाया, उन्हें कैसे प्रशिक्षित किया, और उन्होंने उन्हें इतना तेज़ कैसे बनाया कि उन्हें आपके लिविंग रूम में सुपरकंप्यूटर की आवश्यकता न पड़े।


1. ट्रेनिंग कैंप: उन्होंने रचना करना कैसे सीखा

आप एक रोबोट को केवल एक खाली कैनवास देकर मास्टरपीस की उम्मीद नहीं कर सकते। पेपर में तीन मुख्य चरणों वाले एक कठोर "ट्रेनिंग कैंप" का विवरण दिया गया है:

  • चरण 1: प्री-ट्रेनिंग (द "वर्ल्ड टूर"):
    कल्पना कीजिए कि मॉडल छात्र एक विशाल फील्ड ट्रिप पर जा रहे हैं। उन्हें इंटरनेट से करोड़ों चित्र और वीडियो दिखाए जाते हैं। वे बुनियादी बातें सीखते हैं: बिल्ली कैसी दिखती है, पानी कैसे चलता है, सूर्यास्त कैसा महसूस होता है। यहीं पर वे दृश्य दुनिया की "व्याकरण" सीखते हैं।
  • चरण 2: सुपरवाइज्ड फाइन-ट्यूनिंग (द "आर्ट स्कूल"):
    फील्ड ट्रिप के बाद, वे एक सख्त आर्ट स्कूल में जाते हैं। यहाँ, मानव विशेषज्ञ कला के सबसे अच्छे, सबसे सुंदर उदाहरणों को हाथ से चुनते हैं। मॉडल इन आदर्श उदाहरणों पर अभ्यास करते हैं ताकि वे सीख सकें कि चीजों को केवल "ठीक-ठाक" के बजाय वास्तविक और सौंदर्यपूर्ण कैसे बनाया जाए।
  • चरण 3: "टेस्ट ऑफ टेस्ट" (RL पोस्ट-ट्रेनिंग):
    यह एक चतुर तकनीक है। मॉडल दो चित्र बनाता है। एक "जज" (रिवॉर्ड मॉडल) उन्हें देखता है और कहता है, "मुझे पहला वाला ज्यादा पसंद आया।" मॉडल फिर वह बनाना सीखता है जो जज को पसंद आता है। यह एक शेफ की तरह है जो अपने ही सूप को चखता है और मसालों को तब तक एडजस्ट करता है जब तक कि वह एकदम सही न हो जाए।

2. सीक्रेट सॉस: नए उपकरण और ट्रिक्स

पेपर बताता है कि इन मॉडल्स को बनाने के पुराने तरीके बहुत धीमे और बोझिल थे। उन्होंने चीजों को तेज़ और अधिक स्पष्ट बनाने के लिए नए उपकरणों का आविष्कार किया:

  • "स्मार्ट अटेंशन" मैकेनिज्म (NABLA):
    • समस्या: 10 सेकंड का वीडियो देखना ऐसा है जैसे किसी फिल्म के हर एक फ्रेम को एक साथ याद रखने की कोशिश करना। कंप्यूटर के लिए, यह एक पन्ने को पढ़ते समय अपने दिमाग में किताबों के पुस्तकालय को रखने जैसा है। यह बहुत भारी पड़ता है।
    • समाधान: उन्होंने NABLA नामक एक सिस्टम बनाया। कल्पना कीजिए कि एक लाइब्रेरियन आपके सवाल से संबंधित विशिष्ट अलमारियों को ही देखता है, न कि लाइब्रेरी की हर किताब को पढ़ता है। यह मॉडल को वीडियो के केवल महत्वपूर्ण हिस्सों पर ध्यान केंद्रित करने की अनुमति देता है, जिससे यह बिना गुणवत्ता खोए 2.7 गुना तेज़ हो जाता है।
  • "डिस्टिलेशन" प्रक्रिया (स्पीड-अप):
    • समस्या: उच्च-गुणवत्ता वाला वीडियो बनाने में आमतौर पर बहुत समय लगता है (जैसे शून्य से केक बनाना)।
    • समाधान: उन्होंने अपने मॉडल्स के "फ्लैश" संस्करण बनाए। इसे एक मास्टर शेफ की रेसिपी लेकर उसका "माइक्रोवेव मील" संस्करण बनाने के रूप में सोचें। यह मूल की तरह बहुत जटिल नहीं है, लेकिन 90% उतना ही अच्छा है और बहुत कम समय में तैयार हो जाता है। उन्होंने एक वीडियो बनाने के लिए आवश्यक स्टेप्स की संख्या को 100 से घटाकर केवल 16 कर दिया।

3. डेटा: लाइब्रेरी की सफाई

इससे पहले कि मॉडल सीख पाते, टीम को उस "लाइब्रेरी" की सफाई करनी थी जिससे वे सीख रहे थे।

  • फिल्टरिंग: उन्होंने धुंधली तस्वीरों, वॉटरमार्क वाले वीडियो और बहुत उबाऊ (स्थिर) या बहुत अराजक क्लिप्स को हटा दिया।
  • सांस्कृतिक कोड: उन्होंने विशेष रूप से रूसी संस्कृति (वास्तुकला, इतिहास, प्रकृति) से संबंधित डेटा एकत्र किया ताकि यह सुनिश्चित हो सके कि मॉडल इन विशिष्ट दृश्य शैलियों को समझता है, जिन्हें अक्सर अन्य वैश्विक मॉडल मिस कर देते हैं।
  • इंस्ट्रक्शन ट्यूनिंग: इमेज एडिटिंग मॉडल के लिए, उन्होंने "पहले और बाद के" (Before and After) जोड़ों का एक विशाल डेटासेट बनाया। यदि आपके पास कुत्ते की एक फोटो है और आप उसे बिल्ली में बदलना चाहते हैं, तो मॉडल ने बैकग्राउंड को समान रखते हुए फर को बदलने का सटीक तरीका सीखा।

4. परिणाम: वे कितने अच्छे हैं?

टीम ने केवल यह नहीं कहा कि "यह अच्छा है"; उन्होंने अन्य प्रसिद्ध मॉडल्स (जैसे Sora, Veo, और Wan) के खिलाफ इसका परीक्षण किया।

  • "ब्लाइंड टेस्ट ऑफ टेस्ट": इंसानों को बिना यह जाने कि कौन सा वीडियो किस मॉडल ने बनाया है, दो वीडियो अगल-बगल दिखाए गए। उन्हें विजेता चुनने के लिए कहा गया।
  • फैसला:
    • विजुअल क्वालिटी और मोशन: कांडिंस्की 5.0 (विशेष रूप से प्रो वर्जन) अक्सर Veo 3 और Wan जैसे प्रतिस्पर्धियों के मुकाबले जीता। वीडियो अधिक वास्तविक दिखे, गतिविधियाँ अधिक सहज थीं, और उनमें कम "ग्लिच" (जैसे अजीब चेहरे पिघलना) थे।
    • निर्देशों का पालन: पेपर स्वीकार करता है कि हालांकि कांडिंस्की चीजें वास्तविक दिखाने में बहुत अच्छा है, लेकिन कभी-कभी यह कुछ प्रतिस्पर्धियों (जैसे Veo 3) की तरह बहुत जटिल टेक्स्ट निर्देशों का पूरी तरह से पालन करने में संघर्ष करता है। यह एक ट्रेड-ऑफ है: बेहतर विजुअल्स, थोड़ा कम सटीक टेक्स्ट फॉलोइंग।
    • गति: इसके "फ्लैश" संस्करण अविश्वसनीय रूप से तेज़ हैं, जो इन्हें रियल-टाइम अनुप्रयोगों के लिए उपयोगी बनाते हैं।

5. "ओपन डोर" पॉलिसी

उन कंपनियों के विपरीत जो अपने सर्वश्रेष्ठ मॉडल्स को गुप्त रखती हैं, कांडिंस्की टीम सब कुछ रिलीज़ कर रही है।

  • वे कोड, ट्रेनिंग डेटा रेसिपी और अंतिम मॉडल्स को मुफ्त में (एक ओपन लाइसेंस के तहत) साझा कर रहे हैं।
  • वे कोड के अंदर सख्त "गार्डरेल्स" (सीमाएं) नहीं लगा रहे हैं, क्योंकि उनका मानना है कि उपयोगकर्ता इस बात के लिए जिम्मेदार होने चाहिए कि वे टूल का उपयोग कैसे करते हैं। हालांकि, वे स्पष्ट रूप से चेतावनी देते हैं कि उपयोगकर्ताओं को इसका उपयोग हेट स्पीच, डीपफेक या अवैध गतिविधियों के लिए नहीं करना चाहिए।

सारांश

कांडिंस्की 5.0 AI कलाकारों का एक नया, ओपन-सोर्स परिवार है। वे वीडियो डेटा को देखने के लिए एक स्मार्ट तरीके का उपयोग करते हैं ताकि तेज़ हो सकें, दिखने में अधिक वास्तविक होने के लिए एक कठोर प्रशिक्षण प्रक्रिया का उपयोग करते हैं, और क्लिप्स को जल्दी जेनरेट करने के लिए एक "स्पीड-अप" तकनीक का उपयोग करते हैं। हालांकि वे अभी भी जटिल टेक्स्ट निर्देशों का पालन करने की अपनी क्षमता को बेहतर बनाने पर काम कर रहे हैं, उन्होंने साबित कर दिया है कि वे दुनिया के सर्वश्रेष्ठ क्लोज्ड-सोर्स सिस्टमों की टक्कर के शानदार, उच्च-गुणवत्ता वाले चित्र और 10 सेकंड के वीडियो बना सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →