← नवीनतम पेपर
🤖 AI

Dynin-Omni: Omnimodal Unified Large Diffusion Language Model

Dynin-Omni पहला मास्क्ड-डिफ्यूजन-आधारित ओम्नीमोडल फाउंडेशन मॉडल है जो एक ही आर्किटेक्चर के भीतर टेक्स्ट, इमेज, स्पीच और वीडियो की समझ और जनरेशन को एकीकृत करता है, जो विविध मल्टीमॉडल बेंचमार्क में अत्याधुनिक प्रदर्शन प्राप्त करने के साथ-साथ किसी भी-से-किसी (any-to-any) मॉडलिंग के लिए एक एकीकृत प्रतिमान के रूप में मास्क्ड डिफ्यूजन की क्षमता प्रदर्शित करता है।

मूल लेखक: Jaeik Kim, Woojin Kim, Jihwan Hong, Yejoon Lee, Sieun Hyeon, Mintaek Lim, Yunseok Han, Dogeun Kim, Hoeun Lee, Hyunggeun Kim, Jaeyoung Do

प्रकाशित 2026-04-02
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jaeik Kim, Woojin Kim, Jihwan Hong, Yejoon Lee, Sieun Hyeon, Mintaek Lim, Yunseok Han, Dogeun Kim, Hoeun Lee, Hyunggeun Kim, Jaeyoung Do

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक स्विस आर्मी नाइफ (Swiss Army knife) है। आमतौर पर, इन औजारों में हर काम के लिए एक विशिष्ट ब्लेड होता है: पेच के लिए स्क्रूड्राइवर, बोतलों के लिए कॉर्कस्क्रू और काटने के लिए चाकू। यदि आप एक बोतल खोलना चाहते हैं, तो आपको कॉर्कस्क्रू को खोलना होगा, उसका उपयोग करना होगा, और फिर चाकू तक पहुँचने के लिए उसे वापस मोड़ना होगा। यह काम करता है, लेकिन यह थोड़ा झंझट भरा है और इसमें आपको लगातार टूल्स बदलने पड़ते हैं।

Dynin-Omni एक जादुई, एकल-खंड (single-piece) टूल की तरह है जो सब कुछ—काटना, पेंच कसना और कॉर्क निकालना—एक साथ कर सकता है, बिना किसी दूसरे हिस्से को खोले। यह एक नए प्रकार का आर्टिफिशियल इंटेलिजेंस है जो केवल टेक्स्ट को "पढ़ता" नहीं है, या इमेज को "देखता" नहीं है, या स्पीच को "सुनता" नहीं है। इसके बजाय, यह एक ही, एकीकृत मस्तिष्क का उपयोग करके इन सभी को एक साथ समझता है और बनाता है।

यह कैसे काम करता है और यह इतना महत्वपूर्ण क्यों है, इसका एक सरल विवरण यहाँ दिया गया है:

1. पुराना तरीका: असेंबली लाइन (Autoregressive Models)

अधिकांश वर्तमान AI मॉडल एक सख्त असेंबली लाइन या एक व्यक्ति की तरह काम करते हैं जो एक बार में एक शब्द लिखता है। वे आगे नहीं देख सकते; वे केवल जो पहले आया है उसके आधार पर अगले शब्द का अनुमान लगा सकते हैं।

  • समस्या: यह एक वाक्य लिखने के लिए तो बहुत अच्छा है, लेकिन इमेज या संगीत जैसी चीजों के लिए बहुत खराब है। एक इमेज किसी कहानी की तरह नहीं होती जिसका कोई "शुरुआत" और "अंत" हो। यह एक पूरी तस्वीर एक साथ होती है। AI को बाएं से दाएं एक-एक पिक्सेल करके इमेज बनाने के लिए मजबूर करना वैसा ही है जैसे किसी को केवल एक समय में एक छोटा सा बिंदु लगाने की अनुमति देकर एक उत्कृष्ट कृति (masterpiece) पेंट करने की कोशिश करना, वह भी सख्ती से बाएं से दाएं। यह धीमा है और रचनात्मकता को सीमित करता है।
  • हाइब्रिड समाधान: कुछ नए मॉडल इस समस्या को ठीक करने के लिए एक "टीम" दृष्टिकोण का उपयोग करने का प्रयास करते हैं। उनके पास एक टेक्स्ट ब्रेन होता है जो एक अलग इमेज ब्रेन से बात करता है, जो एक स्पीच ब्रेन से बात करता है। यह एक कंडक्टर की तरह है जो तीन अलग-अलग ऑर्केस्ट्रा का प्रबंधन कर रहा है। यह काम तो करता है, लेकिन यह जटिल है, और ऑर्केस्ट्रा हमेशा एक साथ तालमेल में नहीं बज पाते।

2. नया तरीका: "स्क्रैच एंड स्निफ" गेम (Masked Diffusion)

Dynin-Omni एक अलग रणनीति का उपयोग करता है जिसे Masked Diffusion कहा जाता है। कल्पना कीजिए कि आपके पास एक वाक्य, एक चित्र या एक गाना है, और कोई उसके 50% हिस्से को काले टेप से ढक देता है (मास्क कर देता है)।

  • खेल: AI का काम दिखाई देने वाले हिस्सों को देखना और यह अनुमान लगाना है कि टेप के नीचे क्या है।
  • जादू: असेंबली लाइन के विपरीत, AI एक ही समय में पूरी तस्वीर को देख सकता है। यह शुरुआत, मध्य और अंत का अनुमान एक साथ लगा सकता है। फिर, यह उत्तर का थोड़ा सा हिस्सा प्रकट करता है, इसे फिर से ढकता है, और अपने अनुमान को और बेहतर बनाता है। यह बार-बार ऐसा करता है, हर दौर के साथ स्पष्ट और स्पष्ट होता जाता है, जब तक कि पूरी इमेज, टेक्स्ट या साउंड एकदम सही न हो जाए।

क्योंकि यह "भविष्य" और "अतीत" दोनों को एक साथ देख सकता है, यह बहुत अधिक स्वाभाविक और सुसंगत परिणाम बनाता है, विशेष रूप से इमेज और स्पीच जैसी चीजों के लिए जिनका कोई सख्त क्रम नहीं होता।

3. "एक भाषा" वाला तरीका (The "One Language" Trick)

AI के साथ सबसे बड़ी चुनौती यह है कि टेक्स्ट, इमेज और साउंड सभी अलग-अलग "भाषाएं" हैं।

  • Dynin-Omni का समाधान: यह सब कुछ "टोकन्स" (डिजिटल बिल्डिंग ब्लॉक्स) के एक एकल, साझा वर्णमाला में अनुवादित करता है।
    • एक शब्द एक टोकन है।
    • एक इमेज का एक छोटा सा हिस्सा एक टोकन है।
    • ध्वनि का एक छोटा सा हिस्सा एक टोकन है।
  • परिणाम: AI को किसी विशेष "इमेज ब्रेन" या "स्पीच ब्रेन" की आवश्यकता नहीं है। यह केवल टोकन्स की एक लंबी स्ट्रिंग देखता है। चाहे वह किताब पढ़ रहा हो, वीडियो का वर्णन कर रहा हो, या गाना गा रहा हो, यह बस गायब टोकन्स को भरने जैसा है। यह इसे सहजता से मिक्स और मैच करने की अनुमति देता है। उदाहरण के लिए, आप उससे "ओपेरा गाती हुई बिल्ली की तस्वीर बनाने" के लिए कह सकते हैं, और वह समझ जाता है कि "बिल्ली" वाला हिस्सा और "गाना" वाला हिस्सा एक ही वाक्य में अलग-अलग प्रकार के टोकन हैं।

4. उन्होंने इसे कैसे सिखाया (तीन-चरणीय प्रशिक्षण)

एक साथ सब कुछ करने के लिए मॉडल को सिखाना कठिन है। यदि आप एक बच्चे को एक साथ एक स्विमिंग पूल, एक गहरे समुद्र और एक जैज़ बैंड के बीच डाल देंगे, तो वह डूब सकता है या भ्रमित हो सकता है। शोधकर्ताओं ने एक स्मार्ट, तीन-चरणीय प्रशिक्षण रेसिपी का उपयोग किया:

  1. चरण 1: "नया छात्र" चरण: उन्होंने पहले मॉडल को नई "भाषाओं" (वीडियो और स्पीच) को संभालने के लिए सिखाया, जिसमें सरल कार्यों पर ध्यान केंद्रित किया गया, जैसे स्पीच को टेक्स्ट में बदलना। उन्होंने अभी उससे जटिल तर्क (reasoning) की उम्मीद नहीं की।
  2. चरण 2: "विलय" चरण: यह बहुत चतुर हिस्सा है। जब उन्होंने स्पीच और वीडियो जोड़ा, तो मॉडल अच्छी अंग्रेजी लिखना या अच्छी तस्वीरें बनाना भूलने लगा (जिसे "कैटास्ट्रोफिक फॉरगेटिंग" कहा जाता है)। इसे ठीक करने के लिए, उन्होंने Modality-Disentangled Merging नामक तकनीक का उपयोग किया।
    • उपमा: कल्पना कीजिए कि आपके पास एक मास्टर शेफ है जो खाना बनाने में माहिर है। आपने एक नया सहायक शेफ नियुक्त किया है जो बेकिंग में माहिर है। मास्टर शेफ को निकालने या उसकी जगह लेने के बजाय, आप उनके कौशल को सावधानीपूर्वक मिलाते हैं। आप मास्टर शेफ के चाकू चलाने के कौशल (टेक्स्ट/इमेज) को बनाए रखते हैं और उसमें सहायक शेफ का बेकिंग ज्ञान (स्पीच/वीडियो) जोड़ते हैं, बिना मूल रेसिपी को बिगाड़े।
  3. चरण 3: "मास्टर क्लास" चरण: अब जब मॉडल सभी भाषाएं जानता है, तो उन्होंने इसे जीनियस बनाया। उन्होंने इसे कठिन लॉजिक पहेलियाँ, हाई-रेज़ोल्यूशन इमेज और लंबे भाषण दिए ताकि यह अधिक स्मार्ट और सटीक बन सके।

5. यह क्यों मायने रखता है

  • यह तेज़ और स्मार्ट है: क्योंकि इसे एक टोकन खत्म होने का इंतज़ार नहीं करना पड़ता, यह जटिल आउटपुट बहुत तेज़ी से बना सकता है।
  • यह एकीकृत है: आपको टेक्स्ट, इमेज और वॉयस के लिए अलग-अलग AI टूल्स बदलने की ज़रूरत नहीं है। एक ही मॉडल सब कुछ करता है।
  • यह ओपन सोर्स है: रचनाकारों ने कोड और मॉडल को सभी के उपयोग के लिए उपलब्ध कराया है, जो इतनी शक्तिशाली तकनीक के लिए दुर्लभ है।

संक्षेप में: Dynin-Omni पहला AI है जो टेक्स्ट, इमेज, वीडियो और स्पीच को एक ही शहर के समान नागरिक के रूप में मानता है, न कि उन्हें अलग-अलग मोहल्लों में रहने के लिए मजबूर करता है। "एक-एक शब्द" के सख्त नियम के बजाय "अनुमान और सुधार" के खेल का उपयोग करके, यह एक अधिक लचीला, शक्तिशाली और मानव जैसा इंटेलिजेंस बनाता है जो एक साथ सब कुछ समझ और बना सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →