← नवीनतम पेपर
🤖 AI

UniWeTok: An Unified Binary Tokenizer with Codebook Size 2128\mathit{2^{128}} for Unified Multimodal Large Language Model

UniWeTok एक एकीकृत बाइनरी टोकेनाइज़र है जिसमें एक विशाल 21282^{128} कोडबुक, SigLu एक्टिवेशन के साथ एक कनवल्शन-अटेंशन हाइब्रिड आर्किटेक्चर, और एक नवीन तीन-चरणीय प्रशिक्षण ढांचा है जो मौजूदा मॉडलों की तुलना में काफी कम कम्प्यूटेशनल लागत के साथ इमेज जनरेशन और मल्टीमॉडल अंडरस्टैंडिंग में अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Shaobin Zhuang, Yuang Ai, Jiaming Han, Weijia Mao, Xiaohui Li, Fangyikang Wang, Xiao Wang, Yan Li, Shanchuan Lin, Kun Xu, Zhenheng Yang, Huaibo Huang, Xiangyu Yue, Hao Chen, Yali Wang

प्रकाशित 2026-03-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shaobin Zhuang, Yuang Ai, Jiaming Han, Weijia Mao, Xiaohui Li, Fangyikang Wang, Xiao Wang, Yan Li, Shanchuan Lin, Kun Xu, Zhenheng Yang, Huaibo Huang, Xiangyu Yue, Hao Chen, Yali Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट (एक लार्ज लैंग्वेज मॉडल) को देखना, समझना और कला बनाना सिखाने की कोशिश कर रहे हैं। सबसे बड़ी समस्या यह है कि कंप्यूटर छवियों को लाखों छोटे रंगीन बिंदुओं (पिक्सेल) के रूप में "देखते" हैं। एक-एक करके हर पिक्सेल की भविष्यवाणी करने की कोशिश करना एक पेंटिंग का वर्णन समुद्र तट पर रेत के हर एक कण के रंग की सूची बनाकर करने जैसा है। यह बहुत धीमा, महंगा है, और रोबोट भ्रमित हो जाता है।

इसे ठीक करने के लिए, शोधकर्ता एक टोकनाइज़र (Tokenizer) का उपयोग करते हैं। टोकनाइज़र को एक अनुवादक के रूप में समझें जो एक जटिल छवि को "कोड शब्दों" (टोकन) के एक छोटे, सरल वाक्य में बदल देता है जिसे रोबोट आसानी से समझ और भविष्यवाणी कर सकता है।

हालाँकि, मौजूदा अनुवादकों के साथ एक समस्या है: वे या तो छवि के अर्थ को समझाने में बहुत अच्छे हैं (समझने के लिए अच्छे) लेकिन चित्र बनाने में खराब हैं (बनाने के लिए खराब), या वे चित्र बनाने में बहुत अच्छे हैं लेकिन सारा अर्थ खो देते हैं। यह एक ऐसे अनुवादक की तरह है जो या तो सूर्यास्त के बारे में एक सुंदर कविता लिख सकता है लेकिन सूरज नहीं बना सकता, या वह एक सटीक सूरज बना सकता है लेकिन यह नहीं बता सकता कि उसे देखते समय कैसा महसूस होता है।

UniWeTok वह नया अनुवादक है जो अंततः यह दोनों काम पूरी तरह से करता है। यह इस प्रकार काम करता है, कुछ मजेदार उपमाओं का उपयोग करते हुए:

1. विशाल शब्दकोश (The 21282^{128} Codebook)

कल्पना कीजिए कि आपके पास एक शब्दकोश है। अधिकांश शब्दकोशों में कुछ हज़ार शब्द होते हैं। UniWeTok का शब्दकोश इतना विशाल है कि इसमें 21282^{128} शब्द हैं।

  • उपमा: यदि एक सामान्य शब्दकोश एक छोटा पुस्तकालय है, तो UniWeTok का शब्दकोश पूरे इंटरनेट के आकार के पुस्तकालय जैसा है।
  • यह क्यों मायने रखता है: क्योंकि शब्दकोश इतना बड़ा है, प्रत्येक "शब्द" (टोकन) भारी मात्रा में जानकारी रख सकता है। UniWeTok का एक एकल शब्द एक जटिल बनावट (texture), एक विशिष्ट चेहरा, या एक पूरा दृश्य वर्णित कर सकता है, जबकि अन्य मॉडलों को एक ही बात कहने के लिए सैकड़ों शब्दों की आवश्यकता होती है। यह रोबोट को बहुत तेज़ और अधिक कुशल बनाता है।

2. "प्री-पोस्ट" अध्ययन सत्र (Pre-Post Distillation)

यह सुनिश्चित करने के लिए कि रोबोट यह समझ सके कि वह क्या देख रहा है, शोधकर्ताओं ने एक "शिक्षक-छात्र" पद्धति का उपयोग किया।

  • उपमा: कल्पना कीजिए कि एक छात्र (UniWeTok) एक पेंटिंग के बारे में सीखने की कोशिश कर रहा है।
    • प्री-डिस्टिलेशन (Pre-Distillation): पेंटिंग देखने से पहले, छात्र एक विशेषज्ञ कला समीक्षक को उस कृति के भाव और अर्थ का वर्णन करते हुए सुनता है।
    • पोस्ट-डिस्टिलेशन (Post-Distillation): पेंटिंग को याददाश्त से फिर से बनाने के बाद, विशेषज्ञ उसके काम की जाँच करता है और कहता है, "तुमने रंगों को सही पकड़ा, लेकिन तुम भावना को चूक गए।"
  • परिणाम: कार्य से पहले और बाद में विशेषज्ञ को सुनने से, छात्र विवरण और गहरे अर्थ दोनों को एक साथ पकड़ना सीख जाता है।

3. "जेनरेटिव" कोच (Generative-Aware Prior)

आमतौर पर, मॉडल छवियों को समझना सीखते हैं, लेकिन वे उन्हें बनाना भूल जाते हैं।

  • उपमा: कल्पना कीजिए कि एक शेफ जो भोजन चखने में बहुत अच्छा है (समझना) लेकिन उसने कभी भोजन पकाया नहीं है (बनाना)। UniWetok एक "जेनरेटिव कोच" को काम में नियुक्त करता है जो अभ्यास के दौरान शेफ के कान में फुसफुसाता है: "हे, याद रखो, तुम्हें बाद में इसे पकाना भी होगा, इसलिए सामग्री को ताजा और व्यवस्थित रखें।"
  • परिणाम: मॉडल छवि डेटा को इस तरह से व्यवस्थित करना सीखता है जिससे बाद में नई छवियां बनाना आसान हो जाता है, बिना अपनी वर्तमान छवि को समझने की क्षमता को खोए।

4. हाइब्रिड इंजन (Convolution-Attention + SigLu)

UniWeTok का मस्तिष्क अलग तरह से बना है।

  • उपमा: एक शहर को देखने के बारे में सोचें।
    • कन्वोल्यूशन (Convolution) व्यक्तिगत इमारतों की ईंटों और गारे (स्थानीय विवरण) को देखने जैसा है।
    • अटेंशन (Attention) पूरे शहर के तालमेल को देखने के लिए स्काईलाइन को देखने जैसा है (ग्लोबल कॉन्टेक्स्ट)।
    • UniWeTok एक ही समय में दोनों का उपयोग करता है।
  • SigLu एक्टिवेशन: यह एक विशेष "ब्रेक" सिस्टम है। पिछले मॉडलों में, विवरण और अर्थ को एक साथ सीखने की कोशिश करने से मस्तिष्क भ्रमित हो जाता था और क्रैश हो जाता था (ऑप्टिमाइज़ेशन संघर्ष)। SigLu एक स्मार्ट गवर्नर की तरह काम करता है जो इंजन को सुचारू रूप से चलाने में मदद करता है, यह सुनिश्चित करता है कि मॉडल विशाल शब्दकोश से अभिभूत न हो जाए।

5. तीन-चरणीय प्रशिक्षण (Curriculum Learning)

आप एक बच्चे को पीएचडी थीसिस से पढ़ना नहीं सिखाते। आप पिक्चर बुक्स से शुरू करते हैं, फिर चैप्टर बुक्स, और फिर जटिल उपन्यास।

  • चरण 1: मॉडल छोटी, सरल छवियों (256x256 पिक्सेल) पर सीखता है।
  • चरण 2: यह विभिन्न आकारों और आकृतियों की छवियों को संभालना सीखता है।
  • चरण 3: इसे मानव चेहरे और टेक्स्ट जैसी कठिन चीजों पर "विशेष प्रशिक्षण" दिया जाता है, जिन्हें सही करना मुश्किल होता है।

बड़ी जीत

परिणामस्वरूप एक ऐसा मॉडल मिलता है जो तेज़, सस्ता और स्मार्ट है।

  • दक्षता (Efficiency): यह अन्य शीर्ष मॉडलों की तुलना में एक छवि का वर्णन करने के लिए 75% कम टोकन (शब्दों) का उपयोग करता है।
  • गुणवत्ता (Quality): यह ऐसी छवियां उत्पन्न कर सकता है जो लगभग पूर्ण दिखती हैं (पिछले सर्वश्रेष्ठ मॉडलों को पछाड़ते हुए) और छवियों के बारे में जटिल प्रश्नों को समझ सकता है।
  • बहुमुखी प्रतिभा (Versatility): यह एक ही मस्तिष्क का उपयोग करके किसी छवि के बारे में चैट कर सकता है, शून्य से एक नई छवि बना सकता है, या मौजूदा छवि को संपादित कर सकता है (जैसे बिल्ली के रंग को गुलाबी में बदलना)।

संक्षेप में: UniWeTok विज़न (दृष्टि) के क्षेत्र में "स्विस आर्मी नाइफ" है। यह केवल देखता नहीं है; यह छवि के पीछे की कहानी को समझता है और उतनी ही अच्छी तरह से एक नई पेंटिंग भी बना सकता है, और वह भी अपने प्रतिस्पर्धियों की तुलना में बहुत कम कंप्यूटर पावर का उपयोग करके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →