← नवीनतम पेपर
💻 computer science

Unified Multimodal Autoregressive Modeling with Shared Context-Visual Tokenizer is Key to Unification

UniAR एक एकीकृत ऑटोरेग्रेसिव फ्रेमवर्क पेश करता है जो विजुअल अंडरस्टैंडिंग और जनरेशन के बीच के अंतर को पाटने के लिए एक एकल डिस्क्रीट विजुअल टोकेनाइज़र का लाभ उठाता है, जो साझा संदर्भ (shared context), पैरेलल-बिटवाइज़ प्रेडिक्शन और डिफ्यूजन-आधारित डिकोडर के माध्यम से उच्च-सटीक इमेज सिंथेसिस और एडिटिंग को सक्षम बनाता है और मल्टीमॉडल बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Wujian Peng, Lingchen Meng, Yuxuan Cai, Xianwei Zhuang, Yuhuan Yang, Rongyao Fang, Chenfei Wu, Junyang Lin, Zuxuan Wu, Shuai Bai

प्रकाशित 2026-06-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wujian Peng, Lingchen Meng, Yuxuan Cai, Xianwei Zhuang, Yuhuan Yang, Rongyao Fang, Chenfei Wu, Junyang Lin, Zuxuan Wu, Shuai Bai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट कलाकार है। अतीत में, यदि आप चाहते थे कि यह रोबोट किसी चित्र को देखे और आपको बताए कि वह क्या देख रहा है, तो आपको "चश्मे" का एक विशेष जोड़ा (इमेज को डेटा में बदलने का एक विशिष्ट तरीका) उपयोग करना पड़ता था। लेकिन यदि आप चाहते थे कि रोबोट एक नया चित्र बनाए, तो आपको पूरी तरह से अलग "चश्मे" पर स्विच करना पड़ता था जो एक अलग भाषा बोलता था।

इसका मतलब यह था कि चित्र बनाने के बाद, रोबोट अपनी रचना को समझने के लिए तुरंत उसे "देख" नहीं सकता था। उसे अपने ड्राइंग को फिर से "देखने" वाले चश्मे के माध्यम से डालना पड़ता था और फिर उसे समझने की कोशिश करनी पड़ती थी। यह ऐसा था जैसे किसी ने फ्रेंच में पत्र लिखा हो, और फिर उसे खुद पढ़ने से पहले उसे अंग्रेजी में अनुवाद करना पड़े।

UniAR एक नया सिस्टम है जो इसे ठीक करता है क्योंकि यह रोबोट को देखने और बनाने दोनों के लिए केवल एक ही जोड़ी चश्मे देता है।

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. सार्वभौमिक अनुवादक (The Visual Tokenizer)

आमतौर पर, कंप्यूटर छवियों को छोटे पहेली के टुकड़ों में तोड़ देते हैं जिन्हें "टोकन" कहा जाता है।

  • समस्या: पुराने सिस्टम पहेली के दो अलग-अलग सेटों का उपयोग करते थे। एक सेट बिल्ली (उच्च-स्तरीय अर्थ) को पहचानने में बहुत अच्छा था, लेकिन फर की बनावट (निम्न-स्तरीय विवरण) दिखाने में खराब था। दूसरा सेट फर बनाने के लिए तो बेहतरीन था, लेकिन इस बात को लेकर भ्रमित रहता था कि वास्तव में "बिल्ली" क्या होती है।
  • UniAR समाधान: उन्होंने एक एकल अनुवादक बनाया है जो छवियों को बाइनरी बिट्स (सिर्फ 0 और 1) से बने एक विशेष कोड में बदल देता है, जैसे कि एक विशाल डिजिटल मोर्स कोड।
    • उपमा: कल्पना कीजिए कि सामान्य डिक्शनरी के 10,000 शब्दों के बजाय, यह रोबोट एक ऐसे कोड का उपयोग करता है जहाँ हर शब्द 0 और 1 का 64-अंकों का संयोजन है। यह एक ऐसी विशाल शब्दावली (2642^{64}) बनाता है जो बिना किसी विशाल डिक्शनरी के लगभग कुछ भी वर्णित कर सकती है।
    • जादुई ट्रिक: यह अनुवादक छवि को विभिन्न "गहराइयों" पर देखता है। यह मोटा आकार (जैसे एक गहरी परत) और बारीक विवरण जैसे बनावट (जैसे एक उथली परत) दोनों को एक साथ देखता है। यह रोबोट को उसी कोड का उपयोग करके छवि को समझने और उसे पूरी तरह से बनाने, दोनों में सक्षम बनाता है।

2. तेज़ लेखक (Parallel Bitwise Prediction)

एक बार जब छवि उस 0 और 1 के कोड में बदल जाती है, तो रोबोट को उसे एक-एक बिट करके लिखना होता है।

  • समस्या: पूरे चित्र को बिट-दर-बिट लिखना अविश्वसनीय रूप से धीमा है। यह एक उपन्यास को एक समय में एक अक्षर लिखने जैसा है, और अगला अक्षर लिखने से पहले स्याही सूखने का इंतज़ार करने जैसा है।
  • UniAR समाधान: एक समय में एक बिट लिखने के बजाय, रोबोट एक साथ बिट्स के समूहों को लिखता है।
    • उपमा: कल्पना कीजिए कि एक टाइपिस्ट जो पहले एक अक्षर टाइप करता था और फिर रुक जाता था। अब, वे एक ही कीस्ट्रोक में पूरा शब्द (या यहाँ तक कि एक छोटा वाक्य) टाइप कर सकते हैं। यह रोबोट को चित्र बनाने में 32 गुना तेज़ बनाता है क्योंकि यह कोड के टुकड़ों की भविष्यवाणी एक साथ करता है।

3. चित्रकार (The Visual Decoder)

रोबोट कोड (0 और 1) लिखता है, लेकिन वह अभी चित्र नहीं है। उसे उस कोड को वास्तविक चित्र में बदलने के लिए एक चित्रकार की आवश्यकता होती है।

  • नवाचार: रोबोट कोड लिखता है, और एक अलग "चित्रकार" (डिफ्यूजन ट्रांसफार्मर) उस कोड को लेता है और चित्र पेंट करता है।
  • दक्षता: रोबोट को हर एक पिक्सेल लिखने की आवश्यकता नहीं होती है। वह छवि का एक छोटा, संकुचित संस्करण लिखता है, और चित्रकार उसे एक उच्च-रिज़ॉल्यूशन की उत्कृष्ट कृति (जैसे 1024x1024 पिक्सेल) में "अपस्केल" करता है। इससे रोबोट का काम हल्का और तेज़ रहता है।

यह रोबोट क्या कर सकता है?

क्योंकि रोबोट देखने और बनाने दोनों के लिए एक ही "मस्तिष्क" और "भाषा" का उपयोग करता है, इसलिए इसमें कुछ नई क्षमताएं हैं:

  • स्व-सुधार और बातचीत: आप रोबोट से कह सकते हैं, "पानी पर एक नाव बनाओ।" वह इसे बनाता है। फिर, बिना इमेज को दोबारा स्कैन किए, आप पूछ सकते हैं, "क्या नाव नीली है?" या "बैकग्राउंड को बीच (समुद्र तट) में बदल दें।" रोबोट अपनी ड्राइंग को तुरंत समझ लेता है क्योंकि उसने इसे बनाने और पढ़ने के लिए एक ही भाषा का उपयोग किया है।
  • टेक्स्ट रेंडरिंग: यह छवियों के अंदर टेक्स्ट बनाने में बहुत अच्छा है (जैसे चित्र में साइनबोर्ड पर "Hello" लिखना), जो आमतौर पर AI के लिए बहुत कठिन होता है।
  • संपादन (Editing): यह आपकी ہدशों के आधार पर वस्तुओं को बदल सकता है (जैसे बकरी को खरगोश में बदलना) या रंगों को बदल सकता है।

इसे कैसे प्रशिक्षित किया गया?

उन्होंने रोबोट को तीन चरणों में सिखाया:

  1. पढ़ने और लिखने की बुनियादी बातें: उन्होंने इसे सार्वभौमिक कोड सीखने के लिए भारी मात्रा में डेटा (टेक्स्ट और इमेज) खिलाया।
  2. फाइन-ट्यूनिंग: उन्होंने इसे उच्च-गुणवत्ता वाले उदाहरण दिखाए ताकि यह सुनिश्चित हो सके कि यह निर्देशों का अच्छी तरह से पालन करता है।
  3. रीइन्फोर्समेंट लर्निंग (अभ्यास का चरण): उन्होंने रोबोट को चित्र बनाने की कोशिश करने दी, जांचा कि परिणाम कितना अच्छा था (एक रिवॉर्ड सिस्टम का उपयोग करके), और उसे अपनी गलतियों से सीखने दिया। इसने इसके टेक्स्ट रेंडरिंग और निर्देश पालन को और भी सटीक बनाया।

निचोड़ (The Bottom Line)

UniAR एक बड़ी सफलता है क्योंकि इसने "समझने" और "बनाने" को दो अलग-अलग कार्यों के रूप में मानना बंद कर दिया है। एक एकल, कुशल, बाइनरी-आधारित कोड का उपयोग करके, रोबोट अब एक निरंतर, निर्बाव प्रवाह में सोच, बना और अपने चित्रों के बारे में बात कर सकता है, जबकि यह पिछले मॉडलों की तुलना में अधिक तेज़ और सटीक है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →