← नवीनतम पेपर
💻 computer science

Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens

यह शोध पत्र क्यूबिक डिस्क्रीट डिफ्यूजन (CubiD) को प्रस्तुत करता है, जो सभी आयामों में सूक्ष्म-स्तरीय मास्किंग (fine-grained masking) का उपयोग करके उच्च-आयामी दृश्य निरूपणों (high-dimensional visual representations) पर कार्य करने में सक्षम पहला डिस्क्रीट जनरेशन मॉडल है, जिससे यह अत्याधुनिक प्रदर्शन प्राप्त करते हुए एक एकीकृत मल्टीमॉडल आर्किटेक्चर को सक्षम बनाता है जो समझ और जनरेशन दोनों कार्यों का समर्थन करता है।

मूल लेखक: Yuqing Wang, Chuofan Ma, Zhijie Lin, Yao Teng, Lijun Yu, Shuai Wang, Jiaming Han, Jiashi Feng, Yi Jiang, Xihui Liu

प्रकाशित 2026-03-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuqing Wang, Chuofan Ma, Zhijie Lin, Yao Teng, Lijun Yu, Shuai Wang, Jiaming Han, Jiashi Feng, Yi Jiang, Xihui Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कंप्यूटर को चित्र बनाना सिखाना चाहते हैं। लंबे समय से, कंप्यूटर उन कलाकारों की तरह रहे हैं जो केवल 8 से 32 रंगों के एक बहुत ही छोटे और सीमित पैलेट के साथ पेंट करना जानते हैं। वे अच्छे रेखाचित्र तो बना सकते हैं, लेकिन वे उन समृद्ध और गहरे विवरणों को खो देते हैं जो एक पेंटिंग को वास्तविक और अर्थपूर्ण बनाते हैं।

दूसरी ओर, कंप्यूटर सैकड़ों रंगों (768 से 1,024 आयामों) वाली एक विशाल, हाई-डेफिनिशन "मानसिक लाइब्रेरी" का उपयोग करके चित्रों को समझने में पहले से ही बहुत माहिर हैं। लेकिन वे इस समृद्ध लाइब्रेरी का उपयोग चित्र बनाने के लिए नहीं कर पा रहे थे क्योंकि इसकी गणित बहुत कठिन थी। यह ऐसा था जैसे आपके पास लाखों किताबों की एक लाइब्रेरी हो, लेकिन आपको एक नई कहानी लिखने के लिए केवल एक बार में एक वाक्य, एक विशिष्ट क्रम में पढ़ने की अनुमति हो। इसमें बहुत समय लगता।

CubiD एक नया आविष्कार है जो इस समस्या को हल करता है। यह कैसे काम करता है, इसके लिए कुछ सरल उपमाओं का उपयोग करते हैं:

1. समस्या: "एक-बार-में-एक-शब्द" की बाधा

कल्पना कीजिए कि आपके पास लेगो (Lego) ब्रिक्स से बना एक विशाल 3D क्यूब है। यह क्यूब एक चित्र का प्रतिनिधित्व करता है।

  • पुरानी विधि (Autoregressive): कल्पना कीजिए कि आपको इस क्यूब को एक समय में एक सिंगल ब्रिक रखकर, एक सख्त रेखा में बनाना है। यदि आपके क्यूब में 200,000 ब्रिक्स हैं (जो कि इस नए सिस्टम में एक उच्च-गुणवत्ता वाले चित्र जैसा दिखता है), तो आपको इसे पूरा करने के लिए 200,000 चरणों का इंतजार करना होगा। यह बहुत धीमा है।
  • "लो-डिम" (Low-Dim) शॉर्टकट: चीजों को तेज करने के लिए, पिछली विधियों ने क्यूब को एक छोटे, कम-रिज़ॉल्यूशन वाले पैनकेक (केवल 8-32 रंगों) में दबा दिया। यह तेज़ था, लेकिन इसमें आपने मूल चित्र के सभी सूक्ष्म विवरण और "अर्थ" खो दिए।

2. समाधान: क्यूबिक डिस्क्रीट डिफ्यूजन (Cubic Discrete Diffusion - CubiD)

इस पेपर के लेखकों ने CubiD के माध्यम से एक चतुर तरीका निकाला जिससे उस विशाल 3D लेगो क्यूब को बिना 200,000 चरणों का इंतजार किए बनाया जा सके।

"फाइन-ग्रेन्ड मास्किंग" (Fine-Grained Masking) की उपमा:
कल्पना कीजिए कि आपके पास एक विशाल, खाली 3D क्यूब है जहाँ हर एक छोटा ब्रिक एक सफेद चादर (एक "मास्क") से ढका हुआ है। आप अभी कुछ भी नहीं देख सकते।

  • एक रेखा में एक-एक करके ब्रिक्स को खोलने के बजाय, CubiD एक जादुвई इरेज़र (eraser) की तरह काम करता है जो एक ही बार में क्यूब के किसी भी हिस्से से कोई भी सफेद चादर हटा सकता है।
  • यह उन कुछ ब्रिक्स को देखता है जो पहले से ही दिखाई दे रहे हैं और अनुमान लगाता है कि अन्य चादरों के नीचे छिपे हुए ब्रिक्स क्या होने चाहिए।
  • यह कुछ और चादरें हटाता है, फिर से अनुमान लगाता है, और इस प्रक्रिया को दोहराता है।

यह विशेष क्यों है?

  • "क्यूबिक" वाला हिस्सा: अधिकांश पिछली विधियों ने चित्र को एक सपाट ग्रिड के रूप में माना। CubiD इसे एक वास्तविक 3D वस्तु (ऊंचाई × चौड़ाई × गहराई) के रूप में मानता है। यह समझता है कि एक ही स्थान पर मौजूद "गहराई" (768 विभिन्न विशेषताएं) आपस में जुड़ी हुई हैं। यह केवल एक पूरे स्थान का अनुमान एक साथ नहीं लगाता; यह व्यक्तिगत "आयामों" (जैसे रंग, फिर बनावट, फिर आकार का अनुमान लगाना) का स्वतंत्र रूप से लेकिन समानांतर रूप से अनुमान लगाता है।
  • गति: क्योंकि यह एक ही समय में कई ब्रिक्स को उजागर करता है, इसे पूरा चित्र बनाने के लिए केवल कुछ सौ चरणों की आवश्यकता होती है, चाहे क्यूब कितना भी बड़ा क्यों न हो। यह 200,000 चरणों के मैराथन को 200 चरणों की स्प्रिंट में बदल देता है।

3. "जादुई अनुवादक" (Quantization)

एक डर था कि यदि आप इन हाई-डेफिनिशन 768-आयामी विशेषताओं का उपयोग करने की कोशिश करेंगे, तो कंप्यूटर भ्रमित हो जाएगा और चित्र स्थिर शोर (static noise) जैसा दिखने लगेगा।

  • यह पेपर एक "जादुई अनुवादक" पेश करता है जिसे डायमेंशन-वाइज क्वांटाइजेशन (Dimension-wise Quantization) कहा जाता है।
  • इसे एक जटिल वाक्य को एक सरल कोड में अनुवादित करने की तरह समझें। पूरे वाक्य को एक साथ अनुवाद करने के बजाय (जो कठिन है), यह प्रत्येक शब्द को व्यक्तिगत रूप से अनुवादित करता है।
  • यह कंप्यूटर को समृद्ध, हाई-डेफिनिशन विवरणों ( "अर्थ") को बनाए रखने में सक्षम बनाता है, बिना इस क्षमता को खोए कि उन्हें एक डिस्क्रीट कोड में बदला जा सके जिसका उपयोग जनरेटर कर सके।

4. परिणाम: दो कामों के लिए एक ही दिमाग

इस पेपर का सबसे रोमांचक हिस्सा यह है कि उन्होंने सिद्ध किया कि यह नई विधि समझने और बनाने दोनों के लिए काम करती है।

  • पहले: आपको एक चित्र को समझने के लिए (समृद्ध 768-डिम लाइब्रेरी का उपयोग करके) एक दिमाग और उसे बनाने के लिए (8-डिम पैनकेक का उपयोग करके) एक अलग, सरल दिमाग की आवश्यकता थी।
  • अब: CubiD के साथ, आप दोनों करने के लिए एक ही समृद्ध, हाई-डेफिनिशन टोकन का उपयोग कर सकते हैं। कंप्यूटर एक चित्र को देख सकता है, उसे गहराई से समझ सकता है, और फिर उसी गहरी समझ का उपयोग करके एक नया चित्र बना सकता है।

संक्षेप में

CubiD ऐसा है जैसे कंप्यूटर को 768 रंगों के पूर्ण, हाई-डेफिनिशन पैलेट के साथ पेंट करना सिखाना, लेकिन एक समय में एक छोटे बिंदु के बजाय, यह स्मार्ट, समानांतर विस्फोटों (parallel bursts) में पेंट करता है। यह उस गणितीय समस्या को हल करता है जिसने इसे पहले असंभव बना दिया था, जिससे हम "यूनिफाइड मल्टीमॉडल आर्किटेक्चर" (Unified Multimodal Architectures) बना सकते हैं—अनिवारतः, एक एकल AI दिमाग जो विवरण और बुद्धिमत्ता के समान स्तर के साथ छवियों को पढ़, समझ और बना सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →