← नवीनतम पेपर
💻 computer science

Sumi: Open Uniform Diffusion Language Model from Scratch

यह शोध पत्र सुमी (Sumi) को प्रस्तुत करता है, जो कि 1.5 ट्रिलियन टोकन पर स्क्रैच से प्रीट्रेन किया गया एक पूर्णतः ओपन 7B यूनिफॉर्म डिफ्यूजन लैंग्वेज मॉडल है, जो नेटिव यूनिफॉर्म डिफ्यूजन के अध्ययन के लिए पहला बड़े पैमाने का संदर्भ बिंदु के रूप में कार्य करता है और ज्ञान, तर्क एवं कोडिंग बेंचमार्क पर प्रतिस्पर्धी प्रदर्शन प्रदर्शित करता है।

मूल लेखक: Mengyu Ye, Keito Kudo, Wataru Ikeda, Ryosuke Matsuda, Keisuke Sakaguchi, Jun Suzuki

प्रकाशित 2026-06-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mengyu Ye, Keito Kudo, Wataru Ikeda, Ryosuke Matsuda, Keisuke Sakaguchi, Jun Suzuki

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Sumi" पेपर का विवरण दिया गया है, जिसे रोज़मर्रा की भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवादित किया गया है।

मुख्य विचार: AI के साथ लिखने का एक नया तरीका

कल्पना कीजिए कि आप एक कहानी लिखने की कोशिश कर रहे हैं।

  • पुराना तरीका (Autoregressive Models): यह कागज़ पर पेन से लिखने जैसा है। आप एक शब्द लिखते हैं, फिर अगला, फिर अगला। एक बार जब आप एक शब्द लिख देते हैं, तो वह हो गया। यदि आपसे कोई गलती हो जाती है, तो आपको उसे काट कर हटाना पड़ता है या पूरा पेज फिर से लिखना पड़ता है। आप पहले शब्द को बदले बिना उसके बाद का सब कुछ दोबारा नहीं लिख सकते।
  • नया तरीका (Sumi / Uniform Diffusion): कल्पना कीजिए कि आप एक कैनवास पर पेंटिंग बना रहे हैं जो पहले से ही स्टैटिक शोर (जैसे टीवी पर दिखने वाली बर्फ/झिलमिलाहट) से ढका हुआ है। शब्द-दर-शब्द लिखने के बजाय, आप पूरे कैनवास को एक साथ देखते हैं। आप वाक्य के किसी भी शब्द को चुन सकते हैं, उसे मिटा सकते हैं, और उसे एक बेहतर शब्द से बदल सकते हैं। आप पूरी कहानी को एक साथ बेहतर बनाने के लिए ऐसा बार-बार कर सकते हैं, जब तक कि वह एकदम सही न हो जाए।

यह पेपर Sumi (जिसका अर्थ जापानी में "स्याही" है) को पेश करता है, जो एक 7-बिलियन-पैरामीटर वाला AI मॉडल है जो इस "पेंटिंग" पद्धति का उपयोग करता है। यह पहली बार है जब किसी ने इस विशिष्ट तकनीक का उपयोग करके शुरू से एक इतना बड़ा मॉडल बनाया है, न कि केवल पुराने "पेन-लिखने" वाले मॉडल में बदलाव करके।

उन्होंने इसे कैसे बनाया: "स्कूल" की उपमा

Sumi को प्रशिक्षित करने के लिए, शोधकर्ताओं ने इसमें केवल रैंडम इंटरनेट टेक्स्ट नहीं डाला। उन्होंने एक बहुत ही विशिष्ट "स्कूल पाठ्यक्रम" तैयार किया।

  1. पाठ्यपुस्तक (Pre-training): उन्होंने मॉडल को 1.3 ट्रिलियन शब्द दिए। लेकिन उन्होंने कुछ भी नहीं उठाया। उन्होंने डेटा को फ़िल्टर किया ताकि उच्च गुणवत्ता वाली, शैक्षिक सामग्री को प्राथमिकता दी जा सके। इसे ऐसे समझें जैसे आपने AI को पाठ्यपुस्तकों, विश्वकोशों और कोड मैनुअल से भरी एक लाइब्रेरी दी, जबकि बहुत सारी अनौपचारिक इंटरनेट बातचीत, मीम्स या निम्न-गुणवत्ता वाले ब्लॉग्स को बाहर कर दिया।
  2. विशेष प्रशिक्षण (Mid-training): सामान्य स्कूली शिक्षा के बाद, उन्होंने इसे तीन विशिष्ट विषयों पर केंद्रित एक "बूट कैंप" दिया: कोडिंग, गणित और तर्क (Reasoning)। उन्होंने इसके आहार में और अधिक कोड और गणितीय समस्याओं को जोड़ा।
  3. परिणाम: इस "शिक्षा-प्रधान" आहार के कारण, Sumi ज्ञान, तर्क और कोड लिखने में बहुत अच्छा है। हालाँकि, क्योंकि इसने पर्याप्त "अनौपचारिक बातचीत" या "सामान्य ज्ञान" वाला भोजन नहीं खाया, इसलिए इसे रोज़मर्रा के सामान्य ज्ञान वाले सवालों (जैसे "लोग बारिश होने पर छाता क्यों लेकर चलते हैं?") के साथ थोड़ा संघर्ष करना पड़ता है।

प्रदर्शन: "पेंटर" कितना अच्छा है?

शोधकर्ताओं ने Sumi का परीक्षण अन्य प्रसिद्ध AI मॉडलों (जैसे Llama और Falcon) के खिलाफ किया जो पारंपरिक "पेन-लिखने" की विधि का उपयोग करते हैं।

  • जीत: सामान्य ज्ञान, तर्क और कोडिंग से संबंधित परीक्षणों में, Sumi बेहतरीन "पेन-लिखने" वाले मॉडलों के समान प्रदर्शन करता है, भले ही उन अन्य मॉडलों को बहुत अधिक डेटा पर प्रशिक्षित किया गया हो।
  • हार: सामान्य समझ (जैसे सामाजिक स्थितियों को समझना) की आवश्यकता वाले परीक्षणों में, Sumi का स्कोर कम रहा। लेखक स्वीकार करते हैं कि यह संभवतः इसलिए है क्योंकि उनका प्रशिक्षण डेटा स्कूल के विषयों पर बहुत अधिक केंद्रित था और रोज़मर्रा की ज़िंदगी पर कम।

"कैनवास" प्रयोग: सही संतुलन खोजना

पेपर का एक सबसे दिलचस्प हिस्सा यह है कि उन्होंने मॉडल की "लचीलेपन" (flexibility) का परीक्षण कैसे किया।

  • कैनवास का आकार: इस AI में, आपको वाक्य शुरू करने से पहले यह तय करना होता है कि वाक्य कितना लंबा होगा। इसे "कैनवास लेंथ" कहा जाता है।
  • निष्कर्ष: Sumi तब सबसे अच्छा काम करता है जब कैनवास ठीक 2048 टोकन लंबा होता है।
    • यदि कैनवास बहुत छोटा है, तो मॉडल भ्रमित हो जाता है और बड़बड़ाने (gibberish) लगता है।
    • यदि कैनवास बहुत लंबा है, तो भी यह भ्रमित हो जाता है।
    • यह एक संगीतकार की तरह है जो एक निश्चित आकार के स्टेज पर गाना पूरी तरह से बजा सकता है, लेकिन अगर स्टेज बहुत छोटा या बहुत बड़ा हो, तो वह अपनी लय खो देता है।

"प्रतिबद्धता" का रहस्य: यह कैसे निर्णय लेता है?

चूंकि Sumi किसी भी समय किसी भी शब्द को बदल सकता है, इसलिए आप सोच सकते हैं: क्या यह बस रैंडम अंदाज़ा लगाता है, या इसके पास कोई योजना है?

  • खोज: शोधकर्ताओं ने पाया कि Sumi के पास कोई निश्चित क्रम (जैसे "शुरुआत से शुरू करना") नहीं है। इसके बजाय, यह एक "कॉन्फिडेंस" (विश्वास) प्रणाली का उपयोग करता है।
    • यह पूरे वाक्य को देखता है और कहता है, "मुझे इस शब्द के बारे में काफी यकीन है, इसलिए मैं इसे लॉक कर दूँगा। मुझे उस शब्द के बारे में यकीन नहीं है, इसलिए मैं इस पर काम करना जारी रखूँगा।"
    • इससे एक स्वाभाविक क्रम बनता है जहाँ यह आसान हिस्सों को पहले लॉक करता है और कठिन हिस्सों को बाद के लिए बचाता है।
  • समानांतर गति (Parallel Speed): क्योंकि यह आत्मविश्वासी शब्दों को पहले लॉक करता है, इसलिए यह वास्तव में कोडिंग कार्यों के लिए एक साथ कई शब्द लिख सकता है (पैरेलल डिकोडिंग), जो पुराने "एक बार में एक शब्द" वाले तरीके की तुलना में तेज़ है।

"स्व-सुधार" का मिथक

इस "पेंटिंग" पद्धति का एक बड़ा वादा यह है कि AI अपने दोषों को आसानी से ठीक करने में सक्षम होना चाहिए। शोधकर्ताओं ने Sumi को अपने उत्तरों को संशोधित करने के लिए अतिरिक्त समय देकर इसका परीक्षण किया।

  • परिणाम: आश्चर्यजनक रूप से, इससे कोई मदद नहीं मिली। भले ही Sumi को अपने उत्तरों को कई बार लिखने की अनुमति दी गई, उसने ज्यादातर केवल एक शब्द बदला और फिर उसे मूल शब्द पर वापस बदल दिया। उसने जनरेशन प्रक्रिया के दौरान अपनी गलतियों को सुधारने के लिए वास्तव में "सीखा" नहीं। ऐसा लगता है कि मॉडल एक सीमा (ceiling) पर पहुँच जाता है और एक बार निर्णय लेने के बाद उसे कैसे सुधारा जाए, यह नहीं जानता।

सारांश

Sumi एक साहसिक प्रयोग है जो दिखाता है कि हम पारंपरिक "लिखने" की विधि के बजाय "पेंटिंग" पद्धति (Uniform Diffusion) का उपयोग करके एक शक्तिशाली AI बना सकते हैं।

  • यह इसमें अच्छा है: गणित, कोडिंग और तथ्यों में (क्योंकि इसने कड़ी पढ़ाई की)।
  • यह इसमें ठीक है: सामान्य समझ में (क्योंकि इसने "मज़ेदार" चीज़ों को छोड़ दिया)।
  • यह इसमें अजीब है: अपनी राय बदलने में (यह अभी भी अच्छी तरह से स्व-सुधार नहीं कर पाता है)।

लेखकों ने मॉडल, कोड और उस सटीक रेसिपी को रिलीज़ किया है जिसे उन्होंने इसे खिलाया था, इस उम्मीद में कि अन्य वैज्ञानिक इसका उपयोग यह पता लगाने के लिए करेंगे कि इस "पेंटिंग" पद्धति को और बेहतर कैसे बनाया जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →