← नवीनतम पेपर
💬 NLP

Diffusion Language Model Inference with Monte Carlo Tree Search

यह शोध पत्र MEDAL को प्रस्तुत करता है, जो एक इन्फरेंस-टाइम स्केलिंग फ्रेमवर्क है जो डिफ्यूजन लैंग्वेज मॉडल्स में अनमास्किंग प्रक्षेपवक्र (unmasking trajectory) को अनुकूलित करने के लिए मोंटे कार्लो ट्री सर्च को एकीकृत करता है, जिससे बिना किसी अतिरिक्त प्रशिक्षण के मौजूदा ह्यूरिस्टिक विधियों की तुलना में महत्वपूर्ण प्रदर्शन सुधार प्राप्त होता है।

मूल लेखक: Zheng Huang, Kiran Ramnath, Yueyan Chen, Aosong Feng, Sangmin Woo, Balasubramaniam Srinivasan, Zhichao Xu, Kang Zhou, Shuai Wang, Haibo Ding, Lin Lee Cheong

प्रकाशित 2026-02-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zheng Huang, Kiran Ramnath, Yueyan Chen, Aosong Feng, Sangmin Woo, Balasubramaniam Srinivasan, Zhichao Xu, Kang Zhou, Shuai Wang, Haibo Ding, Lin Lee Cheong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कहानी लिखने की कोशिश कर रहे हैं, लेकिन आप एक ऐसे पन्ने से शुरुआत करते हैं जहाँ हर एक शब्द को एक काले स्टिकी नोट (sticky note) से ढक दिया गया है। आपका लक्ष्य एक-एक करके शब्दों को प्रकट करना है जब तक कि पूरी कहानी समझ में न आने लगे।

डिफ्यूजन लैंग्वेज मॉडल्स (DLMs) इसी तरह काम करते हैं। एक मानक AI के विपरीत जो एक समय में एक शब्द बाएं से दाएं लिखता है (जैसे कि एक इंसान टाइप करता है), एक DLM एक साथ पूरे "ढके हुए" पन्ने को देखता है और अनुमान लगाने की कोशिश करता है कि कौन से स्टिकी नोट्स को हटाना है और उनके नीचे कौन से शब्द प्रकट करने हैं।

समस्या क्या है? उन नोट्स को हटाने के अरबों तरीके हैं। यदि आप केवल उन नोट्स को हटाते हैं जो अभी "सबसे संभावित" लग रहे हैं, तो आप एक खराब कहानी के रास्ते में फंस सकते हैं जिसे बाद में ठीक नहीं किया जा सकता। यह एक वाक्य का पहला शब्द चुनने जैसा है बिना यह सोचे कि वह पैराग्राफ के बाकी हिस्से को कैसे प्रभावित करेगा।

इस शोध पत्र के लेखक, MEDAL, एक बेहतर तरीका प्रस्तावित करते हैं। वे लेखन प्रक्रिया को एक साधारण अनुमान लगाने वाले खेल के रूप में नहीं, बल्कि एक रणनीतिक खोज (strategic search) के रूप में देखते हैं।

यहाँ उनका समाधान बताया गया है, जिसे सरल उपमाओं (analogies) में विभाजित किया गया है:

1. "क्या होगा अगर" वाला खोजकर्ता (MCTS)

कल्पना कीजिए कि आप एक युद्ध की योजना बना रहे हैं एक जनरल के रूप में। केवल अपने सबसे अच्छे अनुमान के साथ आगे बढ़ने के बजाय, आप मानचित्र पर विभिन्न रास्तों को खोजने के लिए कुछ स्काउट्स (scouts) भेजते हैं।

  • शोध पत्र की विधि: वे एक तकनीक का उपयोग करते हैं जिसे मोंटे कार्लो ट्री सर्च (Monte Carlo Tree Search - MCTS) कहा जाता है। इसे एक "सिमुलेशन इंजन" के रूप में सोचें। शब्दों को प्रकट करने के लिए प्रतिबद्ध होने से पहले, यह अपने दिमाग में हजारों छोटे, तेज़ "क्या होगा अगर" वाले परिदृश्यों को चलाता है।
  • लक्ष्य: यह पूछता है, "यदि मैं अभी यह शब्द प्रकट करता हूँ, तो क्या इससे बाकी कहानी लिखना आसान हो जाएगा? या क्या यह मुझे फंसा देगा?"
  • चुनौती: पूरी कहानी के लिए इन सिमुलेशनों को चलाना बहुत लंबा समय लेगा (जैसे हर एक चाल के लिए पूरे युद्ध का सिमुलेशन करना)। इसलिए, MEDAL इस शक्तिशाली खोजकर्ता का उपयोग केवल शुरुआत में (इनिशियलाइजेशन चरण में) एक मजबूत नींव रखने के लिए करता है। एक बार जब रास्ता तय हो जाता है, तो AI काम पूरा करने के लिए एक तेज़, सरल विधि पर स्विच हो जाता है।

2. "कॉन्फिडेंस फ़िल्टर" (स्पष्ट को पहचानना)

"क्या होगा अगर" वाला खोजकर्ता स्मार्ट है, लेकिन वह हर एक शब्द के लिए डिक्शनरी की हर एक संभावना की जांच नहीं कर सकता। यह असंभव होगा।

  • शोध पत्र की विधि: वे एक कॉन्फिडेंस-गाइडेड फ़िल्टर (Confidence-Guided Filter) का उपयोग करते हैं। कल्पना कीजिए कि एक लाइब्रेरियन आपको केवल उन शीर्ष 5 किताबों को देखने देता है जो आपके विषय के लिए सबसे प्रासंगिक लगती हैं, और हजारों अन्य किताबों को अनदेखा कर देता है।
  • यह कैसे काम करता है: AI स्टिकी नोट्स को देखता है और कहता है, "मुझे 90% यकीन है कि यह नोट 'बिल्ली' (cat) है, लेकिन इस नोट के 'क्वांटम फिजिक्स' होने के बारे में मैं केवल 10% ही आश्वस्त हूँ।" यह कम आत्मविश्वास वाले अनुमानों को अनदेखा कर देता है और केवल उच्च-आत्मविश्वास वाले अनुमानों पर ही अपने "क्या होगा अगर" सिमुलेशन चलाता है। यह खोज को तेज़ और कुशल बनाता है।

3. "सूचना लाभ" इनाम (The Smart Choice)

जब खोजकर्ता एक रास्ता चुनता है, तो उसे कैसे पता चलता है कि वह एक अच्छा रास्ता है?

  • शोध पत्र की विधि: वे एक विशेष स्कोर का उपयोग करते हैं जिसे इन्फॉर्मेशन गेन (Information Gain) कहा जाता है।
  • उपमा: कल्पना कीजिए कि आप एक जिग्सॉ पहेली (jigsaw puzzle) सुलझा रहे हैं। यदि आप एक ऐसा टुकड़ा रखते हैं जो केवल एक ही जगह फिट बैठता है, तो वह अच्छा है। लेकिन यदि आप एक ऐसा टुकड़ा रखते है जो साथ ही आपको यह समझने में मदद करता है कि अन्य पाँच टुकड़े कहाँ जाएंगे, तो वह अद्भुत है।
  • परिणाम: AI को न केवल सही शब्द का अनुमान लगाने के लिए, बल्कि एक ऐसा शब्द चुनने के लिए "इनाम" मिलता है जो भविष्य के लिए भ्रम को कम करता है। यह उन चालों को प्राथमिकता देता है जो भविष्य के लिए अनिश्चितता को कम करती हैं।

4. बड़े कार्य को तोड़ना (Task Decomposition)

कभी-कभी प्रॉम्प्ट (निर्देश) इतना जटिल होता है कि AI अभिभूत हो जाता है, जैसे कि एक ही बार में "अंतरिक्ष यात्रा के बारे में एक उपन्यास लिखें" लिखने के लिए कहा गया हो।

  • शोध पत्र की विधि: वे एक टास्क डिकम्पोजिशन (Task Decomposition) चरण जोड़ते हैं। लिखने से पहले, AI को बड़े कार्य को छोटे, प्रबंधनीय चरणों में तोड़ने के लिए कहा जाता है (जैसे, "1. परिवेश को समझें," "2. पात्रों की सूची बनाएं," "3. पहला दृश्य लिखें")।
  • परिणाम: यह एक रोडमैप की तरह कार्य करता है, जो AI को जटिल स्टिकी-नोट वाले पन्ने के माध्यम से चरण-दर-चरण मार्गदर्शन करता है, जिससे भटकने की संभावना कम हो जाती है।

परिणाम

लेखकों ने विभिन्न कठिन कार्यों (जैसे गणित की समस्याएँ, कोडिंग और रीडिंग कॉम्प्रिहेन्शन) पर इस "MEDAL" फ्रेमवर्क का परीक्षण किया।

  • परिणाम: शुरुआत में इस रणनीतिक "क्या होगा अगर" खोज का उपयोग करने के साथ-साथ स्मार्ट फ़िल्टरिंग और कार्य-विभाजन के संयोजन से, AI ने काफी बेहतर कहानियाँ और उत्तर लिखे।
  • आंकड़े: उन्होंने अन्य तरीकों की तुलना में 22% तक का सुधार देखा।
  • मुख्य निष्कर्ष: उन्हें AI को फिर से प्रशिक्षित करने या उसे नई चीजें सिखाने की आवश्यकता नहीं थी। उन्होंने बस उसे लिखने शुरू करने से पहले सोचने के लिए एक बेहतर रणनीति दी।

संक्षेप में: MEDAL एक लेखक को एक "रिहर्सल रूम" देने जैसा है जहाँ वे वास्तविक ड्राफ्ट लिखने के लिए प्रतिबद्ध होने से पहले, यह देखने के लिए विभिन्न शुरुआती पंक्तियों को जल्दी से आजमा सकते हैं कि कौन सी सबसे अच्छी कहानी की ओर ले जाती है। रणनीति में यह सरल बदलाव AI को बहुत अधिक स्मार्ट और सुसंगत बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →