← नवीनतम पेपर
🤖 AI

Can I Have Your Order? Monte-Carlo Tree Search for Slot Filling Ordering in Diffusion Language Models

यह शोध पत्र McDiffuSE को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो मास्क किए गए डिफ्यूजन मॉडल्स (Masked Diffusion Models) में स्लॉट इनफिलिंग क्रमों (slot infilling orders) को अनुकूलित करने के लिए मोंटे कार्लो ट्री सर्च (Monte Carlo Tree Search) का लाभ उठाता है, जिससे गैर-अनुक्रमिक पूर्णता रणनीतियों (non-sequential completion strategies) को प्रभावी ढंग से खोजकर गणितीय और कोड तर्क कार्यों पर जनरेशन की गुणवत्ता में महत्वपूर्ण सुधार होता है।

मूल लेखक: Joshua Ong Jun Leang, Yu Zhao, Mihaela Cătălina Stoian, Wenda Li, Shay B. Cohen, Eleonora Giunchiglia

प्रकाशित 2026-05-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Joshua Ong Jun Leang, Yu Zhao, Mihaela Cătălina Stoian, Wenda Li, Shay B. Cohen, Eleonora Giunchiglia

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल केक बनाने की कोशिश कर रहे हैं, लेकिन एक रेसिपी का चरण-दर-चरण पालन करने के बजाय (पहले मिश्रण बनाएँ, फिर बेक करें, फिर फ्रॉस्ट करें), आपके पास एक जादुई ओवन है जो आपको किसी भी क्रम में केक को भरने की अनुमति देता है। आप पहले ऊपर की तरफ फ्रॉस्टिंग कर सकते हैं, फिर बीच का हिस्सा बेक कर सकते हैं, और फिर स्प्रिंकल्स डाल सकते हैं। मास्क्ड डिफ्यूजन मॉडल्स (MDMs) इसी तरह काम करते हैं: वे टेक्स्ट (जैसे कोड या गणित के समाधान) उत्पन्न करने के लिए किसी भी क्रम में गायब जानकारी के "स्लॉट्स" को भरने के लिए शक्तिशाली AI उपकरण हैं।

हालाँकि, इसमें एक पेच है। यदि आप पैन में बैटर डालने से पहले ही फ्रॉस्टिंग कर देते हैं, तो पूरा केक ढह जाएगा। इसी तरह, यदि AI सबसे पहले गलत "स्लॉट" भर देता है, तो बाकी का टेक्स्ट निरर्थक हो सकता है, भले ही AI उस विशिष्ट हिस्से के बारे में बहुत आश्वस्त क्यों न हो।

यह पेपर इस ऑर्डरिंग समस्या को हल करने के लिए एक नई विधि पेश करता है जिसे MCDIFFUSE कहा जाता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. समस्या: "आत्मविश्वासी लेकिन गलत" शेफ

वर्तमान AI मॉडल अक्सर एक ऐसे शेफ की तरह व्यवहार करते हैं जो अपने द्वारा उठाए गए पहले कदम के बारे में बहुत आत्मविश्वासी होता है। यदि मॉडल सोचता है, "मुझे 90% यकीन है कि इस वाक्य को फंक्शन डेफिनिशन (function definition) से शुरू होना चाहिए," तो वह इसे तुरंत कर देता है। लेकिन कभी-कभी, परिभाषा से शुरुआत करना बाद में गड़बड़ी का कारण बनता है क्योंकि मॉडल को यह एहसास नहीं होता कि काम चलाने के लिए उसे पहले एक कमेंट या एक विशिष्ट सिंटैक्स मार्कर लिखने की आवश्यकता थी।

इसे पेपर में "प्लान-एंड-इनफिल" (plan-and-infill) समस्या कहा गया है: AI को यह तय करने की आवश्यकता है कि अगला हिस्सा कौन सा लिखना है। यदि वह गलत क्रम चुनता है, तो अंतिम परिणाम खराब होता है।

2. समाधान: "क्या-होगा" सिम्युलेटर (MCTS)

लेखक MCDIFFUSE पेश करते हैं, जो मोंटे कार्लो ट्री सर्च (Monte Carlo Tree Search - MCTS) का उपयोग करता है।

MCTS को एक सुपर-प्लानर या सिम्युलेटर के रूप में सोचें। AI द्वारा टेक्स्ट का एक विशिष्ट हिस्सा लिखने के लिए प्रतिबद्ध होने से पहले, यह प्लानर उसके दिमाग में हजारों "क्या-होगा" (what-if) परिदृश्यों को चलाता है:

  • परिदृश्य A: क्या होगा यदि मैं पहले फंक्शन डेफिनिशन लिखूँ? (बाकी कोड का सिमुलेशन करता है... अरे नहीं, यह बाद में क्रैश हो गया)।
  • परिदृश्य B: क्या होगा यदि मैं पहले सिंटैक्स मार्कर लिखूँ? (बाकी का सिमुलेशन करता है... आह, कोड पूरी तरह से फ्लो हो रहा है)।

प्लानर केवल तत्काल आत्मविश्वास (अगले शब्द के बारे में AI कितना आश्वस्त है) को नहीं देखता; यह दीर्घकालिक परिणाम को देखता है। यह पूछता है, "यदि मैं इस रास्ते पर चलता हूँ, तो क्या पूरा केक अच्छा बनेगा?"

3. यह कैसे निर्णय लेता है: "एक्सप्लोरेशन" बनाम "सिमुलेशन" का संतुलन

पेपर इस प्लानर को ट्यून करने के बारे में एक दिलचस्प खोज प्रस्तुत करता है। आमतौर पर, लोग सोचते हैं कि बेहतर उत्तर पाने के लिए आपको अधिक सिमुलेशन चलाने की आवश्यकता है। लेकिन MCDIFFUSE ने पाया कि यह सबसे महत्वपूर्ण चीज़ नहीं है।

  • पुराना तरीका: एक ही पथ के 100 सिमुलेशन चलाएं ताकि सुनिश्चित हो सकें।
  • MCDIFFUSE का तरीका: कम सिमुलेशन चलाएं, लेकिन उन अजीब, असंभावित रास्तों को आजमाने के लिए तैयार रहें जिन्हें AI आमतौर पर अनदेखा कर देता है।

उपमा: कल्पना कीजिए कि आप छिपे हुए खजाने की तलाश कर रहे हैं।

  • उच्च सिमुलेशन, निम्न एक्सप्लोरेशन: आप ठीक उसी जगह पर 100 बार खुदाई करते हैं क्योंकि नक्शा कहता है "खजाना यहाँ है।" आपको कुछ नहीं मिलता, लेकिन आप बहुत आश्वस्त हैं कि आपने पर्याप्त मेहनत की है।
  • उच्च एक्सप्लोरेशन (MCDIFFUSE): आप स्पष्ट स्थान पर कुछ बार खुदाई करते हैं, लेकिन आप उस अजीब, झाड़ियों से भरे बुश में भी खुदाई करने का निर्णय लेते हैं क्योंकि नक्शा गलत हो सकता है। पता चलता है कि खजाना उसी बुश में था!

पेपर ने पाया कि प्लानर को एक "बड़ा एक्सप्लोरेशन कॉन्स्टेंट" (उसे साहसी बनने और असंभाविक क्रमों को आजमाने के लिए कहना) देने से, केवल अधिक सिमुलेशन चलाने की तुलना में कहीं अधिक प्रभावी परिणाम मिले। यह AI को उसके अपने अति-आत्मविश्वास के जाल से बाहर निकलने में मदद करता है।

4. परिणाम: बेहतर कोड और गणित

जब उन्होंने पायथन कोड लिखने और गणित की समस्याओं को हल करने जैसे कार्यों पर इसका परीक्षण किया:

  • यह काम करता है: MCDIFFUSE ने पिछले तरीकों को काफी पीछे छोड़ दिया। कुछ कोडिंग टेस्ट में, इसने सटीकता में लगभग 20% तक सुधार किया।
  • यह कुशल है: भले ही यह अतिरिक्त योजना बनाता है, यह वास्तव में मानक AI मॉडल की तुलना में छोटे, अधिक संक्षिप्त उत्तर उत्पन्न करता है। मानक मॉडल अक्सर लंबी बातें करते हैं या लंबे लूप में फंस जाते हैं; MCDIFFUSE सीधा रास्ता खोज लेता है।
  • "सीक्रेट सॉस" (Secret Sauce): AI ज्यादातर एक सामान्य, बाएं-से-दाएं क्रम (जैसे इंसान पढ़ता है) का पालन करता है, लेकिन आवश्यकता पड़ने पर यह नियम को रणनीतिक रूप से तोड़ता है। यह एक ऐसे लेखक की तरह है जो आमतौर पर कालानुक्रमिक रूप से लिखता है लेकिन जानता है कि कहानी को सार्थक बनाने के लिए कब पीछे जाकर एक महत्वपूर्ण विवरण डालना है।

सारांश

MCDIFFUSE टेक्स्ट जनरेशन के लिए एक स्मार्ट "ट्रैफिक कंट्रोलर" है। AI को केवल वर्तमान क्षण में जो सही लग रहा है उसके आधार पर टेक्स्ट को अंधे होकर भरने देने के बजाय, यह विभिन्न ऑपरेशन्स के क्रम का परीक्षण करने के लिए एक सिमुलेशन इंजन का उपयोग करता है। उन "अजीब" क्रमों को आजमाने का साहस करके जिन्हें AI आमतौर पर अनदेखा कर देता है, यह गलतियों से बचता है और स्वच्छ, अधिक सटीक कोड और गणितीय समाधान प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →