← नवीनतम पेपर
💻 computer science

DISA: Offline Importance Sampling for Distribution-Matching LLM-RL

DISA (Decoupled Importance-Sampled Anchoring) एक नवीन ऑफलाइन डिस्ट्रीब्यूशन-मैचिंग RL पद्धति है जो कैलिब्रेशन त्रुटियों को समाप्त करने के लिए इम्पोर्टेंस सैंपलिंग के माध्यम से पार्टीशन फंक्शन अनुमानों को प्री-कंप्यूट और फ्रीज करती है, जिससे यह LLMs को विविध समाधान रणनीतियों को सीखने में सक्षम बनाती है जो रिवॉर्ड-मैक्सिमाइजेशन बेसलाइन और ऑनलाइन-कपल्ड डिस्ट्रीब्यूशन-मैचिंग दृष्टिकोणों दोनों से बेहतर प्रदर्शन करते हैं।

मूल लेखक: Shaobo Wang, Yujie Chen, Yafeng Sun, Wenjie Qiu, Zhihui Xie, Sihang Li, Yucheng Li, Huiqiang Jiang, Xingzhang Ren, Xuming Hu, Dayiheng Liu, Linfeng Zhang

प्रकाशित 2026-05-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shaobo Wang, Yujie Chen, Yafeng Sun, Wenjie Qiu, Zhihui Xie, Sihang Li, Yucheng Li, Huiqiang Jiang, Xingzhang Ren, Xuming Hu, Dayiheng Liu, Linfeng Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली छात्र (एक AI) को एक कठिन गणित की समस्या हल करना या कोड का एक टुकड़ा लिखना सिखा रहे हैं। लक्ष्य केवल एक सही उत्तर प्राप्त करना नहीं है; बल्कि लक्ष्य छात्र को एक ही समस्या को हल करने के कई अलग-अलग, वैध तरीके खोजने के लिए प्रशिक्षित करना है। यह अत्यंत महत्वपूर्ण है क्योंकि वास्तविक दुनिया में, सफलता के कई मार्ग होते हैं, और विकल्पों का होना छात्र को अधिक सक्षम और रचनात्मक बनाता है।

हालाँकि, इन AI छात्रों को प्रशिक्षित करने का मानक तरीका (जिसे "रिवॉर्ड मैक्सिमाइजेशन" कहा जाता है) में एक दोष है: यह एक ऐसे शिक्षक की तरह है जो छात्र द्वारा दिए गए पहले सही उत्तर की ही प्रशंसा करता है। एक बार जब छात्र एक "पर्याप्त अच्छा" समाधान खोज लेता है, तो शिक्षक उन्हें अन्य तरीकों को आज़माने के लिए प्रोत्साहित करना बंद कर देता है। छात्र एक ही ढर्रे में फंस जाता है, और एक ही पथ को बार-बार दोहराता रहता है, भले ही अन्य समान रूप से वैध पथ मौजूद हों। इसे "मोड कोलैप्स" (mode collapse) कहा जाता है।

इसे ठीक करने के लिए, शोधकर्ताओं ने एक विधि विकसित की जिसे डिस्ट्रीब्यूशन-मैचिंग (Distribution-Matching) कहा जाता है। केवल उच्चतम स्कोर का पीछा करने के बजाय, यह विधि छात्र को सभी संभावित सही समाधानों के एक विशिष्ट "आदर्श मानचित्र" (ideal map) से मेल खाने के लिए सिखाने का प्रयास करती है। इसे एक ऐसे मानचित्र के रूप में समझें जो आपको खजाने तक पहुँचने वाले हर वैध मार्ग को दिखाता है, न कि केवल उस एक मार्ग को जिसे शिक्षक ने सबसे पहले चुना था।

समस्या: "ऑनलाइन" मानचित्र टूटा हुआ है

इस "डिस्ट्रीब्यूशन-मैचिंग" दृष्टिकोण के साथ पेचीदा बात यह है कि उस मानचित्र की गणना कैसे की जाए। यह जानने के लिए कि प्रत्येक संभावित समाधान की प्रायिकता क्या है, आपको एक गणितीय मान की आवश्यकता होती है जिसे पार्टीशन फंक्शन (Partition Function) कहा जाता है।

पिछले तरीकों ने छात्र के सीखने के दौरान ही इस मानचित्र को सीखने का प्रयास किया। कल्पना कीजिए कि आप एक शहर का नक्शा बनाने की कोशिश कर रहे हैं जबकि आप उसी समय एक कार चला रहे हैं, आँखों पर पट्टी बंधी हुई है, और रास्तों का अनुमान लगा रहे हैं। क्योंकि मानचित्र का अनुमान चलते-चलते लगाया जा रहा है, इसलिए मानचित्र की त्रुटियाँ ड्राइविंग निर्देशों के साथ मिल जाती हैं। छात्र भ्रमित हो जाता है, और यह बताना असंभव हो जाता है कि वह एक खराब ड्राइवर होने के कारण विफल हुआ या इसलिए क्योंकि मानचित्र गलत था।

समाधान: DISA (द "ऑफलाइन" मैप)

शोधपत्र DISA (Decoupled Importance-Sampleed Anchoring) पेश करता है। शोधकर्ताओं ने महसूस किया कि "मानचित्र" (पार्टीशन फंक्शन) वास्तव में छात्र के वर्तमान ड्राइविंग कौशल पर निर्भर नहीं करता है; यह केवल समस्या और खेल के नियमों पर निर्भर करता है।

इसलिए, उन्होंने इस प्रक्रिया को तीन स्पष्ट चरणों में बदल दिया:

चरण 1: "सुपर-एक्सपर्ट" अन्वेषण (ऑफलाइन)
छात्र द्वारा सीखना शुरू करने से पहले, शोधकर्ता एक "सुपर-एक्सपर्ट" AI (एक बहुत बड़ा, अधिक स्मार्ट मॉडल) को समस्या के क्षेत्र का अन्वेषण करने के लिए नियुक्त करते हैं। यह विशेषज्ञ समस्या को हल करने के हजारों अलग-अलग प्रयास उत्पन्न करता है। इम्पॉर्टेंस सैंपलिंग (Importance Sampling) नामक एक सांख्यिकीय तकनीक का उपयोग करके, वे इन विशेषज्ञ प्रयासों का उपयोग करके सभी संभावित समाधानों का एक अत्यधिक सटीक, पूर्व-निर्धारित मानचित्र तैयार करते हैं।

  • उपमा: छात्र परीक्षा देने से पहले, शीर्ष गणितज्ञों की एक टीम समस्या को 1,000 अलग-अलग तरीकों से हल करती है और सभी समाधानों की एक विस्तृत मार्गदर्शिका लिखती है।

चरण 2: "चीट शीट" का निर्माण
शोधकर्ता उस विशाल मार्गदर्शिका को एक छोटी, आसानी से पढ़ी जाने वाली "चीट शीट" (एक सरल गणितीय फलन) में संकुचित कर देते हैं जो तुरंत बता सकती है कि किसी भी दी गई समस्या के लिए मानचित्र कैसा दिखता है।

  • उपमा: वे 1,000 पन्नों की मार्गदर्शिका को एक एकल, पूर्ण इंडेक्स कार्ड में सारांशित करते हैं जो छात्र की जेब में समा सके।

चरण 3: छात्र सीखता है (ऑनलाइन)
अब, छात्र प्रशिक्षण शुरू करता है। महत्वपूर्ण बात यह है कि "चीट शीट" स्थिर (frozen) है। यह बदल नहीं सकती। छात्र समस्याओं को हल करने का प्रयास करता है, और शिक्षक यह जाँचने के लिए चीट शीट का उपयोग करता है कि क्या छात्र सही विविधता के समाधानों का पता लगा रहा है।

  • उपमा: छात्र हाथ में इंडेक्स कार्ड लेकर परीक्षा देता है। शिक्षक मानचित्र को फिर से बनाने की कोशिश नहीं करता; वे बस यह देखते हैं कि क्या छात्र के उत्तर पूर्व-अनुमोदित मानचित्र से मेल खाते हैं। यदि छात्र कोई गलती करता है, तो यह स्पष्ट रूप से छात्र की गलती है, मानचित्र की नहीं।

यह बेहतर क्यों काम करता है

सीखने से मानचित्र बनाने की प्रक्रिया को अलग करके, DISA पुराने तरीकों के भ्रम से बचता है।

  • कोई भ्रम नहीं: छात्र एक स्थिर, सटीक लक्ष्य से सीखता है।
  • अधिक रचनात्मकता: क्योंकि लक्ष्य में सभी वैध पथ शामिल हैं (न केवल सबसे आसान वाला), छात्र विविध समाधान उत्पन्न करना सीखता है।
  • बेहतर परिणाम: गणित और कोडिंग बेंचमार्क पर परीक्षणों में, DISA मौजूदा सर्वोत्तम विधियों के बराबर या उनसे बेहतर प्रदर्शन करता है। यह विशेष रूप से कई सही समाधान उत्पन्न करने में अच्छा था (जिसे "pass@16" द्वारा मापा जाता है, जो यह जाँचता है कि क्या 16 प्रयासों में से कोई भी सही है), जबकि अन्य विधियाँ केवल एक प्रकार के उत्तर पर ही अटकी रहती थीं।

मुख्य निष्कर्ष

DISA इस बात जैसा है कि छात्रों के परीक्षा देने के दौरान पाठ्यपुस्तक लिखने के बजाय, कक्षा शुरू होने से पहले विशेषज्ञों की एक टीम को एक आदर्श पाठ्यपुस्तक लिखने के लिए नियुक्त किया जाए। यह सुनिश्चित करता है कि छात्र विविध कौशल सीखें और केवल उत्तर के एक संकीकर मार्ग को याद न करें। शोधपत्र दिखाता है कि यह "ऑफलाइन-फर्स्ट" दृष्टिकोण अधिक बुद्धिमान, बहुमुखी AI एजेंटों की ओर ले जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →