← नवीनतम पेपर
💬 NLP

Deep Dense Exploration for LLM Reinforcement Learning via Pivot-Driven Resampling

यह शोध पत्र डीप डेंस एक्सप्लोरेशन (DDE) का प्रस्ताव करता है, जो DEEP-GRPO के रूप में स्थापित एक नवीन रणनीति है जो असफल प्रक्षेप पथों (trajectories) के भीतर "पिवट" अवस्थाओं की पहचान करके और उन्हें सघन रूप से पुन: नमूनाकरण (resampling) करके LLM सुदृढीकरण शिक्षण (reinforcement learning) को उन्नत करती है ताकि उच्च गुणवत्ता वाले समाधानों को कुशलतापूर्वक खोजा जा सके, जिससे यह गणितीय तर्क संबंधी बेंचमार्क पर मौजूदा GRPO और ट्री-आधारित विधियों से बेहतर प्रदर्शन करती है।

मूल लेखक: Yiran Guo, Zhongjian Qiao, Yingqi Xie, Jie Liu, Dan Ye, Ruiqing Zhang, Shuang Qiu, Lijie Xu

प्रकाशित 2026-06-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yiran Guo, Zhongjian Qiao, Yingqi Xie, Jie Liu, Dan Ye, Ruiqing Zhang, Shuang Qiu, Lijie Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन थोड़े जिद्दी छात्र (AI) को जटिल पहेलियाँ, जैसे गणित के सवाल या बहु-चरणीय (multi-step) प्रश्न हल करना सिखा रहे हैं। आपके पास अभ्यास करने के लिए सीमित समय और ऊर्जा (एक "सैंपलिंग बजट") है। लक्ष्य यह है कि आप हर एक प्रयास से सबसे अधिक सीख सकें।

यह शोध पत्र एक नई प्रशिक्षण विधि पेश करता है जिसे DEEP-GRPO (डीप डेंस एक्सप्लोरेशन) कहा जाता है। यह कैसे काम करता है, यहाँ सरल अवधारणाओं और उपमाओं में दिया गया है।

समस्या: अभ्यास करने के दो बुरे तरीके

यह शोध पत्र तर्क देता है कि AI को प्रशिक्षित करने की वर्तमान विधियों में दो मुख्य कमियां हैं:

  1. "रूट-ओनली" विधि (GRPO):

    • उपमा: कल्पना करें कि छात्र एक विशाल भूलभुलैया में छिपे हुए खजाने को खोजने की कोशिश कर रहा है। वर्तमान विधि (GRPO) छात्र को हर बार प्रवेश द्वार से शुरू करने के लिए कहती है।
    • कमी: छात्र जल्दी ही प्रवेश द्वार के पास के सबसे स्पष्ट, आसान रास्तों को सीख जाता है। वे बार-बार उन्हीं सुरक्षित, उच्च-संभावना वाले गलियारों में दौड़ते रहते हैं। वे कभी भी भूलभुलैया के गहरे, भ्रमित करने वाले कोनों में नहीं जाते जहाँ असली खजाना हो सकता है। यदि वे किसी गहरे कोने में फंस जाते हैं, तो वे बस हार मान लेते हैं और शुरुआत से फिर से शुरू कर देते हैं, जिससे समय बर्बाद होता है।
  2. "ट्री" (Tree) विधि:

    • उपमा: पहली समस्या को ठीक करने के लिए, अन्य शोधकर्ताओं ने एक "ट्री" विधि का प्रयास किया। यह छात्र को यह बताने जैसा है: "ठीक है, हर बार जब तुम रास्ते में कोई मोड़ (fork) आए, तो वहीं रुक जाओ और वहाँ से कुछ अलग रास्ते आज़माओ।"
    • कमी: समस्या यह है कि उनके पास सीमित ऊर्जा है। यदि वे हर मोड़ पर रुककर कुछ रास्ते आज़माने लगते हैं, तो वे अपनी ऊर्जा बहुत अधिक फैला देते हैं। वे 50 अलग-अलग मोड़ों पर एक या दो रास्ते आज़माते हैं, लेकिन वे किसी एक मोड़ पर इतने रास्ते नहीं आज़मा पाते कि यह पता चल सके कि वह रास्ता बंद है या खजाना। यह 50 अलग-अलग केक का एक-एक छोटा टुकड़ा चखने जैसा है, बजाय इसके कि वे सबसे अच्छे वाले का एक पूरा स्लाइस खाएं। इससे भ्रम और अस्थिर शिक्षण होता है।

समाधान: "पिवट" रणनीति (DEEP-GRPO)

लेखक उस सीमित ऊर्जा को खर्च करने का एक स्मार्ट तरीका प्रस्तावित करते हैं। वे इसे Deep Dense Exploration कहते हैं।

1. "पिवट" (Pivot) खोजें (महत्वपूर्ण गलती)
शुरुआत से फिर से शुरू करने या हर जगह फैलने के बजाय, AI अपने विफल प्रयासों को देखता है। वह पूछता है: "मैं कहाँ गलत हुआ, लेकिन अगर मैं फिर से कोशिश करता तो क्या मैं इसे ठीक कर सकता था?"

  • उपमा: कल्पना करें कि छात्र भूलभुलैया में खो गया। प्रवेश द्वार से शुरू करने के बजाय, शिक्षक उस विशिष्ट स्थान की ओर इशारा करता है जहाँ छात्र ने गलत मोड़ लिया था (वह "पिवट" है)। यह स्थान भूलभुलैया में गहरा है, लेकिन यह कोई डेड एंड (बंद रास्ता) नहीं है; यह एक ऐसी जगह है जहाँ एक अलग चुनाव आपको खजाने तक ले जा सकता था।

2. "डेंस" रीसेंपलिंग (गहराई में जाएँ और वहीं रहें)
एक बार जब AI उस विशिष्ट "पिवट" स्थान को ढूंढ लेता है, तो वह केवल एक नया रास्ता नहीं आज़माता। वह उसी स्थान से कई रास्ते आज़माता है।

  • उपमा: शिक्षक कहता है, "ठीक है, तुम इस विशिष्ट मोड़ पर हो। प्रवेश द्वार को भूल जाओ। यहीं रुको। यहीं से 8 अलग-अलग रास्ते आज़माओ जब तक कि तुम्हें बाहर निकलने का रास्ता न मिल जाए।" यह "डेंस" प्रयास उस सही समाधान को खोजने की संभावना को बढ़ाता है जो बस कुछ ही कदमों की दूरी पर छिपा हुआ था।

3. दो अलग-अलग सबक (डुअल-स्ट्रीम ऑप्टिमाइजेशन)
AI एक ही समय में दो प्रकार के अनुभवों से सीखता है, लेकिन उन्हें आपस में भ्रमित होने से बचाने के लिए अलग रखता है:

  • स्ट्रीम A (ग्लोबल): छात्र शुरुआत से अंत तक दौड़ता है (मानक अभ्यास)।
  • स्ट्रीम B (लोकल): छात्र केवल उस कठिन हिस्से का अभ्यास करता है जिसमें वह गलत हुआ था, बार-बार, बिना उन आसान हिस्सों को दोबारा किए जिन्हें वह पहले से जानता है।
  • लाभ: यह 防止 (रोकता) है कि AI "आसान अभ्यास" और "कठिन अभ्यास" को आपस में मिलाकर भ्रमित न हो, जिससे सीखने की प्रक्रिया अधिक स्थिर और तेज़ होती है।

यह बेहतर क्यों काम करता है

शोधकर्ताओं ने गणित की समस्याओं और बहु-चरणीय प्रश्नों पर इसका परीक्षण किया। यहाँ क्या हुआ:

  • अधिक विविधता: AI ने केवल आसान उत्तरों को रटा नहीं। इसने समस्या के "गहरे" हिस्सों को खोजना जारी रखा, जिससे जिज्ञासा (एन्ट्रॉपी) का उच्च स्तर बना रहा।
  • बेह बेहतर परिणाम: क्योंकि इसने अपनी ऊर्जा आसान रास्तों पर बर्बाद करने के बजाय, कठिन और सुधारा जा सकने वाले गलतियों पर केंद्रित की, इसलिए इसने अन्य विधियों की तुलना में अधिक समस्याओं को सही ढंग से हल किया।
  • स्व-सुधार (Self-Correction): AI ने अपने काम की "दोबारा जाँच" करना सीख लिया। यदि उसने कोई गलती की, तो उसने हार मानने के बजाय "पिवट" पर वापस जाना और फिर से प्रयास करना सीखा।

सारांश

DEEP-GRPO को एक ऐसे कोच के रूप में सोचें जो एथलीट को बार-बार पूरी रेस दौड़ने से रोकता है। इसके बजाय, कोच कहता है: "तुमने मील 10 पर गलती की। चलो वहीं रुकते हैं। हम पूरी रेस दोबारा नहीं दौड़ेंगे। हम मील 10 से फिनिश लाइन तक के हिस्से को 8 बार दौड़ेंगे जब तक कि तुम इसे सही से न कर लो।"

यह दृष्टिकोण ऊर्जा बचाता है, विशिष्ट कमजोरियों को ठीक करता है, और AI को एक बहुत बेहतर समस्या समाधानकर्ता बनाने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →