← नवीनतम पेपर
💬 NLP

Reinforced Efficient Reasoning via Semantically Diverse Exploration

यह शोध पत्र ROSE का प्रस्ताव करता है, जो बड़े भाषा मॉडलों (large language models) के लिए एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है, जो मौजूदा MCTS-आधारित विधियों की सीमाओं को दूर करने के लिए सिमेंटिक-एन्ट्रॉपी-आधारित ब्रांचिंग, ε\varepsilon-एक्सप्लोरेशन और एक लेंथ-अवेयर सेगमेंट-लेवल एडवांटेज एस्टिमेटर को एकीकृत करके तर्क दक्षता और विविधता को बढ़ाता है।

मूल लेखक: Ziqi Zhao, Zhaochun Ren, Jiahong Zou, Liu Yang, Zhiwei Xu, Xuri Ge, Zhumin Chen, Xinyu Ma, Daiting Shi, Shuaiqiang Wang, Dawei Yin, Xin Xin

प्रकाशित 2026-04-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ziqi Zhao, Zhaochun Ren, Jiahong Zou, Liu Yang, Zhiwei Xu, Xuri Ge, Zhumin Chen, Xinyu Ma, Daiting Shi, Shuaiqiang Wang, Dawei Yin, Xin Xin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन थोड़े चिंतित छात्र (AI) को एक कठिन गणितीय समस्या हल करना सिखा रहे हैं। लक्ष्य उसे सही उत्तर तक पहुँचाना है, लेकिन साथ ही उसे यह भी सिखाना है कि कैसे सोचना है, बिना समय बर्बाद किए या उलझनों के चक्रव्यूह में फंसे बिना।

यह शोध पत्र ROSE (Reinforced Efficient Reasoning via Semantically Diverse Exploration) नामक एक नई प्रशिक्षण पद्धति पेश करता है। ROSE को एक "सुपर-ट्यूटर" के रूप में समझें जो छात्र के अभ्यास करने का तरीका बदल देता है।

यहाँ सरल उपमाओं का उपयोग करके इसका विवरण दिया गया है:

1. समस्या: "ज़्यादा सोचने वाला" (Overthinking) छात्र

पहले, AI मॉडल को GRPO नामक एक विधि का उपयोग करके प्रशिक्षित किया जाता था। यह ऐसा है जैसे छात्र को एक बहुविकल्पीय परीक्षा देना जहाँ वह एक साथ 8 अलग-अलग उत्तरों का अनुमान लगाता है।

  • दोष: यदि छात्र उत्तर सही देता है, तो शिक्षक कहता है, "बहुत अच्छा!" उस संपूर्ण विचार प्रक्रिया को, भले ही छात्र वहां तक पहुँचने के लिए 50 चरणों तक विषय से भटकता रहा हो।
  • परिणाम: छात्र "ज़्यादा सोचने" (overthink करने) लगता है। सुरक्षित रहने के लिए वे लंबे, भ्रामक निबंध लिखते हैं, जिससे समय और ऊर्जा बर्बाद होती है। साथ ही, वे बार-बार एक ही प्रकार के उत्तरों का अनुमान लगाने लगते हैं, जिससे रचनात्मक समाधान छूट जाते हैं।

2. समाधान: "शाखा-विस्तार करने वाला" ट्यूटर (MCTS)

यह शोध पत्र मोंटे कार्लो ट्री सर्च (MCTS) का सुझाव देता है। कल्पना करें कि छात्र की सोचने की प्रक्रिया एक सीधी रेखा नहीं, बल्कि एक पेड़ (tree) की तरह है।

  • केवल 8 अलग-अलग उत्तरों का अनुमान लगाने के बजाय, छात्र मूल (root/प्रश्न) से शुरू करता है।
  • कुछ निश्चित बिंदुओं पर, छात्र अलग-अलग रास्ते आज़माने के लिए "शाखाएँ" (branch out) निकालता है।
  • इससे शिक्षक को यह देखने की अनुमति मिलती है कि छात्र कहाँ गलत हुआ या कहाँ सही हुआ, न कि केवल अंतिम उत्तर के आधार पर निर्णय लेना।

3. नवाचार: ROSE पेड़ (Tree) में कैसे सुधार करता है

A. "सिमेंटिक एंट्रॉपी" दिशा-सूचक (सही मोड़ खोजना)

पुराने तरीके जेनरेशन एंट्रॉपी (Generation Entropy) के आधार पर तय करते थे कि पेड़ की शाखाएँ कहाँ बनानी हैं।

  • पुराना तरीका: शिक्षक छात्र के भ्रम को देखता था। यदि छात्र "can" या "need" लिखने के बीच अनिश्चित था, तो शिक्षक वहाँ पेड़ की शाखा बनाता था।
  • समस्या: इस संदर्भ में "can" और "need" लगभग एक ही अर्थ रखते हैं। वहाँ शाखा बनाना बेकार है; यह केवल दो समान पथ बनाता है।
  • ROSE का तरीका (सिमेंटिक एंट्रॉपी): अब शिक्षक शब्दों के अर्थ (semantics) को देखता है। वे पेड़ की शाखा तभी बनाते हैं जब छात्र दो पूरी तरह से अलग विचारों के बीच अनिश्चित हो (जैसे, "संख्या जोड़ना" बनाम "संख्या गुणा करना")।
  • उपमा: कल्पना करें कि एक यात्री सड़क के मोड़ पर खड़ा है। पुराना तरीका तब शाखा बनाता था जब यात्री लाल टोपी पहनने या नीली टोपी पहनने के बारे में अनिश्चित होता (जो अप्रासंगिक है)। ROSE केवल तभी शाखा बनाता है जब यात्री उत्तर या दक्षिण जाने के बीच अनिश्चित हो (जो एक महत्वपूर्ण निर्णय है)। यह सुनिश्चित करता है कि AI वास्तव में अलग-अलग समाधानों का पता लगाए।

B. "ε-एक्सप्लोरेशन" सुरक्षा जाल (स्थानीय जाल से बचना)

कभी-कभी छात्र एक छोटे लूप में फंस जाता है, एक ही चीज़ को बार-बार सोचता रहता है।

  • समाधान: ROSE एक नियम जोड़ता है: "समय-समय पर, पेड़ को भूल जाओ और पूरी समस्या को फिर से शुरू करो।"
  • उपमा: यदि आप अपने घर में खोई हुई चाबी ढूँढने की कोशिश कर रहे हैं, तो आप शायद एक ही दराज को बार-बार चेक करते रहेंगे। ROSE कहता है, "ठीक है, उस दराज को चेक करना बंद करो। बाहर जाओ और बगीचे में ढूँढना शुरू करो।" यह AI को एक "स्थानीय" डेड-एंड (गतिरोध) में फंसने से रोकता है।

4. दक्षता वृद्धि: "सबसे छोटा रास्ता" पुरस्कार

भले ही छात्र सही उत्तर खोज ले, हम नहीं चाहते कि वह इसे करने के लिए 100 कदम उठाए।

  • समाधान: ROSE एक लेंथ-अवेयर रिवॉर्ड (Length-Aware Reward) पेश करता है।
  • उपमा: कल्पना करें कि दो छात्र एक ही पहेली को हल करते हैं।
    • छात्र A 10 चरणों में हल करता है।
    • छात्र B 50 चरणों में हल करता है।
    • दोनों सही उत्तर प्राप्त करते हैं।
    • ROSE छात्र A को 'गोल्ड स्टार' देता है और छात्र B को केवल 'भागीदारी का स्टार' देता है। यह सक्रिय रूप से लंबे, अनावश्यक तर्क वाले चरणों को दंडित करता है। यह AI को संक्षिप्त और कुशल बनना सिखाता है।

5. परिणाम: स्मार्ट और तेज़

शोधकर्ताओं ने कठिन गणितीय समस्याओं (जैसे हाई स्कूल प्रतियोगिताओं में पाई जाने वाली) पर इसका परीक्षण किया।

  • बेहतर सटीकता: AI ने पिछले तरीकों की तुलना में अधिक समस्याओं को सही ढंग से हल किया।
  • तेज़ सोच: AI ने उत्तर तक पहुँचने के लिए कम शब्दों और चरणों का उपयोग किया।
  • अधिक रचनात्मकता: "सिमेंटिक एंट्रॉपी" दिशा-सूचक के कारण, AI ने पुराने तरीकों को दोहराने के बजाय समस्याओं को हल करने के अधिक अद्वितीय और विविध तरीके आज़माए।

सारांश

ROSE को एक छात्र के प्रशिक्षण को "अनुमान और जाँच" (guess and check) से बदलकर "रणनीतिक अन्वेषण" (strategic exploration) में अपग्रेड करने जैसा माना जा सकता है।

  1. यह केवल तभी शाखाएँ निकालता है जब पथ का अर्थ बदलता है (न कि केवल शब्द)।
  2. यह फंसने से बचने के लिए बीच-बीच में नई शुरुआत करने के लिए मजबूर करता है।
  3. यह लंबे, भ्रामक विचारों के बजाय संक्षिप्त और कुशल सोच को पुरस्कृत करता है।

परिणामस्वरूप, AI न केवल कठिन समस्याओं को हल करने में स्मार्ट है, बल्कि यह एक मानव विशेषज्ञ की तरह सोचता है: कुशल, विविध और आत्मविश्वासी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →