← नवीनतम पेपर
🤖 machine learning

LaDi-RL: Latent Diffusion Reasoning Prevents Entropy Collapse in Reinforcement Learning

यह शोध पत्र LaDi-RL का प्रस्ताव करता है, जो एक सुव्यवस्थित तर्क प्रक्षेप पथ (reasoning trajectories) उत्पन्न करने के लिए लेटेंट डिफ्यूजन मॉडल का उपयोग करता है और पदानुक्रमित लेटेंट-टेक्स्ट रोलआउट्स (hierarchical latent-text rollouts) को नियोजित करता है ताकि लेटेंट प्लानिंग की गुणवत्ता को टेक्स्ट डिकोडिंग त्रुटियों से अलग किया जा सके, जिससे एंट्रॉपी कोलैप्स (entropy collapse) को रोका जा सके और कोड एवं गणितीय तर्क कार्यों पर पारंपरिक टोकन-स्तरीय RL की तुलना में काफी बेहतर प्रदर्शन किया जा सके।

मूल लेखक: Haoqiang Kang, Yizhe Zhang, Nikki Lijing Kuang, Yi-An Ma, Lianhui Qin

प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haoqiang Kang, Yizhe Zhang, Nikki Lijing Kuang, Yi-An Ma, Lianhui Qin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन थोड़े जिद्दी छात्र (एक लार्ज लैंग्वेज मॉडल) को जटिल पहेलियाँ हल करना सिखाने की कोशिश कर रहे हैं, जैसे कि कंप्यूटर कोड लिखना या उन्नत गणित की समस्याओं को हल करना।

लंबे समय से, इस छात्र को सिखाने का सबसे अच्छा तरीका रीइन्फोर्समेंट लर्निंग (RL) रहा है। इसे एक खेल की तरह समझें जहाँ छात्र एक समस्या को हल करने की कोशिश करता है, और यदि वह सही होता है, तो उसे एक 'गोल्ड स्टार' मिलता है। यदि वह गलत होता है, तो उसे "फिर से प्रयास करें" कहा जाता है।

हालाँकि, पुराने तरीके में एक बड़ी खामी है। यह छात्र को एक बार में एक शब्द सोचने के लिए मजबूर करता है। यह एक मास्टर शेफ से पूरे भोज की योजना बनाने के लिए केवल अगले एक घटक (ingredient) को काटने का निर्णय लेने के लिए कहने जैसा है।

  • समस्या: छात्र सूक्ष्म विवरणों पर ध्यान केंद्रित करने में फंस जाता है (जैसे "इसलिए" के बजाय "तो" शब्द का उपयोग करना) और बड़े चित्र को भूल जाता है। वे समस्या को हल करने के लिए बार-बार एक ही तरह की रणनीतियों को दोहराने लगते हैं, और अन्य चतुर तरीकों को अनदेखा कर देते हैं। पेपर में, वे इसे "एंट्रॉपी कोलैप्स" (Entropy Collapse) कहते हैं। यह एक ऐसे छात्र की तरह है जो केवल संख्याओं को जोड़कर गणित की समस्या हल करना सीख जाता है, भले ही घटाव या गुणा अधिक तेज़ होता। अंततः, वे नई चीज़ें आज़माना बंद कर देते हैं, और उनकी रचनात्मकता मर जाती है।

नया विचार: LaDi-RL (द "ड्रीमिंग" स्टूडेंट)

इस पेपर के लेखक, LaDi-RL, इस छात्र को सिखाने का एक अलग तरीका प्रस्तावित करते हैं। इसके बजाय कि उन्हें शब्द-दर-शब्द निर्णय लेने के लिए मजबूर किया जाए, वे उन्हें पहले एक छिपे हुए, अमूर्त स्थान (abstract space) में पूरा समाधान "सपना" (dream) देखने देते हैं और फिर बस उसे लिख देते हैं।

यह कैसे काम करता है, इसके लिए एक सरल उपमा (analogy) यहाँ दी गई है:

1. "ब्लूप्रिंट" बनाम "घर"

  • पुराना तरीका (टोकन-लेवल): छात्र ईंट-दर-ईंट घर बनाता है, और हर ईंट का रंग तय करते हुए आगे बढ़ता है। यदि वह शुरुआत में कोई गलती करता है, तो पूरा घर टेढ़ा हो सकता है।
  • नया तरीका (लेटेंट डिफ्यूजन): छात्र पहले अपने मन में एक ब्लूप्रिंट (एक "लेटेंट ट्रजेक्टरी") बनाता है। यह ब्लूप्रिंट समाधान के तर्क और रणनीति का प्रतिनिधित्व करता है, न कि विशिष्ट शब्दों का।
    • इस ब्लूप्रिंट को एक "विचार बादल" (thought cloud) के रूप में सोचें। यह विचार का एक निरंतर, तरल प्रतिनिधित्व है।
    • छात्र एक विशेष उपकरण का उपयोग करता है जिसे डिफ्यूजन मॉडल (Diffusion Model) कहा जाता है। कल्पना कीजिए कि यह उपकरण एक मूर्तिकार की तरह है जो मिट्टी के एक ब्लॉक (रैंडम नॉइज़) से शुरू करता है और धीरे-धीरे अतिरिक्त हिस्से को तराशता है जब तक कि एक आदर्श मूर्ति (समाधान की रणनीति) उभर न आए। यह छात्र को किसी विशिष्ट शब्द के प्रति प्रतिबद्ध होने से पहले कई अलग-अलग प्रकार की रणनीतियों (जैसे, "चलो ज्यामिति आजमाते हैं" बनाम "चलो बीजगणित आजमाते हैं") को खोजने की अनुमति देता है।

2. "अनुवादक" की समस्या

एक पेच है। छात्र का "सपना" (ब्लूप्रिंट) एक गुप्त भाषा में है जिसे वह समझता है, लेकिन अंतिम उत्तर साधारण अंग्रेजी (या कोड) में लिखा जाना चाहिए।

  • जोखिम: कभी-कभी छात्र के पास एक शानदार ब्लूप्रिंट होता है, लेकिन "अनुवादक" (वह हिस्सा जो ब्लूप्रिंट को टेक्स्ट में बदलता है) अनुवाद में गड़बड़ी कर देता है। यदि छात्र को खराब ग्रेड मिलता है, तो हमें कैसे पता चलेगा कि विचार बुरा था, या केवल अनुवाद खराब था?
  • समाधान (Hierarchical Rollouts): पेपर एक चतुर सुधार पेश करता है। केवल एक अनुवाद के आधार पर ब्लूप्रिंट को आंकने के बजाय, छात्र एक ही ब्लूप्रिंट के लिए कई अनुवाद उत्पन्न करता है।
    • उपमा: कल्पना कीजिए कि एक शेफ के पास एक बेहतरीन रेसिपी (ब्लूप्रिंट) है। केवल एक बार खाना बनाने और व्यंजन का न्याय करने के बजाय, वह इसे पाँच बार बनाता है। यदि पाँच में से चार व्यंजन स्वादिष्ट हैं, तो हम जानते हैं कि रेसिपी अच्छी है, भले ही एक व्यंजन गलती से जल गया हो। यह हमें यह समझने में बहुत स्पष्ट संकेत देता है कि छात्र की रण策略 वास्तव में स्मार्ट थी या नहीं।

3. पार्टी को विविध बनाए रखना

यह सुनिश्चित करने के लिए कि छात्र आलसी न हो जाए और केवल एक ही ब्लूप्रिंट पर न टिके, लेखक एक "रिपल्शन फ़ोर्स" (Repulsion Force) जोड़ते हैं।

  • उपमा: कल्पना कीजिए कि खजाना खोजने की कोशिश कर रहे खोजकर्ताओं का एक समूह है। यदि वे सभी एक ही रास्ते का अनुसरण करते हैं, तो वे एक छिपी हुई गुफा को मिस कर सकते हैं। "रिपल्शन फ़ोर्स" एक हल्के धक्के की तरह है जो कहता है, "हे, तुम अपने दोस्त के बहुत करीब हो! जाओ और एक अलग दिशा में खोज करो!"
  • यह छात्र को ऐसे ब्लूप्रिंट बनाने के लिए मजबूर करता है जो एक-दूसरे से संरचनात्मक रूप से भिन्न हों, जिससे यह सुनिश्चित होता है कि वे समाधानों की एक विस्तृत विविधता का पता लगाएं।

उन्होंने क्या पाया?

पेपर ने दो कठिन चुनौतियों पर इस नए तरीके का परीक्षण किया: कोड लिखना और गणित की समस्याओं को हल करना

  • बेहतर सटीकता: "ड्रीमिंग स्टूडेंट" (LaDi-RL) ने पुराने "ईंट-दर-ईंट" वाले छात्र की तुलना में पहली बार में काफी अधिक समस्याओं को सही ढंग से हल किया।
    • कोडिंग में, सटीकता में 9.4% का सुधार हुआ।
    • गणित में, इसमें 5.7% का सुधार हुआ।
  • अधिक रचनात्मकता: पुराना छात्र अंततः नई चीज़ें आज़माना बंद कर देता था (एंट्रॉपी कोलैप्स)। नया छात्र विविध, रचनात्मक समाधान ढूंढता रहा। यहाँ तक कि 100 अलग-अलग उत्तर उत्पन्न करने के लिए कहा जाने पर भी, नए छात्र के उत्तर अद्वितीय और सही थे, जबकि पुराने छात्र के उत्तर एक जैसे दिखने लगे और खराब होने लगे।
  • दक्षता (Efficiency): नए छात्र को उत्तर पाने के लिए हजारों शब्दों को "सोचते हुए बोलने" (thinking out loud) की आवश्यकता नहीं पड़ी। उन्होंने अपने विचार को एक छोटे, कुशल "ब्लूप्रिंट" में संकुचित कर दिया, जिससे समय और कंप्यूटिंग शक्ति की बचत हुई।

मुख्य निष्कर्ष

LaDi-RL यह बदल देता है कि AI कैसे तर्क करना सीखता है। AI को छोटे, कठोर चरणों (शब्द-दर-शब्द) में सोचने के लिए मजबूर करने के बजाय, यह उसे पहले विचारों के परिदृश्य का पता लगाने (डिफ्यूजन प्रक्रिया का उपयोग करके) और फिर उन विचारों को शब्दों में अनुवाद करने की अनुमति देता है। यह AI को एक ही ढर्रे में फंसने से रोकता है, इसके समाधानों को विविध बनाए रखता है, और इसे कठिन समस्याओं को अधिक सटीकता के साथ हल करने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →