← नवीनतम पेपर
💬 NLP

LambdaPO: A Lambda Style Policy Optimization for Reasoning Language Models

LambdaPO एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) ढांचे को पेश करता है जो तर्क करने वाले भाषा मॉडलों के लिए GRPO के अखंड समूह माध्य बेसलाइन (monolithic group mean baseline) को एक विघटित, युग्मवार वरीयता संरचना (pairwise preference structure) और सूक्ष्म संकेतों को पकड़ने के लिए सिमेंटिक डेंसिटी रिवार्ड्स (semantic density rewards) से बदल देता है ताकि सूक्ष्म-स्तरीय अनुकूलन संकेतों को कैप्चर किया जा सके और जटिल कार्यों पर प्रदर्शन में सुधार किया जा सके।

मूल लेखक: Zhe Yuan, Yipeng Zhou, Jinghan Li, Xinyuan Chen, Bowen Deng, Zhiqian Chen, Liang Zhao

प्रकाशित 2026-05-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhe Yuan, Yipeng Zhou, Jinghan Li, Xinyuan Chen, Bowen Deng, Zhiqian Chen, Liang Zhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "LambdaPO: A Lambda Style Policy Optimization for Reasoning Language Models" का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ स्पष्टीकरण दिया गया है।

बड़ी तस्वीर: एक छात्र को सोचना सिखाना

कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन भ्रमित छात्र (AI) को जटिल गणित की समस्याएं हल करना सिखाने की कोशिश कर रहे हैं। छात्र एक ही समस्या को हल करने के कई अलग-अलग तरीके बना सकता है, लेकिन कुछ रास्ते बंद गलियां हैं, कुछ बहुत उलझे हुए हैं, और केवल कुछ ही एकदम सटीक हैं।

इस शोध पत्र का लक्ष्य यह पता लगाना है कि छात्र को फीडबैक (प्रतिक्रिया) देने का सबसे अच्छा तरीका क्या है ताकि वे तेज़ी से सीख सकें और कम गलतियाँ करें।

समस्या: "औसत" का जाल

यह शोध पत्र एक लोकप्रिय विधि की ओर इशारा करता है जिसे GRPO (Group Relative Policy Optimization) कहा जाता है।

  • GRPO कैसे काम करता है: कल्पना कीजिए कि छात्र एक गणित की समस्या के 8 अलग-अलग समाधान लिखता है। शिक्षक (एल्गोरिदम) उन सभी 8 को देखता है, उनका औसत (average) स्कोर निकालता है, और फिर प्रत्येक छात्र को बताता है, "तुम औसत से बेहतर थे, इसलिए शाबाश!" या "तुम औसत से खराब थे, इसलिए फिर से कोशिश करो।"
  • खामी: शोध पत्र का तर्क है कि केवल "औसत" का उपयोग करना बहुत ही सतही है। यह एक ऐसे शिक्षक की तरह है जो कहता है, "तुम औसत हो," बिना यह बताए कि क्यों
    • यदि छात्र का समाधान एक खराब उत्तर की तुलना में थोड़ा बेहतर था लेकिन सबसे अच्छे उत्तर की तुलना में बहुत खराब था, तो "औसत" उस बारीकी को छिपा देता है।
    • यह समूह को डेटा के एक एकल ढेर की तरह मानता है, जिससे एक समाधान दूसरे की तुलना में कैसे भिन्न है, इसका विशिष्ट विवरण खो जाता है। इससे छात्र के लिए एक "अच्छे" प्रयास और एक "बेहतरीन" प्रयास के बीच सूक्ष्म अंतर को समझना कठिन हो जाता है।

समाधान: LambdaPO (एक "आमने-सामने" मुकाबला कराने वाला कोच)

लेखक LambdaPO पेश करते हैं, जो छात्र को कोचिंग देने का एक नया तरीका है। औसत से तुलना करने के बजाय, LambdaPO समूह में मौजूद हर समाधान की आमने-सामने (head-to-head) अन्य समाधानों के विरुद्ध तुलना करता है।

उपमा: टूर्नामेंट ब्रैकेट (Tournament Bracket)

  • GRPO एक ऐसे कोच की तरह है जो स्कोरबोर्ड को देखता है और कहता है, "टीम का औसत स्कोर 50 था।"
  • LambdaPO एक ऐसे कोच की तरह है जो एक टूर्नामेंट देखता है जहाँ हर खिलाड़ी दूसरे खिलाड़ी से लड़ता है।
    • यदि समाधान A, समाधान B को हरा देता है, तो समाधान A को एक अंक मिलता है।
    • यदि समाधान A, समाधान C से हार जाता है, तो समाधान A एक अंक खो देता है।
    • अंतिम स्कोर केवल "औसत से ऊपर" होने के बारे में नहीं है; यह इस बारे में है कि आपने विशिष्ट विरोधियों के खिलाफ कैसा प्रदर्शन किया।

"आत्मविश्वास" का मोड़ (The "Confidence" Twist)
LambdaPO एक चतुर मोड़ जोड़ता है: यह छात्र के अपने आत्मविश्वास को भी सुनता है।

  • यदि छात्र अनिश्चित है (उसे लगता है कि दो समाधान समान रूप से अच्छे हैं), तो कोच यह तय करने के लिए कि कौन जीता, वास्तविक गणितीय परिणामों पर ध्यान देता है।
  • यदि छात्र बहुत आत्मविश्वासी है कि समाधान A, समाधान B से बेहतर है, लेकिन गणित कहता है कि समाधान B वास्तव में बेहतर है, तो कोच एक बड़ा "सुधार" (correction) संकेत देता है। यह छात्र को यह समझने में मदद करता है कि वे अपनी अंतरात्मा (intuition) के बारे में गलत थे।

बोनस: "सिमेंटिक डेंसिटी रिवॉर्ड" (The "Semantic Density" Reward)

गणित की समस्याओं में, अंतिम उत्तर सही होना बहुत अच्छी बात है, लेकिन चरणों (steps) को सही करना अधिक कठिन है।

  • पुराना तरीका: यदि छात्र अंतिम संख्या गलत लिख देता है, तो उसे "0" मिलता है, भले ही उसने 90% तर्क (logic) सही ढंग से किया हो। यह एक ऐसी परीक्षा में फेल होने जैसा है क्योंकि आपने एक टाइपो (typo) कर दिया, जबकि आपने पूरी अवधारणा को समझा था।
  • नया तरीका (LambdaPO): लेखक एक "सिमेंटिक डेंसिटी रिवॉर्ड" जोड़ते हैं। यह एक ऐसे शिक्षक की तरह है जो छात्र के काम को पढ़ता है और सही शब्दों और तार्किक चरणों के उपयोग के लिए आंशिक क्रेडिट (partial credit) देता है, भले ही अंतिम संख्या थोड़ी गलत हो। यह केवल अंतिम परिणाम के बजाय तर्क की गुणवत्ता को पुरस्कृत करता है।

प्रयोगों में क्या हुआ?

शोधकर्ताओं ने विभिन्न AI मॉडल का उपयोग करके कठिन गणित और विज्ञान के प्रश्नों पर इस नई विधि का परीक्षण किया।

  1. बेहतर स्कोर: LambdaPO के साथ प्रशिक्षित AI ने पुराने "औसत" वाले तरीके (GRPO) से प्रशिक्षित AI की तुलना में अधिक समस्याओं को सही ढंग से हल किया।
  2. अधिक स्थिर सीखना: पुराने तरीके के कारण कभी-कभी AI भ्रमित हो जाता था और कुछ समय बाद बेतरतीब, खराब अनुमान लगाने लगता था (एक "कोलैप्स")। LambdaPO ने AI को स्थिर और केंद्रित रखा, जिससे वह भटकने से बच गया।
  3. दक्षता (Efficiency): कुछ मामलों में, LambdaPO-प्रशिक्षित AI ने कम शब्दों (टोकन) का उपयोग करके समस्याओं को हल किया और पुराने तरीके के विपरीत, खुद को दोहराने के लूप में नहीं फंसा।

सारांश

LambdaPO AI को सोचने के लिए प्रशिक्षित करने का एक स्मार्ट तरीका है। AI को यह बताने के बजाय कि उसने "समूह के औसत" की तुलना में कैसा प्रदर्शन किया, यह उसे बताता है कि उसने अपने ही विशिष्ट प्रयासों की तुलना में कैसा प्रदर्शन किया। यह AI को केवल सही उत्तर पाने के लिए ही नहीं, बल्कि अच्छे तर्क लिखने के लिए भी पुरस्कृत करता है। यह AI को अधिक स्मार्ट, अधिक स्थिर और कठिन तर्क पहेलियों को हल करने में बेहतर बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →