LamPO: A Lambda Style Policy Optimization for Reasoning Language Models
LoMP0 एक नवीन पॉलिसी ऑप्टिमाइज़ेशन विधि है जो तर्क करने वाले भाषा मॉडलों (reasoning language models) के लिए है, जो स्केलर ग्रुप एडवांटेज को पेयरवाइज डिकम्पोज्ड एडवांटेज से बदलकर सत्यापन योग्य पुरस्कारों (verifiable rewards) के साथ सुदृढीकरण शिक्षण (reinforcement learning) को उन्नत करती है ताकि सूक्ष्म संबंधात्मक जानकारी को संरक्षित किया जा सके, जिससे GRPO जैसे मौजूदा दृष्टिकोणों की तुलना में गणितीय और वैज्ञानिक बेंचमार्क पर अधिक स्थिर प्रशिक्षण और बेहतर प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक छात्र को जटिल गणितीय समस्याओं को हल करना सिखा रहे हैं। आप उन्हें एक प्रश्न देते हैं, और वे उत्तर के आठ अलग-अलग प्रयास लेकर वापस आते हैं।
पुराने तरीके में (जिसे GRPO कहा जाता है), आप सभी आठ उत्तरों को देखते हैं, उनका "औसत" स्कोर निकालते हैं, और फिर छात्र से कहते हैं: "तुम औसत से बेहतर थे, इसलिए अच्छा काम किया!" या "तुम औसत से खराब थे, इसलिए फिर से कोशिश करो।"
इस दृष्टिकोण की समस्या यह है कि यह "औसत" को एक एकल संख्या के रूप में मानता है। यह विवरणों को भूल जाता है। यदि छात्र ने एक उत्तर लगभग सटीक दिया और दूसरा पूरी तरह से गलत था, तो पुराना तरीका उन्हें केवल "औसत से ऊपर" और "औसत से नीचे" के रूप में देखता है। यह इस सूक्ष्मता को खो देता है कि एक उत्तर दूसरे से कितना बेहतर था।
LamPO इन AI छात्रों को सिखाने का एक नया, स्मार्ट तरीका है। आइए यह समझते हैं कि यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:
1. "हेड-टू-हेड" टूर्नामेंट (पेयरवाइज डिकम्पोज्ड एडवांटेज)
हर उत्तर की तुलना एक उबाऊ औसत से करने के बजाय, LamPO उत्तरों को एक टूर्नामेंट में डाल देता है। यह उत्तरों के हर संभव जोड़े (pair) को लेता है और उनकी सीधे तौर पर तुलना करता है।
- पुराना तरीका: "तुम क्लास के औसत से 2 अंक ऊपर हो।"
- LamPO का तरीका: "तुम्हारा उत्तर उत्तर B को 5 अंकों से हरा गया, लेकिन उत्तर C ने तुम्हें 2 अंकों से हरा दिया।"
LamPO हर जोड़े के बीच के अंतर (gap) को देखता है। यदि छात्र का उत्तर एक गलत उत्तर की तुलना में थोड़ा बेहतर है, तो LamPO एक हल्का सा धक्का (nudge) देता है। यदि यह बहुत बेहतर है, तो यह एक बड़ा धक्का (push) देता है। यह "संबंधपरक जानकारी" (relational information) को सुरक्षित रखता है—यह जानता है कि कौन किसको और कितने से हराया।
2. "कॉन्फिडेंस मीटर" (वेटिंग)
कभी-कभी AI छात्र अपने उत्तरों को लेकर बहुत अनिश्चित होता है। LamPO के पास एक विशेष "कॉन्फिडेंस मीटर" होता है।
- यदि AI को पूरा विश्वास है कि उत्तर A, उत्तर B से बेहतर है, तो LamPO उस तुलना को ध्यान से सुनता है।
- यदि AI भ्रमित है और सोचता है कि वे लगभग एक समान हैं, तो LamPO उस तुलना को कम महत्व (weight) देता है।
यह एक ऐसे कोच की तरह है जो उस खिलाड़ी की बात अधिक ध्यान से सुनता है जो अपनी रणनीति के बारे में 100% सुनिश्चित है, और उस खिलाड़ी पर कम ध्यान देता है जो केवल अनुमान लगा रहा है।
3. "हिंट सिस्टम" (डेंस ऑक्सिलरी रिवॉर्ड)
आमतौर पर, गणित या कोडिंग में, आपको बिल्कुल अंत में केवल "सही" या "गलत" का संकेत मिलता है। यह एक शिक्षक की तरह है जो बिना यह बताए कि आप कहाँ गलत हुए, बस "गलत" कह देता है।
LamPO एक "हिंट सिस्टम" जोड़ता है जब शिक्षक के पास सही उत्तर कुंजी होती है। यह ROUGE-L (जो एक "शब्द ओवरलैप चेकर" की तरह है) नामक टूल का उपयोग करता है ताकि यह देख सके कि छात्र की सोचने की प्रक्रिया सही प्रक्रिया से कितनी मिलती-जुलती है।
- भले ही अंतिम उत्तर गलत हो, यदि छात्र के चरण 80% सही चरणों जैसे दिखते हैं, तो LamPO उन्हें एक छोटा "बोनस पॉइंट" देता है क्योंकि वे सही रास्ते पर थे। यह छात्र को कुल "जीरो" स्कोर के कारण हतोत्साहित होने से रोकता है।
परिणाम: एक सुगम यात्रा
पेपर ने इन कठिन गणितीय और वैज्ञानिक पहेलियों (जैसे AIME और MATH डेटासेट) पर इस नए तरीके (LamPO) का पुराने तरीके (GRPO) के मुकाबले परीक्षण किया।
- बेहतर ग्रेड: LamPO के साथ प्रशिक्षित किए गए AI मॉडल इन परीक्षणों में उच्च स्कोर प्राप्त करते हैं।
- कम उतार-चढ़ाव: प्रशिक्षण प्रक्रिया बहुत सहज रही। पुराने तरीके में कभी-कभी AI के प्रदर्शन में भारी उतार-चढ़ाव (जैसे रोलरकोस्टर) आ जाता था। LamPO ने सीखने को स्थिर रखा, जैसे एक शांत लिफ्ट की सवारी।
- दक्षता: AI ने तेजी से सीखा, उसे अच्छा करने के लिए कम प्रयासों की आवश्यकता पड़ी।
कमी (सीमाएं)
इस तरीके की एक छोटी सी लागत है। क्योंकि LamPO हर उत्तर की तुलना हर दूसरे उत्तर से करता है (एक राउंड-रॉबिन टूर्नामेंट की तरह), उन सभी जोड़ों की गणना करने के लिए थोड़े अधिक कंप्यूटर पावर की आवश्यकता होती है। हालांकि, पेपर में उल्लेख किया गया है कि उनके द्वारा उपयोग किए गए समूह के आकार के लिए, यह लागत बहुत कम थी और सुधार के लिए यह सार्थक थी।
संक्षेप में: LamPO AI के लिए एक स्मार्ट कोचिंग विधि है। केवल क्लास औसत को देखने के बजाय, यह हर हेड-टू-हेड मुकाबले को देखता है, AI के आत्मविश्वास को सुनता है, और रास्ते में मददगार संकेत देता है। यह अधिक स्मार्ट, अधिक स्थिर रीजनिंग मॉडल की ओर ले जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।