One-Way Policy Optimization for Self-Evolving LLMs
यह शोध पत्र वन-वे पॉलिसी ऑप्टिमाइज़ेशन (OWPO) को प्रस्तुत करता है, जो एक नवीन विधि है जो एसिमेट्रिक रीवेटिंग और इटरेटिव रेफरेंस अपडेट्स के माध्यम से ऑप्टिमाइज़ेशन दिशा को अपडेट परिमाण से अलग करके, बड़े भाषा मॉडलों के स्व-विकास को स्थिर और उन्नत करती है, जिससे मौजूदा टोकन-स्तरीय बाधाओं की अक्षमताओं को दूर किया जा सके और बाहरी संदर्भ मॉडलों के बिना निरंतर सुधार सक्षम हो सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक बड़ी समस्या: "बीच में फंसने" की दुविधा
कल्पना कीजिए कि आप एक रोबोट (AI) को जटिल गणित के सवाल हल करना सिखा रहे हैं। आपके पास एक जज (वेरिफायर) है जो समाधान के बिल्कुल अंत में केवल "सही" या "गलत" कह सकता है।
- समस्या: क्योंकि जज केवल अंत में बोलता है, रोबोट अक्सर रास्ता भटक जाता है। उसे यह नहीं पता चलता कि कौन सा कदम गलत था, इसलिए वह धीरे सीखता है और भ्रमित हो जाता है।
- पुराना समाधान: मदद करने के लिए, शोधकर्ताओं ने एक रेफरेंस मॉडल (एक "शिक्षक") पेश किया। उन्होंने रोबोट से कहा: "शिक्षक की शैली के करीब रहो।" इसने ट्रेनिंग को स्थिर बनाया, लेकिन एक नई समस्या पैदा कर दी।
- नई समस्या: कभी-कभी, रोबोट समस्या को हल करने का एक बेहतर तरीका खोज लेता है जो शिक्षक ने कभी नहीं सीखा था। लेकिन क्योंकि रोबोट को शिक्षक के करीब रहने के लिए मजबूर किया जाता है, सिस्टम उसे अलग होने के लिए दंडित करता है। यह एक ऐसे छात्र की तरह है जिसने उत्तर तक पहुँचने का एक तेज़ शॉर्टकट खोज लिया है, लेकिन शिक्षक चिल्लाता है, "नहीं! तुम्हें उसी लंबे रास्ते पर चलना होगा जो मैंने सिखाया था!" रोबol फंस जाता है और शिक्षक के स्तर से ऊपर नहीं बढ़ पाता।
समाधान: वन-वे पॉलिसी ऑप्टिमाइजेशन (OWPO)
लेखक OWPO नामक एक नई विधि प्रस्तावित करते हैं। इसे एक स्मार्ट कोच के रूप में सोचें जो दिशा (Direction) को गति (Speed) से अलग करता है।
1. कोच का नियम:
- दिशा: जज तय करता है कि किस दिशा में जाना है। यदि जज कहता है, "यह रास्ता अच्छा है," तो रोबोट उसी दिशा में जाता है। यदि जज कहता है, "यह रास्ता बुरा है," तो रोबोट वापस मुड़ जाता है। शिक्षक कभी भी दिशा तय नहीं करता।
- गति: शिक्षक तय करता है कि कितनी तेज़ी से आगे बढ़ना है।
2. दो-तरफा रास्ता (असिमेट्रिक रीवेटिंग):
OWPO रोबोट के प्रयासों के साथ अलग-अलग व्यवहार करता है, चाहे वे शिक्षक से "बुरे" हों या "बेहतर"।
- परिदृश्य A: जब रोबोट पीछे रह रहा हो (इन्फीरियर डेविएशन)
- स्थिति: रोबोट अनिश्चित है या ऐसी गलतियाँ कर रहा है जहाँ शिक्षक आश्वस्त था।
- कार्रवाई: कोच सीखने की गति बढ़ा देता है। वह कहता है, "तुम यहाँ शिक्षक से पीछे हो! तेज़ी से चलो और बराबरी करो!" इसे एक्सेलेरेटेड एलाइनमेंट कहा जाता है।
- परिदृश्य B: जब रोबोट आगे निकल रहा हो (सुपीरियर डेविएशन)
- स्थिति: रोबोट एक बेहतर समाधान खोज लेता है या शिक्षक से अधिक आत्मविश्वासी होता है।
- कार्रवाई: कोच बदलावों की गति धीमी कर देता है। वह कहता है, "तुम यहाँ कुछ बहुत अच्छा कर रहे हो! बहुत ज़्यादा बदलाव मत करो, वरना तुम इस अच्छे विचार को गलती से खो सकते हो।" इसे गेन लॉकिंग कहा जाता है। यह रोबोट के नए, बेहतर विचारों को रैंडम शोर (noise) से बह जाने से बचाता है।
"रैचेट इफेक्ट": छत को तोड़ना
अतीत में, एक बार जब रोबोट शिक्षक जितना अच्छा हो जाता था, तो वह उससे बेहतर नहीं हो पाता था क्योंकि शिक्षक ही उसकी सीमा था।
OWPO एक रैचेट मैकेनिज्म (एक ऐसे उपकरण की तरह जो केवल एक दिशा में घूमता है और कभी पीछे नहीं हटता) पेश करता है।
- हर कुछ चरणों के बाद, रोबोट एक ब्रेक लेता है, अपने सबसे अच्छे काम को देखता है, और कहता है, "ठीक है, अब मैं ही शिक्षक हूँ।"
- यह अपने वर्तमान सर्वश्रेष्ठ स्वरूप को ही अपना रेफरेंस मॉडल बना लेता है।
- यह एक सीढ़ी बनाता है। रोबोट ऊपर चढ़ता है, उस पायदान को लॉक करता है, और फिर उस नए ऊँचाई को आधार बनाकर और ऊपर चढ़ने के लिए उपयोग करता है। वह कभी भी पुराने, कमजोर शिक्षक की ओर वापस नहीं फिसलता।
यह क्यों महत्वपूर्ण है (परिणाम)
पेपर ने गणित की समस्याओं (जैसे AIME प्रतियोगिता) पर इसका परीक्षण किया।
- पुरानी विधियाँ: रोबोट शिक्षक के स्तर के पास ही फंस जाता था। यदि शिक्षक 37% अच्छा था, तो रोबro 37% या 38% के आसपास ही रहता था।
- OWPO: रोबोट ने उस छत को तोड़ दिया। उसने 30% से शुरुआत की, शिक्षक को पार किया, और 40% से अधिक सटीकता तक पहुँचा।
- स्थिरता: अन्य विधियों के विपरीत, जो बहुत अधिक रचनात्मक होने की कोशिश में अस्थिर हो सकती हैं, OWPO अपने अच्छे विचारों को सुरक्षित रखने के लिए रोबोट को स्थिर रखता है।
सारांश उपमा
कल्पना कीजिए कि एक हाइकर (AI) पहाड़ चढ़ने की कोशिश कर रहा है।
- जज शिखर की ओर इशारा करने वाला कंपास है।
- पुराना शिक्षक एक नक्शा था जो कहता था, "इस विशिष्ट रास्ते पर ही रहो।" यदि हाइकर को कोई शॉर्टकट मिला, तो नक्शा उन्हें वापस पुराने रास्ते पर ले जाता था।
- OWPO एक स्मार्ट गाइड है। गाइड कहता है: "यदि तुम रास्ते से भटक गए हो और खो गए हो, तो वापस आने के लिए तेज़ी से दौड़ो। लेकिन यदि तुम्हें कोई ऐसा शॉर्टकट मिलता है जो तुम्हें और ऊपर ले जाता है, तो धीरे चलो और सावधानी से चलो ताकि तुम फिसल न जाओ, लेकिन उस नए रास्ते पर चलते रहो। एक बार जब तुम एक नए ऊँचे बिंदु पर पहुँच जाओ, तो नक्शे को अपडेट कर दो कि अब तुम विशेषज्ञ हो, और वहीं से अगला शॉर्टकट ढूँढना शुरू करो।"
यह AI को निरंतर विकसित होने की अनुमति देता है, जिससे वह लगातार बेहतर होता जाता है, बिना किसी बाहरी "सुपर-टीचर" के हाथ पकड़ने की ज़रूरत के।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।