← नवीनतम पेपर
💻 computer science

One-Way Policy Optimization for Self-Evolving LLMs

यह शोध पत्र वन-वे पॉलिसी ऑप्टिमाइज़ेशन (OWPO) को प्रस्तुत करता है, जो एक नवीन विधि है जो एसिमेट्रिक रीवेटिंग और इटरेटिव रेफरेंस अपडेट्स के माध्यम से ऑप्टिमाइज़ेशन दिशा को अपडेट परिमाण से अलग करके, बड़े भाषा मॉडलों के स्व-विकास को स्थिर और उन्नत करती है, जिससे मौजूदा टोकन-स्तरीय बाधाओं की अक्षमताओं को दूर किया जा सके और बाहरी संदर्भ मॉडलों के बिना निरंतर सुधार सक्षम हो सके।

मूल लेखक: Shuo Yang, Jinda Lu, Kexin Huang, Chiyu Ma, Shaohang Wei, Yuyang Liu, Guoyin Wang, Jingren Zhou, Li Yuan

प्रकाशित 2026-05-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shuo Yang, Jinda Lu, Kexin Huang, Chiyu Ma, Shaohang Wei, Yuyang Liu, Guoyin Wang, Jingren Zhou, Li Yuan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक बड़ी समस्या: "बीच में फंसने" की दुविधा

कल्पना कीजिए कि आप एक रोबोट (AI) को जटिल गणित के सवाल हल करना सिखा रहे हैं। आपके पास एक जज (वेरिफायर) है जो समाधान के बिल्कुल अंत में केवल "सही" या "गलत" कह सकता है।

  • समस्या: क्योंकि जज केवल अंत में बोलता है, रोबोट अक्सर रास्ता भटक जाता है। उसे यह नहीं पता चलता कि कौन सा कदम गलत था, इसलिए वह धीरे सीखता है और भ्रमित हो जाता है।
  • पुराना समाधान: मदद करने के लिए, शोधकर्ताओं ने एक रेफरेंस मॉडल (एक "शिक्षक") पेश किया। उन्होंने रोबोट से कहा: "शिक्षक की शैली के करीब रहो।" इसने ट्रेनिंग को स्थिर बनाया, लेकिन एक नई समस्या पैदा कर दी।
  • नई समस्या: कभी-कभी, रोबोट समस्या को हल करने का एक बेहतर तरीका खोज लेता है जो शिक्षक ने कभी नहीं सीखा था। लेकिन क्योंकि रोबोट को शिक्षक के करीब रहने के लिए मजबूर किया जाता है, सिस्टम उसे अलग होने के लिए दंडित करता है। यह एक ऐसे छात्र की तरह है जिसने उत्तर तक पहुँचने का एक तेज़ शॉर्टकट खोज लिया है, लेकिन शिक्षक चिल्लाता है, "नहीं! तुम्हें उसी लंबे रास्ते पर चलना होगा जो मैंने सिखाया था!" रोबol फंस जाता है और शिक्षक के स्तर से ऊपर नहीं बढ़ पाता।

समाधान: वन-वे पॉलिसी ऑप्टिमाइजेशन (OWPO)

लेखक OWPO नामक एक नई विधि प्रस्तावित करते हैं। इसे एक स्मार्ट कोच के रूप में सोचें जो दिशा (Direction) को गति (Speed) से अलग करता है।

1. कोच का नियम:

  • दिशा: जज तय करता है कि किस दिशा में जाना है। यदि जज कहता है, "यह रास्ता अच्छा है," तो रोबोट उसी दिशा में जाता है। यदि जज कहता है, "यह रास्ता बुरा है," तो रोबोट वापस मुड़ जाता है। शिक्षक कभी भी दिशा तय नहीं करता।
  • गति: शिक्षक तय करता है कि कितनी तेज़ी से आगे बढ़ना है।

2. दो-तरफा रास्ता (असिमेट्रिक रीवेटिंग):
OWPO रोबोट के प्रयासों के साथ अलग-अलग व्यवहार करता है, चाहे वे शिक्षक से "बुरे" हों या "बेहतर"।

  • परिदृश्य A: जब रोबोट पीछे रह रहा हो (इन्फीरियर डेविएशन)
    • स्थिति: रोबोट अनिश्चित है या ऐसी गलतियाँ कर रहा है जहाँ शिक्षक आश्वस्त था।
    • कार्रवाई: कोच सीखने की गति बढ़ा देता है। वह कहता है, "तुम यहाँ शिक्षक से पीछे हो! तेज़ी से चलो और बराबरी करो!" इसे एक्सेलेरेटेड एलाइनमेंट कहा जाता है।
  • परिदृश्य B: जब रोबोट आगे निकल रहा हो (सुपीरियर डेविएशन)
    • स्थिति: रोबोट एक बेहतर समाधान खोज लेता है या शिक्षक से अधिक आत्मविश्वासी होता है।
    • कार्रवाई: कोच बदलावों की गति धीमी कर देता है। वह कहता है, "तुम यहाँ कुछ बहुत अच्छा कर रहे हो! बहुत ज़्यादा बदलाव मत करो, वरना तुम इस अच्छे विचार को गलती से खो सकते हो।" इसे गेन लॉकिंग कहा जाता है। यह रोबोट के नए, बेहतर विचारों को रैंडम शोर (noise) से बह जाने से बचाता है।

"रैचेट इफेक्ट": छत को तोड़ना

अतीत में, एक बार जब रोबोट शिक्षक जितना अच्छा हो जाता था, तो वह उससे बेहतर नहीं हो पाता था क्योंकि शिक्षक ही उसकी सीमा था।

OWPO एक रैचेट मैकेनिज्म (एक ऐसे उपकरण की तरह जो केवल एक दिशा में घूमता है और कभी पीछे नहीं हटता) पेश करता है।

  • हर कुछ चरणों के बाद, रोबोट एक ब्रेक लेता है, अपने सबसे अच्छे काम को देखता है, और कहता है, "ठीक है, अब मैं ही शिक्षक हूँ।"
  • यह अपने वर्तमान सर्वश्रेष्ठ स्वरूप को ही अपना रेफरेंस मॉडल बना लेता है।
  • यह एक सीढ़ी बनाता है। रोबोट ऊपर चढ़ता है, उस पायदान को लॉक करता है, और फिर उस नए ऊँचाई को आधार बनाकर और ऊपर चढ़ने के लिए उपयोग करता है। वह कभी भी पुराने, कमजोर शिक्षक की ओर वापस नहीं फिसलता।

यह क्यों महत्वपूर्ण है (परिणाम)

पेपर ने गणित की समस्याओं (जैसे AIME प्रतियोगिता) पर इसका परीक्षण किया।

  • पुरानी विधियाँ: रोबोट शिक्षक के स्तर के पास ही फंस जाता था। यदि शिक्षक 37% अच्छा था, तो रोबro 37% या 38% के आसपास ही रहता था।
  • OWPO: रोबोट ने उस छत को तोड़ दिया। उसने 30% से शुरुआत की, शिक्षक को पार किया, और 40% से अधिक सटीकता तक पहुँचा।
  • स्थिरता: अन्य विधियों के विपरीत, जो बहुत अधिक रचनात्मक होने की कोशिश में अस्थिर हो सकती हैं, OWPO अपने अच्छे विचारों को सुरक्षित रखने के लिए रोबोट को स्थिर रखता है।

सारांश उपमा

कल्पना कीजिए कि एक हाइकर (AI) पहाड़ चढ़ने की कोशिश कर रहा है।

  • जज शिखर की ओर इशारा करने वाला कंपास है।
  • पुराना शिक्षक एक नक्शा था जो कहता था, "इस विशिष्ट रास्ते पर ही रहो।" यदि हाइकर को कोई शॉर्टकट मिला, तो नक्शा उन्हें वापस पुराने रास्ते पर ले जाता था।
  • OWPO एक स्मार्ट गाइड है। गाइड कहता है: "यदि तुम रास्ते से भटक गए हो और खो गए हो, तो वापस आने के लिए तेज़ी से दौड़ो। लेकिन यदि तुम्हें कोई ऐसा शॉर्टकट मिलता है जो तुम्हें और ऊपर ले जाता है, तो धीरे चलो और सावधानी से चलो ताकि तुम फिसल न जाओ, लेकिन उस नए रास्ते पर चलते रहो। एक बार जब तुम एक नए ऊँचे बिंदु पर पहुँच जाओ, तो नक्शे को अपडेट कर दो कि अब तुम विशेषज्ञ हो, और वहीं से अगला शॉर्टकट ढूँढना शुरू करो।"

यह AI को निरंतर विकसित होने की अनुमति देता है, जिससे वह लगातार बेहतर होता जाता है, बिना किसी बाहरी "सुपर-टीचर" के हाथ पकड़ने की ज़रूरत के।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →