← नवीनतम पेपर
🤖 machine learning

ESPO: Early-Stopping Proximal Policy Optimization

यह शोध पत्र ESPO (अर्ली-स्टॉपिंग प्रॉक्सिमल पॉलिसी ऑप्टिमाइजेशन) का प्रस्ताव करता है, जो एक सुदृढीकरण लर्निंग (रीइन्फोर्समेंट लर्निंग) एल्गोरिदम है जो शोर को समाप्त करने और कंप्यूट बचाने के लिए विफल होने वाले रीजनिंग ट्रेजेक्टरीज को गतिशील रूप से समाप्त करता है, जिससे AIME और MATH-500 जैसे बेंचमार्क पर गणितीय तर्क प्रदर्शन में सुधार होता है और टोकन उपयोग में 20% से अधिक की कमी आती है।

मूल लेखक: Zihang Li, Rui Zhou, Yingcheng Shi, Wenhan Yu, Zhewen Tan, Zixiang Liu, Zeming Li, Binhua Li, Yongbin Li, Tong Yang, Jieping Ye

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zihang Li, Rui Zhou, Yingcheng Shi, Wenhan Yu, Zhewen Tan, Zixiang Liu, Zeming Li, Binhua Li, Yongbin Li, Tong Yang, Jieping Ye

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन कभी-कभी अति-आत्मविश्वासी छात्र (एक लार्ज लैंग्वेज मॉडल) को जटिल गणित की समस्याएं हल करना सिखा रहे हैं।

समस्या: गलत मोड़ों का "डूबी हुई लागत" (Sunk Cost)

वर्तमान में इन मॉडलों को प्रशिक्षित करने के तरीके (जिसे PPO कहा जाता है) में, छात्र को एक समस्या दी जाती है और उसे अपना पूरा समाधान चरण-दर-चरण लिखने के लिए कहा जाता है।

यहाँ पेंच यह है: यदि छात्र पहले वाक्य में एक छोटी सी गलती करता है—जैसे किसी संख्या को गलत पहचानना या गलत फॉर्मूला चुन लेना—तो उसके बाद का पूरा निबंध बर्बाद हो जाता है। चाहे वह अगले 500 शब्दों को कितनी भी खूबसूरती से क्यों न लिखे, उत्तर गलत ही होगा।

हालाँकि, मानक प्रशिक्षण विधि छात्र को एक सख्त शब्द सीमा तक लिखते रहने के लिए मजबूर करती है, भले ही गलती हो चुकी हो।

  • बर्बादी: कंप्यूटर उन सैकड़ों बेकार शब्दों को उत्पन्न करने में समय और ऊर्जा खर्च करता है जो कभी "अच्छे ग्रेड" नहीं पा सकेंगे।
  • भ्रम: जब शिक्षक (एल्गोरिदम) पूरे निबंध को देखता है ताकि यह तय किया जा सके कि छात्र को क्या सिखाना है, तो वह भ्रमित हो जाता है। वह अंत में "बुरे" टेक्स्ट के बड़े ब्लॉक को देखता है और सोचता है, "ओह, छात्र वाक्य के अंत में बुरा था," बजाय इसके कि वह यह समझ सके कि समस्या बिल्कुल शुरुआत में हुई थी। यह "शोर" (noise) सीखने की प्रक्रिया को धीमा और कम कुशल बना देता है।

समाधान: ESPO (द "अर्ली स्टॉप" कोच)

यहाँ एक नया तरीका पेश किया गया है जिसे ESPO (अर्ली-स्टॉपिंग प्रॉक्सिमल पॉलिसी ऑप्टिमाइजेशन) कहा जाता है। ESPO को एक ऐसे कोच के रूप में सोचें जो छात्र को वास्तविक समय (real-time) में देखता है और उसके पास यह कहने का अधिकार है, "रुको! तुम पटरी से उतर गए हो। चलो फिर से कोशिश करते हैं।"

ESPO कैसे काम करता है, इसके सरल उदाहरण यहाँ दिए गए हैं:

1. "रिग्रेट" (पछतावा) रडार
हर बार जब छात्र एक शब्द चुनता है, तो मॉडल एक "रिग्रेट स्कोर" (Regret Score) की गणना करता है।

  • उदाहरण: कल्पना करें कि छात्र के पास एक अंतर्ज्ञान (gut feeling) है कि कौन सा शब्द सबसे अच्छा है (वह "लालची" विकल्प)। यदि वे एक ऐसा शब्द चुनते हैं जो उनके अंतर्ज्ञान से बहुत अलग है, तो रिग्रेट स्कोर बढ़ जाता है।
  • जादू: ESPO को हर कदम पर नए शिक्षक या मानव द्वारा ग्रेड देने की आवश्यकता नहीं होती है। यह केवल छात्र के अपने आंतरिक "अंतर्ज्ञान" (शब्द चयन के पीछे का गणित) को देखकर यह पता लगा लेता है कि क्या वह हिचकिचा रहा है या बेतरतीब ढंग से अनुमान लगा रहा है।

2. "वैल्यू" गेट (मूल्य द्वार)
कोच एक "वैल्यू मीटर" (Value Meter) की भी जाँच करता है। यह मीटर भविष्यवाणी करता है कि वर्तमान पथ में कितनी "अच्छाई" शेष है।

  • तर्क: यदि छात्र एक ऐसे पथ पर है जो आशाजनक दिखता है (High Value), तो कोच उन्हें एक छोटी सी गलती से उबरने के लिए थोड़ी अधिक छूट देता है। लेकिन यदि पथ निराशाजनक दिखता है (Low Value) और छात्र उच्च रिग्रेट (भ्रम) दिखा रहा है, तो कोच तुरंत काम रोक देता है।

3. "एब्जॉर्बिंग फेलियर" (विफलता को सोखने) का नियम
जब ESPO छात्र को रोकता है, तो यह केवल यह नहीं कहता कि "फिर से प्रयास करें।" यह उस विशिष्ट क्षण को एक टर्मिनल फेलियर (अंतिम विफलता) के रूप में चिह्नित करता है।

  • उदाहरण: छात्र को ढेर सारा कचरा लिखने देने और फिर पूरे निबंध को शून्य देने के बजाय, ESPO कहता है, "तुमने यहाँ गलती की। बाकी का निबंध अस्तित्व में ही नहीं है।"
  • लाभ: यह छात्र को एक बहुत ही स्पष्ट और तीखा संकेत भेजता है: "गलती ठीक यहाँ हुई थी, न कि अंत में।" इससे छात्र को ठीक-ठीक पता चलता है कि वह कहाँ गलत हुआ, बिना उस कचरा टेक्स्ट के शोर के जो उसके बाद आया था।

परिणाम: तेज़, स्मार्ट और सस्ता

पेपर ने विभिन्न आकार के मॉडलों का उपयोग करके गणित की समस्याओं (जैसे AIME और AMC प्रतियोगिताओं) पर ESPO का परीक्षण किया।

  • बेहतर ग्रेड: ESPO के साथ प्रशिक्षित मॉडलों ने वास्तव में इन कठिन गणित परीक्षणों पर उच्च स्कोर प्राप्त किया। उन्होंने अधिक समस्याओं को सही ढंग से हल किया।
  • ऊर्जा की बचत: क्योंकि मॉडलों ने तब लिखना बंद कर दिया जब उन्हें पता चल गया कि वे गलत थे, उन्होंने आमतौर पर बेकार टेक्स्ट उत्पन्न करने में खर्च होने वाली कंप्यूटर शक्ति (टोकन) के 20% से अधिक को बचा लिया।
  • कोई अतिरिक्त शिक्षक नहीं: अन्य तरीकों के विपरीत जिनमें प्रत्येक चरण को ग्रेड देने के लिए मनुष्यों को नियुक्त करने की आवश्यकता होती है, ESPO यह काम स्वचालित रूप से अपने स्वयं के आंतरिक संकेतों का उपयोग करके करता है।

सारांश

संक्षेप में, ESPO एक प्रशिक्षण तकनीक है जो भाषा मॉडल को उस विचार प्रक्रिया पर समय और ऊर्जा बर्बाद करने से रोकती है जो पहले ही दुर्घटनाग्रस्त हो चुकी है। "बुरे" हिस्सों को जल्दी काट कर और यह स्पष्ट रूप से चिह्नित करके कि गलती कहाँ हुई थी, यह मॉडल को तेजी से सीखने, कठिन समस्याओं को हल करने और कम कंप्यूटिंग पावर का उपयोग करने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →