Near-Future Policy Optimization
यह शोध पत्र नियर-फ्यूचर पॉलिसी ऑप्टिमाइज़ेशन (NPO) का प्रस्ताव करता है, जो एक मिश्रित-पॉलिसी सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) विधि है जो अभिसरण (कन्वर्जेंस) को गति देने और प्रदर्शन में सुधार करने के लिए उच्च-गुणवत्ता वाले, कम-विचलन वाले प्रशिक्षण संकेतों के रूप में मॉडल के अपने भविष्य के चेकपॉइंट्स का लाभ उठाता है, साथ ही इसमें ऑटोएनपीओ (AutoNPO) नामक एक अनुकूलित संस्करण भी है जो इस प्रक्रिया को स्वचालित रूप से अनुकूलित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक छात्र को जटिल गणित की समस्याएं हल करना सिखा रहे हैं। आपके पास एक पाठ्यपुस्तक (AI मॉडल) है, और आप चाहते हैं कि वह और भी बुद्धिमान बने।
AI की दुनिया में, एक लोकप्रिय विधि है जिसे Reinforcement Learning with Verifiable Rewards (RLVR) कहा जाता है। इसे एक "कोशिश करो, असफल हो जाओ, सीखो" वाले लूप के रूप में सोचें। छात्र एक समस्या को हल करने की कोशिश करता है। यदि वह सही उत्तर देता है, तो उसे एक 'गोल्ड स्टार' मिलता है। यदि वह गलत होता है, तो वह फिर से प्रयास करता है। लक्ष्य अधिक से अधिक गोल्ड स्टार प्राप्त करना है।
हालाँकि, इस विधि के साथ एक समस्या है: छात्र अटक जाता है।
- शुरुआत में: उसे कठिन समस्याओं को हल करने के लिए पर्याप्त ज्ञान नहीं है, इसलिए उसे शायद ही कभी गोल्ड स्टार मिलते हैं। वह एक "कोल्ड स्टार्ट" (cold start) में फंस जाता है।
- बाद में: वह कुछ प्रकार की समस्याओं में कुशल हो जाता है लेकिन सुधार करना बंद कर देता है। वह एक "सीलिंग" (ceiling) या सीमा पर पहुँच जाता है जहाँ वह केवल एक ही तरह की रणनीतियों को दोहराता रहता है, भले ही वे रणनीतियाँ एकदम सटीक न हों।
पुराने समाधान (और वे क्यों विफल रहे)
शोधकर्ताओं ने बाहरी मदद लाकर इसे ठीक करने की कोशिश की, लेकिन दोनों विकल्पों में खामियां थीं:
- "सुपर-जीनियस ट्यूटर" (बाहरी शिक्षक): आप एक बहुत ही बुद्धिमान शिक्षक को लाते हैं जो छात्र को समस्या हल करने का तरीका दिखाता है।
- समस्या: शिक्षक बहुत अधिक बुद्धिमान है। उनके सोचने का तरीका छात्र से इतना अलग है कि छात्र भ्रमित हो जाता है। यह वैसा ही है जैसे किसी छोटे बच्चे को क्वांटम फिजिक्स सिखाने की कोशिश करना। छात्र पाठ को आत्मसात नहीं कर पाता क्योंकि अंतर बहुत अधिक है।
- "पुराना होमवर्क" (पिछले ट्राजेक्टरीज): आप छात्र को पिछले सप्ताह के अपने सफल होमवर्क को फिर से देखने के लिए कहते हैं।
- समस्या: होमवर्क बहुत आसान है। छात्र वह सब पहले ही सीख चुका है। यह उसे कुछ नया या कठिन सीखने के लिए प्रेरित नहीं करता। वह बस वही करता रहता है जो वह पहले से जानता है।
नया विचार: "नियर-फ्यूचर पॉलिसी ऑप्टिमाइजेशन" (NPO)
लेखकों ने एक शानदार, सरल समाधान निकाला: छात्र को उसके अपने "भविष्य के स्वरूप" (future self) से सीखने दें।
एक टाइम मशीन की कल्पना करें। आप आज छात्र के प्रशिक्षण को रोक देते हैं। आप उसे भविष्य में 20 कदम आगे ले जाते हैं, जहाँ उसने थोड़ा और सीखा है। आप उस "भविष्य के छात्र" को लेते हैं, उसे कठिन समस्याओं को हल करने के लिए कहते हैं, और फिर उन समाधानों को वापस "वर्तमान छात्र" के पास ले आते हैं।
यही NPO है।
यह "गोल्डिलॉक्स" (Goldilocks) समाधान क्यों है?
- बहुत दूर नहीं (सुपर-जीनियस की तरह नहीं): "भविष्य का छात्र" केवल थोड़ा ही आगे है। वह वर्तमान छात्र की तरह ही सोचता है, इसलिए सबक समझना आसान है।
- बहुत करीब नहीं (पुराने होमवर्क की तरह नहीं): "भविष्य के छात्र" ने कुछ नए तरीके सीख लिए हैं और वह उन समस्याओं को हल कर सकता है जिनमें वर्तमान छात्र विफल हो रहा है। वह एक ऐसी चुनौती प्रदान करता है जो बिल्कुल सही है।
व्यवहार में यह कैसे काम करता है
शोधकर्ताओं ने इसे दो तरीकों से परखा:
- "अर्ली बूस्ट" (Early Boost): शुरुआत में, छात्र संघर्ष कर रहा होता है। सिस्टम प्रशिक्षण के कुछ मिनट आगे के "भविट छात्र" को चुनता है। यह वर्तमान छात्र को एक शुरुआती बढ़त देता है, जिससे वह अपने दम पर सीखने की तुलना में तेजी से सीख पाता है।
- "सीलिंग ब्रेकर" (Ceiling Breaker): बाद में, जब छात्र एक पठार (plateau) पर पहुँच जाता है (सुधार करना बंद कर देता है), तो सिस्टम बहुत आगे के "भविष्य के छात्र" को चुनता है। उस छात्र ने कठिन तरकीबें सीख ली हैं। इन समाधानों को वर्तमान छात्र को दिखाकर, सिस्टम उस पठार को तोड़ देता है और छात्र को उच्च स्तर की बुद्धिमत्ता तक पहुँचा देता है।
उन्होंने एक AutoNPO प्रणाली भी बनाई। यह एक स्मार्ट कोच की तरह है जो छात्र पर नज़र रखता है। यदि कोच देखता है कि छात्र अटक गया है या ऊब गया है, तो कोच स्वचालित रूप से निर्णय लेता है, "ठीक है, चलिए भविष्य के छात्र को एक त्वरित सबक के लिए लाते हैं," बिना किसी मानवीय हस्तक्षेप के।
परिणाम
जब उन्होंने गणित और दृश्य पहेलियों (visual puzzles) को हल करने के लिए एक शक्तिशाली AI मॉडल (Qwen3-VL) पर इसका परीक्षण किया:
- गति: AI शुरुआत में लगभग 2.1 गुना तेजी से सीखा।
- कौशल: AI ने अन्य सभी विधियों की तुलना में उच्च अंतिम स्कोर प्राप्त किया, जिससे वह अधिक कठिन समस्याओं को हल करने में सक्षम हुआ।
- दक्षता: इसे किसी सुपर-कंप्यूटर या अलग शिक्षक की आवश्यकता नहीं थी; इसे बस अपने थोड़े भविष्य के स्वरूप को देखने की आवश्यकता थी।
बड़ा चित्र रूपक (Metaphor)
पहाड़ चढ़ने की कल्पना करें।
- मानक AI एक ऐसे हाइकर (पर्वतारोही) की तरह है जो अपने आप रास्ता खोजने की कोशिश कर रहा है। कभी-कभी वह कोहरे में खो जाता है (शुरुआती चरण), और कभी-कभी वह एक समतल सतह पर अटक जाता है (अंतिम चरण)।
- बाहरी शिक्षक एक हेलीकॉप्टर की तरह हैं जो दूसरे पर्वत श्रृंखला से एक नक्शा गिराते हैं। नक्शा तो उत्तम है, लेकिन भूभाग बहुत अलग है, जिससे हाइकर उसका उपयोग नहीं कर पाता।
- पिछले ट्राजेक्टरीज पहाड़ के निचले हिस्से के नक्शे को देखने जैसा है। यह परिचित है, लेकिन यह आपको ऊपर चढ़ने में मदद नहीं करता।
- NPO एक हाइकर के अपने ही थोड़ा आगे के संस्करण को देखने जैसा है जिसने अभी-अभी अगला हाथ रखने योग्य स्थान (handhold) खोजा है। यह वही पहाड़ है, वही हाइकर है, बस कुछ कदम आगे है। यह एक आदर्श मार्गदर्शक है क्योंकि यह जानता है कि हाइकर कहाँ है और उसे आगे कहाँ जाना है।
संक्षेप में: सीखने का सबसे अच्छा तरीका किसी जीनियस को सुनना या अपने पुराने नोट्स को फिर से पढ़ना नहीं है; यह उस व्यक्ति से सीखना है जो आप बनने वाले हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।