← नवीनतम पेपर
🤖 machine learning

Near-Future Policy Optimization

यह शोध पत्र नियर-फ्यूचर पॉलिसी ऑप्टिमाइज़ेशन (NPO) का प्रस्ताव करता है, जो एक मिश्रित-पॉलिसी सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) विधि है जो अभिसरण (कन्वर्जेंस) को गति देने और प्रदर्शन में सुधार करने के लिए उच्च-गुणवत्ता वाले, कम-विचलन वाले प्रशिक्षण संकेतों के रूप में मॉडल के अपने भविष्य के चेकपॉइंट्स का लाभ उठाता है, साथ ही इसमें ऑटोएनपीओ (AutoNPO) नामक एक अनुकूलित संस्करण भी है जो इस प्रक्रिया को स्वचालित रूप से अनुकूलित करता है।

मूल लेखक: Chuanyu Qin, Chenxu Yang, Qingyi Si, Naibin Gu, Dingyu Yao, Zheng Lin, Peng Fu, Nan Duan, Jiaqi Wang

प्रकाशित 2026-04-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chuanyu Qin, Chenxu Yang, Qingyi Si, Naibin Gu, Dingyu Yao, Zheng Lin, Peng Fu, Nan Duan, Jiaqi Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छात्र को जटिल गणित की समस्याएं हल करना सिखा रहे हैं। आपके पास एक पाठ्यपुस्तक (AI मॉडल) है, और आप चाहते हैं कि वह और भी बुद्धिमान बने।

AI की दुनिया में, एक लोकप्रिय विधि है जिसे Reinforcement Learning with Verifiable Rewards (RLVR) कहा जाता है। इसे एक "कोशिश करो, असफल हो जाओ, सीखो" वाले लूप के रूप में सोचें। छात्र एक समस्या को हल करने की कोशिश करता है। यदि वह सही उत्तर देता है, तो उसे एक 'गोल्ड स्टार' मिलता है। यदि वह गलत होता है, तो वह फिर से प्रयास करता है। लक्ष्य अधिक से अधिक गोल्ड स्टार प्राप्त करना है।

हालाँकि, इस विधि के साथ एक समस्या है: छात्र अटक जाता है।

  • शुरुआत में: उसे कठिन समस्याओं को हल करने के लिए पर्याप्त ज्ञान नहीं है, इसलिए उसे शायद ही कभी गोल्ड स्टार मिलते हैं। वह एक "कोल्ड स्टार्ट" (cold start) में फंस जाता है।
  • बाद में: वह कुछ प्रकार की समस्याओं में कुशल हो जाता है लेकिन सुधार करना बंद कर देता है। वह एक "सीलिंग" (ceiling) या सीमा पर पहुँच जाता है जहाँ वह केवल एक ही तरह की रणनीतियों को दोहराता रहता है, भले ही वे रणनीतियाँ एकदम सटीक न हों।

पुराने समाधान (और वे क्यों विफल रहे)

शोधकर्ताओं ने बाहरी मदद लाकर इसे ठीक करने की कोशिश की, लेकिन दोनों विकल्पों में खामियां थीं:

  1. "सुपर-जीनियस ट्यूटर" (बाहरी शिक्षक): आप एक बहुत ही बुद्धिमान शिक्षक को लाते हैं जो छात्र को समस्या हल करने का तरीका दिखाता है।
    • समस्या: शिक्षक बहुत अधिक बुद्धिमान है। उनके सोचने का तरीका छात्र से इतना अलग है कि छात्र भ्रमित हो जाता है। यह वैसा ही है जैसे किसी छोटे बच्चे को क्वांटम फिजिक्स सिखाने की कोशिश करना। छात्र पाठ को आत्मसात नहीं कर पाता क्योंकि अंतर बहुत अधिक है।
  2. "पुराना होमवर्क" (पिछले ट्राजेक्टरीज): आप छात्र को पिछले सप्ताह के अपने सफल होमवर्क को फिर से देखने के लिए कहते हैं।
    • समस्या: होमवर्क बहुत आसान है। छात्र वह सब पहले ही सीख चुका है। यह उसे कुछ नया या कठिन सीखने के लिए प्रेरित नहीं करता। वह बस वही करता रहता है जो वह पहले से जानता है।

नया विचार: "नियर-फ्यूचर पॉलिसी ऑप्टिमाइजेशन" (NPO)

लेखकों ने एक शानदार, सरल समाधान निकाला: छात्र को उसके अपने "भविष्य के स्वरूप" (future self) से सीखने दें।

एक टाइम मशीन की कल्पना करें। आप आज छात्र के प्रशिक्षण को रोक देते हैं। आप उसे भविष्य में 20 कदम आगे ले जाते हैं, जहाँ उसने थोड़ा और सीखा है। आप उस "भविष्य के छात्र" को लेते हैं, उसे कठिन समस्याओं को हल करने के लिए कहते हैं, और फिर उन समाधानों को वापस "वर्तमान छात्र" के पास ले आते हैं।

यही NPO है।

यह "गोल्डिलॉक्स" (Goldilocks) समाधान क्यों है?

  • बहुत दूर नहीं (सुपर-जीनियस की तरह नहीं): "भविष्य का छात्र" केवल थोड़ा ही आगे है। वह वर्तमान छात्र की तरह ही सोचता है, इसलिए सबक समझना आसान है।
  • बहुत करीब नहीं (पुराने होमवर्क की तरह नहीं): "भविष्य के छात्र" ने कुछ नए तरीके सीख लिए हैं और वह उन समस्याओं को हल कर सकता है जिनमें वर्तमान छात्र विफल हो रहा है। वह एक ऐसी चुनौती प्रदान करता है जो बिल्कुल सही है।

व्यवहार में यह कैसे काम करता है

शोधकर्ताओं ने इसे दो तरीकों से परखा:

  1. "अर्ली बूस्ट" (Early Boost): शुरुआत में, छात्र संघर्ष कर रहा होता है। सिस्टम प्रशिक्षण के कुछ मिनट आगे के "भविट छात्र" को चुनता है। यह वर्तमान छात्र को एक शुरुआती बढ़त देता है, जिससे वह अपने दम पर सीखने की तुलना में तेजी से सीख पाता है।
  2. "सीलिंग ब्रेकर" (Ceiling Breaker): बाद में, जब छात्र एक पठार (plateau) पर पहुँच जाता है (सुधार करना बंद कर देता है), तो सिस्टम बहुत आगे के "भविष्य के छात्र" को चुनता है। उस छात्र ने कठिन तरकीबें सीख ली हैं। इन समाधानों को वर्तमान छात्र को दिखाकर, सिस्टम उस पठार को तोड़ देता है और छात्र को उच्च स्तर की बुद्धिमत्ता तक पहुँचा देता है।

उन्होंने एक AutoNPO प्रणाली भी बनाई। यह एक स्मार्ट कोच की तरह है जो छात्र पर नज़र रखता है। यदि कोच देखता है कि छात्र अटक गया है या ऊब गया है, तो कोच स्वचालित रूप से निर्णय लेता है, "ठीक है, चलिए भविष्य के छात्र को एक त्वरित सबक के लिए लाते हैं," बिना किसी मानवीय हस्तक्षेप के।

परिणाम

जब उन्होंने गणित और दृश्य पहेलियों (visual puzzles) को हल करने के लिए एक शक्तिशाली AI मॉडल (Qwen3-VL) पर इसका परीक्षण किया:

  • गति: AI शुरुआत में लगभग 2.1 गुना तेजी से सीखा।
  • कौशल: AI ने अन्य सभी विधियों की तुलना में उच्च अंतिम स्कोर प्राप्त किया, जिससे वह अधिक कठिन समस्याओं को हल करने में सक्षम हुआ।
  • दक्षता: इसे किसी सुपर-कंप्यूटर या अलग शिक्षक की आवश्यकता नहीं थी; इसे बस अपने थोड़े भविष्य के स्वरूप को देखने की आवश्यकता थी।

बड़ा चित्र रूपक (Metaphor)

पहाड़ चढ़ने की कल्पना करें।

  • मानक AI एक ऐसे हाइकर (पर्वतारोही) की तरह है जो अपने आप रास्ता खोजने की कोशिश कर रहा है। कभी-कभी वह कोहरे में खो जाता है (शुरुआती चरण), और कभी-कभी वह एक समतल सतह पर अटक जाता है (अंतिम चरण)।
  • बाहरी शिक्षक एक हेलीकॉप्टर की तरह हैं जो दूसरे पर्वत श्रृंखला से एक नक्शा गिराते हैं। नक्शा तो उत्तम है, लेकिन भूभाग बहुत अलग है, जिससे हाइकर उसका उपयोग नहीं कर पाता।
  • पिछले ट्राजेक्टरीज पहाड़ के निचले हिस्से के नक्शे को देखने जैसा है। यह परिचित है, लेकिन यह आपको ऊपर चढ़ने में मदद नहीं करता।
  • NPO एक हाइकर के अपने ही थोड़ा आगे के संस्करण को देखने जैसा है जिसने अभी-अभी अगला हाथ रखने योग्य स्थान (handhold) खोजा है। यह वही पहाड़ है, वही हाइकर है, बस कुछ कदम आगे है। यह एक आदर्श मार्गदर्शक है क्योंकि यह जानता है कि हाइकर कहाँ है और उसे आगे कहाँ जाना है।

संक्षेप में: सीखने का सबसे अच्छा तरीका किसी जीनियस को सुनना या अपने पुराने नोट्स को फिर से पढ़ना नहीं है; यह उस व्यक्ति से सीखना है जो आप बनने वाले हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →