← नवीनतम पेपर
🤖 machine learning

Learning to Solve, Forgetting to Retain: Correct-Set Turnover in RLVR

यह शोध पत्र 'वेरिफिएबल रिवॉर्ड्स के साथ रिइन्फोर्समेंट लर्निंग' (RLVR) में "करेक्ट-सेट टर्नओवर" को एक छिपे हुए लागत के रूप में पहचानता है जहाँ पहले से हल की गई समस्याएँ अब हल करने योग्य नहीं रह जाती हैं, और \textbf{\method{}} का प्रस्ताव करता है, जो एक रिटेंशन-अवेयर मैकेनिज्म है जो अतिरिक्त रोलआउट ओवरहेड के बिना प्रतिगमन (रिग्रेशन) को रोकने के लिए समय-समय पर मास्टर किए गए प्रॉम्प्ट्स को पुन: पेश करता है।

मूल लेखक: Chuanyu Qin, Chenxu Yang, Qingyi Si, Naibin Gu, Peng Fu, Zheng Lin

प्रकाशित 2026-06-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chuanyu Qin, Chenxu Yang, Qingyi Si, Naibin Gu, Peng Fu, Zheng Lin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Learning to Solve, Forgetting to Retain" नामक शोध पत्र का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

बड़ी समस्या: AI सीखने की "लीकी बकेट" (छेद वाली बाल्टी)

कल्पना कीजिए कि आप एक छात्र (एक AI मॉडल) को गणित के सवाल हल करना सिखा रहे हैं। आप उन्हें एक अभ्यास टेस्ट देते हैं।

  • अच्छी खबर: जैसे-जैसे वे अध्ययन करते हैं, वे नए सवालों को हल करने में बेहतर होते जाते हैं। उनका स्कोर बढ़ता है।
  • बुरी खबर: जबकि वे नए तरीके सीख रहे होते हैं, वे चुपचाप उन समस्याओं को हल करना भूलते जा रहे होते हैं जिन्हें उन्होंने हफ्तों पहले महारत हासिल की थी।

यह शोध पत्र इस घटना को "Correct-Set Turnover" कहता है। यह एक ऐसी बाल्टी की तरह है जिसके नीचे छेद है। आप इसमें पानी (नए समाधान) डालते रहते हैं, लेकिन पानी बाहर भी निकल रहा होता है (पुराने समाधानों को भूलना)। अंततः, पानी का स्तर (सटीकता/accuracy) बढ़ना बंद हो जाता है, भले ही आप अभी भी कड़ी मेहनत कर रहे हों।

खोज: "रिपेयर विंडो" (मरम्मत का समय)

शोधकर्ताओं ने एक महत्वपूर्ण समय नियम की खोज की, जिसे वे "Repair-Window Principle" कहते हैं।

एक बार सीखी गई समस्या को एक ताज़ा बनी सड़क की तरह समझें।

  • यदि आप तुरंत दरार को ठीक करते हैं: तो एक व्यक्ति को इसे पैच करने में केवल पाँच मिनट लगते हैं। यह सस्ता और आसान है।
  • यदि आप तब तक प्रतीक्षा करते हैं जब तक सड़क पूरी तरह टूट न जाए: तो आपको पूरी सड़क खोदकर फिर से बनानी पड़ती है। इसमें कई दिन लगते हैं और बहुत खर्च आता है।

AI प्रशिक्षण में, यदि मॉडल किसी समस्या को हल करने के तुरंत बाद उसे भूल जाता है, तो वह केवल थोड़े से रिव्यु (समीक्षा) के साथ उसे बहुत जल्दी फिर से "याद" कर सकता है। लेकिन यदि आप बहुत अधिक प्रतीक्षा करते हैं, तो मॉडल को उस समस्या को शून्य से फिर से सीखना पड़ता है, जो धीमा और महंगा है। मानक AI प्रशिक्षण विधियाँ आमतौर पर पुरानी समस्याओं की जाँच करने के लिए बहुत अधिक प्रतीक्षा करती हैं, जिससे वे इस सस्ते "रिपेयर विंडो" को खो देती हैं।

समाधान: "ReMind" (एक स्मार्ट स्टडी गाइड)

इसे ठीक करने के लिए, लेखकों ने ReMind नामक एक विधि बनाई है।

एक ऐसे शिक्षक की कल्पना करें जो उन समस्याओं की एक विशेष सूची रखता है जिन्हें छात्र पहले ही सीख चुका है। केवल हमेशा के लिए नई समस्याओं पर आगे बढ़ने के बजाय, शिक्षक समय-समय पर उन पुरानी, सीखी हुई समस्याओं को वापस पाठ योजना में शामिल करता है।

ReMind इस प्रकार काम करता है:

  1. वॉचलिस्ट (निगरानी सूची): जब AI किसी समस्या को पूरी तरह से हल कर लेता है, तो ReMind उसे एक "रिव्यू क्यू" (समीक्षा कतार) में जोड़ देता है।
  2. स्वैप (बदलना): हर कुछ चरणों के बाद, ReMind कुछ नई समस्याओं को कतार में मौजूद कुछ पुरानी समस्याओं के साथ बदल देता है।
  3. चेक (जाँच): AI उन पुरानी समस्याओं को फिर से हल करने की कोशिश करता है।
    • यदि वह अभी भी इसे सही हल करता है: बहुत अच्छा! समस्या को सूची से हटा दिया जाता है (यह सुरक्षित है)।
    • यदि वह इसे गलत हल करता है: ओह! समस्या को दोबारा बाद में समीक्षा के लिए कतार के अंत में रख दिया जाता है।

सबसे अच्छी बात: यह AI की गति को धीमा नहीं करता है। ReMind AI को अतिरिक्त काम करने के लिए नहीं कहता; यह बस नए काम को पुराने काम से बदल देता है। यह एक शेफ की तरह है जो यह सुनिश्चित करने के लिए अपने द्वारा बनाए गए व्यंजन को चखता है कि उसका स्वाद अभी भी अच्छा है, बजाय इसके कि केवल जाँच करने के लिए एक नया भोजन बनाए।

जब उन्होंने इसे आज़माया तो क्या हुआ?

शोधकर्ताओं ने 20 अलग-अलग चुनौतियों पर इसका परीक्षण किया, जिनमें शामिल थे:

  • गणित के सवाल (केवल टेक्स्ट)।
  • इमेज पहेलियाँ (एक तस्वीर देखकर प्रश्न का उत्तर देना)।
  • वीडियो रीजनिंग (वीडियो देखकर समस्या को हल करना)।

परिणाम:

  • कम भूलना: AI मानक विधियों की तुलना में काफी कम समस्याओं को भूल गया।
  • उच्च स्कोर: क्योंकि AI ने अपने पुराने कौशल नहीं खोए, इसलिए उसके समग्र टेस्ट स्कोर बढ़ गए।
  • हर जगह प्रभावी: यह गणित, इमेज और वीडियो, सभी के लिए समान रूप से काम कर गया।

मुख्य निष्कर्ष (Takeaway)

यह शोध पत्र तर्क देता है कि AI की दुनिया में, अधिक सीखना ही एकमात्र तरीका नहीं है जिससे आप स्मार्ट बनते हैं। कभी-कभी, उच्च स्कोर प्राप्त करने की कुंजी केवल कम भूलना है।

पुरानी सीखों को पूरी तरह से भुला देने से पहले ही उनकी जाँच करके, हम AI की "बाल्टी" को बिना दोगुना पानी डाले भरा रख सकते हैं। यह एक सरल, कम लागत वाला तरीका है जो AI को अधिक स्थिर और विश्वसनीय बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →