← नवीनतम पेपर
💻 computer science

Don't Forget the Critic: Value-Based Data Rehearsal for Multi-Cyclic Continual Reinforcement Learning

यह शोध पत्र Qreg+NWLU का प्रस्ताव करता है, जो एक वैल्यू-आधारित डेटा रिहर्सल विधि है जो मल्टी-साइक्लिक कॉन्टिनुअल रीइन्फोर्समेंट लर्निंग के लिए निरंतर Q-वैल्यू संग्रह और तत्काल "नो-वेट" रेगुलाइजेशन को पेश करके एक्टर-सेंट्रिक दृष्टिकोणों की सीमाओं को दूर करती है ताकि कैटास्ट्रोफिक फॉरगेटिंग को प्रभावी ढंग से कम किया जा सके और नॉलेज ट्रांसफर को बढ़ाया जा सके।

मूल लेखक: Benjamin Poole, Andrew Quinn, Li Yang, Minwoo Lee

प्रकाशित 2026-05-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Benjamin Poole, Andrew Quinn, Li Yang, Minwoo Lee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को वीडियो गेम खेलना सिखा रहे हैं। पहले, वह Flappy Bird खेलना सीखता है। फिर, आप उसे Catcher पर स्विच करते हैं, और फिर उसे Room नामक एक भूलभुलैया वाले गेम पर ले जाते हैं। लक्ष्य यह है कि रोबोट इन सभी में कुशल हो जाए बिना पहले वाले गेम को भूले।

आर्टिफिशियल इंटेलिजेंस की दुनिया में, इसे कंटीन्यूअल लर्निंग (Continual Learning) कहा जाता है। सबसे बड़ी समस्या जो रोबोटों के सामने आती है, वह है "कैटैस्ट्रोफिक फॉरगेटिंग" (विनाशकारी विस्मृति)। यह एक छात्र की तरह है जो गणित की परीक्षा के लिए पढ़ाई करता है, फिर तुरंत इतिहास की परीक्षा के लिए पढ़ना शुरू कर देता है, और इस प्रक्रिया में वह गणित करना पूरी तरह से भूल जाता है।

पुराना तरीका: "एक्टर" बनाम "क्रिटिक"

अधिकांश पिछले शोधों ने केवल रोबोट की "मांसपेशियों की याददाश्त" (जिसे एक्टर/Actor कहा जाता है) पर ध्यान केंद्रित करने की कोशिश की। उन्होंने डेटा रिहर्सल (Data Rehearsal) नामक एक तकनीक का उपयोग किया, जो एक छोटे नोटबुक के नोट्स देने जैसा है जिससे रोबोट नए गेम सीखते समय अपने पुराने गेम्स के नोट्स देख सके।

हालाँकि, रोबोट के मस्तिष्क का एक दूसरा हिस्सा भी था जिसे क्रिटिक (Critic) या वैल्यू फंक्शन कहा जाता था। क्रिटिक एक कोच की तरह है जो लगातार मूल्यांकन करता है: "यह चाल कितनी अच्छी है? मुझे कितना इनाम मिलेगा?"

पिछले शोधकर्ताओं ने पाया कि यदि वे क्रिटिक को पुराने स्कोर याद दिलाने के लिए "नोटबुक" (रिहर्सल) का उपयोग करने की कोशिश करते, तो रोबोट वास्तव में सीखने में और खराब हो जाता। इसलिए, उन्होंने क्रिटिक की मदद करने के बजाय केवल एक्टर की मदद करना ही बेहतर समझा। इस पेपर के लेखक कहते हैं, "रुकिए, हम मस्तिष्क के आधे हिस्से को अनदेखा कर रहे हैं!" वे यह देखना चाहते थे कि क्या वे क्रिटिक को बिना खराब किए उसे ठीक कर सकते हैं।

नया विचार: Qreg+NWLU

लेखकों ने Qreg (Q-value Regularization) नामक एक नई विधि का परीक्षण किया। यह सरल रूप से नोटबुक का उपयोग करके क्रिटिक को यह याद दिलाना है कि पुराने मूव्स के स्कोर क्या हुआ करते थे

लेकिन उन्होंने पाया कि इसे करने का मानक तरीका बहुत अव्यवस्थित था। यह अपनी पाठ्यपुस्तक का केवल अंतिम पृष्ठ पढ़ने या पूरे सेमेस्टर के खत्म होने तक नोट्स देखने का इंतजार करने जैसा था। इससे रोबोट भ्रमित हो जाता था या चीजें जल्दी भूल जाता था।

इसे ठीक करने के लिए, उन्होंने दो सरल बदलाव पेश किए, जिन्हें उन्होंने Qreg+NWLU नामक एक नई विधि में मिला दिया:

  1. लाइव अपडेट्स (The "Live" Strategy):

    • समस्या: पुराने तरीके में, रोबोट कोई भी नोट सुरक्षित करने से पहले एक पूरा गेम लेवल खत्म होने का इंतजार करता था। यदि रोबोध लेवल की शुरुआत में गलती करता, तो वे नोट्स कभी सुरक्षित नहीं किए जाते।
    • समाधान: अब, रोबोट खेलते समय लगातार (continuously) नोट्स लिखता है। यह एक छात्र द्वारा लेक्चर के दौरान वास्तविक समय में नोट्स लेने जैसा है, न कि क्लास खत्म होने के बाद सब कुछ याद करने की कोशिश करने जैसा। यह सुनिश्चित करता है कि नोट्स विविध हों और पूरे गेम को कवर करें, न कि केवल अंत को।
  2. नो-वेट (The "No-Wait" Strategy):

    • समस्या: पुराने तरीके में कहा गया था, "जब तक पहला गेम खत्म न हो जाए, तब तक अपने पुराने नोट्स मत देखो।" इसका मतलब था कि रोबोट दूसरे गेम को सीखना शुरू करते समय एक "कोल्ड स्टार्ट" के साथ शुरू करता था, जिससे वह सब कुछ तुरंत भूल जाता था।
    • समाधान: जैसे ही रोबोट के पास अपने नोटबुक में कोई भी नोट्स होते हैं, वह नए गेम को सीखने में मदद के लिए उनका उपयोग करना शुरू कर देता है। यह एक छात्र के समान है जो पहले पाठ के खत्म होने का इंतजार करने के बजाय, नए क्लासरूम में कदम रखते ही अपने पुराने नोट्स की समीक्षा करना शुरू कर देता है।

"मल्टी-साइक्लिक" चुनौती

लेखकों ने Multi-Cyclic नामक एक विशेष वातावरण में भी इसका परीक्षण किया। कल्पना कीजिए कि रोबोट Flappy Bird खेलता है, फिर Catcher, फिर Room। लेकिन फिर, चक्र फिर से शुरू होता है: Flappy Bird फिर से, फिर Catcher फिर से।

वास्तविक जीवन में, हम अक्सर दोहराई जाने वाली स्थितियों का सामना करते हैं (जैसे, एक रोबोट वैक्यूम क्लीनर हर दिन एक ही कमरों की सफाई करता है, या एक स्टॉक ट्रेडर हर सप्ताह एक ही बाजार पैटर्न देखता है)। लेखकों ने पाया कि अधिकांश रोबोट इस लूप में बुरी तरह विफल हो जाते हैं; जैसे-जैसे चक्र बार-बार दोहराया जाता है, वे और खराब होते जाते हैं। हालाँकि, उनकी नई विधि ने रोबोट को चक्र के कई बार गुजरने के बाद भी पुराने गेम्स को याद रखने में सक्षम बनाया।

परिणाम

जब उन्होंने इस नई Qreg+NWLU विधि का परीक्षण किया:

  • उसने बेहतर याद रखा: रोबोट दूसरा गेम सीखते समय पहला गेम खेलना नहीं भूलता।
  • उसने तेजी से सीखा: क्योंकि वह तुरंत नोट्स की समीक्षा कर रहा था ("No-Wait"), उसने बुनियादी चीजों को दोबारा सीखने में समय बर्बाद नहीं किया।
  • यह अधिक स्थिर था: रोबोट का प्रदर्शन जीनियस होने और भ्रमित होने के बीच बहुत अधिक उतार-चढ़ाव नहीं करता था।

निष्कर्ष

यह पेपर तर्क देता है कि रोबोट को निरंतर सीखने के लिए सिखाने हेतु, हमें केवल उसके "मांसपेशियों" (एक्टर) को प्रशिक्षित नहीं करना चाहिए; हमें उसके "कोच" (क्रिटिक) को भी प्रशिक्षित करना चाहिए। कोच को एक ऐसी नोटबुक देकर जो लाइव (live) अपडेट होती है और जिसे तुरंत (immediately) रिव्यु किया जाता है, रोबोट पुराने कार्यों को भूले बिना नए कार्य सीख सकता है, भले ही वे कार्य बार-बार दोहराए जा रहे हों।

उन्होंने यह दावा नहीं किया कि यह AI की हर समस्या को हल कर देता है, लेकिन उन्होंने साबित किया कि एक विशिष्ट प्रकार के लर्निंग एल्गोरिदम (जिसे DQN कहा जाता है) के लिए, "Live" और "No-Wait" का यह सरल संयोजन विस्मृति को रोकने के लिए एक गेम-चेंजर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →