Beyond Binary Rewards: A Comparative Study of Reward Design for Reinforcement Unlearning
यह शोध पत्र सुदृढीकरण अनलर्निंग (Reinforcement Unlearning) के लिए एक सिद्धांतपूर्ण रिवॉर्ड डिकंपोजिशन फ्रेमवर्क प्रस्तुत करता है जो स्पार्स बाइनरी रिवार्ड्स को ग्रेडेड एक्सपोनेंशियल और पेजरैंक-प्रेरित कार्यों से प्रतिस्थापित करता है, यह प्रदर्शित करते हुए कि ये डिज़ाइन सामान्य मॉडल उपयोगिता को संरक्षित करते हुए विशिष्ट ज्ञान को भूलने की प्रक्रिया को महत्वपूर्ण रूप से तेज़ करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने एक विशाल, सुपर-स्मार्ट रोबोट दिमाग बनाया है, जिसे पूरे इंटरनेट को खिलाकर तैयार किया गया है। यह कहानियाँ लिखने, गणित की समस्याओं को हल करने और किसी भी विषय पर बातचीत करने में अद्भुत है। लेकिन इसमें एक पेंच है: कभी-कभी, यह उन चीजों को याद रखता है जिन्हें इसे नहीं जानना चाहिए, जैसे कि किसी सेलिब्रिटी का निजी घर का पता या कोई कॉपीराइट वाली किताब की कहानी जिसे इसे नहीं जानना चाहिए था। वास्तविक दुनिया में, GDPR जैसे कानून लोगों को "भूल जाने का अधिकार" देते हैं, जिसका अर्थ है कि वे अपना डेटा मिटाने की मांग कर सकते हैं। इसे ठीक करने का पुराना तरीका खराब डेटा को डिलीट करना और पूरे रोबोट को फिर से शून्य से बनाना था, जो एक गगनचुंबी इमारत को हटाने के लिए उसे पूरी तरह ढहाने जैसा है। यह धीमा, महंगा और बर्बादी भरा है। वैज्ञानिक अब रोबोट को अपने अन्य कौशल खोए बिना विशिष्ट तथ्यों को "अनलर्न" (unlearn) करना सिखाने की कोशिश कर रहे हैं। इसे करने के लिए, वे 'रीइन्फोर्समेंट लर्निंग' (Reinforcement Learning) नामक तकनीक का उपयोग करते हैं, जो एक कुत्ते को प्रशिक्षित करने जैसा है: जब वह सही काम करता है तो आप उसे इनाम (पुरस्कार) देते हैं और जब वह गलती करता है तो कुछ नहीं देते। लक्ष्य रोबोट को प्रतिबंधित जानकारी भूलने के लिए प्रशिक्षित करना है जबकि उसकी सामान्य बुद्धिमत्ता को बरकरार रखना है।
आप जो शोध पत्र पढ़ने जा रहे हैं, वह इस "कुत्ता प्रशिक्षण" पद्धति की एक विशिष्ट समस्या पर काम करता है। वर्तमान में, रोबोटों को एक बहुत ही साधारण रिवॉर्ड सिस्टम के साथ प्रशिक्षित किया जा रहा है: एक सरल "हाँ/नहीं" का संकेत। यदि रोबोट गलती से प्रतिबंधित नाम का उल्लेख करता है, तो उसे शून्य मिलता है। यदि वह ऐसा नहीं करता है, तो उसे एक मिलता है। यह एक शिक्षक की तरह है जो छात्र से कहता है, "तुम्हारा उत्तर गलत है," बिना यह बताए कि वह कितना गलत था या वह सही होने के कितने करीब था। यह सीखने की प्रक्रिया को धीमा और निराशाजनक बना देता है क्योंकि रोबोट को पता ही नहीं चलता कि वह सुधार कर रहा है या सिर्फ अनुमान लगा रहा है। इस अध्ययन के लेखक, एफ़स्ट्रैटियोस ज़रादौकास और उनकी टीम ने एक सरल प्रश्न पूछा: "क्या होगा अगर हम रोबोट को एक बेहतर स्कोरकार्ड दें?" एक पास/फेल ग्रेड के बजाय, उन्होंने एक विस्तृत रिपोर्ट देने की कोशिश की जो दिखाती है कि उसने कितनी गलतियाँ कीं और उन गलतियों का महत्व क्या था। उन्होंने स्कोरिंग के दो नए तरीके परीक्षण किए: एक जो रोबlet को अधिक दंडित करता है यदि वह बार-बार गलती करता है (जैसे एक "स्ट्रिक ब्रेकर"), और दूसरा जो एक "लोकप्रियता प्रतियोगिता" (Popularity Contest) की तरह कार्य करता है, जहाँ मुख्य सेलिब्रिटी को भूलना उनके मामूली साइड किरदारों को भूलने से अधिक महत्वपूर्ण है।
RWKU नामक एक मानक बेंचमार्क पर उनके प्रयोग बताते हैं कि ये स्मार्ट स्कोरिंग सिस्टम पुराने पास/फेल मेथड की तुलना में बहुत बेहतर काम करते हैं। टीम ने पाया कि इन "ग्रेड वाले" रिवॉर्ड्स का उपयोग करके, रोबोट प्रतिबंधित जानकारी को पुराने बाइनरी मेथड की तुलना में तीन गुना तेजी से भूल सकता है। यह ऐसा है जैसे रोबोट अंधेरे में लड़खड़ाने के बजाय एक टॉर्च का उपयोग कर रहा हो जो उसे ठीक से दिखा रही है कि बाधाएं कहाँ हैं। महत्वपूर्ण बात यह है कि रोबोट ने अन्य चीजें करने की अपनी क्षमता नहीं खोई; वह बस उन विशिष्ट चीजों को भूलने में बेहतर हो गया जिन्हें उसे भूलने के लिए कहा गया था। लेखक दिखाते हैं कि रिवॉर्ड्स का डिज़ाइन ही मशीन अनलर्निंग को कुशल और व्यावहारिक बनाने में एक प्रमुख घटक है, जो हर बार शुरुआत से शुरू किए बिना एक स्वच्छ, अधिक जिम्मेदार AI का मार्ग प्रशस्त करता है।
"भुलक्कड़" रोबोट की कहानी
समस्या: द ब्लंट स्टिक (Blunt Stick)
कल्पना कीजिए कि आप एक तोते को एक विशिष्ट शब्द, जैसे "बनाना" (Banana), बोलना बंद करने के लिए सिखा रहे हैं। पुराने तरीके में (जिसे पेपर में "बाइनरी रिवॉर्ड" कहा गया है), आप केवल तभी ताली बजाते हैं जब तोता उस शब्द को कभी भी नहीं बोलता। यदि वह एक बार "बनाना" बोलता है, तो आप चुप रहते हैं। यदि वह इसे दस बार बोलता है, तो भी आप चुप रहते हैं। तोते को यह अंदाजा नहीं होता कि वह लक्ष्य के करीब पहुँच रहा है या वह पहले जैसा ही बुरा है। यह एक "स्पार्स" (sparse) सिग्नल है—तोते के सीखने के लिए बहुत कम जानकारी उपलब्ध है। पेपर का तर्क है कि यही कारण है कि वर्तमान AI अनलर्निंग धीमी है; AI अंधेरे में अनुमान लगा रहा है।
समाधान: द de Graded Scorecard (Graded Scorecard)
लेखक ताली बजाने (या न बजाने) के दो नए तरीके प्रस्तावित करते हैं जो तोते को बहुत बेहतर फीडबैक देते हैं।
"एक्सपोनेंशियल" रिवॉर्ड (The Streak Counter):
कल्पना कीजिए कि तोता एक वाक्य में तीन बार "बनाना" बोलता है। पुराना तरीका उसे शून्य देता है। नया "एक्सपोनेंशियल" तरीका कहता है, "ठीक है, तुमने इसे तीन बार कहा, इसलिए तुम्हारा स्कोर थोड़ा कम है, लेकिन शून्य नहीं है।" यदि वह इसे एक बार कहता है, तो स्कोर उच्च है लेकिन पूर्ण नहीं। यदि वह इसे दस बार कहता है, तो स्कोर तेजी से गिर जाता है। यह AI को फीडबैक का एक स्मूथ कर्व (smooth curve) देता है। यह एक वीडियो गेम की तरह है जहाँ आपके हिट लगने पर आपकी हेल्थ बार धीरे-धीरे कम होती है, न कि एक बार टकराते ही तुरंत गायब हो जाती है। यह AI को समझने में मदद करता है कि उसे कितना सुधार करने की आवश्यकता है।"पेजरैंक" रिवॉर्ड (The Importance Map):
यह सबसे चतुर हिस्सा है। कल्पना कीजिए कि प्रतिबंधित शब्द केवल "बनाना" नहीं है, बल्कि एक प्रसिद्ध लेखक, जैसे "स्टीफन किंग" से संबंधित शब्दों की एक पूरी सूची है। सूची में "स्टीफन किंग", "द शाइनिंग", "द स्टैंड" और "कैरी" शामिल हैं।
- पुराना तरीका इन सभी शब्दों के साथ एक जैसा व्यवहार करता है। "स्टीफन किंग" को भूलना "द स्टैंड" को भूलने जितना ही आसान है।
- नया "पेजरैंक" तरीका कनेक्शन (संबंधों) को देखता है। "स्टीफन किंग" मुख्य पात्र है; "द शाइनिंग" उनकी सबसे प्रसिद्ध पुस्तक है। यदि AI "स्टीफन किंग" को भूल जाता है, तो यह एक बड़ी जीत है। यदि वह "द स्टैंड" को भूल जाता है, तो यह अच्छा है, लेकिन उतना महत्वपूर्ण नहीं।
- पेपर एक ग्राफ (कनेक्शन का नक्शा) का उपयोग करता है ताकि यह पता लगाया जा सके कि कौन से शब्द "बॉस" हैं और कौन से "मिनियन" (सेवक) हैं। यह एक बड़ा दंड देता है यदि AI "बॉस" को भूल जाता है लेकिन अभी भी "मिनियन्स" का उल्लेख करता है, और छोटा दंड देता है यदि वह "मिनियन्स" को भूल जाता है लेकिन "बॉस" को याद रखता है। यह एक ऐसे शिक्षक की तरह है जिसे कहानी के मुख्य विचार को याद रखने की आपकी क्षमता की परवाह है, न कि किसी मामूली पात्र के नाम की।
परिणाम: तेज़ और स्मार्ट
टीम ने इन विचारों का परीक्षण 3.8-बिलियन पैरामीटर वाले लैंग्वेज मॉडल (एक बहुत स्मार्ट लेकिन सबसे बड़ा नहीं AI) पर किया, जिसका उपयोग RWKU नामक बेंचमार्क के लिए किया गया है। यहाँ उन्हें क्या मिला:
- गति (Speed): नए तरीकों ने AI को लक्षित जानकारी को पुराने बाइनरी मेथड की तुलना में 3 गुना तेजी से भुला दिया। पेपर के ग्राफ में, "पेजरैंक" विधि ने 500 स्टेप्स में वही स्तर प्राप्त कर लिया जो पुराने मेथड को हासिल करने में 1,500 स्टेप्स लगे थे।
- गुणवत्ता (Quality): AI ने न केवल तेजी से भुला, बल्कि बेहतर तरीके से भुला। "पेजरैंक" विधि विशेष रूप से सबसे महत्वपूर्ण तथ्यों को पहले लक्षित करने में अच्छी थी।
- दुष्प्रभाव (Side Effects): अनलर्निंग में एक बड़ी चिंता यह है कि कहीं AI सब कुछ न भूल जाए, यहाँ तक कि अच्छी चीजें भी (जैसे गणित करना या कविता लिखना)। पेपर दिखाता है कि इन नए रिवॉर्ड मेथड्स ने AI के सामान्य कौशल (जैसे तर्क और प्रवाह) को लगभग पहले जैसा ही बनाए रखा। इसके "यूटिलिटी" (उपयोगिता) स्कोर में गिरावट नहीं आई।
उन्होंने क्या खारिज किया
पेपर ने यह देखने के लिए कुछ बदलावों का भी परीक्षण किया कि सबसे अच्छा क्या काम करता है।
- उन्होंने पाया कि यदि "एक्सपोनेंशियल" रिवॉर्ड बहुत सख्त (जैसे बाइनरी रिवॉर्ड) है, तो यह अच्छा काम नहीं करता।
- उन्होंने पेजरैंक स्कोर को फैलाने के विभिन्न तरीकों को आजमाया। उन्होंने पाया कि स्कोर को समान रूप से फैलाने (लीनियर) के बजाय "सॉफ्टमैक्स" (Softmax) विधि का उपयोग करना बेहतर था, जो स्कोर को धीरे से संकुचित करती है ताकि सबसे महत्वपूर्ण वस्तुओं पर सबसे अधिक ध्यान दिया जा सके, लेकिन कम महत्वपूर्ण वस्तुओं को भी थोड़ा दंड मिले।
- उन्होंने पुष्टि की कि आपको यह करने के लिए मूल ट्रेनिंग डेटा जानने की आवश्यकता नहीं है; आप केवल यह देखकर रिवॉर्ड की पुष्टि कर सकते हैं कि AI क्या कह रहा है।
निष्कर्ष (The Takeaway)
पेपर सुझाव देता है कि AI को चीजें कुशलता से भूलने के लिए सिखाने का रहस्य केवल अनलर्निंग एल्गोरिदम के गणित में नहीं है, बल्कि रिवॉर्ड के डिज़ाइन में है। एक साधारण "पास/फेल" सिस्टम से हटकर एक सूक्ष्म, ग्रेड वाले सिस्टम की ओर बढ़कर, जो विभिन्न तथ्यों के महत्व को समझता है, हम AI को विशिष्ट यादों को बहुत तेज़ी से और अधिक प्रभावी ढंग से भूलना सिखा सकते। यह रोबोट के लिए "ताली बजाने" के तरीके में एक छोटा सा बदलाव है, लेकिन यह रोबोट को बहुत कम समय में भूलना सीखने में मदद करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।