← नवीनतम पेपर
🤖 machine learning

TSN-Affinity: Similarity-Driven Parameter Reuse for Continual Offline Reinforcement Learning

यह शोध पत्र TSN-Affinity का प्रस्ताव करता है, जो एक नवीन निरंतर ऑफलाइन सुदृढीकरण शिक्षण (continual offline reinforcement learning) विधि है जो कार्य-विशिष्ट पैरामीट्रिकरण और समानता-संचालित ज्ञान साझाकरण को सक्षम करने के लिए TinySubNetworks और एक डिसीजन ट्रांसफॉर्मर का लाभ उठाती है, जो रीप्ले-आधारित रणनीतियों के लिए एक स्मृति-कुशल विकल्प प्रदान करती है जो डिस्क्रीट और कंटीन्यूअस कंट्रोल कार्यों में कैटास्ट्रोफिक फॉरगेटिंग (catastrophic forgetting) को प्रभावी ढंग से कम करती है।

मूल लेखक: Dominik Żurek, Kamil Faber, Marcin Pietron, Paweł Gajewski, Roberto Corizzo

प्रकाशित 2026-04-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dominik Żurek, Kamil Faber, Marcin Pietron, Paweł Gajewski, Roberto Corizzo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को वीडियो गेम खेलना और एक रोबोटिक आर्म (robotic arm) चलाना सिखाने की कोशिश कर रहे हैं। पेच यह है कि आप रोबोट को वास्तविक दुनिया में अभ्यास करने की अनुमति नहीं दे सकते क्योंकि यह बहुत महंगा या खतरनाक है। इसके बजाय, आपको उसे इंसानों द्वारा किए गए इन कार्यों के पुराने वीडियो रिकॉर्डिंग (डेटासेट्स) के पुस्तकालय का उपयोग करके सिखाना होगा।

अब, कल्पना कीजिए कि आपको हर हफ्ते रोबोट को एक नया गेम सिखाना है। "कंटीन्यूअल ऑफलाइन रीइन्फोर्समेंट लर्निंग" (Continual Offline Reinforcement Learning - CORL) की बड़ी समस्या है: भूल जाना (forgetting)। यदि आप रोबोट को Breakout खेलना सिखाते हैं, तो वह इसमें इतना अच्छा हो सकता है कि वह Pong खेलना भूल जाए। यदि आप पुराने डेटा को हटाए बिना उसे Pong सिखाने की कोशिश करते हैं, तो रोबोट भ्रमित हो जाएगा और दोनों खेलों को बिगाड़ देगा।

यह पेपर इस समस्या को हल करने के लिए एक नया तरीका TSN-Affinity पेश करता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. पुराना तरीका: "एक बड़ा दिमाग" वाली समस्या (The "One Big Brain" Problem)

अधिकांश पिछले तरीकों ने रोबोट को एक विशाल, साझा मस्तिष्क का उपयोग करके सिखाने की कोशिश की। भूलने से बचने के लिए, वे पुराने वीडियो के छोटे अंशों (रीप्ले) को सहेजते थे और उन्हें नए वीडियो के साथ मिला देते थे।

  • खामी: यह फ्रेंच सीखते समय अंग्रेजी बोलने और फिर स्पेनिश सीखते समय दोनों भाषाओं का उपयोग करने जैसा है। अंततः, भाषाएँ आपस में मिल जाती हैं, या आपको सब कुछ व्यवस्थित रखने के लिए पुरानी टेपों के एक विशाल पुस्तकालय की आवश्यकता होती है, जिसमें बहुत अधिक जगह लगती है।

2. नया तरीका: TSN-Affinity ("मॉड्यूलर टूलबॉक्स" वाला तरीका)

लेखक TinySubNetworks का उपयोग करके एक स्मार्ट दृष्टिकोण प्रस्तावित करते हैं। कल्पना कीजिए कि रोबोट का मस्तिष्क एक विशाल गांठ नहीं है, बल्कि कई छोटे, विशिष्ट दराजों (drawers) वाला एक टूलबॉक्स है।

  • विशिष्ट दराज (Subnetworks): जब रोबोट एक नया कार्य सीखता है (जैसे Breakout), तो वह अपने पूरे मस्तिष्क को फिर से नहीं लिखता है। इसके बजाय, वह एक विशिष्ट, छोटा दराज खोलता है और उसे उस खेल के लिए आवश्यक सटीक उपकरणों से भर देता है। एक बार जब वह दराज बंद हो जाता है, तो वह बिल्कुल वैसा ही रहता है जैसा वह था। यदि आप बाद में एक नया खेल सीखते हैं, तो आप एक अलग दराज खोलते हैं। इसका मतलब है कि रोबोट पुराने खेलों को कभी नहीं भूलता क्योंकि पुराने उपकरण सुरक्षित रखे गए हैं और अछूते हैं।

3. असली मंत्र: "एफिनिटी रूटिंग" (द स्मार्ट लाइब्रेरियन)

यदि हर नए कार्य के लिए एक नया दराज बनाया जाता, तो टूलबॉक्स बहुत बड़ा और अस्त-व्यस्त हो जाता। पेपर का नवाचार एक स्मार्ट लाइब्रेरियन (जिसे रूटिंग मैकेनिज्म कहा जाता है) है जो तय करता है कि किस दराज का उपयोग करना है।

रोबोट नया कार्य सीखना शुरू करने से पहले, लाइब्रेरियन पूछता है: "क्या यह नया कार्य उन पुराने कार्यों जैसा है जिनके लिए हमारे पास पहले से ही उपकरण मौजूद हैं?"

लाइब्रेरियन दो चीजें जाँचता है:

  1. एक्शन एफिनिटी (चालें/Moves): "क्या इस नए गेम के लिए आवश्यक चालें वैसी ही हैं जैसी हम पहले से जानते हैं?" (उदाहरण के लिए, यदि नए गेम में कूदना आवश्यक है, और हमारे पास पहले से ही एक "कूदने वाला" दराज है, तो शायद हम उसका उपयोग कर सकते हैं)।
  2. लेटेंट एफिनिटी (अनुभूति/Feel): "क्या यह नया कार्य रोबोट के मन के भीतर पुराने कार्यों जैसा 'महसूस' होता है?" (उदाहरण के लिए, क्या गेम के पैटर्न समान हैं, भले ही ग्राफिक्स अलग हों?)

निर्णय:

  • यदि वे समान हैं: लाइब्रेरियन कहता है, "बहुत बढ़िया! आइए मौजूदा दराज का पुन: उपयोग करें।" रोबोट पुराने उपकरणों का उपयोग करता है (जो स्थिर और सुरक्षित हैं) और बस उनके ऊपर कुछ नए, छोटे उपकरण जोड़ देता है। इससे जगह बचती है और प्रदर्शन में सुधार होता है।
  • यदि वे अलग हैं: लाइब्रेरियन कहता, "नहीं, यह बहुत अलग है।" वह नए कार्य के लिए एक नया, खाली दराज खोलता है।

4. परिणाम: वीडियो गेम्स बनाम रोबोट आर्म

लेखकों ने दो बहुत अलग चुनौतियों पर इसका परीक्षण किया:

  • वीडियो गेम्स (Atari): ये तेज़, पिक्सेल-आधारित गेम हैं जिनमें सरल बटन (डिस्क्रीट एक्शन्स) होते हैं।

    • परिणाम: यह तरीका एक बड़ी सफलता थी। "विशिष्ट दराजों" वाले दृष्टिकोण ने रोबोट को पुराने गेम भूलने से पूरी तरह रोक दिया। "स्मार्ट लाइब्रेरियन" ने सही उपकरणों का पुन: उपयोग करके रोबмट को और भी बेहतर प्रदर्शन करने में मदद की, जो अक्सर केवल एक गेम पर प्रशिक्षित रोबोट के प्रदर्शन के बराबर था।
  • रोबोट आर्म (Panda): इसमें 3D स्पेस में एक भौतिक हाथ को हिलाना और सुचारू, निरंतर गति (जैसे कप उठाना) शामिल है।

    • परिणाम: यह बहुत कठिन था। "स्मार्ट लाइब्रेरियन" को यह तय करने में कठिनाई हुई कि किन उपकरणों का पुन: उपयोग किया जाए क्योंकि गतिविधियाँ बहुत जटिल और विविध थीं। हालांकि यह तरीका पुराने "एक बड़े दिमाग" वाले तरीकों से बेहतर था, लेकिन इसने दिखाया कि जटिल शारीरिक कार्यों में उपकरणों का पुन: उपयोग करना कठिन है। रोबोट को पुराने कौशल को सुरक्षित रखने और नए, कठिन शारीरिक आंदोलनों को सीखने के बीच संतुलन बनाना पड़ा।

सारांश

TSN-Affinity एक छात्र को एक विशाल पाठ्यपुस्तक के बजाय अलग-अलग, लेबल किए गए नोटबुक देने जैसा है।

  • जब वे एक नया विषय सीखते हैं, तो वे एक ताज़ा नोटबुक खोलते हैं।
  • यदि नया विषय पुराने विषय के समान है, तो वे देखते हैं कि क्या वे शून्य से शुरू करने के बजाय पुराने नोट्स को आधार के रूप में उपयोग कर सकते हैं (पुन: उपयोग)।
  • यह सुनिश्चित करता है कि वे अतीत में सीखी गई चीजों को कभी न भूलें, और वे अलग-अलग विषयों को मिलाने से भ्रमित न हों।

यह पेपर साबित करता है कि पुराने डेटा से सीखने के लिए, यह जानना कि कब पुराने ज्ञान का पुन: उपयोग करना है और कब नए सिरे से शुरुआत करनी है, एक ही बड़ी ढेर में सब कुछ याद रखने की कोशिश करने से कहीं बेहतर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →