← नवीनतम पेपर
🤖 machine learning

Hadamard Representation: Scaffolding Performance Across Model-free RL

यह शोध पत्र हैडामार्ड रिप्रेजेंटेशन (Hadamard Representation) का प्रस्ताव करता है, जो एक सरल आर्किटेक्चरल संशोधन है जो मानक हिडन लेयर्स को दो स्वतंत्र लेयर्स के एलिमेंट-वाइज प्रोडक्ट्स से बदल देता है ताकि न्यूरॉन डॉर्मेंसी को रोका जा सके और प्रभावी रैंक को बढ़ाया जा सके, जिससे बिना किसी हाइपरपैरामीटर ट्यूनिंग की आवश्यकता के कई डोमेन में विविध मॉडल-फ्री रीइन्फोर्समेंट लर्निंग एल्गोरिदम के प्रदर्शन में निरंतर सुधार होता है।

मूल लेखक: Jacob E. Kooi, Zhao Yang, Mark Hoogendoorn, Vincent François-Lavet

प्रकाशित 2026-05-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jacob E. Kooi, Zhao Yang, Mark Hoogendoorn, Vincent François-Lavet

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को वीडियो गेम खेलने या इंसान की तरह चलने के लिए प्रशिक्षित कर रहे हैं। आप उसे एक "दिमाग" देते हैं जो एक डीप न्यूरल नेटवर्क से बना है, जो अनिवार्य रूप से नन्हे कार्यकर्ताओं (न्यूरॉन्स) की एक विशाल टीम है जो सूचनाओं को आगे भेजते हैं।

यह शोध पत्र तर्क देता है कि जैसे-जैसे ये रोबोट सीखते हैं, उनके दिमाग बीमार होने लगते हैं। विशेष रूप से, कई कार्यकर्ता पूरी तरह से काम करना बंद कर देते हैं, और जो काम करते रहते हैं वे एक लूप में फंस जाते हैं, बार-बार एक ही बेकार विचार को दोहराते रहते हैं। यह रोबोट की क्षमता को कम कर देता है, भले ही वह लंबे समय से प्रशिक्षण ले रहा हो।

लेखक एक सरल समाधान प्रस्तावित करते हैं जिसे हाडामार्ड रिप्रेजेंटेशन (Hadamard Representation - HR) कहा जाता है। इसे एक चतुर वास्तुशिल्प अपग्रेड के रूप में समझें जो दिमाग को बीमार होने से रोकता है और इसे अधिक रचनात्मक रूप से सोचने में मदद करता है।

यहाँ समस्या और समाधान का रोजमर्रा के उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

समस्या: "मौन षड्यंत्रकारी" (The Silent Saboteurs)

AI की दुनिया में, सूचना को प्रोसेस करने के लिए दो मुख्य प्रकार के "कार्यकर्ता" (एक्टिवेशन फंक्शन्स) उपयोग किए जाते हैं: ReLU और Tanh

  1. ReLU कार्यकर्ता (द "मृत" कर्मचारी):
    कल्पना कीजिए कि एक कार्यकर्ता जो, जब वह थक जाता है या भ्रमित हो जाता है, तो बस बोलना बंद कर देता है और "0" आउटपुट देता है। यदि वह शून्य आउटपुट देता है, तो श्रृंखला में अगला व्यक्ति उसे पूरी तरह से अनदेखा कर देता है। यह एक मौन कर्मचारी की तरह है जिसे नौकरी से निकाल दिया गया है; वे चले गए हैं, लेकिन वे कोई समस्या पैदा नहीं करते हैं। टीम उनके बिना भी काम चला लेती है।

  2. Tanh कार्यकर्ता (द "फंसा हुआ" कर्मचारी):
    यह पेचीदा वाला है। जब एक Tanh कार्यकर्ता थक जाता है, तो वह बोलना बंद नहीं करता है। इसके बजाय, वह हमेशा "हाँ!" (+1) या "नहीं!" (-1) चिल्लाते हुए फंस जाता है, चाहे स्थिति कुछ भी हो।

    • खतरा: क्योंकि वे अभी भी चिल्ला रहे हैं, श्रृंखला में अगला व्यक्ति उनकी बात सुनता है। लेकिन चूंकि चिल्लाना हमेशा एक जैसा होता है, यह एक छिपे हुए, अपरिवर्तनीय पूर्वाग्रह (bias) के रूप में कार्य करता है। यह एक अटके हुए रेडियो की तरह है जो बैकग्राउंड में एक ही गाना बजा रहा है और बातचीत को विकृत कर रहा है। रोबोट सोचता है कि यह निरंतर शोर वास्तविक दुनिया का हिस्सा है, जो उसके निर्णयों को बिगाड़ देता है। शोध पत्र इसे "मौन रूप से भ्रष्ट" (silently corrupting) करने वाला कहता है।

समाधान: "हाडामार्ड रिप्रेजेंटेशन" (HR)

लेखक एक सरल समाधान सुझाते हैं: एक कार्यकर्ता के बजाय, दो स्वतंत्र कार्यकर्ताओं को काम करने दें, और फिर उनके उत्तरों को आपस में गुणा (multiply) करें।

एक निर्णय लेने वाली समिति की कल्पना करें।

  • पुराना तरीका: एक व्यक्ति बोलता है। यदि वह "हाँ" चिल्लाते हुए फंस जाता है, तो पूरी समिति "हाँ" की ओर झुकी हुई होती है।
  • नया तरीका (HR): दो लोग स्वतंत्र रूप से बोलते हैं। अंतिम निर्णय तभी लिया जाता है जब दोनों अपने विचारों के एक विशिष्ट संयोजन पर सहमत होते हैं।

यह दो शक्तिशाली लाभ पैदा करता है:

1. "सुरक्षा जाल" प्रभाव (फंसे हुए चिल्लाने को रोकना)

"फंसे हुए" Tanh कार्यकर्ताओं के बेकार होने के लिए, दोनों स्वतंत्र कार्यकर्ताओं को एक ही समय में फंसना होगा।

  • उपमा: कल्पना कीजिए कि दो लोग कीचड़ के गड्ढे में फंसने की कोशिश कर रहे हैं। एक व्यक्ति के फंसना कठिन है। यह अत्यंत असंभव है कि दो लोग, अलग-अलग स्थानों पर खड़े होकर, ठीक एक ही समय पर और ठीक एक ही तरीके से फंस जाएं।
  • परिणाम: "फंसे हुए" कार्यकर्ता बहुत दुर्लभ हो जाते हैं। दिमाग लचीला रहता है और उन छिपे हुए, निरंतर पूर्वाग्रहों से भ्रष्ट नहीं होता है।

2. "दोहरी दृष्टि" प्रभाव (समृद्ध सोच)

भले ही कार्यकर्ता फंसे न हों, लेकिन दो लोगों को समस्या को देखने और उनके अंतर्दृष्टि को गुणा करने से एक बहुत ही समृद्ध बातचीत पैदा होती है।

  • उपमा: यदि आप एक व्यक्ति से बिल्ली का वर्णन करने के लिए कहते हैं, तो वह कह सकता है "रोएंदार"। यदि आप दो लोगों से पूछते हैं और उनके विवरणों को गुणा करते हैं, तो आपको "रोएंदार और तेज़" जैसी जटिल समझ मिल सकती है।
  • परिणाम: रोबोट अधिक श्रमिकों (न्यूरॉन्स) को नियुक्त किए बिना अधिक जटिल पैटर्न को समझ सकता है। वह बड़ा हुए बिना अधिक स्मार्ट बनता है।

उन्होंने क्या पाया

शोधकर्ताओं ने इस विचार का परीक्षण तीन बहुत अलग प्रकार की चुनौतियों पर किया:

  1. एटारी गेम्स खेलना (Atari Games): (जैसे Pong या Breakout)। यहाँ, "फंसे हुए कार्यकर्ता" की समस्या बहुत बड़ी थी। HR का उपयोग करने से रोबोटों ने काफी बेहतर प्रदर्शन किया, और पुराने तरीकों को बड़े अंतर से पीछे छोड़ दिया।
  2. चलने वाले रोबोट (State-based): ऐसे रोबोट जो सेंसर का उपयोग करके चलना सीखते हैं (जैसे एक रोबोट कुत्ता)। यहाँ, "फंसे हुए कार्यकर्ता" की समस्या दुर्लभ थी, लेकिन "दोहरी दृष्टि" (Double Vision) प्रभाव ने रोबोटों को तेजी से सीखने और बेहतर चलने में मदद की।
  3. चलने वाले रोबोट (Visual-based): ऐसे रोबोट जो केवल कैमरा स्क्रीन देखकर चलना सीखते हैं। यहाँ भी, HR ने बिना किसी अतिरिक्त ट्यूनिंग के प्रदर्शन में सुधार किया।

निचोड़ (The Bottom Line)

यह शोध पत्र दिखाता है कि डीप लर्निंग एजेंट अक्सर सीखने की अपनी क्षमता खो देते हैं क्योंकि उनके आंतरिक "कार्यकर्ता" बुरी आदतों में फंस जाते हैं। केवल आर्किटेक्चर को बदलकर—जिसमें दो समानांतर पथों का उपयोग किया जाता है जो अपने परिणामों को गुणा करते हैं—लेखकों ने एक ऐसी प्रणाली बनाई जो:

  • कार्यकर्ताओं को एक लूप में फंसने से रोकती है।
  • मस्तिष्क को बिना बड़ा हुए अधिक जटिल विचारों को समझने की अनुमति देती है।
  • बिना सेटिंग्स को बदले कई अलग-अलग प्रकार के रोबोटों और खेलों में काम करती है।

यह एक छोटा सा संरचनात्मक परिवर्तन है जो एक वैक्सीन की तरह काम करता है, जो लंबे प्रशिक्षण सत्रों के दौरान होने वाले "ब्रेन रॉट" (दिमाग के सड़ने) को रोकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →