← नवीनतम पेपर
🤖 AI

Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning

यह शोध पत्र एन्सेम्बल इलास्टिक डीक्यूएन (EEDQN) को प्रस्तुत करता है, जो एक वैल्यू-बेस्ड सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) एल्गोरिदम है जो ओवरएस्टिमेशन बायस (अति-आकलन पूर्वाग्रह) को प्रभावी ढंग से कम करने और कई मिनाटार (MinAtar) वातावरणों में बेहतर प्रदर्शन प्राप्त करने के लिए एडेप्टिव इलास्टिक मल्टी-स्टेप रिटर्न्स को होराइजन-डिपेंडेंट एन्सेम्बल एग्रीगेशन के साथ संयोजित करता है।

मूल लेखक: Adrian Ly, Richard Dazeley, Peter Vamplew, Francisco Cruz, Sunil Aryal

प्रकाशित 2026-07-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Adrian Ly, Richard Dazeley, Peter Vamplew, Francisco Cruz, Sunil Aryal

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को वीडियो गेम खेलना सिखा रहे हैं। रोबोट चीज़ों को आज़माकर, अंक (इनाम) प्राप्त करके, और यह समझने की कोशिश करके सीखता है कि कौन सी चालें उसे लंबे समय में सबसे अधिक अंक दिलाएंगी। इसे रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) कहा जाता है।

जिस विशिष्ट पद्धति के बारे में यह शोध पत्र बात करता है, उसे डीप क्यू-नेटवर्क (Deep Q-Network - DQN) कहा जाता है। DQN को एक ऐसे रोबोट के रूप में सोचें जिसके पास एक "क्रिस्टल बॉल" (भविष्य देखने वाला गोला) है जो यह अनुमान लगाती है कि भविष्य की चाल कितनी अच्छी होगी। हालाँकि, इस क्रिस्टल बॉल में एक दोष है: यह अत्यधिक आशावादी (overly optimistic) होने की प्रवृत्ति रखती है। क्योंकि रोबोट को शोर-शराबे वाले, अपूर्ण डेटा के आधार पर भविष्य का अनुमान लगाना पड़ता है, इसलिए वह कभी-कभी अनजाने में कई खराब अनुमानों में से "सबसे अच्छे" अनुमान को चुन लेता है। यह वैसा ही है जैसे कोई छात्र बहुविकल्पीय परीक्षा दे रहा हो और शुद्ध भाग्य से उत्तर पत्र पर सबसे ऊँची संख्या चुन ले, भले ही उसे वास्तव में उत्तर पता न हो। इससे रोबोट अपने कौशल को बढ़ा-चढ़ाकर आंकने लगता है, गलत निर्णय लेता है, और खराब प्रदर्शन के चक्र में फंस जाता है।

यह शोध पत्र एक नया समाधान पेश करता है जिसे एनसेंबल इलास्टिक डीक्यूएन (Ensemble Elastic DQN - EEDQN) कहा जाता है। यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. "समिति" बनाम "अकेला भेड़िया" (एनसेंबल लर्निंग)

मानक DQN भविष्यवाणियां करने के लिए एक एकल "क्रिस्टल बॉल" (एक न्यूरल नेटवर्क) का उपयोग करता है। EEDQN पांच अलग-अलग क्रिस्टल बॉल्स (नेटवर्क्स का एक समूह या एनसेंबल) की एक समिति (committee) का उपयोग करता है।

  • समस्या: यदि आप एक व्यक्ति से भविष्यवाणी करने के लिए कहते हैं, तो वह बहुत गलत हो सकता है।
  • समाधान: यदि आप पांच लोगों से पूछते हैं, तो आप अधिक विश्वसनीय परिणाम प्राप्त करने के लिए उनके उत्तरों का औसत निकाल सकते हैं। हालाँकि, शोध पत्र में पाया गया कि केवल औसत निकालना रोबोट को बहुत अधिक आशावादी होने से रोकने के लिए पर्याप्त नहीं है।

2. "खिंचने वाला रबर बैंड" (इलास्टिक मल्टी-स्टेप रिटर्न्स)

आमतौर पर, रोबोट केवल अगले ही कदम को देखकर सीखते हैं (जैसे एक कदम आगे बढ़ना और यह देखना कि क्या आप लड़खड़ा जाते हैं)। कभी-कभी, और आगे तक देखना बेहतर होता है, जैसे कि एक पूरा रास्ता बनाना।

  • पुराना तरीका: पिछले तरीकों में आगे देखने के लिए एक निश्चित दूरी का उपयोग किया जाता था (जैसे, हमेशा 5 कदम आगे देखें)। यह कठोर था।
  • नया तरीका (इलास्टिक): EEDQN एक "खिंचने वाले रबर बैंड" का उपयोग करता है।
    • यदि रोबोट गेम के सुरक्षित और अनुमानित हिस्से से गुजर रहा है, तो रबर बैंड बाहर की ओर खिंचता है, जिससे रोबोट तेजी से सीखने के लिए भविष्य में बहुत आगे तक देख पाता है।
    • यदि रोबोट गेम के अराजक या बदलते हुए हिस्से में पहुँचता है, तो रबर बैंड पीछे की ओर खिंचकर छोटा हो जाता है ताकि वह खराब दीर्घकालिक अनुमानों से भ्रमित न हो।
    • शोध पत्र का अपग्रेड: इस "रबर बैंड" का मूल संस्करण जटिल गणित (क्लस्टरिंग) का उपयोग करने के कारण भारी और धीमा था। EEDQN इसे एक हल्के नियम से बदल देता है: यह बस यह जाँचता है कि वर्तमान स्थान का अनुमानित मूल्य अगले स्थान के मूल्य से बहुत अलग है या नहीं। यदि वे अलग हैं, तो यह खिंचना बंद कर देता है। यह रोबोट को बहुत तेज़ और चलाने में आसान बनाता है।

3. "स्मार्ट एग्रीगेशन" (असली जादू)

यह इस शोध पत्र का सबसे रचनात्मक हिस्सा है। लेखकों ने महसूस किया कि समिति की क्रिस्टल बॉल्स को इस आधार पर अलग तरह से बोलना चाहिए कि रोबोट भविष्य में कितनी दूर देख रहा है।

  • तत्काल अगले कदम को देखना (कम दूरी): समिति को अपने विचारों का औसत (average) लेना चाहिए। यह रोबट को आत्मविश्वासी रखता है और बिना बहुत अधिक डरे आगे बढ़ने में मदद करता है।
  • भविष्य में बहुत दूर देखना (लंबी दूरी): समिति को न्यूनतम (minimum) (सबसे निराशावादी) विचार लेना चाहिए।
    • उपमा: कल्पना कीजिए कि आप एक रोड ट्रिप की योजना बना रहे हैं।
      • अगले मोड़ के लिए, आप समूह की औसत सलाह पर भरोसा करते हैं।
      • लेकिन 500 मील दूर की यात्रा के लिए, आप समूह के सबसे सतर्क व्यक्ति की बात सुनते हैं। क्यों? क्योंकि आप जितना दूर देखेंगे, उतनी ही अधिक संभावना है कि आपका "क्रिस्टल बॉल" गलत और अत्यधिक आशावादी होगा। लंबी अवधि की योजनाओं के लिए "सबसे खराब स्थिति" वाले व्यक्ति की बात सुनकर, आप रोबोट को असंभव पुरस्कारों के बारे में उम्मीदें जगाने से रोकते हैं।

उन्होंने क्या पाया?

शोधकर्ताओं ने पांच मिनी-वीडियो गेम्स (MinAtar वातावरण) पर इस नए रोबोट का परीक्षण किया।

  • परिणाम: EEDQN पांच में से चार खेलों में पहले स्थान पर रहा या बराबरी पर रहा।
  • निदान: उन्होंने रोबोट की "क्रिस्टल बॉल" संख्याओं की जाँच की और पाया कि मानक रोबोट ऐसे स्कोर का अनुमान लगा रहे थे जो भौतिक रूप से असंभव थे (जैसे, यह अनुमान लगाना कि आपको 1,000 अंक मिलेंगे जबकि गेम में केवल 100 अंक ही संभव हैं)। EEDQN ने इन संख्याओं को वास्तविक और नियंत्रण में रखा।
  • सबक: कोई "एक ही नियम सबके लिए" (one size fits all) वाला नियम नहीं है। कुछ खेलों में, बहुत सतर्क रहना (न्यूनतम को चुनना) सबसे अच्छा काम करता है। अन्य में, मिश्रण बेहतर होता है। लेकिन मुख्य निष्कर्ष यह है कि "खिंचने वाले रबर बैंड" को "स्मार्ट समिति" के साथ जोड़ने से अकेले किसी भी ट्रिक का उपयोग करने की तुलना में बेहतर परिणाम मिलते हैं।

सारांश

यह शोध पत्र AI के वीडियो गेम सीखने के एक स्मार्ट तरीके को प्रस्तुत करता है। यह AI के बहुत अधिक आत्मविश्वासी होने की समस्या को हल करता है:

  1. एक मस्तिष्क के बजाय टीम का उपयोग करके।
  2. यह तय करने के लिए कि कितना आगे देखना है, एक खिंचने वाली समयरेखा (stretchy timeline) का उपयोग करके।
  3. यह सुनिश्चित करने के लिए कि टीम वोट देने का तरीका बदले कि वे कितनी दूर देख रहे हैं (कम दूरी के लिए औसत लेना, लंबी दूरी के लिए सबसे सतर्क अनुमान चुनना)।

यह AI को तेजी से सीखने, अधिक स्थिर रहने और अपनी क्षमताओं का अतिरंजित आकलन करने के जाल से बचने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →