← नवीनतम पेपर
🤖 machine learning

Forager: a lightweight testbed for continual learning with partial observability in RL

यह शोधपत्र Forager को प्रस्तुत करता है, जो एक हल्का, आंशिक रूप से अवलोकन योग्य निरंतर सुदृढ़ीकरण शिक्षण (continual reinforcement learning) वातावरण है जिसका मेमोरी फुटप्रिंट स्थिर रहता है, जिसे एजेंटों की प्लास्टिसिटी के नुकसान और नए कार्यों की अंतहीन धाराओं को संभालने में अवस्था निर्माण (state construction) की महत्वपूर्ण भूमिका के गहन अध्ययन को सुगम बनाने के लिए डिज़ाइन किया गया है।

मूल लेखक: Steven Tang, Xinze Xiong, Anna Hakhverdyan, Andrew Patterson, Jacob Adkins, Jiamin He, Esraa Elelimy, Parham Mohammad Panahi, Martha White, Adam White

प्रकाशित 2026-05-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Steven Tang, Xinze Xiong, Anna Hakhverdyan, Andrew Patterson, Jacob Adkins, Jiamin He, Esraa Elelimy, Parham Mohammad Panahi, Martha White, Adam White

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अनंत जंगल में एक खाद्य संग्राहक (forager) हैं। आपका लक्ष्य सरल है: खाने के लिए स्वादिष्ट मशरूम ढूँढना और जहरीले मशरूमों से बचना। लेकिन एक पेच है: आपने एक आँखों की पट्टी पहनी हुई है जो आपको केवल अपने पैरों के पास एक छोटा सा घेरा ही देखने देती है। आप पूरे जंगल को नहीं देख सकते, और जंगल लगातार बदलता रहता है। कभी-कभी स्वादिष्ट मशरूम अपनी जगह बदल लेते हैं, कभी वे सड़ जाते हैं, और कभी रात भर में "स्वादिष्ट" होने के नियम भी बदल जाते हैं।

यह वास्तविक दुनिया की चुनौती है जिसे कंप्यूटर वैज्ञानिक कंटीन्यूअल रीइन्फोर्समेंट लर्निंग (Continual Reinforcement Learning - CRL) कहते हैं। यह AI एजेंटों को उस दुनिया में अनंत काल तक सीखने के लिए प्रशिक्षित करने के बारे में है जो विशाल, भ्रमित करने वाली और लगातार बदलती रहती है।

समस्या यह है कि वर्तमान AI अनुसंधान के अधिकांश परीक्षण एजेंटों को बहुत छोटी, आदर्श दुनिया में परखते हैं जहाँ वे सब कुछ देख सकते हैं (जैसे शतरंज का खेल)। लेकिन वास्तविक दुनिया शतरंज जैसी नहीं है। इस "आँखों की पट्टी" और अनंत परिवर्तनों को कैसे संभालना है, इसका अध्ययन करने के लिए, शोधकर्ताओं को एक विशेष परीक्षण स्थल की आवश्यकता है।

पेश है Forager

Forager क्या है?

Forager को एक हल्के, सुपर-फास्ट वीडियो गेम के रूप में सोचें जिसे विशेष रूप से यह परीक्षण करने के लिए डिज़ाइन किया गया है कि एक AI आँखों की पट्टी पहनकर कितनी अच्छी तरह सीख सकता है।

  • पुराना तरीका: पिछले परीक्षण स्थल ऐसे थे जैसे ईंटों से भरा भारी बैग लेकर मैराथन दौड़ने की कोशिश करना। वे धीमे थे, उनके लिए विशाल कंप्यूटरों की आवश्यकता थी, और अक्सर मेमोरी एरर (स्मृति त्रुटियों) में फंस जाते थे क्योंकि AI अधिक याद रखने की कोशिश करता था।
  • Forager का तरीका: Forager एक चिककी, बेहद हल्के दौड़ने वाले जूते की तरह है। यह अविश्वसनीय रूप से तेज़ चलता है (प्रति सेकंड 100,000 बार तक) और बहुत कम कंप्यूटर मेमोरी का उपयोग करता है, चाहे AI कितनी भी देर तक चले। यह शोधकर्ताओं को यह देखने के लिए हजारों प्रयोग जल्दी से चलाने की अनुमति देता है कि क्या काम करता है और क्या विफल होता है।

बड़ा परीक्षण: "आँखों की पट्टी" और "बदलाव"

पेपर में AI का परीक्षण दो मुख्य परिदृश्यों में किया गया है:

  1. सीमित दृश्य (The Limited View): AI के पास एक छोटा "दृश्य क्षेत्र" (field of view) है। यदि दृश्य चौड़ा है, तो AI पूरे जंगल को देख सकता है और आसानी से भोजन पा सकता है। लेकिन जैसे-जैसे शोधकर्ता दृश्य को छोटा करते हैं (आँखों की पट्टी को कसते हैं), AI को याद रखना पड़ता है कि अच्छे मशरूम कहाँ थे और उन्हें कब वापस उगना चाहिए इसका अनुमान लगाना पड़ता है।

    • परिणाम: मानक AI एजेंट (जैसे DQN और PPO) रास्ता भटक गए। वे भूल गए कि भोजन कहाँ था और प्रभावी ढंग से सीखना बंद कर दिया। वे बस बिना किसी दिशा के भटकते रहे।
  2. कभी न खत्म होने वाला बदलाव (The Never-Ending Switch): शोधकर्ताओं ने एक मोड़ जोड़ा जहाँ नियम लगातार बदलते रहते हैं। शायद आज बैंगनी मशरूम स्वादिष्ट हैं, लेकिन कल वे जहरीले हो सकते हैं, और पीले मशरूम नए पसंदीदा बन सकते हैं। AI को पुरानी आदतों को छोड़ना होगा और तुरंत नई आदतें सीखनी होंगी, और यह प्रक्रिया बार-बार होनी चाहिए।

    • परिणाम: AI ने सीखना ही छोड़ दिया। इसे लॉस ऑफ प्लास्टिसिटी (Loss of Plasticity) कहा जाता है। यह एक ऐसे छात्र की तरह है जो एक परीक्षा के लिए इतनी मेहनत करता है कि उसका दिमाग इतना भर जाता है कि वह अगली परीक्षा के लिए कुछ भी नया नहीं सीख पाता।

क्या "उपाय" काम आए?

शोधकर्ताओं ने AI की स्मृति और सीखने की समस्याओं को ठीक करने के लिए कई "बैंड-एड" (अस्थायी उपचार) आजमाए। उन्होंने प्रयास किया:

  • रेगुलराइजेशन (Regularization): AI को अपने मूल "व्यक्तित्व" के करीब रहने के लिए कहना।
  • विशेष एक्टिवेशन (Special Activations): AI की मस्तिष्क कोशिकाओं के काम करने के तरीके को बदलना ताकि वे खत्म न हों।
  • मल्टीपल नेटवर्क (Multiple Networks): AI को केवल एक मस्तिष्क के बजाय दिमागों की एक टीम देना।

फैसला: ये उपाय थोड़े बहुत मददगार थे, जैसे टूटी हुई टांग पर पट्टी लगाना। उन्होंने AI को समय के साथ और खराब होने से तो रोका, लेकिन वे इसे कार्य में अच्छा बनाने के लिए पर्याप्त नहीं थे। AI अभी भी नेविगेट करने के लिए संघर्ष कर रहा था।

असली समाधान: AI को याददाश्त देना

पेपर ने खोजा कि गुप्त हथियार कोई फैंसी एल्गोरिदम नहीं, बल्कि याददाश्त (Memory) थी।

  • साधारण स्मृति (Simple Memory): जब शोधकर्ताओं ने AI को आखिरी कुछ चीजें जो उसने खाई थीं, उन्हें लिखने के लिए एक साधारण "नोटबुक" दी, तो इसने बहुत बेहतर प्रदर्शन किया। यह याद रख सका, "ओह, मैंने यहाँ एक गुलाबी मशरूम खाया था, और वह अच्छा था।"
  • रिकरेंट मेमोरी (The Hero): सबसे अच्छा प्रदर्शन करने वाला एक रिकरेंट (Recurrent) मस्तिष्क वाला AI था (विशेष रूप से एक एल्गोरिदम जिसे RTU-PPO कहा जाता है)। इसे एक ऐसे AI के रूप में सोचें जिसके पास एक सक्रिय अल्पकालिक स्मृति (short-term memory) है। यह केवल अपने सामने मौजूद मशरूम को नहीं देखता; यह उस रास्ते को याद रखता है जिस पर इसने यात्रा की, उन गंधों को जो इसके पास से गुजरीं, और उन परिवर्तनों को जो इसने देखे।
    • इस AI ने न केवल जीवित रहने में सफलता पाई; बल्कि यह फल-फूल उठा। इसने परिवर्तनों का अनुमान लगाना सीखा और अंधे जंगल में लगभग उतनी ही कुशलता से नेविगेट किया जितना कि एक ऐसा एजेंट जो पूरी दुनिया देख सकता है।

अंतिम चुनौती: अनंत प्रवाह (The Infinite Stream)

अंत में, शोधकर्ताओं ने Forager का एक "हार्ड मोड" संस्करण बनाया। इस संस्करण में, जंगल हर बार जब AI पर्याप्त मशरूम खा लेता है, तो नए नियमों के साथ मशरूम की प्रजातियों का एक कभी न खत्म होने वाला प्रवाह उत्पन्न करता है। AI को बिना रुके, हमेशा सीखना, अनुकूलन करना और याद रखना होगा।

यहाँ तक कि मेमोरी वाले स्मार्ट AI भी इसमें संघर्ष कर रहे थे। वे नए कार्यों के अंतहीन प्रवाह के साथ तालमेल नहीं बिठा सके। यह साबित करता है कि जबकि हमने प्रगति की है, वर्तमान AI हमारी दुनिया जैसी जटिल और आंशिक रूप से दृश्य दुनिया में "हमेशा" सीखने के लिए अभी भी बहुत दूर है।

सारांश

Forager एक नया, तेज़ और कुशल उपकरण है जो हमें दिखाता है कि वर्तमान AI कहाँ विफल होता है। यह प्रकट करता है कि जब दुनिया बड़ी होती है और हम सब कुछ नहीं देख सकते, तो केवल AI को "शक्तिशाली" बनाना ही काफी नहीं है। AI को परिवर्तनों को ट्रैक करने और दुनिया का मानसिक मानचित्र बनाने के लिए याददाश्त (Memory) की आवश्यकता होती है। इसके बिना, AI रास्ता भटक जाता है और सीखना बंद कर देता है। यह परीक्षण स्थल वैज्ञानिकों को अगली पीढ़ी के AI बनाने के लिए एक स्पष्ट मैदान प्रदान करता है जो वास्तव में जीवन भर सीख सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →