← नवीनतम पेपर
🤖 machine learning

Hierarchical Successor Representation for Robust Transfer

यह शोध पत्र पदानुक्रमित उत्तराधिकारी प्रतिनिधित्व (Hierarchical Successor Representation - HSR) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो शास्त्रीय उत्तराधिकारी प्रतिनिधित्वों की नीति निर्भरता (policy dependence) और स्पेक्ट्रल डिफ्यूजन (spectral diffusion) को दूर करने के लिए टेम्पोरल एब्स्ट्रैक्शन (temporal abstractions) और नॉन-नेगेटिव मैट्रिक्स फैक्टराइजेशन (non-negative matrix factorization) का लाभ उठाता है, जिससे जटिल, गैर-स्थिर वातावरण में सुदृढ़, सैंपल-कुशल स्थानांतरण और कुशल अन्वेषण सक्षम होता है।

मूल लेखक: Changmin Yu, Máté Lengyel

प्रकाशित 2026-06-12
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Changmin Yu, Máté Lengyel

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, जटिल इमारत में नेविगेट करना सीख रहे हैं जिसमें कई कमरे, गलियारे और दरवाजे हैं। आपका लक्ष्य एक विशिष्ट निकास (exit) खोजना है।

पुराना तरीका (सक्सेसर रिप्रेजेंटेशन - Successor Representation)
पारंपरिक रूप से, AI एजेंट "सक्सेसर रिप्रेजेंटेशन" (SR) नामक एक विधि का उपयोग करते हैं। इसे एक मानसिक मानचित्र के रूप में सोचें जो बताता है कि "यहाँ से हर जगह पहुँचने में कितना समय लगता है।"

  • यदि आप रसोई में हैं, तो मानचित्र बताता है कि लिविंग रूम तक पहुँचने में 10 सेकंड लगते हैं, गैरेज तक पहुँचने में 20 सेकंड लगते हैं, आदि।
  • समस्या: यह मानचित्र इस बात से बंधा हुआ है कि आप कैसे चलते हैं। यदि आप आमतौर पर तेज़ चलते हैं, तो मानचित्र कहता है "5 सेकंड।" यदि आपको अचानक एक भारी बॉक्स ले जाने के कारण धीरे चलना पड़ता है (एक "पॉलिसी" में बदलाव), तो आपका पुराना मानचित्र बेकार हो जाता है। आपको पूरा मानचित्र फिर से बनाना पड़ता है।
  • "धुंधलापन" की समस्या: एक बड़ी इमारत में, यह मानचित्र धुंधला होता जाता है। यह पानी में फैली हुई स्याही की एक बूंद जैसा है; यह स्पष्ट रूप से नहीं दिखा पाता कि दीवारें और गलियारे कहाँ हैं, जिससे इमारत के लेआउट को समझना कठिन हो जाता है।

नया तरीका (Hierarchical Successor Representation - HSR)
लेखक एक नई विधि प्रस्तावित करते हैं जिसे Hierarchical Successor Representation (HSR) कहा जाता है। इसे एक कदम-दर-कदम चलने वाले गाइड से अपग्रेड करके एक रणनीतिक यात्रा गाइड (strategic travel guide) के रूप में सोचें।

हर एक कदम (बायां पैर, दायां पैर) सोचने के बजाय, एजेंट "मैक्रो-मूव्स" या विकल्पों (Options) को सीखता है।

  • उपमा: "कदम, कदम, मुड़ना, कदम" सोचने के बजाय, एजेंट सोचता है, "गलियारे से गुजरना," "दरवाजे से अंदर जाना," या "पुल पार करना।"
  • यह बेहतर क्यों है: भले ही आप अपनी चलने की गति बदल दें (आपका लो-लेवल पॉलिसी), लेकिन "अगले कमरे तक पहुँचने के लिए गलियारे से गुजरना" की रणिति (strategy) वही रहती है। HSR मानचित्र को क्षणिक पैरों की गतिविधियों के बजाय इन स्थिर, उच्च-स्तरीय रणनीतियों पर आधारित बनाता है। यह मानचित्र को मजबूत बनाता है; यदि आपका कार्य बदल जाता है (उदाहरण के लिए, लक्ष्य दूसरे कमरे में चला जाता है), तो आपको पूरा मानचित्र फिर से बनाने की आवश्यकता नहीं होती। आप बस अपने मौजूदा रणनीतिक मानचित्र का उपयोग करते हैं और नया लक्ष्य खोज लेते हैं।

मानचित्र को स्पष्ट बनाना (NMF)
लेखकों ने यह भी देखा कि HSR के साथ भी, मानचित्र अभी भी थोड़ा अव्यवस्थित हो सकता है। इसे ठीक करने के लिए, उन्होंने Non-Negative Matrix Factorization (NMF) नामक एक गणितीय उपकरण का उपयोग किया।

  • उपमा: एक शहर की धुंधली, ओवरलैपिंग फोटो लेने और उसे अलग-अलग, स्पष्ट बिल्डिंग ब्लॉक्स में विभाजित करने के लिए एक फ़िल्टर का उपयोग करने की कल्पना करें।
  • NMF उस HSR मानचित्र को लेता है और उसे स्पार्स (sparse), स्थानीय टुकड़ों में तोड़ देता है। पूरे भवन पर फैले एक धुंधले धब्बे के बजाय, यह विशिष्ट "खंडों" की पहचान करता है जैसे कि "उत्तरी गलियारा" या "पूर्वी विंग"।
  • परिणाम: AI इमारत के प्राकृतिक "बॉटलनेक्स" (दरवाजे और गलियारे जो कमरों को जोड़ते हैं) को खोज लेता है। ये मानचित्र की प्रमुख विशेषताएं बन जाते हैं। यह मानचित्र को न केवल सटीक बनाता है बल्कि AI के लिए इसे समझना और उपयोग करना भी आसान बनाता है।

यह क्या हासिल करता है

  1. सुपर ट्रांसफर: क्योंकि मानचित्र विशिष्ट चलने की शैलियों के बजाय स्थिर रणनीतियों (जैसे "दरवाजे से गुजरना") पर आधारित है, AI तुरंत नए लक्ष्यों के अनुकूल हो सकता है। यह एक शहर के मानचित्र होने जैसा है जो काम करता है चाहे आप कार चला रहे हों, साइकिल चला रहे हों, या पैदल चल रहे हों।
  2. बेहतर अन्वेषण (Exploration): उन वातावरणों में जहाँ पुरस्कार दुर्लभ होते हैं (जैसे एक विशाल भूलभुलैया में छिपा खजाना खोजना), HSR एजेंट को अधिक कुशलता से अन्वेषण करने में मदद करता है। यह AI को मानसिक रूप से स्थानीय बाधाओं के ऊपर "कूदने" की अनुमति देता है, यह महसूस करते हुए कि "यदि मैं इस दरवाजे से जाता हूँ, तो मैं भूलभुलैया के एक बिल्कुल नए हिस्से तक पहुँच सकता हूँ," बजाय इसके कि वह एक छोटे से कमरे में चक्कर काटते हुए फंसा रहे।

सारांश में
यह पेपर तर्क देता है कि AI को एकल कदमों के बजाय समय और रणनीति के खंडों (hierarchy) में सोचना सिखाकर, और फिर उस सोच को स्पष्ट, विशिष्ट भागों (NMF) में साफ करके, हम ऐसा AI बना सकते हैं जो तेजी से सीखता है, नए कार्यों के अनुकूल तुरंत ढल जाता है, और जटिल वातावरण में बहुत अधिक प्रभावी ढंग से अन्वेषण करता है। यह तेज़ होने (एक रिफ्लेक्स की तरह) और लचीला होने (एक योजनाकार की तरह) के बीच के अंतर को पाटता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →