← नवीनतम पेपर
🤖 machine learning

Understanding Goal Generalisation in Sequential Reinforcement Learning

यह शोध पत्र इस बात की जांच करता है कि सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) एजेंट क्रमिक प्रशिक्षण पाइपलाइनों के माध्यम से लक्ष्यों का सामान्यीकरण कैसे करते हैं, यह प्रकट करते हुए कि प्रमुख विशेषताएं और पूर्व-सीखे गए लक्ष्य आउट-ऑफ-डिस्ट्रीब्यूशन व्यवहार को आकार देते हैं, और इन व्यवहारों की भविष्यवाणी करने के लिए निम्न-आयामी गुप्त चरों के विकास पर आधारित एक व्याख्यात्मक "लेटेंट पॉलिसी ग्रेडिएंट्स" पद्धति प्रस्तुत करता है।

मूल लेखक: Jason Ross Brown, Edward James Young

प्रकाशित 2026-05-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jason Ross Brown, Edward James Young

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट कुत्ते को चीज़ें लाने (fetch) के लिए प्रशिक्षित कर रहे हैं। पहले, आप उसे एक लाल गेंद लाने के लिए प्रशिक्षित करते हैं। वह जल्दी सीख जाता है। फिर, आप उसे एक नया करतब सिखाने का निर्णय लेते हैं: एक नीली फ्रिसबी लाना। आप उम्मीद कर सकते हैं कि रोबोट लाल गेंद को भूल जाएगा और पूरी तरह से नीली फ्रिसबी पर ध्यान केंद्रित करेगा।

लेकिन क्या होगा यदि आप रोबोट को एक नए कमरे में रखें जहाँ लाल गेंद और नीली फ्रिसबी दोनों मौजूद हों, और वह दोनों के पीछे भागने लगे? या क्या होगा यदि वह नीली फ्रिसबी को पूरी तरह से अनदेखा कर दे और वापस लाल गेंद के पीछे चला जाए, भले ही आपने उसे नीली वाली लाने के लिए कहा हो?

यह लक्ष्य सामान्यीकरण (Goal Generalization) की समस्या है। यह इस बारे में है कि कैसे एक AI का पिछला प्रशिक्षण इतिहास (training history) नए, अपरिचित स्थितियों में उसके मूल्यों को आकार देता है। जेसन रॉस ब्राउन और एडवर्ड जेम्स यंग का यह शोध पत्र इस रहस्य को सुलझाने की कोशिश करता है कि क्यों AI एजेंट वास्तविक दुनिया में प्रवेश करते समय ये विशिष्ट विकल्प चुनते हैं।

उनके कार्य का एक सरल विवरण यहाँ दिया गया है:

1. प्रयोग: भूलभुलैया का खेल (The Maze Game)

शोधकर्ताओं ने जटिल वास्तविक दुनिया के रोबोटों का उपयोग नहीं किया। इसके बजाय, उन्होंने एक साधारण वीडियो गेम का उपयोग किया: एक भूलभुलैया (maze)।

  • एजेंट: एक छोटा ग्रे रंग का गोला (रोबोट)।
  • लक्ष्य: एक विशिष्ट वस्तु, जैसे कि लाल क्रॉस या नीला डायमंड
  • प्रशिक्षण: उन्होंने रोबोट को दो तरीकों से प्रशिक्षित किया:
    1. एकल चरण (Single Stage): इसे केवल लाल क्रॉस खोजने के लिए प्रशिक्षित करना।
    2. दो चरण (Two Stages): इसे पहले लाल क्रॉस खोजना सिखाना, फिर बदलकर नीला डायमंड खोजना सिखाना।

प्रशिक्षण के बाद, उन्होंने रोबोट को एक ऐसी भूलभुलैया में रखा जहाँ दो वस्तुएं थीं (जैसे, एक लाल क्रॉस और एक नीला डायमंड) जिन्हें उसने पहले कभी एक साथ नहीं देखा था। उन्होंने यह देखने के लिए निगरानी की कि रोबोट किसके पीछे भागता है।

2. उन्होंने क्या पाया: AI की "आदत"

रोबोटों ने बेतरतीब ढंग से व्यवहार नहीं किया। उनके प्रशिक्षण इतिहास के आधार पर उनके बहुत सुसंगत "व्यक्तित्व" थे। शोधकर्ताओं ने तीन मुख्य नियम खोजे:

  • आकार राजा है, रंग रानी है (Shape is King, Color is Queen): रोबोट वस्तु के रंग (लाल बनाम नीला) की तुलना में उसके आकार (क्रॉस बनाम डायमंड) पर बहुत अधिक ध्यान देते थे। यदि किसी रोबोट को "क्रॉस" के लिए प्रशिक्षित किया गया था, तो वह किसी भी क्रॉस के पीछे जाएगा, भले ही उसका रंग अलग हो।
  • पुरानी आदतें आसानी से नहीं जातीं (Persistence): यदि किसी रोबोट ने पहले चरण में "क्रॉस" से प्यार करना सीखा, तो दूसरे चरण में "डायमंड" खोजने के लिए प्रशिक्षित होने के बाद भी वह उस प्रेम को बनाए रखता था। पहला सबक बना रहता था और दूसरे सबक को प्रभावित करता था।
  • "दोहरा-प्रशिक्षण" प्रभाव (The "Double-Training" Effect): यदि किसी रोबोट को "लाल क्रॉस" और फिर "लाल डायमंड" के लिए प्रशिक्षित किया गया था, तो वह रंग लाल के प्रति बहुत अधिक जुनूनी हो गया। रंग लाल को दो बार सुदृढ़ (reinforce) किया गया था। हालांकि, "डायमंड" आकार (जो केवल दूसरे चरण में आया था) बहुत कम महत्वपूर्ण हो गया। "लाल" की मजबूत आदत ने रोबोट को "डायमंड" को उतना महत्व देने से रोक दिया जितना कि वह अन्यथा दे सकता था।

3. समाधान: "लेटेंट पॉलिसी ग्रेडिएंट्स" (Latent Policy Gradients)

शोधकर्ता बिना रोबोट को हर बार पुन: प्रशिक्षित किए इन व्यवहारों की भविष्यवाणी करना चाहते थे। उन्होंने लेटेंट पॉलिसी ग्रेडिएंट्स नामक एक विधि विकसित की।

इसे एक AI के मस्तिष्क के लिए GPS की तरह समझें।

  • रोबोट के मस्तिष्क के भीतर लाखों कोड की पंक्तियों को देखने के बजाय, शोधकर्ताओं ने एक सरल, निम्न-आयामी मानचित्र (छिपे हुए नंबरों का एक सेट, या "लेटेंट्स") बनाया।
  • उन्होंने कल्पना की कि ये नंबर एक ढलान से लुढ़कती हुई गेंद की तरह विकसित होते हैं। हर बार जब रोबित को एक नए कार्य पर प्रशिक्षित किया जाता था, तो यह गेंद को एक विशिष्ट दिशा में धकेलने जैसा होता था।
  • इस "गेंद के लुढ़कने" की प्रक्रिया (चरण 1, फिर चरण 2) को सिम्युलेट करके, वे सटीक भविष्यवाणी कर सकते थे कि रोबोट नई भूलभुलैया में क्या करेगा।

उपमा (Analogy):
कल्पना कीजिए कि रोबोट की प्राथमिकताएं मिट्टी का एक टुकड़ा हैं।

  • प्रशिक्षण चरण 1 एक मूर्तिकार है जो मिट्टी को "क्रॉस" के आकार में दबा रहा है।
  • प्रशिक्षण चरण 2 दूसरा मूर्तिकार है जो मिट्टी को "डायमंड" के आकार में दबाने की कोशिश कर रहा है।
  • अंतिम आकार केवल डायमंड नहीं है; यह एक अजीब मिश्रण है क्योंकि पहले दबाव ने एक गहरा निशान छोड़ दिया है।
  • लेटेंट पॉलिसी ग्रेडिएंट विधि एक गणितीय सूत्र है जो इन दो मूर्तिकारों के निर्देशों को देखता है और भविष्यवाणी करता है कि अंतिम, अजीब मिट्टी का आकार कैसा दिखेगा, बिना वास्तव में उसे तराशे।

4. यह क्यों महत्वपूर्ण है

यह शोध पत्र दिखाता है कि AI का व्यवहार केवल एक रहस्य नहीं है; इसका एक ढांचा है।

  • यह अनुमानित है: भले ही AI एक नए वातावरण में हो, उसका व्यवहार उसके प्रशिक्षण इतिहास का एक तार्किक परिणाम है।
  • यह व्याख्या योग्य है: शोधकर्ताओं की विधि कोई "ब्लैक बॉक्स" नहीं है। वे अपने सूत्र को देख सकते हैं और कह सकते हैं, "आह, रोबोट इसके पीछे भाग रहा है क्योंकि इसे पहले इस विशिष्ट आकार के लिए प्रशिक्षित किया गया था, और यह विशेषता इस प्रकार के AI के लिए बहुत 'चिपचिपी' (sticky) है।"

सारांश

यह शोध पत्र तर्क देता है कि यह समझने के लिए कि वास्तविक दुनिया में एक AI क्या करेगा, आप केवल उसके अंतिम प्रशिक्षण को नहीं देख सकते। आपको उसके संपूर्ण सफर को देखना होगा। AI के सीखने की प्रक्रिया को चरणों की एक श्रृंखला के रूप में मानकर, जहाँ पुरानी आदतें बनी रहती हैं और नई आदतें उनके ऊपर बनाई जाती हैं, लेखकों ने एक सरल, गणितीय तरीका बनाया जिससे यह भविष्यवाणी की जा सके कि एक AI अपने लक्ष्यों को कैसे सामान्य (generalize) करेगा। उन्होंने सिद्ध किया कि हालांकि AI का व्यवहार आश्चर्यजनक हो सकता है, लेकिन यह एक छिपे हुए तर्क का पालन करता है जिसे हम मैप और समझ सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →