← नवीनतम पेपर
🤖 machine learning

A Unified Causal-Origin Taxonomy of Distributional Shifts in Reinforcement Learning

यह शोध पत्र एजेंट-संचालित और पर्यावरण-संचालित स्रोतों के बीच अंतर करने के लिए समस्या को एक POMDP ढांचे के भीतर पुनर्गठित करके, सुदृढीकरण aprendizaje (रिनफोर्समेंट लर्निंग) में वितरण संबंधी बदलावों (डिस्ट्रीब्यूशनल शिफ्ट्स) के लिए एक एकीकृत कारण-मूल (कॉज़ल-ओरिजिन) वर्गीकरण प्रस्तावित करता है, जिससे इन-डिस्ट्रीब्यूशन/आउट-ऑफ-डिस्ट्रीब्यूशन सामान्यीकरण को गैर-स्थिर (नॉन-स्टेशनरी) परिवेशों के साथ एकीकृत किया जा सके और बदलाव के प्रभाव तथा अनुकूलन को मापने के लिए एक नया मूल्यांकन ढांचा पेश किया जा सके।

मूल लेखक: Ardianto Wibowo, Paulo E Santos, Amer Baghdadi, Matthew Stephenson, Karl Sammut, Jean-Philippe Diguet

प्रकाशित 2026-06-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ardianto Wibowo, Paulo E Santos, Amer Baghdadi, Matthew Stephenson, Karl Sammut, Jean-Philippe Diguet

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य चित्र: रोबोट क्यों भ्रमित हो जाते हैं

कल्पना कीजिए कि आप एक रोबोट कुत्ते को अपने लिविंग रूम में गेंद लाने (fetch) के लिए सिखा रहे हैं। आप इसे हफ्तों तक प्रशिक्षित करते हैं। यह पूरी तरह सीख जाता है: जब मैं लाल गेंद देखूँगा, तो मैं कोने की ओर दौड़ूँगा, उसे उठाऊँगा और वापस ले आऊँगा।

अब, कल्पना कीजिए कि आप उसी रोबोट कुत्ते को एक पार्क में ले जाते हैं। अचानक, घास लंबी है, हवा गेंद को अलग तरह से उड़ा रही है, और वह "गेंद" वास्तव में एक नीली फ्रिसबी (frisbee) है। रोबोट जम जाता है। उसे समझ नहीं आता कि क्या करना है।

आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, इसे डिस्ट्रीब्यूशनल शिफ्ट (Distributional Shift) कहा जाता है। यह तब होता है जब वह दुनिया जिसमें AI को प्रशिक्षित किया गया था, उस दुनिया से मेल नहीं खाती जिसमें उसे काम करना है।

लंबे समय से, शोधकर्ता इसे ठीक करने के लिए "शॉक एब्जॉर्बर" (ऐसे एल्गोरिदम जो AI को अधिक मजबूत बनाते हैं) बनाने की कोशिश कर रहे हैं। लेकिन यह पेपर तर्क देता है कि हम बीमारी को समझे बिना केवल लक्षणों को ठीक कर रहे हैं। हमें यह पता लगाने के लिए एक बेहतर मानचित्र की आवश्यकता है कि ठीक-ठीक क्या बदला है।

मुख्य विचार: एक नया "टैक्सोनॉमी" (एक फाइलिंग सिस्टम)

लेखक, अरडियांतो विबोवो और सहयोगियों के नेतृत्व में, एक नया यूनिफाइड कॉज़ल-ओरिजिन टैक्सोनॉमी (Unified Causal-Origin Taxonomy) प्रस्तावित करते हैं। इसे AI समस्याओं के लिए एक नए फाइलिंग सिस्टम के रूप में समझें। केवल यह कहने के बजाय कि "AI विफल हो गया," यह प्रणाली पूछती है: "इंटरेक्शन का कौन सा विशिष्ट हिस्सा टूट गया?"

वे समस्या को दो मुख्य प्रश्नों में विभाजित करते हैं:

1. अपराधी कौन है? (आंतरिक बनाम बाहरी)

पेपर विफलता के कारणों को दो समूहों में विभाजित करता है:

  • बाहरी बदलाव (दुनिया बदल गई - External Shifts): वातावरण बदल गया, लेकिन रोबोट वही रहा।
    • उपमा: आपने एक शेफ को गैस स्टोव पर स्टेक पकाने के लिए प्रशिक्षित किया। फिर, आप उन्हें बिजली के स्टोव वाले किचन में ले गए। शेफ (AI) वही है, लेकिन स्टोव (वातावरण) अलग है।
    • विशिष्टता: शुरुआती स्थिति बदल गई, भौतिकी (physics) बदल गई (हवा, गुरुत्वाकर्षण), या रिवॉर्ड (इनाम) बदल गया (शायद अब बॉस केवल तभी भुगतान करता है जब स्टेक 5 मिनट के भीतर पका हो)।
  • आंतरिक बदलाव (रोबोट बदल गया - Internal Shifts): दुनिया वैसी ही रही, लेकिन रोबोट का दिमाग या सेंसर बदल गए।
    • उपमा: आपने शेफ को गैस स्टोव पर प्रशिक्षित किया। फिर, आपने शेफ को धूप का चश्मा पहना दिया जिससे सब कुछ नीला दिखाई देता है। या, आपने शेफ को एक नई रेसिपी बुक दे दी जिससे वह पुरानी चीजें भूल गया।
    • विशिष्टता: रोबोट के कैमरे में खराबी आ गई (ऑब्जर्वेशन शिफ्ट), या रोबोट के निर्णय लेने वाले सॉफ़्टवेयर को मेमोरी बचाने के लिए कंप्रेस (छोटा) कर दिया गया, जिससे उसके सोचने का तरीका बदल गया (पॉलिसी शिफ्ट)।

2. स्विच कब हुआ? (समय की सीमा - The Time Boundary)

पेपर यह भी देखता है कि सीखने की प्रक्रिया के सापेक्ष बदलाव कब होता है:

  • एक्सप्लिसिट बाउंड्री (The "Freeze"): आप रोबोट को प्रशिक्षित करते हैं, "सेव" बटन दबाते हैं, और फिर उसे एक नई दुनिया में टेस्ट करते हैं। रोबोट अब और सीख नहीं सकता; उसे बस अनुमान लगाना होगा। यह एक ऐसी कार चलाने के टेस्ट जैसा है जिसे आपने पहले कभी नहीं चलाया।
  • इम्प्लिसिट बाउंड्री (The "Drift"): रोबोट सीखते समय ही उसके आसपास की दुनिया धीरे-धीरे बदल रही है। बदलाव बिना किसी स्पष्ट "स्टॉप" बटन के होता है। यह कार चलाने जैसा है जहाँ सड़क की सतह धीरे-धीरे डामर से कीचड़ में बदल जाती है जबकि आप अभी भी गाड़ी चला रहे होते हैं।
  • हाइब्रिड (Hybrid): दोनों का मिश्रण। आप टेस्ट करने के लिए रोबोट को फ्रीज करते हैं, लेकिन फिर उसे तब तक सीखते रहने देते हैं जब तक दुनिया बदलती रहती है।

प्रयोग: सिद्धांत का परीक्षण

अपने सिस्टम को सिद्ध करने के लिए, लेखकों ने एक साधारण ग्रिड-वर्ल्ड गेम (एक विशाल शतरंज बोर्ड की तरह) बनाया और एक मानक AI (DQN) को इसमें नेविगेट करने के लिए प्रशिक्षित किया। फिर, उन्होंने जानबूझकर सिस्टम के विभिन्न हिस्सों को एक-एक करके बिगाड़ा ताकि देख सकें कि AI कैसे प्रतिक्रिया करता है।

उन्होंने पाया कि अलग-अलग टूट-फूट के कारण अलग-तरह की विफलता होती है:

  • यदि उन्होंने शुरुआती बिंदु (बाहरी) को बदला, तो AI तुरंत रास्ता भटक गया।
  • यदि उन्होंने भौतिकी (बाहरी) को बदला, तो AI दीवारों के माध्यम से चलने की कोशिश करता रहा।
  • यदि उन्होंने रिवॉर्ड (बाहरी) को बदला, तो AI ने कोशिश करना बंद कर दिया क्योंकि उसे समझ नहीं आया कि उसे क्या करना चाहिए।
  • यदि उन्होंने कैमरा व्यू (आंतरिक) को बदला, तो AI रास्ता पहचानने में असमर्थ रहा।
  • यदि उन्होंने दिमाग की सटीकता (आंतरिक) को बदला, तो AI ने ऐसी गलतियाँ कीं जो उसने पहले कभी नहीं की थीं।

मुख्य निष्कर्ष: आप केवल यह नहीं कह सकते कि "AI मजबूत है।" आपको पूछना होगा, "किस चीज़ के विरुद्ध मजबूत?" एक AI नए मैप (बाहरी) को संभालने में बहुत अच्छा हो सकता है लेकिन अगर उसका कैमरा धुंधला (आंतरिक) हो जाए तो वह बहुत खराब हो सकता है।

नया स्कोरकार्ड: रिकवरी को मापना

पेपर AI प्रदर्शन को ग्रेड करने का एक नया तरीका भी पेश करता है। केवल अंतिम स्कोर देखने के बजाय, वे मापते हैं:

  1. द क्रैश (The Crash): बदलाव होने के क्षण में प्रदर्शन कितनी बुरी तरह गिरा?
  2. द डेप्थ (The Depth): यह कितना नीचे तक गया?
  3. द स्पीड (The Speed): AI कितनी तेज़ी से नए नियमों को समझ पाया और सामान्य स्थिति में वापस आया?
  4. द रिकवरी (The Recovery): क्या वह कभी अपने मूल कौशल स्तर पर पूरी तरह वापस आ पाया?

यह शोधकर्ताओं को यह देखने में मदद करता है कि क्या कोई AI केवल "मजबूत" (tough) है या वह वास्तव में "अनुकूलनशील" (adaptable) है।

निष्कर्ष

यह पेपर कोई नया रोबोट या कोई जादुई एल्गोरिदम नहीं बनाता है। इसके बजाय, यह समझने के लिए एक साझा भाषा और एक संरचित मानचित्र प्रदान करता है कि जब दुनिया बदलती है तो AI क्यों विफल होता है।

समस्या को आंतरिक बनाम बाहरी कारणों और एक्सप्लिसिट बनाम इम्प्लिसिट समय के आधार पर अलग करके, लेखक शोधकर्ताओं को समस्याओं का निदान करने का एक स्पष्ट तरीका देते हैं। यह एक मैकेनिक की तरह है जो केवल यह कहने के बजाय कि "कार खराब है," विशिष्ट हिस्से (इंजन, टायर, या ईंधन) की ओर इशारा कर सकता है और समझा सकता है कि वह कैसे विफल हुआ। यह स्पष्टता, AI को वास्तव में इस बदलती और जटिल वास्तविक दुनिया को संभालने में सक्षम बनाने की दिशा में पहला कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →