Learning from the Unseen: Offline Reinforcement Learning with Hidden Actions
यह शोध पत्र LURE प्रस्तुत करता है, जो छिपे हुए कार्यों (hidden actions) वाले ऑफलाइन सुदृढीकरण शिक्षण (reinforcement learning) के लिए पहली विधि है, जो अनंत-क्षितिज वाले मार्कोव निर्णय प्रक्रियाओं (infinite-horizon Markov decision processes) में बहु-सुदृढ़ (multiply robust) और सांख्यिकीय रूप से वैध नीति मूल्य अनुमान को सक्षम करने के लिए अगली-अवस्था चरों (next-state variables) को प्रॉक्सी के रूप में उपयोग करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक जटिल खेल खेलना सिखाने की कोशिश कर रहे हैं, जैसे कि किसी शहर में नेविगेट करना या किसी मरीज के स्वास्थ्य का प्रबंधन करना। आपके पास रोबोट को वास्तविक समय में खेल चलाने का समय नहीं है; इसके बजाय, आप उसे एक मानव खिलाड़ी द्वारा किए गए पिछले प्रयासों की एक विशाल लॉगबुक देते हैं। यह रीइन्फोर्समेंट लर्निंग (RL) की दुनिया है, जो आर्टिफिशियल इंटेलिजेंस की एक शाखा है जहाँ कंप्यूटर समय के साथ सर्वोत्तम निर्णय लेने के लिए परीक्षण और त्रुटि (trial and error) से सीखते हैं। इसका लक्ष्य आमतौर पर यह पता लगाना होता है: "यदि हम भविष्य में नियमों के एक विशिष्ट सेट (एक पॉलिसी) का पालन करते हैं, तो इस पुराने लॉगबुक के आधार पर हम कितना अच्छा प्रदर्शन करेंगे?"
हालाँकि, इसमें एक पेंच है। वास्तविक दुनिया में, लॉगबुक शायद ही कभी पूर्ण होती है। कभी-कभी, नोट लिखने वाले व्यक्ति ने गलती की होती है, या डेटा रिकॉर्ड करने वाली प्रणाली दोषपूर्ण होती है। इस शोध पत्र की भाषा में, वह "एक्शन" (क्रिया) जो इंसान ने वास्तव में लिया था (जैसे कि एक विशिष्ट दवा देना) छिपा हुआ हो सकता है, और हमें केवल उसका एक "प्रॉक्सि" या शोर भरा अनुमान दिखाई देता है (जैसे कि डॉक्टर का नोट कहता है "दवा दी गई" जबकि वास्तव में उन्होंने नहीं दी थी, या इसके विपरीत)। यदि आप एक ऐसी लॉगबुक का उपयोग करके अपने रोबोट को सिखाने की कोशिश करते हैं जो गलतियों से भरी है, तो वह गलत सबक सीख जाएगा, जिससे बाद में बुरे निर्णय लिए जाएंगे। यह शोध पत्र इस पेचीदा समस्या पर काम करता है कि कैसे प्रभावी ढंग से सीखा जाए जब कहानी का सबसे महत्वपूर्ण हिस्सा—वास्तविक एक्शन—गायब या छद्म रूप में हो।
लापता चाल का रहस्य
"लर्निंग फ्रॉम द अनसीन" (Learning from the Unseen) नामक शोध पत्र में, लेखक ज़ेयू बियान, यिंग झोउ और यिफान कुई एक ऐसी जासूसी कहानी का सामना करते हैं जहाँ मुख्य सुराग गायब है। कल्पना कीजिए कि आप एक सुरक्षा वीडियो देखकर अपराध को सुलझाने की कोशिश कर रहे हैं एक जासूस हैं। लेकिन यहाँ एक मोड़ है: वीडियो संदिग्ध की छाया दिखाता है, न कि स्वयं संदिग्ध को। आप छाया को हिलते हुए देख सकते हैं, लेकिन आप यह नहीं जान सकते कि संदिग्ध के हाथ वास्तव में क्या कर रहे थे। डेटा साइंस की दुनिया में, इसे "हिडन एक्शन्स" (छिपे हुए एक्शन) कहा जाता है।
आमतौर पर, जब वैज्ञानिक पिछले डेटा का उपयोग करके किसी रणनीति का मूल्यांकन करने की कोशिश करते हैं (जिसे ऑफ-पॉलिसी इवैल्यूएशन कहा जाता है), तो वे मानते हैं कि लॉगबुक एकदम सही है। वे मानते हैं कि यदि लॉग कहता है "एक्शन A लिया गया था," तो एक्शन A निश्चित रूप से लिया गया था। लेकिन वास्तविक दुनिया के अव्यवस्थित परिदृश्यों में—जैसे अस्पताल के रिकॉर्ड जहाँ एक डॉक्टर उपचार के घंटों बाद नोट लिख सकता है, या एक सिस्टम जो गलती से बटन दबाने को गलत लेबल कर देता है—यह धारणा एक जाल है। यदि आप गलतियों को अनदेखा करते हैं, तो आपकी रणनीति का मूल्यांकन पक्षपाती होगा, जैसे कि किसी शेफ के खाना बनाने के कौशल का आकलन उस मेनू के आधार पर करना जिसमें गलत सामग्री सूचीबद्ध है।
अगले कदम का जादू
लेखकों की बड़ी सफलता यह महसूस करने में है कि भले ही आप "एक्शन" को सीधे नहीं देख सकते, लेकिन आप अक्सर अगले क्षण में उसकी परछाई देख सकते हैं।
इसे इस तरह सोचिए: यदि एक जादूगर छड़ी लहराता है (छिपा हुआ एक्शन), तो आप कैमरे पर धुंध के कारण छड़ी को स्पष्ट रूप से नहीं देख पाते। लेकिन आप टोपी में खरगोब का प्रकट होना (अगली स्थिति/नेक्स्ट स्टेट) देख सकते हैं। खरगोब अचानक कहीं से भी प्रकट नहीं हुआ; वह छड़ी लहराने के कारण प्रकट हुआ। "नेक्स्ट स्टेट" (खरगोब) और "शोर भरे नोट" (धुंधला वीडियो) के बीच के संबंध का अध्ययन करके, लेखकों ने यह पता लगाया कि जादूगर ने वास्तव में क्या किया था।
वे अपने नए तरीके को LURE (लर्निंग फ्रॉम द अनसीन: रोबस्ट एस्टिमेटर) कहते हैं। यह एक सुपर-स्मार्ट जासूस की तरह है जो न केवल संदिग्ध की धुंधली फोटो देखता है, बल्कि यह भी देखता है कि पीछे पैरों के निशान क्या हैं और मौसम की रिपोर्ट क्या कहती है ताकि सटीक निष्कर्ष निकाला जा सके कि वास्तव में क्या हुआ था।
LURE कैसे काम करता है: "डबल-चेक" सिस्टम और जासूस का टूलकिट
यह शोध पत्र एक रणनीति के मूल्य का अनुमान लगाने का एक चतुर तरीका पेश करता है ताकि गलतियों से धोखा न खाया जाए। वे मल्टीपल रोबस्टनेस (बहु-मजबूती) नामक एक अवधारणा का उपयोग करते हैं।
कल्पना कीजिए कि आप बाहर के तापमान का अनुमान लगाने की कोशिश कर रहे हैं, लेकिन आपका थर्मामीटर खराब है। आपके पास तीन अन्य सुराग हैं: एक गीला कुत्ता, एक हिलता हुआ पेड़ और एक बादल का निर्माण।
- यदि आपका थर्मामीटर खराब है, तो भी आप सही अनुमान लगा सकते हैं यदि आपका "गीला कुצא" वाला सुराग सटीक है।
- यदि कुत्ता सूखा है लेकिन पेड़ हिल रहा है, तो भी आप सही अनुमान लगा सकते हैं।
- यह सिस्टम "रोबस्ट" है क्योंकि इसे हर सुराग के एकदम सही होने की आवश्यकता नहीं है; इसे बस उनके संयोजन में से कुछ के सही होने की आवश्यकता है।
LURE भी इसी तरह काम करता है। यह एक गणितीय मॉडल बनाता है जो डेटा के कई अलग-अलग हिस्सों की जांच करता है। भले ही "शोर वाले एक्शन" का मॉडल थोड़ा गलत हो, या "नेक्स्ट स्टेट" का मॉडल थोड़ा हटकर हो, एस्टिमेटर रणनीति के वास्तविक मूल्य को पा सकता है, बशर्ते कि अन्य भागों में से कम से कम एक सही हो। यह अंतिम उत्तर को पिछले तरीकों की तुलना में बहुत अधिक विश्वसनीय बनाता है, जो केवल एक हिस्से के खराब होने पर भी विफल हो जाते थे।
लेकिन LURE इस पहेली को कैसे सुलझाता है, इसमें एक छिपी हुई जटिलता है। चूंकि वास्तविक एक्शन कभी देखे नहीं जाते, इसलिए कंप्यूटर को यह अनुमान लगाना पड़ता है कि वास्तव में क्या हुआ था। इसे करने के लिए, लेखकों ने एक विशेष इटरेटिव एल्गोरिदम (जो 'एक्सपेक्टेशन-मैक्सिमाइजेशन' या EM नामक विधि पर आधारित है) विकसित किया है। इसे एक ऐसे जासूस के रूप में सोचें जो लगातार अपने सिद्धांत को परिष्कृत करता रहता है:
- अनुमान (E-step): कंप्यूटर छिपे हुए एक्शन के बारे में एक अनुमान से शुरू करता है।
- अपडेट (M-step): उस अनुमान का उपयोग करते हुए, यह उन मॉडलों को अपडेट करता है कि कैसे एक्शन रिवॉर्ड्स और नेक्स्ट स्टेट्स की ओर ले जाते हैं।
- परिष्करण (Refinement): फिर यह छिपे हुए एक्शन के बारे में बेहतर अनुमान लगाने के लिए इन अपडेटेड मॉडलों का उपयोग करता है, और जब तक कहानी पूरी तरह से समझ में न आ जाए, तब तक यह चक्र दोहराता रहता है।
हालाँकि, एक अंतिम मोड़ भी है। क्योंकि कंप्यूटर अनुमान लगा रहा है, यह गलती से लेबल बदल सकता है। यह तय कर सकता है कि "एक्शन 0" वास्तव में "दवा" है और "एक्शन 1" "कोई दवा नहीं" है, जबकि वास्तव में यह बिल्कुल उल्टा है। गणित दोनों तरफ काम करता है, लेकिन अर्थ बदल जाता है। इसे ठीक करने के लिए, लेखक एक महत्वपूर्ण लेबल अलाइनमेंट चरण शामिल करते हैं। अंतिम उत्तर देने से पहले, सिस्टम यह जांचता है कि कौन सा "अनुमान" शोर वाले डेटा के साथ सबसे अधिक तर्कसंगत है (उदाहरण के लिए, कौन सा छिपा हुआ एक्शन देखे गए "दवा दी गई" नोट का परिणाम होने की अधिक संभावना रखता है)। फिर यह आवश्यक होने पर लेबल को पलट देता है ताकि अंतिम रिपोर्ट वास्तविकता से मेल खा सके।
सिद्धांत का परीक्षण
लेखकों ने केवल सिद्धांत नहीं लिखा; उन्होंने इसे तीन अलग-अलग तरीकों से परखा:
- सरल सिमुलेशन: उन्होंने केवल तीन अवस्थाओं (states) और दो क्रियाओं (actions) के साथ एक छोटा, काल्पनिक संसार ("टेबुलर MDP") बनाया। उन्होंने जानबूझकर डेटा को 5% से 30% बार गलत लेबल करके बिगाड़ दिया। जबकि अन्य तरीके भ्रमित होकर गलत उत्तर देते रहे, LURE लक्ष्य पर बना रहा और रणनीति के मूल्य का सही अनुमान लगाया।
- जटिल सिमुलेशन: वे एक अधिक जटिल, निरंतर दुनिया (जैसे एक चिकनी जगह में घूमता हुआ रोबोट) की ओर बढ़े और वही परिणाम पाया: LURE ने त्रुटियों को सहजता से संभाला, जबकि अन्य विफल रहे।
- वास्तविक दुनिया का डेटा: उन्होंने अस्पताल (MIMIC-III) के वास्तविक रोगी रिकॉर्ड के एक विशाल डेटाबेस पर LURE का परीक्षण किया, विशेष रूप से सेप्सिस (संक्रमण के प्रति जीवन के लिए खतरा पैदा करने वाली प्रतिक्रिया) के उपचार पर ध्यान केंद्रित किया। इस वास्तविक परिदृश्य में, उन्होंने LURE की तुलना मानक तरीकों से की। परिणाम चौंकाने वाले थे: मानक तरीकों ने सुझाव दिया कि एक उपचार दूसरे से बेहतर था, लेकिन LURE ने, चिकित्सा रिकॉर्ड में छिपी त्रुटियों को ध्यान में रखते हुए, एक अलग, अधिक विश्वसनीय रैंकिंग का सुझाव दिया। वास्तव में, मानक तरीकों के कॉन्फिडेंस इंटरवल (संभावित उत्तरों की सीमा) इतने ओवरलैप हुए कि वे अंतर नहीं बता सके, जबकि LURE ने एक स्पष्ट, विशिष्ट उत्तर प्रदान किया।
निष्कर्ष
शोध पत्र यह निष्कर्ष निकालता है कि छिपे हुए एक्शन को अनदेखा करना एक खतरनाक जुआ है। "नेक्स्ट स्टेट" को सच्चाई को उजागर करने के लिए एक प्राकृतिक सुराग के रूप में उपयोग करके, और एक ऐसा सिस्टम बनाकर जो मॉडल के विभिन्न हिस्सों की गलतियों के प्रति मजबूत (robust) है, हम अंततः रणनीतियों का सटीक मूल्यांकन कर सकते हैं, भले ही हमारा डेटा अपूर्ण हो।
यह केवल एक सैद्धांतिक जीत नहीं है; यह भविष्य के लिए एक व्यावहारिक उपकरण है। चाहे चिकित्सा उपचार का निर्णय लेना हो, ट्रैफिक लाइट का प्रबंधन करना हो, या AI एजेंटों को प्रशिक्षित करना हो, LURE शोर से भ्रमित हुए बिना अतीत से सीखने का एक तरीका प्रदान करता है। लेखक दिखाते हैं कि सही गणितीय जासूसी के साथ, हम अनदेखे को देख सकते हैं और कल के लिए बेहतर निर्णय ले सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।