← नवीनतम पेपर
🤖 AI

Missingness-MDPs: Bridging the Theory of Missing Data and POMDPs

यह शोध पत्र 'missingness-MDPs' को प्रस्तुत करता है, जो POMDPs का एक नवीन उपवर्ग है जो मिसिंग डेटा थ्योरी के माध्यम से स्टेट फीचर अनऑब्जर्वेबिलिटी (state feature unobservability) को मॉडल करता है, और ट्रैजेक्टरी डेटा से अंतर्निहित मिसिंगनेस फंक्शन को सीखने के लिए PAC एल्गोरिदम प्रस्तावित करता है ताकि एप्सिलॉन-इष्टतम (epsilon-optimal) नीतियां प्राप्त की जा सकें।

मूल लेखक: Joshua Wendland, Markel Zubia, Roman Andriushchenko, Maris F. L. Galesloot, Milan Ceska, Henrik von Kleist, Thiago D. Simao, Maximilian Weininger, Nils Jansen

प्रकाशित 2026-05-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Joshua Wendland, Markel Zubia, Roman Andriushchenko, Maris F. L. Galesloot, Milan Ceska, Henrik von Kleist, Thiago D. Simao, Maximilian Weininger, Nils Jansen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को भूलभुलैया (maze) में रास्ता खोजना सिखाने की कोशिश कर रहे हैं, लेकिन रोबोट के सेंसर खराब हैं। कभी-कभी, वह पूरे कमरे को स्पष्ट रूप से देखता है; कभी-कभी, कमरे के कुछ हिस्से उसकी दृष्टि से गायब हो जाते हैं। शायद एक दीवार गायब हो जाए, या एक दरवाजा अदृश्य हो जाए। रोबोट को अभी भी भूलभुलैया के नियम पता हैं (कि वह एक स्थान से दूसरे स्थान पर कैसे जाता है), लेकिन उसे यह नहीं पता कि सेंसर कब और क्यों विफल हो रहे हैं।

यह शोध पत्र एक नया तरीका पेश करता है जिससे रोबोट को तब भी पूरी तरह से कार्य करने के लिए प्रशिक्षित किया जा सके, जब उसकी दृष्टि अविश्वसनीय हो। यहाँ सरल उपमाओं का उपयोग करके इसका विवरण दिया गया है:

1. समस्या: "खराब चश्मे" (The "Glitchy Glasses")

वास्तविक दुनिया में, डेटा अक्सर अधूरा होता है। एक डॉक्टर के बारे में सोचें जो मरीज की जांच कर रहा है। डॉक्टर जानता है कि बीमारी आमतौर पर कैसे आगे बढ़ती है (नियम), लेकिन कभी-कभी थर्मामीटर टूट जाता है, या हार्ट रेट मॉनिटर सिग्नल खो देता है। डॉक्टर को अधूरी जानकारी के आधार पर निर्णय लेना पड़ता है।

कंप्यूटर विज्ञान में, इसे आमतौर पर एक POMDP (पार्शियली ऑब्जर्वेबल मार्कोव डिसीजन प्रोसेस) के रूप में मॉडल किया जाता है। समस्या यह है कि मानक AI मॉडल इस बात को सीखने में संघर्ष करते हैं कि डेटा क्यों गायब है। यह एक ताश के खेल के नियमों को सीखने जैसा है जहाँ डीलर कभी-कभी कार्ड छिपा देता है, लेकिन आपको यह नहीं पता कि वह कार्डों को बेतरतीब ढंग से छिपा रहा है, क्योंकि वह कार्ड बांटने में बुरा है, या इसलिए कि वह आपके पास मौजूद कार्डों के आधार पर धोखाधड़ी कर रहा है।

2. समाधान: "मिसिंगनेस-MDPs" (miss-MDPs)

लेखकों ने इन मॉडलों का एक नया, विशिष्ट संस्करण बनाया है जिसे miss-MDPs कहा जाता है। गायब डेटा को एक अस्पष्ट "धुंध" मानने के बजाय, वे इसे तीन अलग-अलग व्यक्तित्वों वाले एक विशिष्ट प्रकार के "ग्लिच" (खराबी) के रूप में देखते हैं:

  • MCAR (Missing Completely At Random - पूरी तरह से यादृच्छिक रूप से गायब): एक ऐसे बल्ब की तरह जो बेतरतीब ढंग से झपकाता है। डेटा गायब है, लेकिन इसका मरीज के स्वास्थ्य या रोबोट के स्थान से कोई लेना-देना नहीं है। यह बस एक बुरा संयोग है।
  • MAR (Missing At Random - यादृच्छिक रूप से गायब): एक ऐसे कैमरे की तरह जो केवल तभी विफल होता है जब बहुत अंधेरा होता है। डेटा गायब है, लेकिन यह किसी ऐसी चीज़ पर निर्भर करता है जिसे आप देख सकते हैं (जैसे, हार्ट रेट मॉनिटर केवल तभी विफल होता है जब तापमान अधिक होता है, जो कि आप देख सकते हैं)।
  • MNAR (Missing Not At Random - यादृच्छिक रूप से नहीं गायब): सबसे कठिन वाला। एक ऐसे कैमरे की तरह जो विषय के कुछ शर्मनाक करने पर फोटो लेने से मना कर देता है। डेटा इसलिए गायब है क्योंकि वह डेटा के स्वयं के मान (value) पर निर्भर करता है (जैसे, हार्ट रेट मॉनिटर विशेष रूप से तब विफल होता है जब हार्ट रेट खतरनाक रूप से उच्च होती है)।

3. रणनीति: "ग्लिच पैटर्न" को सीखना

शोध पत्र की बड़ी सफलता यह पता लगाने में है कि AI को इतिहास से इन "ग्लिच पैटर्न" को कैसे सिखाया जाए।

  • पुराना तरीका: आमतौर पर, डेटा क्यों गायब है यह सीखना असंभव होता है। यह एक जादूगर के हाथों को देखे बिना उसके जादू के नियमों का अनुमान लगाने जैसा है।
  • नया तरीका: लेखकों ने महसूस किया कि यदि "ग्लिच" ऊपर दिए गए तीन पैटर्न (MCAR, MAR, या एक विशिष्ट प्रकार का MNAR) में से किसी एक का पालन करता है, तो आप पैटर्न सीख सकते हैं।
    • वे पिछले कार्यों और प्रेक्षणों (observations) के एक डेटासेट (जैसे, रोबोट की यात्रा का लॉगबुक) का उपयोग करते हैं।
    • वे एक सांख्यिकीय एल्गोरिदम चलाते है कि विभिन्न स्थितियों के तहत चीजें कितनी बार गायब होती हैं।
    • वे गायब होने का एक "मानचित्र" (map) बनाते हैं।

4. परिणाम: एक "सुपर-प्लानर"

एक बार जब AI "ग्लिच पैटर्न" (missingness function) को सीख लेता है, तो वह इस ज्ञान को एक मानक प्लानिंग टूल में जोड़ सकता है।

  • गारंटी: शोध पत्र गणितीय रूप से सिद्ध करता है कि यदि आप AI को पर्याप्त डेटा देते हैं, तो वह ग्लिच पैटर्न को इतनी सटीकता से सीख लेगा कि वह निर्णय लेने में लगभग उतना ही अच्छा होगा जितना कि एक आदर्श, सैद्धांतिक सर्वश्रेष्ठ निर्णय।
  • प्रमाण: उन्होंने दो परिदृश्यों पर इसका परीक्षण किया:
    1. ICU: एक सिमुलेशन जहाँ एक डॉक्टर मरीज का इलाज कर रहा है जिसमें महत्वपूर्ण संकेतों (vital signs) की कमी है।
    2. Predator (शिकारी): एक सिमुलेशन जहाँ एक शेर सूअर का पीछा कर रहा है और सूअर कभी-कभी छिप जाता है।

दोनों मामलों में, उनकी विधि (पहले ग्लिच पैटर्न को सीखना) उन मानक AI विधियों की तुलना में काफी बेहतर प्रदर्शन करती है जो बिना गायब डेटा को समझे सीधे उत्तर का अनुमान लगाने की कोशिश करती हैं।

5. पकड़ (The Catch)

यह विधि तब बहुत अच्छा काम करती है जब "ग्लिच" नियमों (MCAR, MAR, या विशिष्ट MNAR) का पालन करता है। यदि गायब होना अराजक है और इनमें से किसी भी पैटर्न का पालन नहीं करता है (जैसे, उनके परीक्षणों में "अनआइडेंटिफिएबल" MNAR), तो AI पैटर्न को पूरी तरह से नहीं सीख सकता है, और प्रदर्शन गिर जाता है।

संक्षेप में: शोध पत्र कहता है, "डेटा गायब होने पर केवल अनुमान न लगाएं। पहले, इतिहास को देखकर यह पता लगाएं कि डेटा कैसे गायब हो रहा है। एक बार जब आप गायब हिस्सों के पैटर्न को समझ लेते हैं, तो आप पहेली को पूरी तरह से हल कर सकते हैं।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →