← नवीनतम पेपर
🤖 AI

Adaptive Policy Portfolios for Robust Markov Decision Processes

यह शोध पत्र आंशिक रूप से पहचान योग्य गतिकी वाले परिवेशों के लिए मानक सुदृढ़ मार्कोव निर्णय प्रक्रियाओं के एक कम रूढ़िवादी विकल्प के रूप में अनुकूली नीति पोर्टफोलियोओं (adaptive policy portfolios) को प्रस्तुत करता है, साथ ही यह स्थापित करता है कि ऐसे पोर्टफोलियोओं को प्रमाणित करना और संश्लेषित करना कम्प्यूटेशनल रूप से कठिन समस्याएँ (R\forall\mathbb{R}-पूर्ण और R\exists\forall\mathbb{R}-पूर्ण रूप से) हैं और रनटाइम विशिष्टीकरण (runtime specialization) के अनुकूल एक ऑफलाइन निर्माण विधि प्रस्तुत करता है।

मूल लेखक: Kasper Engelen, Sebastian Junges, Guillermo A. Pérez, Marnix Suilen

प्रकाशित 2026-08-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kasper Engelen, Sebastian Junges, Guillermo A. Pérez, Marnix Suilen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की दुनिया में, मशीनें अक्सर अनगिनत संभावित भविष्यों का अनुकरण करके निर्णय लेना सीखती हैं। कल्पना कीजिए कि एक रोबोट कमरे में रास्ता खोज रहा है, या एक सॉफ्टवेयर एजेंट बिजली ग्रिड का प्रबंधन कर रहा है। इसे अच्छी तरह से करने के लिए, वे एक गणितीय ढांचे पर भरोसा करते हैं जो यह भविष्यवाणी करता है कि उनके कार्यों से दुनिया कैसे बदलेगी। हालाँकि, ये भविष्यवाणियाँ कभी भी पूर्ण नहीं होतीं। वास्तविक दुनिया अव्यवस्थित है, और इन मॉडलों को बनाने के लिए उपयोग किए जाने वाले डेटा में अक्सर अंतराल या त्रुटियां होती हैं। जब एक AI एक त्रुटिपूर्ण मॉडल पर कार्य करता है, तो वह विनाशकारी गलतियाँ कर सकता है। इसे संभालने के लिए, शोधकर्ताओं ने 'रोबस्ट डिसीजन-मेकिंग' (robust decision-making) नामक एक विधि विकसित की। एक एकल, सबसे संभावित परिणाम पर दांव लगाने के बजाय, AI संभावनाओं की एक सीमा के भीतर सबसे खराब स्थिति के लिए योजना बनाता है। वह पूछता है, "यदि मैं यह कदम उठाता हूँ तो सबसे बुरा क्या हो सकता है, और मैं इससे कैसे बच सकता हूँ?" यह दृष्टिकोण सुरक्षा की गारंटी देता है, लेकिन इसकी एक भारी कीमत है: AI अत्यधिक सतर्क हो जाता है। वह किसी आपदा की मामूली संभावना से बचने के लिए कार्य करने से इनकार कर सकता है या एक औसत दर्ता का रास्ता चुन सकता है, भले ही वह आपदा अत्यधिक असंभव हो।

यह शोध पत्र अनिश्चितता का सामना कर रहे आर्टिफिशियल इंटेलिजेंस के लिए एक स्मार्ट मध्य मार्ग तलाशता है। बेल्जियम और नीदरलैंड के विश्वविद्यालयों में कार्यरत शोधकर्ता एक ऐसी प्रणाली का प्रस्ताव करते हैं जो AI को एक एकल, कठोर योजना के प्रति प्रतिबद्ध होने के लिए मजबूर नहीं करती है। इसके बजाय, वे पहले से ही विभिन्न रणनीतियों का एक छोटा, क्यूरेटेड संग्रह तैयार करने का सुझाव देते हैं। इसे एक पायलट के रूप में सोचें जो साफ आसमान के लिए एक उड़ान योजना, भारी टर्बुलेंस के लिए दूसरी, और अचानक आए तूफान के लिए तीसरी योजना साथ रखता है। पायलट को यह नहीं पता होता कि कौन सा मौसम आएगा, लेकिन उनके पास प्रत्येक के लिए सही योजना तैयार रहती है। शोधकर्ताओं की भाषा में, यह एक "एडेप्टिव पॉलिसी पोर्टफोलियो" (adaptive-policy portfolio) है। यह प्रणाली विभिन्न संभावित वास्तविकताओं के लिए सर्वोत्तम चाल की गणना करते हुए, ऑफलाइन इन विभिन्न रणनीतियों को संश्लेषित करती है। फिर, एक बार जब सिस्टम तैनात हो जाता है, तो यह वातावरण के विकसित होने का अवलोकन करता है। जैसे-जैसे यह सबूत जुटाता है कि वास्तव में क्या हो रहा है, यह उस रणनीति पर स्विच हो जाता है जो सबसे उपयुक्त है। यह AI को डर के कारण पंगु हुए बिना सुरक्षित रहने की अनुमति देता है।

टीम ने इस विचार का दो अलग-अलग चुनौतियों पर परीक्षण किया। पहला एक डेटा सेंटर का सिमुलेशन था, जहाँ एक कंट्रोलर को तापमान, आर्द्रता और कंप्यूटर जॉब्स की कतार का प्रबंधन करना होता है। सिस्टम को यह ठीक से नहीं पता था कि उसके कूलिंग फैन कितने प्रभावी हैं या बाहर की हवा कितनी गर्मी लाएगी। दूसरा चुनौतीपूर्ण कार्य एक ड्रोन था जो हवा के झोंकों और मोटर फेल होने के जोखिम से जूझते हुए एक त्रि-आयामी ग्रिड के माध्यम से उड़ रहा था। दोनों मामलों में, शोधकर्ताओं ने रणनीतियों का एक पुस्तकालय बनाया, जिसमें से प्रत्येक को हवा की शक्ति या कूलिंग दक्षता के विशिष्ट संयोजन के लिए अनुकूलित किया गया था। फिर, उन्होंने ड्रोन के उड़ने या डेटा सेंटर के चलने के दौरान सबसे अच्छी रणनीति चुनने के लिए एक सरल, तेज़ एल्गोरिदम का उपयोग किया। परिणाम प्रभावशाली थे। केवल कुछ रणनीतियों के पोर्टफोलियो का उपयोग करके, सिस्टम ने एक एकल, अत्यधिक सतर्क योजना का उपयोग करने की तुलना में अपनी गलतियों को नाटकीय रूप रूप से कम कर दिया। दस रणनीतियों के एक छोटे पुस्तकालय के साथ, ड्रोन की त्रुटियां लगभग शून्य तक गिर गईं, और डेटा सेंटर कंट्रोलर ने न्यूनतम ऊर्जा व्यय के साथ वातावरण को स्थिर रखा।

हालाँकि, यह शोध पत्र एक महत्वपूर्ण सीमा को भी प्रकट करता है। जबकि व्यावहारिक विधि अच्छी तरह से काम करती है, शोधकर्ताओं ने सिद्ध किया कि जटिल समस्याओं के लिए रणनीतियों का परफेक्ट सेट खोजना गणितीय रूप से कुशलतापूर्वक संभव नहीं है। उन्होंने दिखाया कि यह प्रमाणित करने का कार्य कि क्या रणनीतियों का एक दिया गया सेट पर्याप्त अच्छा है, या सबसे अच्छा सेट खोजना, उन समस्याओं की श्रेणी में आता है जिन्हें हल करना कंप्यूटर के लिए अत्यंत कठिन है। यहाँ तक कि समस्या के सरलीकृत संस्करणों में भी, जटिलता इतनी अधिक है कि किसी भी तेज़, सामान्य-उद्देश्य वाले एल्गोरिदम का अस्तित्व नहीं हो सकता जो हर मामले में इसे हल कर सके। इसका अर्थ यह है कि हालांकि शोधकर्ता एक बहुत अच्छा, व्यावहारिक सिस्टम बना सकते हैं, वे यह गारंटी नहीं दे सकते कि यह सबसे अच्छा संभव वाला है। कठिनाई इसलिए उत्पन्न होती है क्योंकि सिस्टम को इस बात का हिसाब रखना पड़ता है कि वातावरण हर संभव तरीके से कैसे व्यवहार कर सकता है, और विभिन्न रणनीतियों के बीच की अंतःक्रियाएं संभावनाओं का एक ऐसा जाल बनाती हैं जिसे पूरी तरह से सुलझाना बहुत बड़ा हो जाता है।

अध्ययन यह निष्कर्ष निकालता है कि यह दृष्टिकोण अनिश्चितता के अनुकूल होने का एक शक्तिशाली, प्रमाणित तरीका प्रदान करता है। यह एक कठोर, एकल योजना और हर विचारणीय भविष्य के लिए एक साथ योजना बनाने के असंभव कार्य के बीच के अंतर को पाटता है। शोधकर्ताओं ने प्रदर्शित किया कि विकल्पों के एक छोटे, प्रबंधनीय सेट को स्वीकार करके, एक AI अज्ञात के विरुद्ध मजबूत रह सकता है और साथ ही लगभग उतना ही अच्छा प्रदर्शन कर सकता है जितना कि वह भविष्य को जानने पर करता। ट्रेड-ऑफ यह है कि सिस्टम को इन विकल्पों को पहले से तैयार करने में समय बिताना होगा, और ऑनलाइन चयन प्रक्रिया को सही रणनीति की पहचान करने में थोड़ा समय लगेगा। फिर भी, प्रयोगों ने दिखाया कि यह लागत प्रदर्शन में होने वाले लाभों की तुलना में बहुत कम है। यह कार्य एक ऐसा स्पष्ट मार्ग प्रदान करता है जिससे ऐसे AI सिस्टम बनाए जा सकें जो सुरक्षित और प्रभावी दोनों हों, यह स्वीकार करते हुए कि हम हर गणितीय पहेली को पूरी तरह से हल नहीं कर सकते, फिर भी हम ऐसे उपकरण बना सकते हैं जो वास्तविक दुनिया को संभालने के लिए पर्याप्त अच्छे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →