Policy Gradients for Cumulative Prospect Theory in Reinforcement Learning
यह शोध पत्र परिमित-क्षितिज सुदृढीकरण शिक्षण (finite-horizon reinforcement learning) में संचयी प्रोस्पेक्ट थ्योरी (Cumulative Prospect Theory - CPT) उद्देश्यों के लिए एक पॉलिसी ग्रेडिएंट प्रमेय व्युत्पन्न करता है और गैर-उत्तल जोखिम-संवेदनशील नीतियों (nonconvex risk-sensitive policies) को अनुकूलित करने के लिए मोंटे कार्लो ऑर्डर सांख्यिकी (Monte Carlo order statistics) का उपयोग करके एक प्रमाणित रूप से अभिसारी प्रथम-क्रम एल्गोरिदम प्रस्तावित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मानव होने के नाते हम जोखिम की गणना करने में बेहद खराब हैं। हम एक गणितज्ञ की तरह संभावनाओं का वजन नहीं करते; इसके बजाय, हम उन्हें महसूस करते हैं। हम एक बड़ी हानि की छोटी संभावना से कहीं अधिक, एक मध्यम हानि की बड़ी संभावना से डरते हैं, और हम अक्सर एक विशाल लाभ की मामूली संभावना के पीछे भागते हैं, भले ही संभावनाएं हमारे खिलाफ हों। यह हमारे सॉफ्टवेयर में कोई खराबी नहीं है; यह हमारी बनावट ही ऐसी है। दशकों से, अर्थशास्त्रियों और मनोवैज्ञानिकों ने इन विचित्रताओं का वर्णन करने के लिए 'क्युमुलेटिव प्रॉस्पेक्ट थ्योरी' (Cumulative Prospect Theory) नामक एक ढांचे का उपयोग किया है। यह सुझाव देता है कि हम परिणामों का निर्णय उनके पूर्ण मूल्य से नहीं, बल्कि एक व्यक्तिगत संदर्भ बिंदु (reference point) के साथ उनकी तुलना करके करते हैं, और हम घटनाओं की संभावना को विकृत कर देते हैं, दुर्लभ आपदाओं को बढ़ा-चढ़ाकर देखते हैं और सामान्य घटनाओं को कम आंकते हैं।
लंबे समय तक, आर्टिफिशियल इंटेलिजेंस का क्षेत्र, विशेष रूप से 'रीइन्फोर्समेंट लर्निंग' (reinforcement learning), इन मानवीय विचित्रताओं को अनदेखा करता रहा है। इस क्षेत्र में, एक एजेंट इनाम (reward) को अधिकतम करने के लिए वातावरण के साथ बातचीत करके निर्णय लेना सीखता है। मानक दृष्टिकोण यह मानता है कि एजेंट पूरी तरह से तर्कसंगत है, जो हर संभावित पथ के औसत अपेक्षित परिणाम की गणना करता है और उच्चतम संख्या वाले पथ को चुनता है। यह मशीनों के लिए अच्छा काम करता है, लेकिन यह पकड़ने में विफल रहता है कि मनुष्य वास्तव में जटिल, अनिश्चित स्थितियों में कैसे व्यवहार करते हैं। जब हम ऐसा AI बनाने की कोशिश करते हैं जो लोगों के साथ मिलकर काम करे या उनके लिए निर्णय ले, तो एक शुद्ध तर्कसंगत एजेंट अक्सर ऐसे तरीकों से कार्य करता है जो एक मानव पर्यवेक्षक को ठंडा, तर्कहीन या बस गलत लगता है। शोधकर्ता यह सवाल पूछ रहे हैं कि क्या हम मशीनों को हमारी तरह सोचना सिखा सकते हैं, न कि केवल उनके अंतिम विकल्पों में, बल्कि इस बात में भी कि वे जोखिम और पुरस्कार को कैसे देखते हैं।
शोधकर्ताओं की एक टीम ने अब उस प्रश्न का उत्तर देने की दिशा में एक महत्वपूर्ण कदम उठाया है। उन्होंने एक नया गणितीय ढांचा विकसित किया है जो आर्टिफिशियल इंटेलिजेंस एजेंटों को मानव मनोविज्ञान के सिद्धांतों के आधार पर अपने व्यवहार को अनुकूलित करने की अनुमति देता है, न कि ठंडी गणना के आधार पर। सिमुलेशन की एक श्रृंखला में, उन्होंने प्रदर्शित किया कि एक एजेंट को 'क्युमुलेटिव प्रॉस्पेक्ट थ्योरी' के लेंस के माध्यम से दुनिया को देखना सिखाने से, मशीन वही सूक्ष्म, कभी-कभी विरोधाभासी जोखिम व्यवहार प्रदर्शित करने लगती है जो मनुष्य दिखाते हैं। शोधकर्ताओं ने केवल एक सिद्धांत प्रस्तावित नहीं किया; उन्होंने एक व्यावहारिक एल्गोरिदम बनाया है जो इन व्यवहारों को सीख सकता है और गणितीय रूप से सिद्ध किया है कि यह काम करता है, जो वित्त, स्वास्थ्य सेवा और यातायात प्रबंधन जैसे उच्च-दांव वाले वातावरण में AI को मानवीय प्राथमिकताओं के साथ संरेखित करने का एक तरीका प्रदान करता है।
उनके कार्य का मूल एक एजेंट को यह सिखाने की नई विधि है कि कैसे सीखा जाए। पारंपरिक रीइन्फोर्समेंट लर्निंग में, एजेंट उस इनाम के योग को अधिकतम करने की कोशिश करता है जिसकी वह अपेक्षा करता है। नई विधि लक्ष्य को बदल देती है। यह पूछने के बजाय कि, "औसत इनाम क्या है?" यह पूछता है, "एक मानव इस इनाम की धारा को कैसे देखता है?" इसे करने के लिए, एजेंट को पहले यह तय करना होगा कि एक विशिष्ट संदर्भ बिंदु के सापेक्ष क्या लाभ है और क्या हानि है। दर्द के स्तर को सात से पांच तक गिराना एक बड़ी जीत जैसा लग सकता है यदि रोगी का आधारभूत स्तर सात है, लेकिन यदि उनका आधारभूत स्तर दो है, तो यह एक मामूली सुधार हो सकता है। एजेंट फिर इन लाभों और हानियों पर एक विशेष रूपांतरण (transformation) लागू करता है, जिससे एक समान लाभ की खुशी की तुलना में एक हानि का दर्द अधिक भारी महसूस होता है। अंत में, यह संभावनाओं को विकृत करता है, जिससे दुर्लभ घटनाएं अधिक संभावित और सामान्य घटनाएं कम संभावित महसूस होती हैं, ठीक वैसे ही जैसे मानव मस्तिष्क करता है।
शोधकर्ताओं को इसे सफल बनाने में एक बड़ी बाधा का सामना करना पड़ा। इन मानव-समान विकृतियों द्वारा निर्मित गणितीय परिदृश्य अविश्वसनीय रूप से ऊबड़-खाबड़ और जटिल है। मानक अनुकूलन (optimization) के चिकने, अनुमानित टीलों के विपरीत, यह नया परिदृश्य तीखे शिखरों और गहरी घाटियों से भरा है, जिससे एल्गोरिदम के लिए बिना फंसे सबसे अच्छा रास्ता खोजना कठिन हो जाता है। इसके अलावा, AI को उसके निर्णयों में सुधार करने के तरीके को सिखाने के लिए उपयोग किए जाने वाले मानक उपकरण यहाँ लागू नहीं होते थे क्योंकि मानव-समान उद्देश्य फलन (objective function) उन सरल नियमों का पालन नहीं करता है जो अधिकांश लर्निंग एल्गोरिदम भरोसा करते हैं (जैसे कि योग और रैखिकता)। टीम को पूरी तरह से नए नियमों का एक सेट, एक "पॉलिसी ग्रेडिएंट थ्योरम" (policy gradient theorem) विकसित करना पड़ा, जो एजेंट के लिए एक दिशा-सूचक यंत्र (compass) के रूप में कार्य करता है। यह नया प्रमेय एक तरीका प्रदान करता है जिससे एजेंट अपने व्यवहार को बदलने की दिशा की गणना कर सके ताकि वह अपने प्रदर्शन को बेहतर बना सके, भले ही वह प्रदर्शन एक जटिल, मानव-समान मानक द्वारा मापा गया हो।
अपने नए दिशा-सूचक यंत्र का परीक्षण करने के लिए, शोधकर्ताओं ने प्रयोगों की एक श्रृंखला चलाई। एक साधारण परिदृश्य में, उन्होंने एक एजेंट को ऐसी स्थिति में रखा जहाँ उसे एक सुरक्षित, छोटे इनाम और एक जोखिम भरे, बड़े इनाम के बीच चयन करना था। एक मानक, तर्कसंगत एजेंट हमेशा उस विकल्प को चुनता है जिसमें औसत भुगतान सबसे अधिक होता है, भले ही इसका मतलब जुआ खेलना हो। एक जोखिम-विमुख (risk-averse) एजेंट, जिसे अनिश्चितता से बचने के लिए डिज़ाइन किया गया था, लगातार जुए से बचता रहा। लेकिन नए मानव-समान ढांचे के साथ प्रशिक्षित एजेंट ने कुछ अधिक दिलचस्प दिखाया। जब चुनाव में संभावित लाभ शामिल था, तो इसने सावधानी बरती, सुरक्षित विकल्प को प्राथमिकता दी। हालाँकि, जब परिदृश्य को संभावित नुकसान की ओर मोड़ा गया, तो वही एजेंट अचानक साहसी हो गया, और निश्चित नुकसान से बचने के लिए जोखिम भरा विकल्प चुना। व्यवहार में यह बदलाव, जिसे 'रिफ्लेक्शन इफेक्ट' (reflection effect) कहा जाता है, मानव निर्णय लेने की एक पहचान है जिसे मानक AI मॉडल दोहराने में संघर्ष करते हैं। नए एल्गोरिदम ने इसी आंतरिक सेटिंग का उपयोग करके इस बारीकी को पूरी तरह से पकड़ा।
शोधकर्ताओं ने अपने तरीके की तुलना मौजूदा दृष्टिकोणों से भी की जो जोखिम को मॉडल करने का प्रयास करते थे। उन्होंने पाया कि पुराने तरीके, जो ज़ीरो-ऑर्डर एस्टीमेशन (zeroth-order estimation - जिसका अर्थ है छोटे बदलाव करके सुधार की दिशा का अनुमान लगाना) पर निर्भर थे, जटिल होने पर संघर्ष करते थे। जब चरों (variables) की संख्या बढ़ती थी, तो ये विधियाँ अक्षम और धीमी हो जाती थीं। इसके विपरीत, नया एल्गोरिदम, जो सुधार की सटीक दिशा की गणना करने के लिए फर्स्ट-ऑर्डर जानकारी का उपयोग करता है, बहुत बेहतर तरीके से स्केल करता है। यह कुशल बना रहा, भले ही वातावरण की जटिलता बढ़ी, जो बताता है कि इसे कई गतिशील हिस्सों वाले वास्तविक दुनिया की समस्याओं, जैसे कि पावर ग्रिड का प्रबंधन करना या स्टॉक का व्यापार करना, में लागू किया जा सकता है।
इस कार्य के निहितार्थ साधारण खेलों से परे हैं। शोधकर्ताओं ने स्पष्ट किया कि इस दृष्टिकोण का उपयोग महत्वपूर्ण क्षेत्रों में कैसे किया जा सकता है। उदाहरण के लिए, स्वास्थ्य सेवा में, एक डॉक्टर जो रोगी के पुराने दर्द (chronic pain) का प्रबंधन कर रहा है, उसे तत्काल राहत और दीर्घकालिक निर्भरता के जोखिम के बीच संतुलन बनाना पड़ सकता है। एक मानक AI केवल औसत दर्द स्कोर को कम कर सकता है, जिससे संभावित रूप से रोगी के विड्रॉल लक्षणों (withdrawal symptoms) के डर को अनदेखा किया जा सकता है। हालाँकि, एक मानव-संरेखित एजेंट, एक दुर्लभ लेकिन विनाशकारी दुष्प्रभाव के डर को अधिक महत्व दे सकता है, जिससे उपचार योजनाएं अधिक सुरक्षित और रोगी के प्रति विचारशील महसूस होती हैं। इसी तरह, वित्त में, एक एजेंट को निवेशक की विशिष्ट जोखिम सहनशीलता को दर्शाने के लिए ट्यून किया जा सकता है, न कि केवल एक संख्या को समायोजित करके, बल्कि मौलिक रूप से यह बदलकर कि वह बाजार की गिरावट या भारी मुनाफे की संभावना को कैसे देखता है।
अध्ययन ने यह भी स्पष्ट किया कि इन एजेंटों के काम करने के लिए क्या आवश्यक है। शोधकर्ताओं ने उल्लेख किया कि एल्गोरिदम के कार्य करने के लिए, मानवीय प्राथमिकताएं—एक व्यक्ति हानि से कितना डरता है या वह संभावनाओं को कैसे विकृत करता है—पहले से ज्ञात होनी चाहिए। ये एजेंट द्वारा शून्य से नहीं सीखे जाते हैं, बल्कि मॉडल के हिस्से के रूप में प्रदान किए जाते हैं, ठीक वैसे ही जैसे खेल के नियम सेट किए जाते हैं। यह सिस्टम को विशिष्ट व्यक्तियों या समूहों के लिए अनुकूलित करने की अनुमति देता है। शोधकर्ताओं ने दिखाया कि संदर्भ बिंदु (reference point) या हानि के प्रति संवेदनशीलता को समायोजित करके, एजेंट के व्यवहार को नाटकीय रूप रूप से बदला जा सकता है, जो यह सिद्ध करता है कि सिस्टम मानवीय दृष्टिकोणों की एक विस्तृत श्रृंखला को मॉडल करने के लिए पर्याप्त लचीला है।
हालाँकि परिणाम उत्साहजनक हैं, शोधकर्ता अपने निष्कर्षों को अपने सिमुलेशन की सीमाओं के भीतर रखने के प्रति सावधान हैं। उन्होंने सिद्ध किया है कि एल्गोरिदम एक स्थिर समाधान की ओर अभिसरण (converge) करता है और यह जटिल, गैर-रैखिक वातावरण में इष्टतम नीतियां (optimal policies) खोज सकता है। उन्होंने सिमुलेशन के माध्यम से दिखाया है कि यह गति और स्केलेबिलिटी के मामले में पुराने तरीकों से बेहतर प्रदर्शन करता है। हालाँकि, उन्होंने अभी तक इस प्रणाली को किसी लाइव, वास्तविक दुनिया के परिवेश में तैनात नहीं किया है जहाँ मानव जीवन या वित्तीय संपत्ति तत्काल जोखिम में हो। यह कार्य एक सैद्धांतिक और कम्प्यूटेशनल सफलता है, एक प्रमाण है कि मशीनों को मानव जोखिम धारणा के अव्यवस्थित, तर्कहीन परिदृश्य को नेविगेट करना सिखाया जा सकता है।
आगे का मार्ग इन मॉडलों को परिष्कृत करने और उन्हें अधिक विविध, वास्तविक दुनिया के परिदृश्यों में परीक्षण करने पर केंद्रित है। शोधकर्ता सुझाव देते हैं कि भविष्य का कार्य मानवीय प्राथमिकताओं को डेटा से सीधे सीखने (pre-programmed करने के बजाय) और सिद्धांत को निरंतर, अनंत-क्षितिज (infinite-horizon) समस्याओं तक विस्तारित करने पर केंद्रित हो सकता है। वे इस दृष्टिकोण को मानव फीडबैक से सीखने के अन्य तरीकों के साथ मिलाने में भी क्षमता देखते हैं, जिससे एक हाइब्रिड सिस्टम बन सके जो समय के साथ बदलती प्राथमिकताओं के अनुकूल हो सके। फिलहाल, यह उपलब्धि दो दुनियाओं के बीच एक सेतु के रूप में खड़ी है: मशीन अनुकूलन का ठंडा तर्क और मानव निर्णय लेने की गर्म, अक्सर विरोधाभासी वास्तविकता। यह एक ऐसा AI बनाने का तरीका प्रदान करता है जो न केवल सर्वोत्तम परिणाम की गणना करता है, बल्कि यह भी समझता है कि उन परिणामों का उन लोगों के लिए क्या अर्थ है जिनकी वे सेवा करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।