← नवीनतम पेपर
🤖 machine learning

Issues with Value-Based Multi-objective Reinforcement Learning: Value Function Interference and Overestimation Sensitivity

यह शोध पत्र दो पूर्व में अप्रतिवेदित चुनौतियों, वैल्यू फंक्शन इंटरफेरेंस (value function interference) और ओवरएस्टिमेशन के प्रति संवेदनशीलता (sensitivity to overestimation), की पहचान और विश्लेषण करता है, जो गैर-रेखीय उपयोगिता कार्यों (non-linear utility functions) के साथ उपयोग किए जाने पर वैल्यू-आधारित मल्टी-ऑब्जेक्टिव रीइन्फोर्समेंट लर्निंग एल्गोरिदम के प्रदर्शन में बाधा उत्पन्न करते हैं।

मूल लेखक: Peter Vamplew (EJ), Ethan (EJ), Watkins, Cameron Foale, Richard Dazeley

प्रकाशित 2026-04-23
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Peter Vamplew (EJ), Ethan (EJ), Watkins, Cameron Foale, Richard Dazeley

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक अंतरिक्ष यान के कप्तान हैं जो एक दूर स्थित ग्रह तक पहुँचने की कोशिश कर रहे हैं। लेकिन यहाँ एक पेच है: आप केवल वहाँ तेज़ी से पहुँचने की कोशिश नहीं कर रहे हैं। आपके पास एक डैशबोर्ड है जिसमें तीन परस्पर विरोधी लक्ष्य हैं:

  1. गति (Speed): (वहाँ जल्दी पहुँचना)।
  2. ईंधन दक्षता (Fuel Efficiency): (ऊर्जा बचाना)।
  3. सुरक्षा (Safety): (क्षुद्रग्रहों/एस्टरॉयड से बचना)।

आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, इसे मल्टी-ऑब्जेक्टिव रीइन्फोर्समेंट लर्निंग (MORL) कहा जाता है। AI एजेंट (आपका अंतरिक्ष यान का कंप्यूटर) को इन प्रतिस्पर्धी लक्ष्यों के बीच संतुलन बनाना सीखना होगा। आमतौर पर, AI एक "स्कोरकार्ड" (जिसे Q-वैल्यू कहा जाता है) के माध्यम से सीखता है। साधारण AI में, यह स्कोर केवल एक संख्या होती है। लेकिन इस जटिल दुनिया में, स्कोरकार्ड एक वेक्टर (vector) है—संख्याओं की एक सूची, जो प्रत्येक लक्ष्य के लिए एक संख्या है (जैसे, [गति: 10, ईंधन: 5, सुरक्षा: 9])।

पीटर वैम्पलव और उनके सहयोगियों द्वारा लिखित यह शोध पत्र खोज निकालता है कि जब आप इन जटिल स्कोरकार्डों को गैर-रैखिक (non-linear) प्राथमिकताओं (जहाँ आपकी खुशी का गणित एक सीधी रेखा नहीं है) के साथ उपयोग करने की कोशिश करते हैं, तो दो प्रमुख "ग्लिच" (खामियां) उत्पन्न होती हैं।

यहाँ दोनों समस्याओं का विवरण दिया गया है, जिन्हें रोजमर्रा के उदाहरणों के माध्यम से समझाया गया है।


समस्या 1: "औसत बनाम वास्तविकता" का जाल (वैल्यू फंक्शन इंटरफेरेंस)

अवधारणा:
मानक AI में, यदि आप कोई जुआ खेलते हैं, तो AI औसत परिणाम की गणना करता है और उस औसत के आधार पर निर्णय लेता है। यह तब ठीक काम करता है जब आपकी खुशी एक सीधी रेखा (linear) हो। लेकिन यदि आपकी खुशी एक वक्र (curve/non-linear) है, तो औसत आपसे झूठ बोल सकता है।

उदाहरण: लॉटरी टिकट बनाम गारंटीकृत नकद
कल्पना कीजिए कि आप एक कैसीनो में हैं। आपके पास दो विकल्प हैं:

  • विकल्प A (जुआ): 10∗∗या∗∗10** या **100 जीतने का 50/50 मौका।
    • इसका औसत मूल्य $55 है।
  • विकल्प B (सुरक्षित दांव): गारंटीकृत $40।

परिदृश्य 1: यदि आप पैसे को रैखिक रूप से पसंद करते हैं।
यदि आप केवल सबसे अधिक पैसा चाहते हैं, तो 55(Aकाऔसत)55 (A का औसत) 40 (B) से बेहतर है। आप A चुनते हैं। सरल।

परिदृश्य 2: यदि आप जोखिम से डरते हैं (Non-linear utility)।
मान लीजिए कि आपकी "खुशी" का फंक्शन अजीब है। आप हारने से बहुत डरते हैं, इसलिए 10मिलनाआपकोदुखीकरताहै,लेकिन10 मिलना आपको दुखी करता है, लेकिन 100 मिलना आपको बेहद उत्साहित कर देता है।

  • विकल्प A के लिए आपकी खुशी का औसत कम हो सकता है क्योंकि $10 मिलने का जोखिम इसे नीचे खींच लेता है।
  • हालाँकि, शोध पत्र एक विशिष्ट गणितीय जाल की ओर इशारा करता है: कभी-कभी, AI पहले औसत वेक्टर (average vector) की गणना करता है, और फिर आपके खुशी के फॉर्मूले को लागू करता है।
    • वह औसत वेक्टर देखता है: [गति: 55, ...]|
    • वह उस औसत पर खुशी की गणना करता है: Happiness(55)।
    • जाल: कुछ जटिल गणितीय परिदृश्यों में (जैसे कि पेपर में बताए गए "कॉन्वेक्स" या "कॉन्केव" कर्व्स), Happiness(Average) और Average(Happiness) एक समान नहीं होते हैं।

वास्तविक दुनिया का परिणाम:
AI किसी जुए के "औसत वेक्टर" को देख सकता है, एक स्कोर की गणना कर सकता है, और यह निर्णय ले सकता है कि यह सुरक्षित दांव से बेहतर है। लेकिन वास्तव में, यदि आप वास्तव में 100 बार वह खेल खेलते हैं, तो आप हर बार सुरक्षित दांव लेने में अधिक खुश होंगे। AI "औसत" से भ्रमित हो जाता है और गलत रास्ता चुन लेता है, जिससे उप-इष्टतम (sub-optimal) परिणाम मिलता है।

समाधान:
पेपर सुझाव देता है कि यदि AI को दो ऐसे चालों के बीच चयन करना है जो समान रूप से अच्छी दिखती हैं, तो उसे सिक्का नहीं उछालना चाहिए (यानी रैंडमली नहीं चुनना चाहिए)। उसे हर बार एक ही चीज़ चुननी चाहिए (डिटरमिनिस्टिक)। यह AI को गलती से एक "नकली औसत" बनाने से रोकता है जो उसके अपने तर्क को भ्रमित कर देता है।


समस्या 2: "अतिशयोक्तिपूर्ण स्कोर" की संवेदनशीलता (Overestimation)

अवसेप्ट:
AI एल्गोरिदम अक्सर थोड़े अधिक उत्साहित हो जाते हैं। वे किसी चाल को उसकी वास्तविक क्षमता से अधिक (overestimate) आंकते हैं। साधारण AI (एकल उद्देश्य) में, यह ज्यादा मायने नहीं रखता। यदि आप सोचते हैं कि एक चाल 8 के बजाय 10 अंक की है, और दूसरी चाल 5 की है, तो भी आप पहली चाल ही चुनेंगे। रैंकिंग वही रहती है।

उदाहरण: विकृत मानचित्र (Distorted Map)
कल्पना कीजिए कि आप एक मानचित्र के साथ हाइकिंग कर रहे हैं जिसमें थोड़ा सा विरूपण (distortion) है।

  • रैखिक मानचित्र (साधारण AI): मानचित्र कहता है कि पर्वत A 100 मीटर ऊँचा है, और पर्वत B 50 मीटर ऊँचा है। भले ही मानचित्र गलत हो और वे 105 मीटर और 55 मीटर कहें, फिर भी आप जानते हैं कि A ऊँचा है। आप A चुनते हैं।
  • गैर-रैखिक मानचित्र (जटिल AI): अब, कल्पना कीजिए कि आपका लक्ष्य केवल "ऊंचाई" नहीं है, बल्कि "प्राकृतिक सुंदरता" है, जो एक अजीब फॉर्मूले पर निर्भर करती है। शायद आप केवल उन पहाड़ों की परवाह करते हैं जो बिल्कुल 100 मीटर से ऊपर हैं, या शायद एक निश्चित बिंदु के बाद सुंदरता तेजी से गिर जाती है।
    • यदि मानचित्र पर्वत B को बहुत मामूली रूप से बढ़ा-चढ़ाकर दिखाता है, तो यह अचानक आपके फॉर्मूले के एक "थ्रेशोल्ड" (सीमा) को पार कर सकता है।
    • अचानक, AI सोचता है कि पर्वत B सबसे सुंदर है, भले ही पर्वत A वास्तव में बेहतर हो।

वास्तविक दुनिया का परिणाम:
पेपर दिखाता है कि जब आप जटिल, गैर-रैखिक नियमों का उपयोग करते हैं (जैसे "सुरक्षा पूर्ण होनी चाहिए, अन्यथा मुझे गति की परवाह नहीं है"), तो AI के स्कोरकार्ड में थोड़ी सी भी "शोर" (noise) या अतिरंजना (overestimation) पूरी तरह से उसके निर्णय को बदल सकती है।

  • रैखिक AI: अतिरंजना (Overestimation) केवल एक हानिरहित शोर है।
  • गैर-रैखिक AI: अतिरंजना एक आपदा है। यह AI को गलत रास्ता चुनने के लिए मजबूर करती है, जिससे प्रदर्शन में भारी गिरावट आती है।

"थ्रेशोल्ड" का उदाहरण:
एक स्पीड लिमिट साइन (गति सीमा बोर्ड) के बारे में सोचें।

  • यदि आप 59 मील प्रति घंटे की गति से चल रहे हैं और स्पीडोमीटर थोड़ा खराब है और 61 मील प्रति घंटे दिखाता है, तो आप घबरा सकते हैं और सोच सकते हैं कि आप ओवरस्पीडिंग कर रहे हैं।
  • यदि आप 61 मील प्रति घंटे की गति से चल रहे हैं और स्पीडोमीटर 63 मील प्रति घंटे दिखाता है, तो भी आप ओवरस्पीडिंग ही कर रहे हैं।
  • लेकिन यदि आपकी "यूटिलिटी" (उपयोगिता) यह है कि "मैं खुश हूँ यदि मैं 60 से नीचे हूँ, और दुखी हूँ यदि मैं इससे ऊपर हूँ," तो स्पीडोमीटर की एक छोटी सी त्रुटि आपकी पूरी भावनात्मक स्थिति को "खुश" से "दुखी" में बदल देती है। AI की अतिरंजना उस टूटे हुए स्पीडोमीटर की तरह काम करती है।

सारांश: हमें क्या करना चाहिए?

लेखकों का निष्कर्ष है कि वर्तमान AI विधियाँ जटिल, बहु-लक्ष्य समस्याओं को संभालने में थोड़ी नाजुक हैं।

  1. अनिश्चितता को रोकें: जब AI दो समान विकल्पों के बीच अनिश्चित हो, तो सिक्का उछालना बंद करें। एक ही विकल्प को लगातार चुनें ताकि "औसत" गणनाओं को भ्रमित होने से बचाया जा सके।
  2. अतिरंजना पर नज़र रखें: उस AI के प्रति बहुत सावधान रहें जो जटिल, गैर-रैखिक नियमों का उपयोग करता है। भविष्य के पुरस्कारों के अनुमान में छोटी सी त्रुटि भी विनाशकारी निर्णय लेने का कारण बन सकती है।
  3. भविष्य के समाधान: पेपर दो तरीके सुझाता है:
    • डिस्ट्रिब्यूशनल लर्निंग (Distributional Learning): केवल एक "औसत" स्कोर सीखने के बजाय, AI को संभावित परिणामों की पूरी रेंज सिखाएं (जैसे यह जानना कि 10मिलनेकी5010 मिलने की 50% संभावना है और 100 मिलने की 50% संभावना है, न कि केवल "औसत $55")। इससे AI सही खुशी की गणना कर सकता है।
    • स्केलराइजेशन (Scalarization): जटिल वेक्टर लक्ष्यों को हर कदम पर तुरंत एक एकल संख्या में बदल दें, बजाय इसके कि अंत तक प्रतीक्षा की जाए। यह "औसत बनाम वास्तविकता" के जाल से पूरी तरह बचता है।

संक्षेप में: जब एक AI को जटिल नियमों के साथ कई परस्पर विरोधी लक्ष्यों को संभालना होता है, तो वह औसत और छोटी त्रुटियों से आसानी से भ्रमित हो जाता है। हमें इसे केवल औसत देखने के बजाय पूरी तस्वीर देखने के लिए प्रशिक्षित करने की आवश्यकता है, और इसके स्कोरकीपिंग में बहुत सटीक होने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →