← नवीनतम पेपर
🤖 AI

Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization

यह शोध पत्र D3POD^3PO को प्रस्तुत करता है, जो एक प्राथमिकता-सशर्त बहु-उद्देश्यीय सुदृढीकरण शिक्षण (multi-objective reinforcement learning) ढांचा है, जो एक विखंडित, विलंब-चरण भारण पाइपलाइन (decomposed, late-stage weighting pipeline) और एक विविधता नियमितकर्ता (diversity regularizer) का उपयोग करके मौजूदा विधियों की सीमाओं को दूर करता है ताकि विविध बेंचमार्क में बेहतर पारेटो फ्रंट कवरेज और उच्च-गुणवत्ता वाली नीतियां प्राप्त की जा सकें।

मूल लेखक: Tanmay Ambadkar, Sourav Panda, Shreyash Kale, Jonathan Dodge, Abhinav Verma

प्रकाशित 2026-07-13
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tanmay Ambadkar, Sourav Panda, Shreyash Kale, Jonathan Dodge, Abhinav Verma

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को वीडियो गेम खेलना सिखा रहे हैं, लेकिन यह सिर्फ कोई साधारण गेम नहीं है। यह एक ऐसा लेवल है जहाँ आपको एक साथ तीन गेंदों को संभालना है: गति (speed), सुरक्षा (safety), और ऊर्जा दक्षता (energy efficiency)। यदि आप रोबोट को "तेज़" जाने के लिए कहते हैं, तो वह क्रैश हो सकता है। यदि आप उसे "सुरक्षित" रहने के लिए कहते हैं, तो वह इतना धीरे चल सकता है कि कभी गेम पूरा ही न कर पाए। यह मल्टी-ऑब्जेक्टिव रिइन्फोर्समेंट लर्निंग (MORL) की दुनिया है: एक एजेंट को परस्पर विरोधी लक्ष्यों के बीच संतुलन बनाना सिखाना।

लंबे समय तक, शोधकर्ताओं ने इसे हल करने की कोशिश की कि वे शुरुआत में ही सभी लक्ष्यों को एक संख्या में मिलाकर एक एकल "स्कोर" दे दें। वे कहते थे, "ठीक है, गति 50 अंक है, सुरक्षा 50 अंक है, तो आपका कुल स्कोर 100 है।" यह पेपर इस दृष्टिकोण को अर्ली स्केलराइजेशन (Early Scalarization) कहता है।

पेंस स्टेट के तन्मय अंबेडकर और उनकी टीम ने खोजा कि यह "सब कुछ पहले ही मिला देने वाला" दृष्टिकोण दोषपूर्ण है। उन्होंने पाया कि जब लक्ष्य आपस में लड़ते हैं (जैसे गति बनाम सुरक्षा), तो उनके स्कोर को जल्दी जोड़ने से सकारात्मक संकेत नकारात्मक संकेतों को रद्द कर देते हैं। यह बिल्कुल वैसा ही है जैसे किसी कार को आगे धकेलने की कोशिश करना जबकि कोई दूसरा उसे बराबर बल के साथ पीछे खींच रहा हो; कार आगे नहीं बढ़ती और इंजन (लर्निंग एल्गोरिदम) भ्रमित हो जाता है। उनके प्रयोगों में, इस रद्दीकरण (cancellation) ने रोबोट के सीखने के अवसर से पहले ही 60-65% उपयोगी लर्निंग सिग्नल को खत्म कर दिया।

D3PO समाधान: कोचिंग का एक नया तरीका

इसे ठीक करने के लिए, टीम ने D3PO (डिकम्पोज्ड, डाइवर्सिटी-ड्रिवन पॉलिसी ऑप्टिमाइजेशन) नामक एक नया फ्रेमवर्क पेश किया। इसे ऐसे समझें कि D3PO कोई नया रोबोट नहीं है, बल्कि मौजूदा PPO (प्रॉक्सिमल पॉलिसी ऑप्टिमाइजेशन) एल्गोरिदम के लिए एक स्मार्ट कोचिंग रणनीति है, जो रोबोट को प्रशिक्षित करने का एक लोकप्रिय तरीका है।

यहाँ बताया गया है कि D3PO दो मुख्य ट्रिक्स का उपयोग करके खेल को कैसे बदल देता है:

1. "इंतज़ार करो और देखो" की रणनीति (लेट-स्टेज वेटिंग)
स्कोर को तुरंत मिलाने के बजाय, D3PO रोबोट को कहता है: "पहले हम गति के स्कोर और सुरक्षा के स्कोर को अलग-अलग देखते हैं।"

  • पुराना तरीका: स्कोर मिलाएं \rightarrow देखें कि चाल अच्छी है या नहीं \rightarrow रोबोट को अपडेट करें।
  • D3PO का तरीका: देखें कि क्या गति वाली चाल अच्छी है (अलग से) \rightarrow देखें कि क्या सुरक्षा वाली चाल अच्छी है (अलग से) \rightarrow फिर अंतिम अपडेट तय करने के लिए स्कोर को मिलाएं।

पेपर तर्क देता है कि वेटिंग (preferences) को मिलाने के लिए अंत तक इंतजार करके (Late-Stage Weighting), रोबोट प्रत्येक लक्ष्य से मिलने वाली "अच्छी खबर" को सुरक्षित रखता है। भले ही लक्ष्य आपस में लड़ रहे हों, रोबोट कोच द्वारा उन्हें संयोजित करने से पहले प्रत्येक के विशिष्ट सुझाव से सीखता है। यह उस "विनाशकारी रद्दीकरण" (destructive cancellation) को रोकता है जहाँ रोबोट सीखना बंद कर देता है क्योंकि संकेत एक-दूसरे को रद्द कर देते हैं।

2. "व्यक्तित्व" बूस्टर (डाइवर्सिटी रेगुलराइजेशन)
एक और समस्या थी: जब रोबोट को विभिन्न लक्ष्यों को संतुलित करने के लिए कहा जाता है, तो वे अक्सर आलसी हो जाते हैं और केवल एक "सुरक्षित औसत" व्यवहार सीख लेते हैं। वे न तो तेज़ होने की कोशिश करते हैं और न ही धीमे होने की; वे बस औसत दर्जे के बन जाते हैं। इसे मोड कोलैप्स (mode collapse) कहा जाता है।

D3PO इसे एक डाइवर्सिटी रेगुलराइज़र के साथ ठीक करता है। कल्पना कीजिए कि कोच रोबोट को कह रहा है: "यदि आपसे तेज़ होने के लिए कहा गया है, तो आपको सुरक्षित होने के निर्देश के मुकाबले अलग तरह से कार्य करना ही होगा। यदि आप दोनों के लिए एक जैसा व्यवहार करते हैं, तो आपको दंड दिया जाएगा।"
यह रोबोट को संभावनाओं की पूरी रेंज में अपने व्यवहार को फैलाने के लिए मजबूर करता है। एक "ठीक-ठाक" समाधान खोजने के बजाय, यह समाधानों का एक पूरा स्पेक्ट्रम सीखता है, जिसमें "सुपर फास्ट लेकिन जोखिम भरा" से लेकर "सुपर सेफ लेकिन धीमा" और उनके बीच की हर चीज़ शामिल है।

परिणाम: संभावनाओं का एक बेहतर मानचित्र

टीम ने Hopper, Ant, Humanoid, और Building-9d नामक एक जटिल बिल्डिंग सिमुलेशन सहित कुछ कठिन वीडियो गेम वातावरणों पर D3PO का परीक्षण किया। उन्होंने इसकी तुलना मौजूदा सर्वोत्तम तरीकों से की।

परिणाम स्पष्ट थे:

  • बेहतर कवरेज: D3PO ने पिछले तरीकों की तुलना में बहुत व्यापक और उच्च गुणवत्ता वाला समाधान सेट (जिसे Pare Pareto front कहा जाता है) खोजा। सरल शब्दों में, इसने गेम जीतने के अधिक तरीके खोजे, जो ट्रेड-ऑफ के पूरे मानचित्र को कवर करते हैं, न कि केवल कुछ बिंदुओं को।
  • दक्षता: जबकि अन्य तरीकों ने सैकड़ों अलग-अलग रोबोटों (प्रत्येक विशिष्ट लक्ष्य मिश्रण के लिए एक) को प्रशिक्षित करने की कोशिश की और भारी मेमोरी की आवश्यकता पड़ी, D3PO ने केवल एक ही रोबोट का उपयोग किया जो किसी भी प्राथमिकता मिश्रण को संभाल सकता था। इससे उन मल्टी-रोबोट दृष्टिकोणों की तुलना में 99% तक मेमोरी बचाई गई।
  • प्रदर्शन: Humanoid वातावरण में, कुछ अन्य तरीके केवल एक ही समाधान खोजने के साथ ढह गए (Sparsity 0), जबकि D3PO ने 0.003 की Sparsity के साथ विविध समाधानों का एक सेट खोजा, जो साबित करता है कि यह अटका नहीं।

यह पेपर किन चीजों को खारिज करता है

लेखक इस बारे में बहुत विशिष्ट हैं कि क्या काम नहीं करता है या क्या समाधान नहीं है:

  • उन्होंने जटिल गणित से समस्या को "ठीक करने" को खारिज कर दिया: उन्होंने (और पेपर अपेंडिक्स में चर्चा की है) बाद में मिक्सिंग समस्या को ठीक करने के लिए फैंसी नॉन-लीनियर गणित का उपयोग करने का प्रयास किया, लेकिन इससे ट्रेनिंग अस्थिर हो गई। उनका तर्क है कि समस्या गणित के बहुत सरल होने की नहीं है; बल्कि ऑपरेशन्स का क्रम गलत है।
  • उन्होंने यह भी खारिज किया कि समस्या "मस्तिष्क की शक्ति की कमी" है: वे दिखाते हैं कि विफलता इसलिए नहीं है क्योंकि रोबोट जटिल लक्ष्यों को समझने के लिए पर्याप्त स्मार्ट नहीं है। विफलता संरचनात्मक है: प्रशिक्षण प्रक्रिया स्वयं उस जानकारी को नष्ट कर देती है जिसे रोबोट उपयोग कर सकता है।
  • उन्होंने यह भी स्पष्ट किया कि यह हर प्रकार की समस्या का समाधान नहीं है: पेपर स्वीकार करता है कि चूंकि वे अभी भी स्कोर को मिलाने के लिए लीनियर (रैखिक) तरीके का उपयोग करते हैं, इसलिए वे केवल मानचित्र के "कॉन्वेक्स" (convex) हिस्सों पर ही समाधान पा सकते हैं। यदि परफेक्ट ट्रेड-ऑफ कर्व एक गहरी घाटी (concave) की तरह आकार लेता है, तो उनका तरीका, अन्य लीनियर तरीकों की तरह, उसके ऊपर से निकल जाएगा। वे सुझाव देते हैं कि उन गहरी घाटियों को खोजने के लिए भविष्य के कार्यों को उनके तरीके को अन्य उपकरणों के साथ जोड़ने की आवश्यकता हो सकती है।

वे कितने आश्वस्त हैं?

लेखक अपने निष्कर्षों में काफी आश्वस्त हैं, लेकिन वे केवल सिद्धांत नहीं, बल्कि डेटा के साथ अपनी बात रखते हैं।

  • मापा गया: उन्होंने मापा कि ट्रेनिंग के दौरान 36% से 53% समय लक्ष्य सक्रिय रूप से एक-दूसरे के खिलाफ लड़ रहे थे (नेगेटिव कोसाइन सिमिलैरिटी)।
  • मापा गया: उन्होंने दिखाया कि अर्ली स्केलरइजेशन ने उनके प्रयोगों में लर्निंग सिग्नल को 60-65% कम कर दिया।
  • सिमुलेटेड: प्रदर्शन लाभ (जैसे टेबल 1 में Hypervolume स्कोर) MO-Gymnasium जैसे वातावरणों में सिमुलेशन पर आधारित हैं। उन्होंने परिणामों को केवल भाग्य न होने के लिए 5 रैंडम सीड्स के साथ इन्हें चलाया।
  • सिद्ध (सैद्धांतिक रूप से): उन्होंने गणितीय प्रमाण (अपेंडिक्स में) प्रदान किए जो दिखाते हैं कि जब लक्ष्य संघर्ष करते हैं, तो उनका "लेट-स्टेज वेटिंग" पुराने "अर्ली स्केलरइजेशन" की तुलना में गणितीय रूप से अधिक सिग्नल को सुरक्षित रखता है।

संक्षेप में, पेपर सुझाव देता है कि परस्पर विरोधी लक्ष्यों को संतुलित करने के लिए रोबोट को सिखाने का रहस्य एक बड़ा दिमाग या एक अधिक जटिल गणितीय सूत्र बनाना नहीं है। यह लेसन प्लान (पाठ योजना) के क्रम को बदलने के बारे में है: रोबोट को पहले प्रत्येक लक्ष्य को स्पष्ट रूप से सुनने दें, फिर यह तय करें कि प्रत्येक को कितनी सुनना है। ऐसा करके, D3PO एक ही कुशल रोबोट का उपयोग करके समाधानों का एक समृद्ध और विविध सेट खोजने में सक्षम होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →