← नवीनतम पेपर
🤖 machine learning

AETDICE: Unified Framework and Offline Optimization for Nonlinear Multi-Objective RL

यह शोध पत्र AETDICE को प्रस्तुत करता है, जो एक एकीकृत ढांचा और ऑफलाइन RL एल्गोरिदम है जो स्थिर डेटासेट का उपयोग करके नॉनलीनियर मल्टी-ऑब्जेक्टिव रीइन्फोर्समेंट लर्निंग के लिए सुलभ सैंपल-आधारित अनुकूलन को सक्षम करने हेतु स्केलेराइज्ड एक्सपेक्टेड रिटर्न (SER) और एक्सपेक्टेड स्केलेराइज्ड रिटर्न (ESR) प्रतिमानों के बीच के अंतर को पाटता है।

मूल लेखक: Woosung Kim, Youngjun Suh, Jinho Lee, Jongmin Lee, Byung-Jun Lee

प्रकाशित 2026-07-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Woosung Kim, Youngjun Suh, Jinho Lee, Jongmin Lee, Byung-Jun Lee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को टैक्सी चलाने के लिए प्रशिक्षित कर रहे हैं। लेकिन यह केवल बिंदु A से बिंदु B तक पहुँचने के बारे में नहीं है; रोबोट को एक ही समय में कई, परस्पर विरोधी लक्ष्यों को संतुलित करना होगा। शायद वह तेज़ होना चाहता है, लेकिन साथ ही ऊर्जा भी बचाना चाहता है। या शायद उसे दो अलग-अलग समूहों की समान रूप से सेवा करनी है, न कि केवल उन लोगों पर ध्यान केंद्रित करना है जो सबसे अधिक भुगतान करते हैं।

रोबोटिक्स और AI की दुनिया में, इसे मल्टी-ऑब्जेक्टिव रीइन्फोर्समेंट लर्निंग (MORL) कहा जाता है। चुनौती यह है: आप रोबोट को यह कैसे बताएंगे कि "अच्छा" क्या है जब "अच्छा" अलग-अलग लोगों के लिए अलग-अलग चीजें होती है?

पुराना मुद्दा: दो अलग-अलग नियम (Rulesets)

लंबे समय तक, शोधकर्ताओं को रोबोट को सिखाने के दो बहुत अलग तरीकों में से किसी एक को चुनना पड़ता था, और वे उन्हें मिला नहीं सकते थे:

  1. "औसत" दृष्टिकोण (SER): आप रोबोट को कहते हैं, "औसतन, कई यात्राओं के दौरान, मैं चाहता हूँ कि तुम संतुलित रहो।" यह एक स्कूल प्रिंसिपल की तरह है जो कहता है, "हमें परवाह नहीं है कि तुम एक दिन गणित में फेल हो गए, जब तक कि पूरे साल का तुम्हारा औसत ग्रेड अच्छा है।" रोबोट जोखिम लेने के लिए सीखता है, कभी-कभी बाद में बेहतर औसत पाने के लिए एक विशिष्ट यात्रा में विफल हो जाता है।

  2. "हर एक यात्रा" दृष्टिकोण (ESR): आप रोबोट को कहते हैं, "हर एक यात्रा संतुलित होनी चाहिए।" यह एक सख्त माता-पिता की तरह है जो कहता है, "तुम्हें हर परीक्षा में A ग्रेड लाना ही होगा।" यदि रोब dalam एक गणित की परीक्षा में विफल हो जाता है, तो पूरी रणनीति बिगड़ जाती है। यह बहुत कठिन है क्योंकि रोबोट को यह याद रखना पड़ता है कि अतीत में वास्तव में क्या हुआ था (जैसे, "मैंने पहले ही समूह A की सेवा कर दी है, इसलिए अब मुझे समूह B की सेवा जरूर करनी चाहिए") ताकि वह वर्तमान क्षण में सही निर्णय ले सके।

समस्या यह थी कि मौजूदा AI विधियाँ "औसत" दृष्टिकोण या "हर एक यात्रा" दृष्टिकोण को संभाल सकती थीं, लेकिन दोनों को एक साथ नहीं। और इससे भी बदतर, किसी ने भी यह नहीं पता लगाया था कि कैसे रोबोट को केवल एक फिक्स्ड डेटासेट (जैसे, पिछले ड्राइविंग लॉग का एक पुस्तकालय) का उपयोग करके ये जटिल नियम सिखाए जाएं, बिना रोबोट को वास्तविक दुनिया में गलतियाँ करने के लिए चलाने के।

नया समाधान: AETDICE

इस पेपर के लेखकों ने AETDICE नामक एक नया फ्रेमवर्क बनाया है। इसे एक 'यूनिवर्सल ट्रांसलेटर' की तरह समझें जो इन नियमों के किसी भी संयोजन को समझ सकता है।

उन्होंने इसे कैसे किया, यहाँ एक सरल उपमा दी गई है:

1. "मेमोरी बैकपैक" (Augmented State)

"हर एक यात्रा" नियम के साथ सबसे बड़ा सिरदर्द यह है कि रोबोट को अपने इतिहास को याद रखने की आवश्यकता होती है। यदि वह केवल वर्तमान सड़क के कोने को देखता है, तो उसे नहीं पता कि उसने पहले यात्री समूह की सेवा की है या नहीं।

  • समाधान: लेखकों ने रोबोट को एक बैकपैक दिया। हर बार जब रोबोट एक कदम उठाता है, तो वह अपना "अब तक का स्कोर" बैकपैक में लिख देता है। अब, जब रोबोट सड़क के कोने को देखता है, तो वह केवल "कोना" नहीं देखता; वह "कोना + बैकपैक स्कोर" देखता है।
  • यह कैसे मदद करता है: यह एक भ्रमित करने वाली, मेमोरी-निर्भर समस्या को एक मानक समस्या में बदल देता है। रोबोट अब "कोना + बैकपैक" के आधार पर निर्णय ले सकता है, ठीक वैसे ही जैसे एक सामान्य रोबोट "कोने" के आधार पर निर्णय लेता है।

2. "नक्शे को फिर से लिखना" (Transformed Rewards)

आमतौर पर, आप रोबोट को कहते हैं, "दुकान पर जाओ, तुम्हें 10 अंक मिलेंगे।" लेकिन जटिल नियमों के साथ (जैसे, "स्कोर को संतुलित करना"), अंक निश्चित नहीं होते; वे बैकपैक पर निर्भर करते हैं।

  • समाधान: लेखकों ने नक्शा बदल दिया। यात्रा के अंत में अंक देने के बजाय, उन्होंने गणना की कि प्रत्येक एकल कदम ने अंतिम लक्ष्य में कितना योगदान दिया और रोबм को तुरंत उस छोटे से हिस्से के अंक दे दिए।
  • यह कैसे मदद करता है: यह रोबोट को भविष्य में क्या होगा इसका अनुमान लगाए बिना, फिक्स्ड डेटासेट (पिछले यात्राओं के पुस्तकालय) से सीखने की अनुमति देता है। यह एक जटिल, वैश्विक पहेली को सरल, स्थानीय चरणों की श्रृंखला में बदल देता है।

3. "ग्लोबल बैलेंसर" (DICE Optimization)

एक बार जब रोबोट के पास अपना बैकपैक और नया नक्शा होता है, तो अभी भी एक पेचीदा हिस्सा बाकी है: यह सुनिश्चित करना कि सभी यात्राओं में कुल मिलाकर संतुलन बना रहे, न कि केवल स्थानीय स्तर पर।

  • समाधान: उन्होंने DICE (डिस्ट्रीब्यूशन करेक्शन एस्टीमेशन) नामक एक गणितीय उपकरण का उपयोग किया। कल्पना कीजिए कि आपके पास आपके डेटासेट में सभी पिछली यात्राओं का प्रतिनिधित्व करने वाला मोतियों का एक बैग है। कुछ मोती आपके विशिष्ट लक्ष्य के लिए "अच्छे" हैं, और कुछ "बुरे" हैं। DICE एक स्मार्ट फिल्टर की तरह काम करता है जो मोतियों को पुन: भारित (re-weight) करता है, रोबोट को बताता है: "उन यात्राओं को अनदेखा करें जहाँ आप बहुत लालची थे; उन यात्राओं पर ध्यान केंद्रित करें जहाँ आप संतुलित थे।"
  • यह कैसे मदद करता है: यह रोबोट को एक आदर्श रणनीति खोजने में मदद करता है, भले ही मूल डेटा अव्यवस्थित या पक्षपाती क्यों न हो।

उन्होंने क्या खोजा?

जब उन्होंने इस नई प्रणाली का परीक्षण किया, तो उन्होंने कुछ दिलचस्प व्यवहार देखे जिन्हें पुराने तरीके हासिल नहीं कर सके:

  • "स्टोकेस्टिक" मिश्रण: कभी-कभी, सबसे अच्छी रणनीति 100% सुसंगत होना नहीं होती। रोबोट ने एक "सिक्का उछालने वाला" (coin flipper) बनना सीखा। 50% यात्राओं में, वह पूरी तरह से यात्री समूह A पर ध्यान केंद्रित करेगा, और अन्य 50% में, वह पूरी तरह से समूह B पर ध्यान केंद्रित करेगा। औसत पर, यह सबसे संतुलित परिणाम था। पुराने तरीके रोबोट को या तो "स्पेशलिस्ट" (हमेशा A) या "जनरलिस्ट" (हमेशा विभाजित) होने के लिए मजबूर करते थे, जिससे यह चतुर मध्य मार्ग छूट जाता था।

  • "हिस्ट्री-अवेयर" ड्राइवर: "हर एक यात्रा" नियम के लिए, रोबोट ने अपने बैकपैक के आधार पर अपना व्यवहार बदलना सीखा। यदि उसने पहले ही समूह A की सेवा कर दी थी, तो वह समूह B की तलाश में आक्रामक हो जाएगा, भले ही सड़क वैसी ही दिख रही हो। यह एक ऐसा व्यवहार है जिसे मानक AI आमतौर पर स्थिर डेटा से नहीं सीख सकता।

निष्कर्ष

यह पेपर AI एजेंटों को केवल पिछले डेटा का उपयोग करके जटिल, प्रतिस्पर्धी लक्ष्यों को संभालने के लिए प्रशिक्षित करने का एक नया तरीका पेश करता है। यह "औसत प्रदर्शन" और "पूर्ण निरंतरता" के बीच के अंतर को पाटता है, जिससे रोबोट को ऐसी रणनीतियाँ सीखने में मदद मिलती है जो निष्पक्ष, संतुलित और विभिन्न स्थितियों के अनुकूल हैं—और वह भी बिना प्रशिक्षण के दौरान वास्तविक दुनिया के साथ संवाद किए।

संक्षेप में: उन्होंने एक यूनिवर्सल ट्रेनिंग किट बनाई है जो रोबोट को केवल पुराने वीडियो के पुस्तकालय का उपयोग करके, उन्हें एक मेमोरी बैकपैक और एक स्मार्ट मैप देकर, कई लक्ष्यों को पूरी तरह से संतुलित करना सिखाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →