← नवीनतम पेपर
🤖 machine learning

Goal-Conditioned Agents that Learn Everything All at Once

यह शोध पत्र लर्निंग एवरीथिंग ऑल एट वन्स (LEO) को प्रस्तुत करता है, जो एक ऐसी विधि है जो प्रत्येक लक्ष्य के लिए मान (values) और क्रियाओं (actions) को संयुक्त रूप से आउटपुट करके, गोल-कंडीशन्ड रिइन्फोर्समेंट लर्निंग में कुशल, समानांतर ऑल-गोल्स ऑफ-पॉलिसी अपडेट्स को सक्षम बनाती है, जिससे पारंपरिक रीलेबलिंग तकनीकों की तुलना में महत्वपूर्ण प्रदर्शन लाभ और भारी गति वृद्धि प्राप्त होती है।

मूल लेखक: Michael Matthews, Matthew Jackson, Michael Beukman, Thomas Foster, Alistair Letcher, Scott Fujimoto, Cédric Colas, Jakob Foerster

प्रकाशित 2026-05-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Michael Matthews, Matthew Jackson, Michael Beukman, Thomas Foster, Alistair Letcher, Scott Fujimoto, Cédric Colas, Jakob Foerster

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक विशाल, निरंतर बदलते हुए भूलभुलैया (maze) में रास्ता खोजना सिखा रहे हैं। पुराने तरीके में (जिसे गोल-कंडीशन्ड रिइन्फोर्समेंट लर्निंग कहा जाता है), आप रोबोट को एक विशिष्ट निर्देश देते हैं, जैसे "रसोई में जाओ।" रोबोट इधर-उधर भटकता है, दीवारों से टकराता है, और अंततः शायद रसोई तक पहुँच जाता है।

जब रोबोट काम पूरा कर लेता है, तो शिक्षक उस रास्ते को देखता है जो उसने तय किया था। यदि रोबोट को रसोई में जाने के लिए कहा गया था लेकिन वह रास्ते में पुस्तकालय (library) के पास से गुजर गया, तो पुराना तरीका कहेगा, "पुस्तकालय वाला यह हिस्सा एक गलती थी; इसे फेंक दो। हमें केवल रसोई की परवाह है।"

समस्या: यह जानकारी की बर्बादी है! रोबौट ने रसोई को खोजने की कोशिश करते समय पुस्तकालय के बारे में बहुत कुछ सीखा। इस डेटा को फेंककर, रोबोट को बाद में पुस्तकालय के बारे में फिर से सीखना होगा यदि आप कभी उसे वहां जाने के लिए कहें।

पुराना "सुधार" (हाइंडसाइट एक्सपीरियंस रीप्ले - Hindsight Experience Replay):
पहले, शोधकर्ताओं ने इस समस्या को ठीक करने के लिए रोबोट के रास्ते को देखा और कहा, "ओह, यह पुस्तकालय में समाप्त हुआ! चलो मान लेते हैं कि हम शुरू से ही चाहते थे कि यह पुस्तकालय जाए।" यह थोड़ा मदद करता है, लेकिन यह एक पूरी फिल्म को देखने के बाद उसे फिर से लेबल करने जैसा है। यह धीमा है, और आप एक समय में केवल कुछ अलग अंत (endings) के लिए ही ऐसा कर सकते हैं।

नया समाधान: "सब कुछ एक साथ सीखना" (LEO)
लेखकों ने एक स्मार्ट तरीका प्रस्तावित किया है। रोबोट को एक समय में एक लक्ष्य सिखाने के बजाय, वे एक "सुपर-ब्रेन" बनाते हैं जो हर संभव लक्ष्य को एक साथ सीखता है

इसे एक शेफ (chef) के रूप में सोचें जो एक विशाल दावत (banquet) बना रहा है।

  • पुराना तरीका: शेफ एक व्यंजन (रसोई) बनाता है, उसे चखता है, प्याज काटने के अपने नोट्स को फेंक देता है, और फिर अगला व्यंजन (पुस्तकालय) बनाने के लिए फिर से शुरू करता है।
  • LEO का तरीका: शेफ एक ही बार में पूरी दावत बनाता है। उनके पास एक बड़ा बोर्ड है जिस पर 512 अलग-अलग रेसिपी (लक्ष्य) लिखी हुई हैं। जैसे ही वे प्याज काटते हैं, वे तुरंत एक ही समय में सभी 512 रेसिपी के लिए अपने ज्ञान को अपडेट करते हैं। वे महसूस करते हैं, "अरे, प्याज काटना सूप, स्टू और सलाद तीनों के लिए उपयोगी है!"

यह तकनीकी रूप से कैसे काम करता है (लेकिन सरल रूप में):
आमतौर पर, एक कंप्यूटर नेटवर्क पूछता है, "इस विशिष्ट लक्ष्य के लिए सबसे अच्छा कदम क्या है?"
LEO नेटवर्क को इस तरह बदलता है कि वह पूछता है, "अभी के लिए हर एक लक्ष्य के लिए सबसे अच्छा कदम क्या है?" यह एक ही बार में हर संभावित गंतव्य के उत्तरों की एक विशाल सूची आउटपुट करता है। यह सीखने की प्रक्रिया को अविश्वसनीय रूप से तेज़ (पुराने "री-लेबलिंग" तरीके से 250 गुना से अधिक तेज़) बनाता है क्योंकि रोबोट को एक ही यात्रा को सैकड़ों बार दोहराने की आवश्यकता नहीं होती है।

चुनौती: "लेट फ्यूजन" (Late Fusion) की समस्या
लेखकों ने पाया कि एक छोटी सी खामी है। क्योंकि रोबोट को एक ही समय में सभी लक्ष्यों के बारे में सोचना पड़ता है, इसलिए वह कभी-कभी भ्रमित हो जाता है। यह एक छात्र की तरह है जो एक ही समय में 500 अलग-अलग परीक्षाओं की पढ़ाई करने की कोशिश कर रहा है। वे सामग्री का एक सामान्य बोध तो प्राप्त कर सकते हैं, लेकिन वे एक ऐसे छात्र जितने सटीक नहीं हो सकते हैं जिसने केवल उसी एक परीक्षा के लिए पढ़ाई की हो।

पेपर में, इसका मतलब था कि LEO कठिन, जटिल लक्ष्यों को हल करने में महान था लेकिन कभी-कभी सरल लक्ष्यों के लिए खराब प्रदर्शन करता था क्योंकि यह अपने ध्यान को "पतला" (dilute) कर रहा था।

अंतिम समाधान: "डुअल LEO" (शिक्षक-छात्र प्रणाली)
इस समस्या को हल करने के लिए, लेखकों ने एक टीम बनाई:

  1. शिक्षक (LEO): यह नेटवर्क एक "डेटा स्पंज" है। यह सब कुछ, यहाँ तक कि अगर वह थोड़ा अस्त-व्यệt भी हो, सब कुछ सीखता है। यह दुनिया का एक रफ मैप प्रदान करता है।
  2. छात्र (स्टैंडर्ड नेटवर्क): यह नेटवर्क एक विशेषज्ञ है। यह केवल उस विशिष्ट लक्ष्य पर ध्यान केंद्रित करता है जिसे आप वर्तमान में करने के लिए कह रहे हैं।

शिक्षक छात्र से कहता है, "अरे, मुझे पता है कि पुस्तकालय की सामान्य दिशा क्या है, भले ही मैं एकदम सटीक न हूँ। यहाँ एक संकेत है।" छात्र उस संकेत को लेता है और खुद को पुस्तकालय जाने में विशेषज्ञ बनाने के लिए उसे परिष्कृत (refine) करता है।

परिणाम
टीम ने Craftax (जो Minecraft जैसा है) नामक एक जटिल वीडियो गेम और कुछ रोबोट मूवमेंट कार्यों पर इस परीक्षण को किया।

  • 512 अलग-अलग लक्ष्यों वाले बड़े, कठिन संस्करण पर, नया Dual LEO तरीका स्पष्ट विजेता था, जिसने अन्य सभी तरीकों को पीछे छोड़ दिया।
  • इसने बहुत तेज़ी से सीखा और उन विशाल कार्यों को संभाल सका जिन्हें अन्य तरीकों ने छोड़ दिया था।
  • उन्होंने यह भी दिखाया कि यह निरंतर गतिविधियों (जैसे एक रोबोटिक हाथ का सुचारू रूप से हिलना) के लिए भी काम करता है, न कि केवल वीडियो गेम के स्टेप्स के लिए।

सारांश में
यह पेपर एक ऐसी विधि पेश करता है जहाँ एक AI एक-एक करके, बल्कि एक ही समय में हर संभव समस्या को हल करना सीखता है। जब यह बहुत व्यापक हो जाता है और अपना ध्यान खो देता है, तो वे इसे एक विशेषज्ञ "छात्र" नेटवर्क के साथ जोड़ते हैं जो व्यापक ज्ञान का उपयोग एक मार्गदर्शक के रूप में करता है। यह रोबोटों और गेम खेलने वाले AI को पहले की तुलना में बहुत अधिक तेज़ी से और अधिक कुशलता से जानकारी सीखने में सक्षम बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →