← नवीनतम पेपर
⚡ electrical engineering

Align and Filter: Improving Performance in Asynchronous On-Policy RL

यह शोध पत्र वितरित प्रशिक्षण और उच्च अपडेट आवृत्तियों में इसके स्रोतों को संबोधित करके, एसिंक्रोनस ऑन-पॉलिसी सुदृढीकरण शिक्षण (reinforcement learning) में पॉलिसी लैग के प्रदर्शन को कम करने वाले प्रभावों को कम करने के लिए टोटल वेरिएशन-आधारित एडवांटेज अलाइन्ड कंस्ट्रेंड पॉलिसी ऑप्टिमाइज़ेशन (TV-ACPO) विधि प्रस्तुत करता है।

मूल लेखक: Homayoun Honari, Roger Creus Castanyer, Michael Przystupa, Michael Noukhovitch, Pablo Samuel Castro, Glen Berseth

प्रकाशित 2026-03-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Homayoun Honari, Roger Creus Castanyer, Michael Przystupa, Michael Noukhovitch, Pablo Samuel Castro, Glen Berseth

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Align and Filter: Improving Performance in Asynchronous On-Policy RL" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ स्पष्टीकरण दिया गया है।

बड़ी समस्या: "आउट-ऑफ-डेट मैप" (पुराना नक्शा)

कल्पना कीजिए कि आप एक रोबोट को चलना सिखा रहे हैं। आप उसे निर्देशों का एक सेट (एक पॉलिसी) देते हैं और वह चलने की कोशिश करता है। हर बार जब वह गिरता है या सफल होता है, तो वह उस डेटा को सीखने के लिए एक केंद्रीय कंप्यूटर को भेजता है।

एक आदर्श दुनिया में, रोबोट डेटा भेजेगा, कंप्यूटर सीखेगा, और तुरंत रोबोट के अगला कदम उठाने से पहले उसे निर्देशों का एक नया सेट वापस भेज देगा। इसे On-Policy लर्निंग कहा जाता है।

लेकिन वास्तविक दुनिया में, कंप्यूटर तेज़ होते हैं, लेकिन संचार (communication) धीमा होता है।

  • परिदृश्य: आपके पास एक ही समय में चलने वाले 1,000 रोबोट हैं। वे सभी अपना डेटा केंद्रीय मस्तिष्क (central brain) को भेजते हैं।
  • गड़बड़ी: जब मस्तिष्क रोबोट #1 के डेटा को प्रोसेस करने में व्यस्त होता है, तब तक रोबोट #2 पुराने निर्देशों का उपयोग करके 50 कदम आगे बढ़ चुका होता है। रोबोट #3 ऐसे निर्देशों का उपयोग कर रहा है जो 100 कदम पुराने हैं।
  • परिणाम: मस्तिष्क "पुराने रोबोट", "मध्यम रोबोट" और "नए रोबोट" के मिले-जुले डेटा से सीखने की कोशिश कर रहा है, लेकिन वह "सुपर न्यू रोबोट" को अपडेट करने की कोशिश कर रहा है।

पेपर इस बेमेल स्थिति को पॉलिसी लैग (Policy Lag) कहता है। यह एक ऐसे शहर में नेविगेट करने जैसा है जहाँ आप कुछ दिन पुराने नक्शे का उपयोग कर रहे हैं जबकि ट्रैफिक लाइटें पहले ही बदल चुकी हैं। यदि आप इस अस्त-व्यस्त डेटा से बहुत तेज़ी से सीखने की कोशिश करते हैं, तो रोबोट भ्रमित हो सकता है, गोल-गोल घूमना शुरू कर सकता है, या यहाँ तक कि गिर भी सकता है।

लैग के दो प्रकार

लेखक इस समस्या को दो विशिष्ट सिरदर्द में विभाजित करते हैं:

  1. बैकवर्ड लैग (The "Wrong Starting Line" - गलत शुरुआती रेखा):

    • उपमा: कल्पना कीजिए कि एक रिले रेस चल रही है। धावक दौड़ना शुरू करता है, लेकिन कोच अभी भी कल के अभ्यास के निर्देश चिल्ला रहा है। धावक पहले से ही गति पकड़ चुका है, लेकिन निर्देश वर्तमान गति से मेल नहीं खाते।
    • समस्या: डेटा एक "बिहेवियर पॉलिसी" (पुराने रोबोट) द्वारा एकत्र किया गया था, लेकिन "लर्निंग पॉलिसी" (नया मस्तिष्क) शुरुआत से ही अलग है।
  2. फॉरवर्ड लैग (The "Moving Target" - बदलता लक्ष्य):

    • उपमा: कल्पना कीजिए कि आप एक छात्र को पढ़ा रहे हैं। आप उन्हें गणित का एक सवाल देते हैं। जब वे उसे हल कर रहे होते हैं, तो आप अपने दिमाग में गणित के नियम बदलते रहते हैं। जब तक वे सवाल पूरा करते हैं, नियम इतने बदल चुके होते हैं कि उनका उत्तर गलत हो जाता है, भले ही उन्होंने गणित बिल्कुल सही किया हो।
    • समस्या: जैसे-जैसे कंप्यूटर उसी डेटा के बैच का उपयोग करके पॉलिसी को कई बार अपडेट करता है, पॉलिसी उस डेटा से और दूर होती जाती है जिस पर वह मूल रूप से प्रशिक्षित की गई थी।

समाधान: VACO (Align and Filter)

लेखक एक नई विधि प्रस्तावित करते हैं जिसे VACO (Variation-based Advantage aligned Constrained policy Optimization) कहा जाता है। इसे एक स्मार्ट कोच के रूप में समझें जो लैग को ठीक करने के लिए दो तरकीबों का उपयोग करता है: रीअलाइनमेंट (Realignment) और फिल्टरिंग (Filtering)

तरकीब 1: एडवांटेज रीअलाइनमेंट (The "Translator" - अनुवादक)

  • समस्या: डेटा "पुराने रोबोट" के दृष्टिकोण से लेबल किया गया है। यदि "नया रोबोट" सीधे इससे सीखने की कोशिश करता है, तो वह भ्रमित हो जाता है क्योंकि संदर्भ (context) गलत है।
  • समाधान: नया रोबोट सीखने से पहले, सिस्टम एक अनुवादक (translator) की तरह काम करता है। यह पुराने डेटा को लेता है और इसे गणितीय रूप से "री-अलाइन" करता है ताकि यह वर्तमान लर्निंग पॉलिसी के विचारों से मेल खा सके।
  • उपमा: कल्पना कीजिए कि आप इंटरनेट के बारे में 1990 के एक पत्र को पढ़ रहे हैं। आज समझने के लिए, आप इसे केवल पढ़ते नहीं हैं; आप स्लैंग (slang) को अनुवादित करते हैं और संदर्भों को 2024 के मानकों के अनुसार अपडेट करते हैं ताकि जानकारी अब समझ में आ सके। VACO इस अनुवाद को तुरंत करता है, ताकि सीखने की प्रक्रिया सही शुरुआत कर सके।

तरकीक 2: TV-आधारित फ़िल्टरिंग (The "Bouncer" - बाउंसर)

  • समस्या: कभी-कभी, डेटा इतना पुराना या इतना अलग होता है कि उससे सीखना खतरनाक होता है। यह कच्ची सड़क पर गाड़ी चलाने का वीडियो देखकर हाईवे पर गाड़ी चलाना सीखने जैसा है।
  • समाधान: सिस्टम पुराने डेटा और नई पॉलिसी के बीच की "दूरी" (Total Variation) को मापता है।
    • यदि डेटा पर्याप्त करीब है, तो यह रोबोट को इससे सीखने देता है।
    • यदि डेटा बहुत दूर है (बहुत अधिक लैग है), तो सिस्टम एक बाउंसर (Bouncer) की तरह कार्य करता है और उस विशिष्ट डेटा को ट्रेनिंग बैच से बाहर निकाल देता है।
  • उपमा: कल्पना कीजिए कि एक डीजे (DJ) गाना बजा रहा है। यदि गाना माहौल (vibe) के अनुकूल है, तो वे इसे बजाते हैं। यदि गाना बहुत अजीब है और डांस फ्लोर को खराब कर सकता है, तो वे उसे तुरंत काट देते हैं। VACO उन "बुरे वाइब्स" (डेटा पॉइंट्स जो रोबोट को भ्रमित कर सकते हैं) को काट देता है ताकि रोबोट केवल सुरक्षित और विश्वसनीय उदाहरणों से सीख सके।

यह क्यों महत्वपूर्ण है

पेपर ने इसे दो बहुत अलग चीजों पर टेस्ट किया:

  1. रोबोट्स: चलने और दौड़ने के लिए सीखते हुए सिम्युलेटेड रोबोट।
  2. AI मैथ ब्रेन्स: गणित की समस्याओं को हल करने के लिए सीखते हुए लार्ज लैंग्वेज मॉडल्स (LLMs)।

परिणाम:
दोनों मामलों में, मानक तरीके (जैसे PPO) विफल होने लगे या अस्थिर हो गए जब "लैग" अधिक हो गया (अर्थात, जब रोबोट बहुत अधिक सिंक से बाहर हो गए)। हालाँकि, VACO स्थिर रहा। इसने तेजी से सीखा और डेटा अस्त-व्यस्त और एसिंक्रोनस (asynchronous) होने के बावजूद क्रैश नहीं हुआ।

सारांश

  • समस्या: तेज़, डिस्ट्रिब्यूटेड AI ट्रेनिंग में, डेटा अक्सर "पुराना" (stale) होता है, जिससे AI गलत चीजें सीख जाता है।
  • समाधान: VACO इसे नए मस्तिष्क के अनुरूप डेटा को अनुवादित (Realignment) करके और बहुत अलग डेटा को बाहर निकालकर (Filtering) ठीक करता है।
  • परिणाम: AI अपने इतिहास से भ्रमित हुए बिना तेजी से और समानांतर (in parallel) प्रशिक्षण ले सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →