← नवीनतम पेपर
🤖 AI

LaGO: Latent Action Guidance for Online Reinforcement Learning

यह शोध पत्र LaGO का प्रस्ताव करता है, जो एक ऐसा फ्रेमवर्क है जो प्रीट्रेंड लार्ज लैंग्वेज मॉडल्स को लेटेंट एक्शन प्रायर्स (latent action priors) के रूप में उपयोग करके ऑनलाइन रिइन्फोर्समेंट लर्निंग को सॉफ्टली गाइड करता है, जो मानक PPO की तुलना में डिस्क्रीट और कंटीन्यूअस कंट्रोल बेंचमार्क्स दोनों पर सफलता दर और रिवार्ड्स में महत्वपूर्ण सुधार प्रदर्शित करता है।

मूल लेखक: Kuan-Yen Liu, Ren-Jyun Huang, Ti-Rong Wu

प्रकाशित 2026-06-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kuan-Yen Liu, Ren-Jyun Huang, Ti-Rong Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल भूलभुलैया (maze) में रास्ता खोजना या किसी विशिष्ट वस्तु को उठाना सिखाने की कोशिश कर रहे हैं। आपके पास दो मुख्य उपकरण हैं: एक प्रतिभावान लेकिन अनाड़ी विशेषज्ञ (एक लार्ज लैंग्वेज मॉडल, या LLM) और एक ज़िद्दी लेकिन तेज़ सीखने वाला (एक रीइन्फोर्समेंट लर्निंग एजेंट)।

लंबे समय तक, शोधकर्ताओं ने "अनाड़ी विशेषज्ञ" को सीधे रोबोट चलाने के लिए इस्तेमाल करने की कोशिश की। उन्होंने विशेषज्ञ से पूछा कि कौन सा बटन दबाना है या किस दिशा में मुड़ना है। समस्या यह थी कि विशेषज्ञ बातें करने और योजना बनाने में तो बहुत अच्छा है, लेकिन सटीक, पलक झपकते ही दिए जाने वाले निर्देशों में बहुत खराब है। यदि विशेषज्ञ एक छोटी सी गलती भी करता है, तो रोबोट टकरा जाता है और पूरा मिशन विफल हो जाता है।

LaGO (Latent Action Guidance) एक नया फ्रेमवर्क है जो इस तालमेल को बदल देता है। विशेषज्ञ को कार चलाने देने के बजाय, LaGO विशेषज्ञ को यात्री की सीट पर बैठने और ड्राइवर को दिशा निर्देश फुसफुसाने की अनुमति देता है।

यह कैसे काम करता है, इसे सरल चरणों में यहाँ दिया गया है:

1. सेटअप: दो चरण

पेपर एक प्रभावी ढंग से रोबोट को सिखाने के लिए दो-चरणीय प्रक्रिया का वर्णन करता है।

  • चरण 1: "अध्ययन सत्र" (ऑफलाइन)
    सबसे पहले, सिस्टम एक "अनाड़ी विशेषज्ञ" (एक प्री-ट्रेंड AI जैसे Llama) लेता है और उसे मनुष्यों द्वारा सफलतापूर्वक कार्य करने के कई वीडियो (एक्सपर्ट डेमोंस्ट्रेशन) दिखाता है। यह विशेषज्ञ से अभी चलाने के लिए नहीं कहता। इसके बजाय, यह विशेषज्ञ को पैटर्न पहचानने के लिए प्रशिक्षित करता है। यह एक शतरंज ग्रैंडमास्टर को हज़ारों खेल दिखाने जैसा है और उनसे तुरंत एक आदर्श खेल खेलने के बजाय यह समझने के लिए कहने जैसा है कि एक अच्छे मूव का "वाइब" (vibe) क्या होता है। विशेषज्ञ एक "अंतर्ज्ञान" या लेटेंट प्रायर (latent prior) सीखता है कि कौन से एक्शन आमतौर पर काम करते हैं।

  • चरण 2: "ड्राइविंग लेसन" (ऑनलाइन)
    अब, वास्तविक सीखना शुरू होता है। एक अलग, तेज़ सीखने वाला रोबोट (RL पॉलिसी) वास्तविक दुनिया के साथ बातचीत करना शुरू करता है। वह चीज़ें आज़माता है, असफल होता है, रिवॉर्ड प्राप्त करता है और सीखता है।

    • ट्विस्ट: जैसे-जैसे रोबट सीख रहा होता है, "अनाड़ी विशेषज्ञ" अभी भी वहीं बैठा रहता है। लेकिन आदेश चिल्लाने के बजाय, वह ड्राइवर को धीरे से संकेत देता है। वह कहता है, "हे, मैंने जो देखा है उसके आधार पर, तुम शायद इस दिशा में जाना चाहोगे।"
    • रोबोट इस संकेत को सुनता है लेकिन उसे मानने के लिए मजबूर नहीं किया जाता। यदि रोबोट एक नया मूव आज़माता है और उसे बड़ा रिवॉर्ड मिलता है, तो वह संकेत को अनदेखा कर देता है और अपने रास्ते पर चलता रहता है। यदि रोबोट भटक जाता है, तो संकेत उसे बेहतर रास्ता खोजने में मदद करता है।

2. उपमा: GPS बनाम को-पायलट

पुराने तरीके को (LLMs को सीधे कंट्रोलर के रूप में उपयोग करना) एक कार चलाने के लिए एक ऐसे GPS के रूप में सोचें जो आपको सटीक, कठोर निर्देश देता है जैसे "3.42 इंच में बाएं मुड़ें।" यदि GPS थोड़ा भी गलत है, तो आप पेड़ से टकरा जाएंगे।

LaGO एक जानकार को-पायलट रखने जैसा है। को-पायलट स्टीयरिंग व्हील नहीं छीनता। इसके बजाय, वे कहते हैं, "मुझे लगता है कि वहां एक शॉर्टकट है," या "वह रास्ता खतरनाक लग रहा है।"

  • यदि को-पायलट सही है, तो आप शॉर्टकट लेते हैं और वहां तेज़ी से पहुँच जाते हैं।
  • यदि को-पायलट गलत है, तो आप उन्हें अनदेखा करते हैं और अपने तरीके से गाड़ी चलाते रहते हैं।
  • परिणाम? आपको उनके अनुभव का लाभ मिलता है बिना नियंत्रण लेकर कार क्रैश करने के जोखिम के।

3. परिणाम: क्या यह काम करता है?

शोधकर्ताओं ने इसे दो अलग-अलग "भूलभुलैया" पर परखा:

  • CLEVR-Robot: एक गेम जहाँ एक रोबोट ग्रिड पर गेंदों को इधर-उधर घुमाता है (डिस्क्रीट स्टेप्स)।
  • Meta-World: एक जटिल सिमुलेशन जहाँ एक रोबोटिक हाथ को दरवाजे खोलने, बटन दबाने और वस्तुएं उठाने जैसे कार्य करने होते हैं (कंटीन्यूअस, स्मूथ मूवमेंट)।

परिणाम:
दोनों मामलों में, LaGO का उपयोग करने वाले रोबोटों ने अकेले सीखने वाले रोबोटों की तुलना में बहुत बेहतर सीखा।

  • बॉल-मूविंग गेम में, सफलता दर 15% से बढ़कर 27% हो गई।
  • जटिल रोबोटिक आर्म गेम में, सफलता दर आसमान छूकर 2.7% से 15.2% हो गई।

यह एक बड़ी बात है क्योंकि "अनाड़ी विशेषज्ञ" परफेक्ट नहीं था। वास्तव में, यदि आप विशेषज्ञ को सीधे रोबोट चलाने देते, तो वह बुरी तरह विफल हो जाता। लेकिन उसे एक सॉफ्ट गाइड के रूप में उपयोग करके, रोबोट ने अधिक बार सफल होने के लिए सीखना सीखा।

4. गुप्त सामग्री: एक स्मार्ट विशेषज्ञ

पेपर ने यह भी पाया कि "अनाड़ी विशेषज्ञ" की गुणवत्ता मायने रखती है।

  • जब उन्होंने गाइड के रूप में एक छोटे, कमजोर AI का उपयोग किया, तो रोबोट उतना अच्छा नहीं सीख पाया।
  • जब उन्होंने एक बड़े, स्मार्ट AI (Llama 2 7B बनाम TinyLlama) का उपयोग किया, तो मार्गदर्शन बहुत बेहतर था, और रोबोट ने और भी तेज़ी से सीखा।

यह सुझाव देता है कि भविष्य में जैसे-जैसे AI मॉडल स्मार्ट होंगे, वे रोबोटों के लिए बेहतर "को-पायलट" बन जाएंगे, भले ही वे खुद परफेक्ट ड्राइवर न हों।

सारांश

LaGO बड़े AI मॉडल्स के विशाल ज्ञान का उपयोग रोबोट को सीखने में मदद करने के लिए करने का एक चतुर तरीका है, बिना उन मॉडल्स को रोबोट को नियंत्रित करने का सटीक और कठिन काम सौंपे। यह एक "सब कुछ जानने वाले लेकिन अनाड़ी" AI को एक सहायक मार्गदर्शक में बदल देता है जो सीखने की गति बढ़ाता है और रोबोट को अधिक बार सफल होने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →