Towards Scalable Multi-Task Reinforcement Learning with Large Decision Models
यह शोध पत्र LDM-v0 को प्रस्तुत करता है, जो हज़ारों वातावरणों से विविध प्रक्षेप पथों (trajectories) पर ऑफलाइन प्रशिक्षित एक बड़े पैमाने का, मल्टी-टास्क ट्रांसफार्मर पॉलिसी है, जो यह प्रदर्शित करता है कि एक एकल एकीकृत मॉडल रोबोटिक्स से लेकर साइबर सुरक्षा तक के डोमेन में विशिष्ट पॉलिसियों के प्रदर्शन के बराबर हो सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को सब कुछ करना सिखाने की कोशिश कर रहे हैं: वीडियो गेम खेलना, कार चलाना, गोदाम का प्रबंधन करना और यहाँ तक कि एक रोबोटिक हाथ को नियंत्रित करना। पारंपरिक रूप से, आपको प्रत्येक काम के लिए एक अलग विशेषज्ञ कोच को काम पर रखना होगा। वीडियो गेम कोच को ड्राइविंग के बारे में कुछ नहीं पता होगा, और गोदाम प्रबंधक को यह नहीं पता होगा कि सुपर मारियो कैसे खेला जाता है। यह धीमा, महंगा है और हर एक कार्य के लिए बहुत अधिक कस्टम ट्यूनिंग की आवश्यकता होती है।
यह पेपर LDM-v0 को पेश करता है, जो एक नया दृष्टिकोण है जो यह हल करने की कोशिश करता है कि एक ही "सुपर-कोच" को ये सभी अलग-अलग काम एक साथ सीखने के लिए कैसे प्रशिक्षित किया जाए।
यहाँ बताया गया है कि उन्होंने इसे कैसे किया, सरल उपमाओं का उपयोग करते हुए:
1. समस्या: बहुत सी अलग "भाषाएँ"
रिनफोर्समेंट लर्निंग (RL) एक छात्र को चीजें करने देकर और अच्छा करने पर उन्हें स्कोर (रिवॉर्ड) देकर सिखाने जैसा है। समस्या यह है कि हर वातावरण (जैसे कि एक वीडियो गेम या रोबोट सिम्युलेटर) एक अलग "भाषा" बोलता है।
- एक वातावरण रोबोट के हाथ का वर्णन करने के लिए संख्याओं का उपयोग कर सकता है।
- दूसरा चित्रों का उपयोग कर सकता है।
- तीसरा टेक्स्ट का उपयोग कर सकता है।
- "एक अच्छा कदम" क्या माना जाएगा, इसके नियम प्रत्येक में पूरी तरह से अलग होते हैं।
एक ही मॉडल को इन सभी पर एक साथ प्रशिक्षित करने की कोशिश करना एक छात्र को फ्रेंच, जापानी और मोर्स कोड तीनों एक साथ बोलने के लिए सिखाने जैसा है, जबकि वह साथ ही करतब (जगलिंग) भी सीख रहा हो।
2. समाधान: "यूनिवर्सल ट्रांसलेटर" (LDM-v0)
शोधकर्ताओं ने LDM-v0 (लार्ज डिसीजन मॉडल) नामक एक विशाल मॉडल बनाया है। इस मॉडल को एक यूनिवर्सल ट्रांसलेटर के रूप में सोचें जो उन सभी अलग-अलग "भाषाओं" को एक एकल, सामान्य प्रारूप में बदल देता है जिसे कंप्यूटर समझ सके।
- इनपुट (Input): मॉडल को कच्चा डेटा (raw data) देने के बजाय, वे सब कुछ "टोकन्स" (वाक्य में शब्दों की तरह) में अनुवादित करते हैं। चाहे वह एक चित्र हो, एक संख्या हो, या किसी रोबोट की स्थिति हो, उसे एक मानकीकृत टोकन में बदल दिया जाता है।
- मस्तिष्क (The Brain): उन्होंने एक विशिष्ट प्रकार के AI आर्किटेक्चर का उपयोग किया (जो "Llama" पर आधारित है, जो चैटबॉट्स के लिए उपयोग किए जाने वाले मॉडलों के समान है), जो लंबी कहानियों को याद रखने में बहुत अच्छा है। इस मामले में, "कहानी" वह इतिहास है जो रोबोट ने देखा, जो उसने किया, और उसे क्या स्कोर मिला।
3. उन्होंने इसे कैसे प्रशिक्षित किया: "शैडोइंग" (Shadowing) विधि
आप मॉडल को बस 1,000 अलग-अलग कमरों में नहीं फेंक सकते और उम्मीद नहीं कर सकते कि वह खुद सब कुछ समझ लेगा। उसे एक शिक्षक की आवश्यकता है। लेकिन चूंकि कोई भी इंसान सभी खेल पूरी तरह से जानता हुआ नहीं है, इसलिए शोधकर्ताओं ने ऑटोमेटेड रेफरेंस-पॉलिसी सुपरविजन नामक एक चतुर ट्रिक का उपयोग किया।
कल्पना कीजिए कि आप शतरंज, सॉकर और पोकर खेलना सीखना चाहते हैं। एक इंसान द्वारा पढ़ाने के बजाय, आप 1,000 अलग-अलग विशेषज्ञ बॉट्स को काम पर रखते हैं।
- विशेषज्ञों को काम पर रखें: उन्होंने विशिष्ट वातावरणों में महारत हासिल करने के लिए हजारों विशेष AI एजेंटों (PPO या DQN जैसे मानक एल्गोरिदम का उपयोग करके) को प्रशिक्षित किया।
- मास्टर्स को रिकॉर्ड करें: उन्होंने उन विशेषज्ञ बॉट्स द्वारा किए गए "परफेक्ट" मूव्स को रिकॉर्ड किया।
- शैडोइंग गेम: फिर उन्होंने इन रिकॉर्डिंग्स को LDM-v0 को फीड किया। मॉडल का काम "सोचना" या "खोजबीन" करना नहीं था; उसका काम केवल विशेषज्ञ बॉट्स की नकल (mimic) करना था। इसने खेल के इतिहास को देखा और भविष्यवाणी की, "विशेषज्ञ आगे क्या करेगा?"
ऐसा करके, LDM-v0 ने प्रत्येक नियम को स्पष्ट रूप से बताए बिना 1,000 अलग-अलग वातावरणों में सर्वश्रेष्ठ रणनीतियों की नकल करना सीखा।
4. परिणाम: क्या यह एक मॉडल सभी पर राज करेगा?
टीम ने लगभग 1,000 अलग-अलग वातावरणों पर इस एकल मॉडल का परीक्षण किया, जिसमें शामिल थे:
- रोबोटिक्स: रोबोटिक हाथों और ड्रोन को नियंत्रित करना।
- ड्राइविंग: हाईवे पर कारों का सिम्युलेशन।
- बिजनेस: इन्वेंट्री और स्टॉक ट्रेडिंग का प्रबंधन करना।
- गेमिंग: क्लासिक आर्केड गेम्स और सुपर मारियो खेलना।
बड़ी जीत:
एक ही LDM-v0 मॉडल ने लगभग 1,000 वातावरणों में उन विशिष्ट "विशेषज्ञ" बॉट्स के समान प्रदर्शन किया। दूसरे शब्दों में, एक सामान्य मॉडल (generalist model) 1,000 अलग-अलग विशेषज्ञों का काम कर सका।
उन्होंने यह भी पाया कि मॉडल को बड़ा बनाने से (उसे अधिक "ब्रेन पावर" देने से) वह आम तौर पर बेहतर होता गया, जब तक कि एक सीमा तक न पहुँच जाए।
5. इसका क्या अर्थ है (और क्या नहीं है)
- यह क्या सिद्ध करता है: यह संभव है कि एक विशाल AI मॉडल को कार्यों के एक बड़े मिश्रण पर प्रशिक्षित किया जाए और वह उन सभी पर अच्छा प्रदर्शन करे। यह सुझाव देता है कि इन विभिन्न कार्यों के बीच छिपे हुए पैटर्न साझा होते हैं जिन्हें मॉडल सीख सकता है।
- यह क्या दावा नहीं करता: पेपर यह नहीं कहता कि यह मॉडल कल आपकी कार चलाने के लिए तैयार है या आपके वास्तविक स्टॉक पोर्टफोलियो का प्रबंधन करने के लिए तैयार है। परीक्षण सिमुलेशन (वीडियो गेम और डिजिटल ट्विन्स) में किए गए थे।
- सीमा (Limitation): यह मॉडल उन कार्यों में बहुत अच्छा है जिन्हें इसने पहले देखा है (या जो बहुत समान हैं)। लेखक स्वीकार करते हैं कि उन्होंने अभी तक पूरी तरह से यह परीक्षण नहीं किया है कि क्या यह किसी बिल्कुल नए प्रकार के कार्य को संभाल सकता है जिसे इसने पहले कभी नहीं देखा है। यह नकल करने में माहिर है, न कि आविष्कार करने में।
सारांश उपमा
पिछले AI मॉडलों को विशेषीकृत प्रशिक्षुओं (specialized apprentices) के रूप में सोचें: एक बढ़ई जो केवल कुर्सियाँ बना सकता है, एक प्लंबर जो केवल सिंक ठीक कर सकता है।
LDM-v0 एक सुपर-अपेंटिस की तरह है जिसने बढ़ाई, प्लंबिंग, बिजली और शेफ के हजारों वीडियो देखे हैं। इसने अभी तक खुद घर नहीं बनाया है या भोजन नहीं पकाया है, लेकिन यदि आप इसे एक नई स्थिति दिखाते हैं, तो यह तुरंत याद कर सकता है, "ओह, विशेषज्ञ प्लंबर यह करेगा," और इसे सही ढंग से करेगा।
पेपर दिखाता है कि यह "सुपर-अपेंटिस" दृष्टिकोण आश्चर्यजनक रूप से अच्छी तरह से काम करता है, जो भविष्य के AI सिस्टम के लिए मार्ग प्रशस्त करता है जो एक ही विशाल प्रशिक्षण सत्र से कई कौशल सीख सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।