Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Tasks
यह शोध पत्र COSPLAY को प्रस्तुत करता है, जो एक सह-विकासवादी (co-evolutionary) ढांचा है जहाँ एक LLM निर्णय एजेंट और एक कौशल प्रबंधन एजेंट मिलकर बिना लेबल वाले रोलआउट्स से संरचित कौशलों की खोज, परिशोधन और पुनर्प्राप्ति करते हैं, जो फ्रंटियर LLM बेसलाइन की तुलना में गेम वातावरण में दीर्घकालिक (long-horizon) प्रदर्शन में महत्वपूर्ण सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े भुलक्कड़ रोबोट को डिप्लोमेसी (Diplomacy) या सुपर मारियो (Super Mario) जैसा कोई जटिल वीडियो गेम खेलना सिखाने की कोशिश कर रहे हैं।
उस रोबोट के पास एक विशाल मस्तिष्क (एक लार्ज लैंग्वेज मॉडल, या LLM) है जो दुनिया के बारे में बहुत कुछ जानता है। हालाँकि, जब वह किसी लंबे, जटिल खेल का सामना करता है, तो वह अक्सर भटक जाता है। वह भूल जाता है कि उसने पाँच मिनट पहले क्या किया था, उसे नहीं पता होता कि कब रणनीति बदलनी है, और वह बार-बार एक ही गलती करता रहता है। यह एक ऐसे शेफ की तरह है जो सब्जियां काटना तो जानता है, लेकिन रेसिपी भूल जाने के कारण हथौड़े से केक बनाने की कोशिश करता रहता है।
यह पेपर COS-PLAY नामक एक नई प्रणाली पेश करता है जो इसे ठीक करती है। COS-PLAY को एक अकेले रोबोट के रूप में नहीं, बल्कि एक रसोई में मिलकर काम करने वाले दो सहकर्मियों की एक टीम के रूप में समझें।
दो सहकर्मी
- शेफ (निर्णय लेने वाला एजेंट - The Decision Agent): यह वह रोबोट है जो गेम खेल रहा है। इसका काम स्क्रीन को देखना, यह तय करना कि आगे क्या करना है, और बटन दबाना है।
- सू-शेफ (कौशल बैंक एजेंट - The Sous-Chef): यह दूसरा रोबोट है जिसका एकमात्र काम शेफ को देखना, नोट्स लेना और एक "रेसिपी बुक" व्यवस्थित करना है।
वे एक साथ कैसे काम करते हैं (सह-विकास - The Co-Evolution)
पुराने दिनों में, आप बस शेफ को कह देते, "यह रही रेसिपी, अब खाना बनाओ!" यदि शेफ विफल हो जाता, तो आपको पूरी रेसिपी फिर से शुरू से लिखनी पड़ती।
COS-PLAY के साथ, यह सीखने की एक निरंतर प्रक्रिया है:
चरण 1: शेफ खाना बनाने की कोशिश करता है
शेफ गेम का एक राउंड खेलता है। कभी-कभी वह बहुत अच्छा करता है; कभी-कभी वह टोस्ट जला देता है। उसे यह नहीं पता होता कि वह क्यों विफल हुआ, उसे बस अपने स्कोर का पता होता है।
चरण 2: सू-शेफ देखता है और लिखता है
जब शेफ खेल रहा होता है, तो सू-शेफ बारीकी से देख रहा होता है। वह एक पैटर्न देखता है: "ओह, हर बार जब शेफ सेना को सीमा पर ले जाता है, तो उसे दुश्मन की जासूसी करने में आमतौर पर 3 टर्न लगते हैं, फिर हमला करने के लिए 2 टर्न सेट करने में लगते हैं।"
सू-शेफ इस बिखरी हुई क्रियाओं की श्रृंखला को एक साफ, पुन: प्रयोज्य "स्किल कार्ड" (Skill Card) (जैसे कि रेसिपी कार्ड) में बदल देता है।
- स्किल कार्ड कहता है: "जब आप दुश्मन को सीमा पर देखें, तो उनकी जासूसी करने के लिए इन 5 चरणों का क्रमवार पालन करें। तब तक रुकें जब तक कि आपको लाल झंडा न दिख जाए।"
चरण 3: शेफ को एक नया टूल मिलता है
सू-शेफ इस नए स्किल कार्ड को "रेसिपी बुक" (Skill Bank) में डाल देता है।
अब, जब शेफ अगला गेम शुरू करता है, तो उसे सब कुछ शून्य से समझने की आवश्यकता नहीं होती। वह रेसिपी बुक खोल सकता है, "स्कॉट द बॉर्डर" (सीमा की जासूसी) कार्ड ढूंढ सकता है और निर्देशों का पालन कर सकता है।
चरण 4: चक्र जारी रहता है
- यदि शेफ कार्ड का उपयोग करता है और जीत जाता है, तो सू-शेफ कहता है, "बहुत बढ़िया! यह कार्ड काम करता है।"
- यदि शेफ कार्ड का उपयोग करता है और हार जाता है, तो सू-शेफ कहता है, "हम्म, यह कार्ड यहाँ काम नहीं आया। चलिए रेसिपी में थोड़ा बदलाव करते हैं।"
- सू-शेफ यह भी देख सकता है कि शेफ अपने आप में कुछ शानदार कर रहा है और वह किताब में एक नया कार्ड जोड़ सकता है।
समय के साथ, शेफ स्मार्ट होता जाता है क्योंकि उसके पास ट्रिक्स की एक बेहतर लाइब्रेरी होती है, और रेसिपी बुक बेहतर होती जाती है क्योंकि इसे लगातार अपडेट किया जाता है कि वास्तव में क्या काम करता है। वे "सह-विकसित" (Co-evolve) होते हैं—वे एक साथ बढ़ते हैं।
यह एक बड़ी बात क्यों है
"सिर्फ एक दिमाग" के साथ समस्या:
बड़े AI मॉडल कम ध्यान अवधि वाले जीनियस की तरह होते हैं। वे एक कविता लिख सकते हैं, लेकिन यदि आप उन्हें 50-चरणीय रणनीति वाला गेम खेलने के लिए कहें, तो वे बीच में ही भ्रमित हो जाते हैं। वे अपनी योजना भूल जाते हैं।
समाधान:
COS-PLAY उन्हें "चंक्स" (Chunks) की याददाश्त देता है। हर एक बटन प्रेस को याद रखने के बजाय, वे व्यवहार के "चंक्स" (कौशल/Skills) को याद रखते हैं।
- उपमा: कल्पना कीजिए कि आप एक उपन्यास लिखने की कोशिश कर रहे हैं। यदि आप हर उस अक्षर को याद रखने की कोशिश करते हैं जो आप टाइप करते हैं, तो आप पागल हो जाएंगे। लेकिन यदि आप याद रखते हैं "नायक की यात्रा के बारे में एक अध्याय लिखें," और फिर "विलेन की योजना के बारे में एक अध्याय लिखें," तो यह बहुत आसान हो जाता है। COS-PLAY AI को अक्षरों के बजाय अध्यायों में सोचने के लिए प्रशिक्षित करता है।
परिणाम: इस प्रणाली का "जादू"
शोधकर्ताओं ने छह अलग-अलग खेलों पर इसका परीक्षण किया, जिसमें 2048 जैसे सरल पहेली से लेकर डिप्लोमेसी (Diplomacy) जैसे जटिल सामाजिक रणनीति वाले खेल (जहाँ आपको अन्य खिलाड़ियों के साथ बातचीत करनी होती है) शामिल हैं।
- परिणाम: भले ही उन्होंने एक अपेक्षाकृत छोटा AI मॉडल (एक "8B" मॉडल, जो एक मानक लैपटॉप कंप्यूटर की तरह है) का उपयोग किया था, यह इन खेलों पर दुनिया के सबसे बड़े, सबसे महंगे AI मॉडल (जैसे GPT-5 या Gemini) से बेहतर प्रदर्शन करता है।
- क्यों? क्योंकि बड़े मॉडल हर कदम के लिए "सोचने" की कोशिश कर रहे थे, जबकि COS-PLAY वाले छोटे मॉडल के पास निकालने के लिए सिद्ध रणनीतियों की एक लाइब्रेरी थी। यह एक जूनियर कर्मचारी की तरह था जिसके पास एक परफेक्ट हैंडबुक थी और वह उस जीनियस को हरा रहा था जिसे सब कुछ मौके पर ही खुद समझना पड़ रहा था।
"फेलियर मोड" (एक मजेदार मोड़)
पेपर ने यह भी देखा कि यह सिस्टम कैसे विफल होता है।
- पुराना AI: जब यह विफल होता है, तो यह अक्सर ध्वस्त (Collapse) हो जाता है। यह भ्रमित हो जाता है, घबरा जाता है और जो कुछ भी इसने बनाया था वह सब खो देता है।
- COS-PLAY: जब यह विफल होता है, तो यह आमतौर पर स्थिर (Stagnate) हो जाता है। यह एक ही चीज़ को बार-बार करने में फंस जाता है (जैसे पहिये पर दौड़ता हुआ हैम्स्टर), लेकिन यह शायद ही कभी सब कुछ खो देता है। इसके पास कौशल में एक "सुरक्षा जाल" होता है जो पूर्ण आपदा को रोकता है।
संक्षेप में
COS-PLAY एक ऐसी प्रणाली है जहाँ एक AI खेलते समय खुद को ट्रिक्स की एक लाइब्रेरी सिखाकर गेम खेलना सीखता है।
- खिलाड़ी (Player) जीतने के लिए उन ट्रिक्स का उपयोग करता है।
- लाइब्रेरियन (Librarian) खिलाड़ी को देखता है, काम करने वाले ट्रिक्स को लिखता है, और जो काम नहीं करते उन्हें हटा देता है।
- मिलकर, वे बेहतर होते जाते हैं, एक भ्रमित रोबोट को एक मास्टर रणनीतिकार में बदल देते हैं।
यह एक छात्र द्वारा एक रात में पूरी किताब याद करने की कोशिश करने और एक छात्र द्वारा फ्लैशकार्ड का एक सेट बनाने, उनकी समीक्षा करने और हर दिन अपने अध्ययन गाइड को बेहतर बनाने के बीच का अंतर है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।