Unified Context Evolution for LLM Agents
यह शोधपत्र यूनिफाइड कॉन्टेक्स्ट इवोल्यूशन (UCE) प्रस्तुत करता है, जो एक ग्रेडिएंट-मुक्त फ्रेमवर्क है जो 'इवॉलेबल कॉन्टेक्स्ट यूनिट्स' के एक गतिशील, टाइप किए गए लाइब्रेरी में अनुभव को बाह्य रूप से संचित करके LLM एजेंटों को बेहतर बनाता है, जिन्हें निरंतर प्रदर्शन और विभिन्न बैकबोन के बीच स्थानांतरण में सुधार करने के लिए चयनात्मक रूप से जनरेट, स्कोर और प्रून किया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन भुलक्कड़ रोबोट को पहेलियाँ सुलझाना सिखा रहे हैं। हर बार जब आप उसे एक नई पहेली देते हैं, तो वह बिल्कुल शून्य से शुरुआत करता है, जैसे कि उसने पहले कभी कोई पहेली नहीं देखी हो। भले ही उसने पहेली #1 को हल करने के लिए कोई चतुर तरकीब खोज ली हो, वह ज्ञान पहेली #2 मिलने पर गायब हो जाता है।
शोध पत्र "Unified Context Evolution" इस "भूलने की बीमारी" (amnesia) की समस्या का समाधान प्रस्तावित करता है। यह UCE (Unified Context Evolution) नामक एक प्रणाली पेश करता है जो एक बढ़ते हुए, व्यवस्थित नोटबुक की तरह काम करता है। रोबोट के दिमाग को फिर से प्रशिक्षित (retrain) करने के बजाय (जो महंगा और कठिन है), UCE खेल के हर राउंड के बाद रोबोट के "चीट शीट" (cheat sheet) को अपडेट करता है।
यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:
1. समस्या: "रीसेट बटन" (The "Reset Button")
वर्तमान में, अधिकांश AI एजेंट एक छात्र की तरह काम करते हैं जो परीक्षा दे रहा है। उन्हें एक प्रश्न मिलता है, वे सोचते हैं, और उत्तर देते हैं। जब परीक्षा समाप्त होती है, तो वे सब कुछ भूल जाते हैं। यदि उन्होंने कोई गलती की या कोई शॉर्टकट खोजा, तो वह जानकारी खो जाती है।
- पेपर का दृष्टिकोण: मौजूदा तरीके या तो रोबोट के दिमाग को फिर से प्रशिक्षित करने की कोशिश करते हैं (महंगा है) या उनके अनुभवों को नोट्स के एक अव्यवस्थित ढेर में डाल देते हैं (जो भ्रमित करने वाला है)।
2. समाधान: "चार दराजों वाली फाइलिंग कैबिनेट" (The "Four-Drawer Filing Cabinet")
UCE उस अव्यवस्थित ढेर के स्थान पर Evolvable Context Units (ECUs) की एक संरचित लाइब्रेरी (library) स्थापित करता है। इस लाइब्रेरी को चार विशिष्ट दराजों वाली एक फाइलिंग कैबिनेट के रूप में सोचें, जिनमें से प्रत्येक में ज्ञान का एक अलग प्रकार होता है:
दराज 1: स्मृति (तथ्य) (Memory - The "Facts")
- यह क्या है: दुनिया कैसे काम करती है इसके बारे में ठोस तथ्य।
- उपमा: "क्या आप जानते हैं कि इस रसोई में, आप बिना नल चलाए बस सिंक में कप रखकर उसे साफ कर सकते हैं?"
- इसका उपयोग कब होता है: उन चरणों पर समय बर्बाद करने से बचने के लिए जो आवश्यक नहीं हैं।
दराज 2: रणनीति (यदि-तो नियम) (Strategy - The "If-Then" Rules)
- यह क्या है: चीजें गलत होने पर निर्णय लेने के नियम।
- उपमा: "यदि आप कुछ खरीदने की कोशिश करते हैं और आपको एरर मैसेज मिलता है, तो 'Buy' पर बार-बार क्लिक न करें; पहले मुख्य पेज पर वापस जाएं।"
- इसका उपयोग कब होता है: गलतियों से उबरने या कठिन स्थितियों से निपटने के लिए।
दराज 3: वर्कफ़्लो (नुस्खा/विधि) (Workflow - The "Recipe")
- यह क्या है: किसी विशिष्ट प्रकार के कार्य के लिए मानक चरण-दर-चरण योजना।
- उपमा: "एक मग को गर्म करने के लिए: 1. मग ढूंढें। 2. उसे माइक्रोवेव में रखें। 3. उसे चालू करें। 4. उसे कप होल्डर में रखें।"
- इसका उपयोग कब होता है: रोबोट को एक बुनियादी योजना (skeleton plan) देने के लिए जिसे वह पालन कर सके।
दराज 4: कौशल (सार्वभौमिक उपकरण) (Skill - The "Universal Tools")
- यह क्या है: छोटे, पुन: प्रयोज्य (reusable) कार्य जो विभिन्न प्रकार के कार्यों में काम आते हैं।
- उपमा: "एक बंद बॉक्स को कैसे खोलें" या "एक लिस्ट में कैसे खोजें।"
- इसका उपयोग कब होता है: उन विशिष्ट उप-चरणों (sub-steps) को संभालने के लिए जो कई अलग-अलग परिदृश्यों में दिखाई देते हैं।
3. प्रक्रिया: लाइब्रेरी कैसे "विकसित" (Evolve) होती है
सिस्टम केवल कैबिनेट को भरता नहीं है; यह एक चक्र के माध्यम से इसे बुद्धिमानी से प्रबंधित करता है:
- खेलना और देखना (Play and Watch): रोबोट कार्यों को हल करने की कोशिश करता है। कुछ को वह हल कर लेता है, कुछ में विफल रहता है।
- नोट्स को ग्रेड देना (Grade the Notes): सिस्टम परिणामों को देखता है। यदि किसी "नोट" (ECU) ने रोबोट को सफल होने में मदद की, तो उसे उच्च स्कोर मिलता है। यदि उसने भ्रम पैदा किया, तो उसे कम स्कोर मिलता है।
- लाइब्रेरियन (शेड्यूलिंग) (The Librarian - Scheduling): एक स्मार्ट शेड्यूलर लाइब्रेरी को देखता है और पूछता है, "हमें क्या कमी है?"
- उदाहरण: "हमारे पास सफाई के लिए बेहतरीन रेसिपी (Workflows) हैं, लेकिन हमारे पास इस बात के लिए कोई 'यदि-तो' (If-Then) नियम (Strategies) नहीं हैं कि जब रोबोट फंस जाए तो क्या करें। आइए अगली बार नए Strategies लिखने पर ध्यान केंद्रित करें।"
- लिखना और छांटना (Write and Prune): सिस्टम रोबोट के हालिया अनुभवों के आधार पर नए नोट्स बनाता है। यह पुराने, बेकार नोट्स को भी हटा देता है जो काफी समय से काम नहीं आए हैं।
- इंजेक्ट करना (Inject): अगला कार्य शुरू करने से पहले, रोबोट चारों दराजों से सबसे अच्छे नोट्स पढ़ता है और उन्हें अपने निर्देशों में जोड़ देता है।
4. परिणाम: नए दिमाग के बिना स्मार्ट बनना
शोधकर्ताओं ने दो वातावरणों पर इसका परीक्षण किया:
- ALFWorld (आभासी घर): एक रोबोट जिसे चीजों को साफ करने, गर्म करने या स्थानांतरित करने के लिए कहा जाता है।
- WebShop (ऑनलाइन शॉपिंग): एक रोबोट जिसे विशिष्ट उत्पाद खोजने और खरीदने के लिए कहा जाता है।
परिणाम:
- ALFWorld: सफलता दर 75.4% से बढ़कर 96.3% हो गई। रोबोट ने सीखा कि उसे चीजों को साफ करने के लिए नल चलाने की आवश्यकता नहीं है और उसे वस्तुओं के लिए विशिष्ट दराजों की जांच करने की आवश्यकता है।
- WebShop: स्कोर 45.1% से सुधरकर 61.3% हो गया। रोबोट ने सीखा कि किसी सब-टैब (जैसे "Features") के अंदर "Buy Now" पर क्लिक करने से काम नहीं चलेगा, और उसे पहले मुख्य पेज पर वापस जाना होगा।
5. मुख्य निष्कर्ष
इस पेपर का सबसे महत्वपूर्ण हिस्सा यह है कि रोबोट का दिमाग (AI मॉडल) कभी नहीं बदला। शोधकर्ताओं ने AI को फिर से प्रशिक्षित नहीं किया। इसके बजाय, उन्होंने केवल उस कॉन्टेक्स्ट (context) को बेहतर बनाया (निर्देश और नोट्स) जो रोबोट को दिए जा रहे थे।
यह एक ऐसे छात्र को देने जैसा है जो पहले से ही बुद्धिमान लेकिन भुलक्कड़ है, उसे सुझावों और ट्रिक्स की एक बेहतर, व्यवस्थित नोटबुक देना, और उसे अगला टेस्ट पास करते हुए देखना। छात्र अधिक बुद्धिमान नहीं हुआ; बल्कि उनके संसाधन (resources) बेहतर हो गए।
संक्षेप में: UCE एक भूलक्कड़ AI को एक संचयी शिक्षार्थी (cumulative learner) में बदल देता है, जो अपने पिछले अनुभवों को तथ्यों, नियमों, विधियों और कौशलों की एक स्मार्ट, स्व-अपडेट होने वाली लाइब्रेरी में व्यवस्थित करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।