RIMRULE: Improving Tool-Using Language Agents via MDL-Guided Rule Learning
RIMRULE एक न्यूरो-सिंबोलिक दृष्टिकोण है जो न्यूनतम विवरण लंबाई (Minimum Description Length) उद्देश्य के माध्यम से विफलता ट्रैसेस (failure traces) से संकलित संक्षिप्त, व्याख्या योग्य नियमों को गतिशील रूप से इंजेक्ट करके डोमेन-विशिष्ट सेटिंग्स में लार्ज लैंग्वेज मॉडल्स की टूल-उपयोग विश्वसनीयता को बढ़ाता है, जिससे मॉडल वेट्स को संशोधित किए बिना देखे गए और अनदेखे टूल्स में सटीकता में सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े अनाड़ी रोबोटिक सहायक को औजारों का एक नया सेट उपयोग करना सिखा रहे हैं। शायद वे औजार अजीब हैं, निर्देश गायब हैं, या रोबोट बार-बार गलत बटन दबा रहा है।
अतीत में, यदि रोबोट विफल हो जाता था, तो इसे ठीक करने के दो मुख्य तरीके थे:
- इसे उदाहरण दिखाएं: "मैंने इसे एक बार कैसे किया था, इसे देखो और मेरी नकल करो।" (यह एक छात्र को पाठ्यपुस्तक का उदाहरण दिखाने जैसा है)।
- इसके मस्तिष्क को फिर से वायर करें (Rewire): हम रोबोट को नए तरीके को याद रखने के लिए शुरू से फिर से प्रशिक्षित करेंगे। (यह महंगा है, धीमा है, और आप इस नए "मस्तिष्क" को अन्य रोबोटों के साथ आसानी से साझा नहीं कर सकते)।
यह पेपर एक तीसरा, अधिक स्मार्ट तरीका पेश करता है जिसे RIMRULE कहा जाता है। इसे एक रोबोट को अपनी गलतियों के आधार पर अपना खुद का चीट शीट (cheat sheet) लिखने के लिए सिखाने के रूप में सोचें।
यह कैसे काम करता है, यहाँ सरल चरणों में दिया गया है:
1. "ओह!" वाला क्षण (विफलता से सीखना)
सबसे पहले, रोबोट एक कार्य करने की कोशिश करता है और विफल हो जाता है। शायद उसने किसी टूल को गलत तरीके से कॉल करने की कोशिश की। केवल "फिर से प्रयास करें" कहने के बजाय, सिस्टम देखता है कि वह क्यों विफल हुआ।
- उपमा: कल्पना कीजिए कि आप केक बनाने की कोशिश कर रहे हैं, लेकिन क्योंकि आप ओवन को प्रीहीट करना भूल गए, इसलिए केक जल गया। केवल दूसरा केक बनाने और उम्मीद करने के बजाय कि सब ठीक हो जाएगा, आप एक नोट लिखते हैं: "यदि रेसिपी में 'बेक' लिखा है, तो पहले ओवन का तापमान जांच लें।"
2. चीट शीट लिखना (नियम निर्माण)
रोबोट (एक लार्ज लैंग्वेज मॉडल का उपयोग करके) अपनी गलती को देखता है और उसे ठीक करने के लिए एक सरल नियम लिखता है।
- ट्विस्ट: रोबोट केवल एक लंबा, बिखरा हुआ पैराग्राफ नहीं लिखता। वह एक छोटा, स्पष्ट "If-Then" (यदि-तो) नियम लिखता है।
- उदाहरण: "यदि उपयोगकर्ता फैमिली ट्री (वंशवृक्ष) के बारे में पूछता है, तो पूरे सवाल को एक साथ पूछने के बजाय, प्रश्न को छोटे चरणों में तोड़ें (पहले माँ को खोजें, फिर दादा को खोजें)।"
3. "संपादक" (MDL कंसोलिडेशन)
शुरुआत में, रोबोट 100 नियम लिख सकता है, जो बहुत दोहराव वाले या बहुत विशिष्ट हो सकते हैं (जैसे, "यदि उपयोगकर्ता जॉन की माँ के बारे में पूछता है..." और "यदि उपयोगकर्ता सारा की माँ के बारे में पूछता है...")।
सिस्टम मिनिमम डिस्क्रिप्शन लेंथ (MDL) नामक एक सिद्धांत का उपयोग करता है। इसे एक सख्त संपादक के रूप में समझें जो कहता है, "100 नियम लिखना बंद करो। उन्हें एक शक्तिशाली नियम में मिला दो जो सभी मामलों को कवर करे।"
- लक्षक: चीट शीट को जितना संभव हो उतना छोटा और सरल रखें ताकि वह सबसे अधिक समस्याओं को हल कर सके। यह नियमों को पढ़ने और याद रखने में आसान बनाता है।
4. "पॉकेट गाइड" (रिट्रीवल)
जब रोबोट के सामने कोई नया कार्य आता है, तो वह अपने पूरे 100 पन्नों के इतिहास की किताब को नहीं पढ़ता। इसके बजाय, वह जल्दी से देखता है कि वर्तमान स्थिति पर कौन सा विशिष्ट नियम लागू होता है और उसे अपनी "जेब" (प्रॉम्ट) में रख लेता है।
- उपमा: यह एक मैकेनिक की तरह है जो कार को ठीक करने से पहले, पूरी कार मैनुअल पढ़ने के बजाय, "ब्रेक की आवाज" के बारे में विशिष्ट मैनुअल पेज अपनी जेब में जल्दी से चेक करता है।
यह विशेष क्यों है?
- यह पोर्टेबल है: क्योंकि नियम साधारण अंग्रेजी (और एक सरल कोड फॉर्मेट) में लिखे गए हैं, आप एक "कम बुद्धिमान" रोबोट द्वारा लिखी गई चीट शीट ले सकते हैं और उसे एक "सुपर-स्मार्ट" रोबोट को दे सकते हैं। स्मार्ट रोबोट को फिर से प्रशिक्षित करने की आवश्यकता नहीं है; वह बस नई चीट शीट पढ़ता है और तुरंत बेहतर हो जाता है।
- यह एक "चीट शीट" है, "ब्रेन सर्जरी" नहीं: अन्य तरीकों के विपरीत जिनमें मॉडल को फिर से प्रशिक्षित करने (जो ब्रेन सर्जरी जैसा है) की आवश्यकता होती है, यह केवल निर्देशों में एक नोट जोड़ देता है। यह तेज़ है और रोबोट के मूल व्यक्तित्व को नहीं बदलता है।
- यह नए टूल्स पर काम करता है: भले ही रोबोट ने पहले कभी विशिष्ट टूल नहीं देखा हो, यदि नियम कहता है "हमेशा टूल की आवश्यकताओं की जाँच करें," तो वह सलाह अभी भी मदद करती है।
परिणाम
शोधकर्ताओं ने दो बड़े टूल-यूज़ चुनौतियों पर इसका परीक्षण किया। उन्होंने पाया कि:
- रोबोट को ये चीट शीट देने से वह टूल्स का उपयोग करने में बहुत बेहतर हो गया, यहाँ तक कि उन कार्यों पर भी जिन्हें उसने पहले कभी नहीं देखा था।
- यह केवल उदाहरण दिखाने या टेक्स्ट प्रॉम्ट को अनुकूलित करने की तुलना में बेहतर काम करता है।
- इसने उन रोबोटों की भी मदद की जो पहले से ही "फाइन-ट्यून" (विशेष रूप से उस काम के लिए प्रशिक्षित) किए गए थे, जो बची हुई गलतियों को पकड़ने के लिए एक सुरक्षा जाल के रूप में कार्य करता है।
संक्षेप में: RIMRULE AI को अपनी गलतियों से सीखने के लिए सिखाता है, जिससे वह उदाहरणों को याद करने या अपने पूरे मस्तिष्क को फिर से लिखने के बजाय, अपने स्वयं के सरल, पुन: प्रयोज्य निर्देश लिख सकता है। यह "परीक्षण और त्रुटि" (trial and error) को एक स्थायी, साझा करने योग्य सबक में बदल देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।