HiSkill: Empowering LLM Agents with Hierarchical Skill Graphs
यह शोध पत्र HiSkill प्रस्तुत करता है, जो एक पदानुक्रमित कौशल ग्राफ (hierarchical skill graph) ढांचा है जो इंटरेक्शन ट्रेजेक्टरीज को उच्च-स्तरीय कौशलों को निष्पादन योग्य कार्यों से जोड़ने वाले एक संरचित ग्राफ में व्यवस्थित करता है, जिससे LLM एजेंटों के लिए कार्य-प्रासंगिक सबग्राफ को कुशलतापूर्वक पुनर्प्राप्त करना और निर्देशित निष्पादन करना सक्षम होता है जो टोकन की खपत को कम करते हुए मौजूदा विधियों से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को एक विशाल, अस्त-व्यस्त घर में एक विशिष्ट खिलौने को खोजने के लिए नेविगेट करना सिखा रहे हैं। आप नहीं चाहते कि आपको हर बार रोबोट को मोज़ा उठाने या लाइट जलाने के लिए एक नया, लंबा निर्देश मैनुअल देना पड़े। इसके बजाय, आप चाहते हैं कि वह उन "कौशलों" (skills) को याद रखे जो उसने पहले सीखे हैं, जैसे कि "दराज कैसे खोलें" या "कप कैसे उठाएं।" यह लार्ज लैंग्वेज मॉडल (LLM) एजेंटों की दुनिया है—ऐसे AI सिस्टम जो बात कर सकते हैं और सोच सकते हैं, लेकिन उन्हें वास्तविक दुनिया में (या उसके डिजिटल सिमुलेशन में) काम करने के लिए सीखने की आवश्यकता होती है।
लंबे समय तक, वैज्ञानिकों ने इन रोबोटों की मदद करने के लिए उन्हें पिछले अनुभवों की एक सूची दी है, जैसे कि उन्होंने क्या किया है उसका एक डायरी जैसा विवरण। लेकिन एक समस्या है: ये डायरियाँ अक्सर केवल टेक्स्ट की लंबी, सपाट सूचियाँ होती हैं। यह एक ऐसी लाइब्रेरी की तरह है जहाँ हर किताब केवल एक वाक्य है। यदि रोबोट को "सैंडविच बनाने" के बारे में जानना है, तो उसे "सैंडविच बनाओ" वाला वाक्य मिल सकता है, लेकिन उसे चरणों का पता नहीं चलेगा: ब्रेड लें, मक्खन लें, मक्खन फैलाएं, ब्रेड को आपस में जोड़ें। उसे यह भी पता नहीं चलेगा कि यदि उसने ब्रेड गिरा दी तो क्या करना है। रोबोट अटक जाता है क्योंकि उसके पास बड़ा विचार तो है लेकिन सूक्ष्म, ठोस चरणों और गलतियों को सुधारने के लिए बैकअप योजनाओं का अभाव है। यह शोध पत्र पूछता है: हम इन यादों को कैसे व्यवस्थित करें ताकि रोबोट जटिल समस्याओं को हल करने के लिए वास्तव में इनका उपयोग कर सके बिना भ्रमित हुए?
यहाँ आता है HiSkill, एक नया तरीका जो रोबोट के मस्तिष्क के लिए एक मास्टर आर्किटेक्ट की तरह काम करता है। एक सपाट स्मृति सूची के बजाय, HiSkill एक पदानुक्रमित कौशल ग्राफ (hierarchical skill graph) बनाता है। इस ग्राफ को रोबोट के मन के लिए एक विशाल, इंटरैक्टिव सबवे मैप की तरह समझें।
इस मानचित्र पर, दो मुख्य प्रकार के स्टेशन हैं। बड़े, शानदार स्टेशन "स्किल नोड्स" (Skill Nodes) हैं। ये उच्च-स्तरीय लक्ष्य हैं, जैसे कि "रसोई साफ करें" या "लाल गेंद खोजें।" लेकिन एक सबवे मैप पर स्टेशन तब तक उपयोगी नहीं होता जब तक आप यह न जान लें कि वहां पहुँचने के लिए कौन सी ट्रेन लेनी है। वहीं से छोटे स्टेशन आते हैं: "एटॉमिक ऑप नोड्स" (AtomicOp Nodes)। ये सूक्ष्म, ठोस क्रियाएं हैं, जैसे कि "स्पंज पकड़ें," "नल चालू करें," या "काउंटर पोंछें।"
HiSkill का जादू यह है कि यह इन स्टेशनों को कैसे जोड़ता है। यह केवल "रसोई साफ करें" से "स्पंज पकड़ें" तक एक रेखा नहीं खींचता है। यह विभिन्न प्रकार की रेखाएं (एजेस/edges) खींचता है जो रोबro को बताती हैं कि वे हिस्से एक दूसरे में कैसे फिट होते हैं:
- डिकम्पोजिशन लाइन्स (Decomposition lines) दिखाती हैं कि "रसोई साफ करें" किन विशिष्ट छोटी क्रियाओं से मिलकर बना है।
- ट्रांजिशन लाइन्स (Transition lines) दिखाती हैं कि एक बार जब आप "स्पंज पकड़ते हैं," तो आप आमतौर पर "नल चालू कर" सकते हैं।
- रिकवरी लाइन्स (Recovery lines) आपातकालीन निकास की तरह हैं; यदि रोबोट स्पंज गिरा देता है, तो ये रेखाएं "स्पंज उठाएं" क्रिया की ओर इशारा करती हैं ताकि वापस पटरी पर आया जा सके।
- सपोर्ट लाइन्स (Support lines) दिखाती हैं कि किसी कौशल को शुरू करने से पहले किन अतिरिक्त उपकरणों या चरणों की आवश्यकता होती है।
जब रोबोट को कोई नया कार्य दिया जाता है, तो HiSkill उसके पूरे मस्तिष्क (पूरे ग्राफ) को रोबोट की मेमोरी में नहीं डाल देता! वह बहुत अधिक जानकारी हो जाएगी! इसके बजाय, यह एक स्मार्ट GPS की तरह कार्य करता है। यह कार्य को देखता है, प्रासंगिक "स्किल स्टेशन" को ढूंढता है, और फिर उस विशिष्ट यात्रा के लिए आवश्यक केवल छोटा, संक्षिप्त मानचित्र (सबग्राफ) बाहर निकालता है। यह बड़े लक्ष्य को छोटे चरणों और बैकअप योजनाओं के साथ जोड़ता है, और यह सब एक व्यवस्थित पैकेज में होता है।
पेपर ने इस विचार का तीन अलग-अलग डिजिटल दुनिया में परीक्षण किया: एक घर जहाँ रोबोट को वस्तुओं को हिलाना होता है (ALFWorld), एक वेबसाइट जहाँ उसे वस्तुओं की खरीदारी करनी होती है (WebShop), और एक विज्ञान प्रयोगशाला जहाँ उसे प्रयोग चलाने होते हैं (ScienceWorld)। परिणाम प्रभावशाली थे। HiSkill रोबोट ने न केवल अन्य तरीकों की तुलना में अधिक कार्यों को हल किया—उसने उन्हें बहुत तेज़ी से और बहुत कम "सोचने" की आवश्यकता के साथ हल किया। वास्तव में, इसने काम पूरा करने के लिए पिछले सबसे मजबूत तरीके की तुलना में 78.75% कम शब्दों (टोकन) का उपयोग किया। यह सुझाव देता है कि अपनी यादों को एक संरचित मानचित्र में व्यवस्थित करके जिसमें बड़े विचारों और छोटी क्रियाओं के बीच स्पष्ट संबंध हों, रोबोट बहुत अधिक कुशल और विश्वसनीय बन सकते हैं।
शोधकर्ताओं ने यह भी जांचा कि क्या होता है यदि हम मानचित्र को तोड़ दें। यदि उन्होंने सूक्ष्म क्रिया स्टेशनों (AtomicOps) को हटा दिया, तो रोबोट खो गया क्योंकि उसके पास केवल बड़े विचार थे। यदि उन्होंने उन विशेष रेखाओं (edges) को हटा दिया जो गलतियों से उबरने के लिए दिखाते हैं, तो चीजें गलत होने पर रोबोट हार मान गया। यह साबित करता है कि संरचना ही—जिस तरह से बड़े कौशल और छोटे कार्य आपस में जुड़े हुए हैं—ही असली सफलता का रहस्य है।
संक्षेप में, HiSkill सुझाव देता है कि AI एजेंटों को वास्तव में सहायक बनाने के लिए, हमें उन्हें केवल नोट्स का ढेर नहीं देना चाहिए। हमें उन्हें एक अच्छी तरह से व्यवस्थित, जुड़ा हुआ मानचित्र देना चाहिए जो न केवल यह दिखाता है कि क्या करना है, बल्कि यह भी कि इसे चरण-दर-चरण कैसे करना है, और चीजें गलत होने पर क्या करना है। यह किसी को शब्दों की सूची देने और किसी को पूरी तरह से सचित्र, इंटरैक्टिव गाइडबुक देने के बीच का अंतर है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।