HyperAgent: Planning and Acting over Tool-Schema Hypergraphs for Tool-Use LLM Agents
यह शोध पत्र HyperAgent को प्रस्तुत करता है, जो एक निर्देशित टूल-स्कीमा हाइपरग्राफ (directed Tool-Schema Hypergraph) का लाभ उठाकर गतिशील योजना और कमी-उन्मुख निष्पादन (deficit-oriented execution) को निर्देशित करता है, जिससे मौजूदा बेसलाइन की तुलना में जटिल टूल-उपयोग परिदृश्यों में एलएलएम (LLM) एजेंटों के लिए कार्य पूर्णता दर और दक्षता में सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक अंतरिक्ष यान के कप्तान हैं, लेकिन आपको एक सिंगल जॉयस्टिक से स्टीयरिंग करने के बजाय, हजारों अलग-अलग रोबोटों के बेड़े को कमांड देना है, जिनमें से प्रत्येक एक अलग भाषा बोलता है और एक अनूठे सेट के औजार रखता है। यह "AI एजेंट्स" की दुनिया है—स्मार्ट कंप्यूटर प्रोग्राम जो लार्ज लैंग्वेज मॉडल्स (LLMs) पर आधारित हैं और जिन्हें हमारे लिए वास्तविक दुनिया के कार्य करने के लिए बनाया गया है, जैसे कि फ्लाइट बुक करना, किराने का सामान ऑर्डर करना, या आपके बैंक अकाउंट को मैनेज करना। ये एजेंट्स प्रतिभाशाली लेकिन थोड़े बिखरे हुए सहायकों की तरह हैं; वे आपके अनुरोध को पूरी तरह से समझ सकते हैं, लेकिन जब बात इसे करने का तरीका समझने की आती है, तो वे अक्सर भटक जाते हैं। वे किसी टूल का उपयोग करने की कोशिश कर सकते हैं बिना यह जाने कि उनके पास आवश्यक सामग्री है या नहीं, या वे भूल सकते हैं कि एक रोबोट को अपना काम पूरा करने के बाद ही दूसरा शुरू कर सकता है। बड़ा सवाल जो वैज्ञानिक पूछ रहे हैं वह यह है: हम इन AI सहायकों को दीवारों से टकराने से कैसे रोकें और उन्हें डिजिटल टूल्स के एक जटिल भूलभुलैया में बिना घबराए रास्ता दिखाने में कैसे मदद करें?
यहाँ HyperAgent आता है, एक नया तरीका जो इन AI एजेंट्स के लिए एक सुपर-स्मार्ट GPS की तरह काम करता है। AI को ट्रायल और एरर (गलती करके सीखने) के जरिए रास्ता खोजने देने के बजाय, HyperAgent इस बात का एक विस्तृत और विशाल मानचित्र बनाता है कि सभी टूल्स आपस में कैसे जुड़े हुए हैं, इससे पहले कि एजेंट चलना भी शुरू करे। इसे एक मास्टर शेफ की तरह समझें जो केवल रेसिपी नहीं देखता; वह पहले पेंट्री, फ्रिज और बगीचे की जांच करता है ताकि यह देख सके कि उसके पास कौन सी सामग्री है, उन्हें काटने के लिए किन औजारों की आवश्यकता है, और चीजें किस क्रम में होनी चाहिए। इस "मैप" का उपयोग करके, HyperAgent AI को उसके कदमों की योजना सटीकता के साथ बनाने में मदद करता है, जिससे वह गलत रास्तों से बच जाता है और बहुत सारा समय और ऊर्जा बचाता है।
समस्या: AI का "अनुमान लगाने का खेल"
अभी, अधिकांश AI एजेंट्स कुछ इस तरह काम करते हैं जैसे कोई व्यक्ति किसी कार के इंजन को तब तक हथौड़े से मार रहा हो जब तक कि वह ठीक न हो जाए। वे टूल्स की एक सूची देखते हैं (जैसे "ईमेल भेजें" या "बैंक बैलेंस चेक करें") और अनुमान लगाने की कोशिश करते हैं कि किन्हें और किस क्रम में उपयोग करना है। समस्या यह है कि ये टूल्स अक्सर एक-दूसरे पर निर्भर होते हैं। आप "ईमेल भेज" नहीं सकते यदि आपने पहले "लॉग इन" नहीं किया है, और आप "लॉग इन" नहीं कर सकते यदि आपके पास अपना पासवर्ड नहीं है।
वर्तमान तरीके AI के दिमाग पर भरोसा करते हैं कि वह केवल विवरण पढ़कर इन कनेक्शनों को समझ ले। लेकिन जब सैकड़ों टूल्स होते हैं, तो AI भ्रमित हो जाता है। वह ऐसे टूल का उपयोग करने की कोशिश कर सकता है जिसे एक विशिष्ट इनपुट की आवश्यकता है जो उसके पास अभी नहीं है, जिससे प्रयास विफल हो जाता है। यह बिना अंडे चेक किए केक बनाने की कोशिश करने जैसा है, और फिर आधे रास्ते में एहसास होता है कि आपको अंडे खरीदने जाना होगा, और तब तक दुकान बंद भी हो चुकी है। यह "अनुमान लगाने का खेल" समय बर्बाद करता है, पैसा (कंप्यूटर प्रोसेसिंग पावर के रूप में) खर्च करता है, और अक्सर कार्य को पूरी तरह से विफल कर देता है।
समाधान: "टूल-स्कीमा हाइपरग्राफ" (Tool-Schema Hypergraph)
HyperAgent के पीछे के शोधकर्ताओं ने अनुमान लगाना बंद करने और मानचित्र बनाना शुरू करने का निर्णय लिया। उन्होंने Tool-Schema Hypergraph नामक कुछ बनाया। इसे समझने के लिए, एक विशाल, 3D मकड़ी के जाल की कल्पना करें जहाँ हर धागा टूल्स के बीच के संबंध को दर्शाता है।
एक सामान्य मैप में, आप "टूल A" से "टूल B" तक एक रेखा खींच सकते हैं। लेकिन इस नए "हाइपरग्राफ" में, कनेक्शन बहुत अधिक सटीक हैं। यह केवल यह नहीं कहता कि "टूल A, टूल B की मदद करता है।" यह कहता है, "टूल A यह विशिष्ट सामग्री (जैसे कि पासवर्ड) उत्पन्न करता है, जो बिल्कुल वही है जिसकी टूल B को शुरू करने के लिए आवश्यकता है।" यह डेटा के प्रवाह को पाइपों में बहते पानी की तरह मैप करता है, यह सुनिश्चित करता है कि एक टूल का हर आउटपुट अगले टूल के लिए आवश्यक इनपुट से पूरी तरह मेल खाता हो।
उन्होंने इस मैप को ईमेल, शॉपिंग और म्यूजिक सेवाओं जैसे ऐप्स के 250 विभिन्न परिदृश्यों के वास्तविक दुनिया के डेटासेट का उपयोग करके बनाया। उन्होंने इसमें "प्रीकंडिशन्स" (पूर्व-शर्तें) भी जोड़ीं—जैसे यह जानना कि "संदेश भेजें" टूल तभी काम करता है जब आप पहले से "लॉग इन" हों। यह डिजिटल दुनिया के काम करने का एक गतिशील, जीवित ब्लूप्रिंट बनाता है।
HyperAgent कैसे काम करता है: तीन-चरणीय नृत्य
एक बार जब यह मैप बन जाता है, तो HyperAgent काम पूरा करने के लिए एक चतुर तीन-चरणीय प्रक्रिया का उपयोग करता है:
- द स्काउट (कॉन्टेक्स्ट एक्सट्रैक्शन): जब आप AI को एक कार्य देते हैं (जैसे, "मेरे रूममेट को हमारे नवीनतम ऑर्डर की रसीद ईमेल करें"), तो HyperAgent पूरे उलझे हुए जाल को नहीं देखता। इसके बजाय, यह मैप का उपयोग करके केवल उन विशिष्ट टूल्स और कनेक्शनों को निकालता है जो उस कार्य के लिए प्राget relevant हैं। यह एक "Task DAG" (एक फैंसी शब्द जो फ्लोचार्ट के लिए उपयोग किया जाता है) बनाता है जो संचालन के सटीक क्रम को दिखाता है, जैसे कि एक रेसिपी कार्ड जिसमें हर चरण और आवश्यक सामग्री सूचीबद्ध होती है।
- द बिल्डर (डेफिसिट-ओरिएंटेड एक्सपेंशन): यहीं पर HyperAgent वास्तव में स्मार्ट हो जाता है। जैसे-जैसे AI काम करना शुरू करता है, यह अपने वर्तमान "स्टेट" (अवस्था) की जांच करता है—उसके पास अभी कौन सी जानकारी है? यदि उसे एक "रसीद फ़ाइल" की आवश्यकता है लेकिन उसके पास अभी वह नहीं है, तो HyperAgent मैप में उस सटीक टूल को खोजता है जो वह फ़ाइल उत्पन्न करता है। वह उस लापता हिस्से के लिए केवल टूल्स का एक छोटा उप-नेटवर्क बनाता है, यह सुनिश्चित करता है कि AI कभी भी ऐसा कुछ करने की कोशिश न करे जो वह अभी नहीं कर सकता। यह एक निर्माण दल की तरह है जो वर्तमान दीवार के लिए केवल आवश्यक ईंटों का ऑर्डर देता है, बजाय इसके कि वे एक साथ पूरा घर बनाने की कोशिश करें।
- द नेविगेटर (डायनेमिक एक्जीक्यूशन): जैसे-जैसे AI चरणों को पूरा करता है और नई जानकारी एकत्र करता है (जैसे रसीद ढूंढना), यह अपनी आंतरिक स्थिति को अपडेट करता है। यदि कुछ गलत हो जाता है या स्थिति बदल जाती है, तो HyperAgent घबराता नहीं है। यह मैप की दोबारा जांच करता है, योजना को समायोजित करता है, और आगे बढ़ने के लिए एक नया रास्ता खोजता है। यह एक GPS की तरह है जो ट्रैफिक देखने पर तुरंत रास्ता बदल लेता है, बजाय इसके कि वह ट्रैफिक साफ होने की उम्मीद में आपको गोल-गोल घुमाता रहे।
परिणाम: तेज़, स्मार्ट और सस्ता
शोधकर्ताओं ने HyperAgent का परीक्षण AppWorld बेंचमार्क पर किया, जो सरल से लेकर बहुत जटिल तक के 750 विभिन्न कार्यों वाला एक कठोर टेस्ट सूट है। उन्होंने अन्य AI विधियों के साथ इसकी तुलना की, जिसमें वे विधियाँ भी शामिल हैं जो केवल अनुमान लगाती हैं (जैसे ReAct) और वे जो पिछले उदाहरणों पर प्रशिक्षित हैं।
परिणाम प्रभावशाली थे। HyperAgent ने न केवल अधिक कार्य सफलतापूर्वक पूरे किए; उसने उन्हें बहुत अधिक कुशलता से भी किया।
- सफलता दर (Success Rate): स्टैंडर्ड टेस्ट सेट पर, HyperAgent ने 63.1% कार्यों को सफलतापूर्वक पूरा किया, जबकि अगली सर्वश्रेष्ठ विधि ने 48.8% किया। कठिन "चैलेंज" सेट पर, इसने 35.7% बनाम 30.2% पूरा किया।
- दक्षता (Efficiency): शायद इससे भी महत्वपूर्ण बात यह है कि HyperAgent ने भारी मात्रा में संसाधनों की बचत की। इसने प्रति कार्य 46,000 टोकन (डिजिटल "शब्द" जिन्हें AI प्रोसेस करता है) का उपयोग किया, जबकि स्टैंडर्ड मेथड के लिए यह 140,000 था। इसने API कॉल्स (बाहरी टूल्स के अनुरोध) भी कम किए, जो औसतन 75.1 से घटकर 48.0 रह गए।
सरल शब्दों में, HyperAgent न केवल सफल होने की अधिक संभावना रखता था, बल्कि वहां तक पहुँचने के लिए उसने कम समय और कंप्यूटर शक्ति भी बर्बाद की। इसने "ट्रायल एंड एरर" के लूप से परहेज किया जहाँ अन्य एजेंट्स एक टूल आज़माते, विफल होते, दूसरा आज़माते, विफल होते, और अंततः हार मान लेते।
यह क्यों मायने रखता है
पेपर सुझाव देता है कि टूल्स एक-दूसरे पर कैसे निर्भर हैं—केवल टेक्स्ट से इन कनेक्शनों का अनुमान लगाने के बजाय—इसे स्पष्ट रूप से मॉडल करके, हम AI एजेंट्स को बहुत अधिक विश्वसनीय बना सकते हैं। शोधकर्ताओं ने पाया कि जब उन्होंने "मैप" (ग्राफ कॉन्टेक्स्ट) या "बिल्डर" (सपोर्ट ग्राफ) को हटाया, तो प्रदर्शन काफी गिर गया। यह साबित करता है कि मैप की संरचना आवश्यक है, न कि केवल एक अतिरिक्त सुविधा।
हालांकि यह अध्ययन एक सिम्युलेटेड वातावरण (AppWorld डेटासेट) में किया गया था, परिणाम एक स्पष्ट मार्ग सुझाते हैं: AI एजेंट्स को केवल पढ़ने में स्मार्ट होने की ही नहीं जरूरत है; उन्हें उन टूल्स के स्ट्रक्चर (संरचना) को समझने में भी बेहतर होना होगा जिनका वे उपयोग करते हैं। उन्हें एक मैप देकर, हम उन्हें अंधेरे में भटकने से रोकते हैं और उन्हें आत्मविश्वास के साथ जटिल डिजिटल दुनिया में नेविगेट करने में मदद करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।