← नवीनतम पेपर
💬 NLP

MyAG: A Graph-Based Framework for Designing and Analyzing Composable LLM Agent Systems

यह शोधपत्र MyAG को प्रस्तुत करता है, जो एक ओपन-सोर्स, ग्राफ-आधारित फ्रेमवर्क है जो लचीले डिज़ाइन, पदानुक्रमित संरचना (hierarchical composition) और प्रदर्शन विश्लेषण को सक्षम करने के लिए कंपोजेबल LLM एजेंट सिस्टम को घटक (component), वर्कफ़्लो और सर्च ग्राफ में विभाजित करता है।

मूल लेखक: Zhisong Zhang

प्रकाशित 2026-07-16
📖 10 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhisong Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ कंप्यूटर केवल सवालों के जवाब ही नहीं देते, बल्कि वास्तव में काम भी करते हैं। वे वेब ब्राउज़ कर सकते हैं, उड़ानें बुक कर सकते हैं, या डिजिटल सहायकों की तरह काम करके जटिल पहेलियों को हल कर सकते हैं। यह AI एजेंट्स (AI Agents) का क्षेत्र है। इन्हें केवल साधारण चैटबॉट्स के रूप में नहीं, बल्कि एक छोटे रोबोट के रूप में सोचें जिसके पास एक दिमाग (एक लार्ज लैंग्वेज मॉडल) और दुनिया के साथ बातचीत करने के लिए हाथों का एक सेट (टूल्स) है। लेकिन यहाँ पेचीदा बात यह है: इन रोबोटों को बनाना बहुत अव्यवस्थित काम है। आपको यह तय करना होता है कि उनके पास कौन से टूल्स होंगे, वे चरण-दर-चरण कैसे सोचेंगे, और जब वे फंस जाते हैं तो वे क्या करेंगे। यह एक कार बनाने की कोशिश करने जैसा है जहाँ इंजन, स्टीयरिंग व्हील और जीपीएस को इस तरह चिपका दिया गया है कि उन्हें आपस में बदला नहीं जा सकता। यदि आप कार चलाने का तरीका बदलना चाहते हैं, तो आपको पूरा इंजन फिर से बनाना पड़ सकता है। शोधकर्ता इन एजेंट्स को इस तरह बनाने का तरीका खोज रहे हैं ताकि वे लचीले, कुशल और आसानी से ठीक करने योग्य हों, क्योंकि अभी यह बताना मुश्किल है कि कोई रोबोट इसलिए विफल हो रहा है क्योंकि वह "मूर्ख" है या इसलिए क्योंकि निर्देश ही खराब लिखे गए थे।

यहाँ MyAG आता है, जो सिटी यूनिवर्सिटी ऑफ हांगकांग के ज़िसोंग झांग द्वारा बनाया गया एक नया टूलकिट है। यह पेपर MyAG को एक "ग्राफ-आधारित फ्रेमवर्क" के रूप में प्रस्तुत करता है, जो एक फैंसी तरीका है यह कहने का कि यह एजेंट डिज़ाइन को एक विशाल, उलझे हुए ढेर के बजाय तीन अलग-अलग, स्पष्ट ब्लूप्रिंट्स में व्यवस्थित करता है। लेखक सुझाव देते हैं कि "कौन" (घटक/कंपोनेंट्स), "कैसे" (वर्कफ़्लो), और "क्या होगा अगर" (सर्च स्ट्रैटेजी) को अलग करके, डेवलपर्स लेगो ब्रिक्स (Lego bricks) की तरह हिस्सों को मिला और मिला सकते हैं। उन्होंने पाया कि यह अलगाव विभिन्न रणनीतियों का परीक्षण करना बहुत आसान बना देता है बिना पूरे सिस्टम को फिर से लिखे। अपने प्रयोगों में, उन्होंने दिखाया कि यह दृष्टिकोण डेवलपर्स को यह देखने में मदद करता है कि एक एजेंट कार्य को कितनी अच्छी तरह करता है और इसे करने में कितना समय या पैसा खर्च होता है। उन्होंने यह दावा नहीं किया कि उन्होंने सभी AI समस्याओं को हल कर लिया है, लेकिन उन्होंने प्रदर्शित किया कि उनका तरीका शोधकर्ताओं को यह देखने में मदद करता है कि उनका एजेंट अपना समय कहाँ खर्च कर रहा है और कहाँ संसाधन बर्बाद कर रहा है।

एक डिजिटल मस्तिष्क के तीन ब्लूप्रिंट

MyAG को समझने के लिए, कल्पना करें कि आप एक फिल्म निर्देशित कर रहे हैं। आपके पास तीन अलग-अलग काम हैं, और MyAG चाहता है कि आप एक को दूसरे को खराब किए बिना ठीक करने के लिए उन्हें अलग रखें।

1. द कंपोनेंट ग्राफ (The Component Graph): कास्ट और क्रू
यह आपकी फिल्म में कौन शामिल है, इसकी सूची है। AI की दुनिया में, ये एजेंट्स (निर्णय लेने वाले अभिनेता), एनवायरनमेंट्स (सेट जिन पर वे अभिनय करते हैं, जैसे वेब ब्राउज़र), और टूल्स (वे प्रॉप्स जिनका वे उपयोग करते हैं) हैं। MyAG में, इसे एक मानचित्र के रूप में खींचा गया है जो दिखाता है कि कौन किससे बात कर सकता है। उदाहरण के लिए, एक "एक्शन एजेंट" एक "ब्राउज़र एनवायरनमेंट" से जुड़ा हो सकता है, जिसका अर्थ है कि एजेंट वेबपेज पर बटन क्लिक कर सकता है। मजेदार बात यह है कि आप अलग-अलग दृश्यों के लिए एक ही अभिनेता का पुन: उपयोग कर सकते हैं। आपको नया अभिनेता बनाने की आवश्यकता नहीं है क्योंकि दृश्य बदल गया है; आप बस मौजूदा अभिनेता को अगला क्या करना है, यह बताते हैं।

2. द वर्कफ़्लो ग्राफ (The Workflow Graph): स्क्रिप्ट
यह वह स्क्रिप्ट है जो अभिनेताओं को बताती है कि कब बोलना है और आगे क्या करना है। यह कहानी का प्रवाह है। क्या एजेंट मौसम की जाँच करता है, और फिर टिकट बुक करता है? या क्या यह विफल होने पर फिर से प्रयास करने के लिए वापस जाता है? MyAG आपको इस स्क्रिप्ट को एक फ्लोचार्ट के रूप में बनाने की अनुमति देता है। आप इसमें लूप, शाखाएँ (यदि यह होता है, तो बाएँ जाएँ; यदि वह होता है, तो दाएँ जाएँ), और रुकने की शर्तें रख सकते हैं। सबसे अच्छी बात? आप वही कास्ट (कंपोनेंट ग्राफ) रख सकते हैं लेकिन स्क्रिप्ट (वर्कफ़्लो ग्राफ) को बदलकर देख सकते हैं कि क्या एक अलग कहानी का ढांचा बेहतर काम करता है।

3. द सर्च ग्राफ (The Search Graph): "क्या होगा अगर" वाले रिहर्सल
यहीं पर यह वास्तव में दिलचस्प हो जाता है। कभी-कभी, एक रोबोट को सबसे अच्छा निर्णय लेने से पहले विभिन्न पथों को एक्सप्लोर करने की आवश्यकता होती है। शायद वह एक दरवाजा आजमाता है, महसूस करता है कि वह बंद है, और फिर एक खिड़की आजमाता है। सर्च ग्राफ इन सभी "क्या होगा अगर" परिदृश्यों को रिकॉर्ड करता है। यह एजेंट द्वारा लिए गए हर मोड़, हर डेड एंड (रास्ता बंद होना), और हर सफल पथ का हिसाब रखता है। यह सिस्टम को "बेस्ट-फर्स्ट सर्च" (हमेशा सबसे आशाजनक पथ चुनना) या "रोलबैक" (यदि चीजें गलत हो जाती हैं तो पिछले चरण पर वापस जाना) जैसी रणनीतियों का उपयोग करने की अनुमति देता है। यह एक ऐसे निर्देशक की तरह है जो कह सकता है, "कट! चलिए उस दृश्य को फिर से आजमाते हैं, लेकिन इस बार, चरित्र चलने के बजाय दौड़ता है," बिना पूरे मूवी सेट को फिर से बनाए।

लेगो ब्लॉक्स के साथ टावर बनाना

पेपर का एक बड़ा विचार हायरार्किकल कंपोजिशन (Hierarchical Composition) है। कल्पना करें कि आप एक विशाल रोबोट बना रहे हैं। हर छोटे पेंच और तार को एक साथ डिजाइन करने के बजाय, आप एक हाथ बनाते हैं, फिर एक पैर, फिर एक सिर, और अंत में उन्हें एक साथ जोड़ते हैं। MyAG आपको AI एजेंट्स के साथ ऐसा करने की अनुमति देता है। आप एक छोटा "वेब ब्राउजिंग सिस्टम" बना सकते हैं जो इंटरनेट पर पेपर खोजने में बहुत अच्छा है। फिर, आप उस पूरे सिस्टम को एक बड़े "रिसर्च असिस्टेंट" सिस्टम के भीतर एक एकल टूल के रूप में लपेट सकते हैं।

पेपर बताता है कि ये "सब-सिस्टम्स" स्टेटलेस (stateless) (हर बार उपयोग किए जाने पर रीसेट होने वाले, जैसे कैलकुलेटर) या स्टेटफुल (stateful) (पहले जो हुआ उसे याद रखने वाले, जैसे एक मानव सहायक जो आपकी पसंद को याद रखता है) हो सकते हैं। यह मॉड्यूलरिटी (modularity) आपको हर बार शुरुआत से शुरू करने के बजाय छोटे, परीक्षण किए गए हिस्सों को जोड़कर जटिल एजेंट बनाने की अनुमति देती है।

स्टॉपवॉच और वॉलेट: दक्षता को मापना

लेखक दक्षता (efficiency) की भी परवाह करते हैं। उनका तर्क है कि केवल इसलिए कि एक एजेंट सही उत्तर प्राप्त करता है, इसका मतलब यह नहीं है कि वह एक अच्छा एजेंट है; हो सकता है कि उसने 100 बार प्रयास किया हो और कंप्यूटर समय के रूप में एक बड़ी कीमत चुकाई हो। MyAG में एक बिल्ट-इन स्टॉपवॉच और वॉलेट शामिल है।

वे दो मुख्य चीजों को मापते हैं:

  • LLM लागत (CLC_L): "दिमाग" की कितनी लागत आती है। इसकी गणना इस आधार पर की जाती है कि AI कितने शब्दों (टोकन) को पढ़ता और लिखता है। वे एक फॉर्मूला का उपयोग करते हैं जहाँ वे इनपुट और आउटपुट टोकन को महत्व देते हैं, जिससे उपयोगकर्ताओं को AI मॉडल की कीमत के आधार पर कीमतें सेट करने की अनुमति मिलती है।
  • एनवायरनमेंट लागत (CEC_E): "हाथों" की कितनी लागत आती है। यह वास्तविक दुनिया में चीजें करने में लगने वाले समय को मापता है, जैसे कि वेबपेज लोड होने का इंतजार करना या पेज को नीचे स्क्रॉल करना।

इन लागतों को ट्रैक करके, शोधकर्ता देख सकते हैं कि परफॉर्मेंस-एफिशिएंसी ट्रेड-ऑफ (performance-efficiency trade-off) क्या है। उदाहरण के लिए, उन्होंने पाया कि एक सरल "ग्रीडी" (Greedy) रणनीति (बस जो पहला विचार आता है उसे करना) सबसे तेज़ और सस्ती है। हालांकि, एक "रोलबैक" (Rollback) रणनीति (जो एजेंट को वापस जाने और फिर से प्रयास करने की अनुमति देती है) थोड़ी महंगी हो सकती है लेकिन अक्सर बेहतर परिणाम देती है। "बेस्ट-ऑफ-एन" (Best-of-N) रणनीति (एक साथ कई पथों को आजमाना और सबसे अच्छा चुनना) बहुत सटीक हो सकती है लेकिन यह बहुत धीमी और महंगी है।

प्रयोगों ने क्या दिखाया

टीम ने दो वास्तविक कार्यों पर MyAG का परीक्षण किया: जटिल प्रश्नों का उत्तर देना (GAIA बेंचमार्क का उपयोग करके) और वेबसाइटों को नेविगेट करना (Mind2Web-Live का उपयोग करके)। उन्होंने यह देखने के लिए विभिन्न रणनीतियों के साथ ये परीक्षण चलाए कि वे एक-दूसरे के मुकाबले कैसे खड़े हैं।

  • गति बनाम बुद्धिमत्ता: ग्रीडी (Greedy) रणनीति सबसे कुशल थी, क्योंकि इसने विकल्पों की जांच करने में समय बर्बाद नहीं किया, इसलिए इसमें सबसे कम समय लगा और सबसे कम कंप्यूटर टोकन का उपयोग हुआ।
  • दूसरे मौके की शक्ति: रोलबैक (Rollback) रणनीति पर्याप्त समय मिलने पर समग्र रूप से सबसे अच्छा प्रदर्शन करती है। इसने एजेंट को अपनी गलतियों को स्वीकार करने और फिर से प्रयास करने की अनुमति दी, जिससे उच्च सटीकता मिली, भले ही इसके लिए समय और टोकन की थोड़ी अधिक लागत आई।
  • जटिलता की लागत: बेस्ट-फर्स्ट (Best-First) और बेस्ट-ऑफ-एन (Best-of-N) जैसी रणनीतियाँ प्रदर्शन में सुधार कर सकती हैं, लेकिन वे एक भारी कीमत के साथ आती हैं। उन्हें बहुत अधिक कंप्यूटर पावर और समय की आवश्यकता होती। पेपर नोट करता है कि इन जटिल तरीकों की सफलता काफी हद तक एक अच्छे "जज" (judge) के होने पर निर्भर करती है जो यह तय कर सके कि कौन सा पथ सबसे अच्छा है।

उन्होंने यह भी विस्तार से बताया कि समय कहाँ खर्च हुआ। वेब नेविगेशन के लिए, उन्होंने पाया कि "स्क्रॉलिंग" आश्चर्यजनक रूप से सस्ती और तेज़ थी, जबकि पेज लोड होने के लिए "इंतजार करना" सबसे महंगा कार्य था, जो अक्सर होने के बावजूद समय का एक बड़ा हिस्सा ले लेता था। इस तरह का विस्तृत विश्लेषण डेवलपर्स को यह जानने में मदद करता है कि उन्हें अपने एजेंट्स को कहाँ अनुकूलित (optimize) करने की आवश्यकता है।

निष्कर्ष

MyAG कोई जादुई छड़ी नहीं है जो सभी AI समस्याओं को हल कर देती है, और लेखक स्पष्ट हैं कि इसे एक शोध उपकरण के रूप में डिज़ाइन किया गया है, न कि लाखों उपयोगकर्ताओं वाले वाणिज्यिक ऐप्स बनाने के लिए एक तैयार उत्पाद के रूप में। यह अभी सुरक्षा या वितरित नेटवर्क (distributed networks) जैसी चीजों को नहीं संभालता है। हालांकि, यह सफलतापूर्वक सिद्ध करता है कि "कौन", "कैसे", और "क्या होगा अगर" को अलग करने से AI एजेंटों को डिजाइन करना, परीक्षण करना और समझना बहुत आसान हो जाता है। शोधकर्ताओं को यह समझने में मदद करने के लिए कि वे अपने एजेंटों को बिल्कुल कैसे बेहतर, तेज़ और अधिक लागत प्रभावी बना सकते हैं, MyAG उन्हें एक स्पष्ट तरीका प्रदान करता है। यह पेपर सुझाव देता है कि यह दृष्टिकोण AI एजेंट सिस्टम को अधिक पारदर्शी और प्रबंधनीय बनाने की दिशा में एक ठोस कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →