← नवीनतम पेपर
💻 computer science

Learning to Evolve: A Self-Improving Framework for Multi-Agent Systems via Textual Parameter Graph Optimization

यह शोध पत्र टेक्स्टुअल पैरामीटर ग्राफ ऑप्टिमाइज़ेशन (TPGO) को प्रस्तुत करता है, जो एक स्व-सुधार ढांचा है जो मल्टी-एजेंट सिस्टम को मॉड्यूलर ग्राफ के रूप में मॉडल करता है और प्राकृतिक भाषा फीडबैक का उपयोग करके एजेंट इंटरैक्शन को पुनरावृत्ति से परिष्कृत करने के लिए ग्रुप रिलेटिव एजेंट ऑप्टिमाइज़ेशन (GRAO) नामक एक मेटा-लर्निंग रणनीति को नियोजित करता है, जिससे जटिल एजेंट सिस्टम के विकास को स्वचालित और उन्नत किया जाता है।

मूल लेखक: Shan He, Runze Wang, Zhuoyun Du, Huiyu Bai, Zouying Cao, Yu Cheng, Bo Zheng

प्रकाशित 2026-04-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shan He, Runze Wang, Zhuoyun Du, Huiyu Bai, Zouying Cao, Yu Cheng, Bo Zheng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही कठिन पहेली को हल करने के लिए रोबोटों की एक सुपर-स्मार्ट टीम बनाने की कोशिश कर रहे हैं, जैसे कि एक वैश्विक आपूर्ति श्रृंखला (global supply chain) को व्यवस्थित करना या एक जटिल सॉफ़्टवेयर प्रोग्राम लिखना। AI की दुनिया में, हम इसे मल्टी-एजेंट सिस्टम (MAS) कहते हैं। इसमें एक अकेला रोबोट सब कुछ करने के बजाय, आपके पास एक टीम होती है: एक रोबोट रिसर्च करता है, दूसरा कोड लिखता है, तीसरा गलतियों की जाँच करता है, और वे काम पूरा करने के लिए एक-दूसरे से बात करते हैं।

समस्या क्या है? इस टीम को बनाना और ट्यून करना एक बुरा सपना है।

अभी, यदि कोई रोबोट टीम विफल हो जाती है, तो मानव इंजीनियरों को यह अनुमान लगाने के लिए हजारों निर्देशों (जिसे "प्रॉम्प्ट्स" कहा जाता है) को मैन्युअल रूप से पढ़ना पड़ता है कि क्या गलत हुआ। क्या रिसर्चर ने गलत जानकारी दी? क्या कोडर ने निर्देशों को गलत समझा? क्या टीम ने एक-दूसरे से बहुत अधिक या बहुत कम बात की? यह एक मैनुअल के बिना टूटी हुई कार को ठीक करने की कोशिश करने जैसा है। इसमें बहुत समय लगता है, और आप इसे और भी खराब कर सकते हैं।

इसके अलावा, हमारे पास जो "फिक्स-इट टूल्स" (ठीक करने वाले उपकरण) वर्तमान में उपलब्ध हैं, वे स्थिर (static) हैं। वे समस्या को एक बार ठीक करने की कोशिश करते हैं, लेकिन वे अपनी गलतियों से सीखते नहीं हैं। यदि वे आज कार को ठीक करने में विफल रहते हैं, तो वे कल भी उसी तरह विफल होंगे।

पेश है TPGO: "सेल्फ-इंप्रूविंग टीम कोच"

यह पेपर TPGO (टेक्स्टुअल पैरामीटर ग्राफ ऑप्टिमाइज़ेशन) नामक एक नया फ्रेमवर्क पेश करता है। TPGO को एक मैकेनिक के रूप में नहीं, बल्कि एक अत्यधिक बुद्धिमान, स्व-शिक्षण कोच के रूप में सोचें जो रोबोट टीम का प्रबंधन करता है।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए देखें:

1. "लेगो ब्लूप्रिंट" (टेक्स्टुअल पैरामीटर ग्राफ)

रोबोट टीम को एक विशाल, अव्यवस्थित टेक्स्ट के रूप में देखने के बजाय, TPGO निर्देशों को एक लेगो ब्लूप्रिंट में तोड़ देता है।

  • नोड्स (ईंटें): टीम का प्रत्येक हिस्सा एक अलग लेगो ईंट है। एक ईंट "रिसर्चर का व्यक्तित्व" है, दूसरी "कोडर के नियम" है, और तीसरी "वह टूल जिसका वे उपयोग करते हैं"।
  • एजेस (कनेक्शन): ईंटों को जोड़ने वाली रेखाएं दिखाती हैं कि वे एक-दूसरे से कैसे बात करते हैं।
  • यह क्यों मायने रखता है: यदि टीम विफल होती है, तो कोच को पूरी किताब को फिर से लिखने की आवश्यकता नहीं होती है। वह देख सकता है कि कौन सी ईंट गलत रंग की है या कौन सा कनेक्शन बहुत ढीला है। वह पूरे ढांचे को तोड़े बिना केवल उस एक ईंट को बदल सकता है या तारों को फिर से जोड़ सकता है।

2. "पोस्ट-मॉर्टम रिपोर्ट" (टेक्स्टुअल ग्रेडिएंट्स)

जब रोबोट टीम एक कार्य करने का प्रयास करती है और विफल हो जाती है, तो TPGO केवल यह नहीं कहता कि "आप विफल रहे।" यह एक टेक्स्टुअल ग्रेडिएंट उत्पन्न करता है।

  • उपमा: कल्पना कीजिए कि एक स्पोर्ट्स कोच खेल देख रहा है। केवल "अच्छा काम" या "बुरा काम" कहने के बजाय, कोच एक विस्तृत रिपोर्ट लिखता है: "स्ट्राइकर इसलिए चूक गया क्योंकि उसने पहले मिडफील्डर को गेंद पास नहीं की थी। साथ ही, गोलकीपर गलत जगह पर खड़ा था।"
  • जादू: TPGO इन विफलता रिपोर्टों को "ग्रेडिएंट्स" (सुधार की दिशा बताने वाला एक फैंसी गणितीय शब्द) में बदल देता है। यह सिस्टम को बताता है कि विशिष्ट त्रुटि के आधार पर उसे क्या बदलना चाहिए और कैसे बदलना चाहिए।

3. "मेमोरी बुक" (GRAO - ग्रुप रिलेटिव एजेंट ऑप्टिमाइज़ेशन)

यह सबसे रोमांचक हिस्सा है। अधिकांश AI ऑप्टिमाइज़र उन छात्रों की तरह होते हैं जो कल सीखी गई बातों को भूल जाते हैं। TPGO के पास एक मेमोरी बुक है।

  • यह कैसे काम करता है: हर बार जब कोच किसी सुधार की कोशिश करता है, तो वह लिखता है: "हमने नियम बदलकर 'पासिंग' की समस्या को ठीक करने की कोशिश की। यह 80% बार काम कर गया।"
  • "ग्रुप" का पहलू: यदि टीम फिर से समान समस्या के साथ विफल होती है, तो कोच शून्य से शुरुआत नहीं करता है। वह अपनी मेमोरी बुक को देखता है, समान पिछली विफलताओं के समूह को ढूंढता है, और कहता है, "हे, पिछली बार जब हमारे पास यह 'पासिंग' की समस्या थी, तो सबसे अच्छा समाधान नियम को X में बदलना था। आइए इसे फिर से आजमाएं, लेकिन इसमें थोड़ा बदलाव करें।"
  • परिणाम: कोच समय के साथ स्मार्ट होता जाता है। वह ऑप्टिमाइज़ करना सीख जाता है। वह एक नौसिखिया कोच से एक ग्रैंडमास्टर रणनीतिकार के रूप में विकसित होता है।

परिणाम: हमें इसकी परवाह क्यों करनी चाहिए?

शोधकर्ताओं ने दो बहुत कठिन चुनौतियों पर इसका परीक्षण किया:

  1. MCP-Universe: एक परीक्षण जहाँ रोबोटों को वास्तविक दुनिया के टूल्स (जैसे ब्राउज़र और सर्वर) का उपयोग करके समस्याओं को हल करना होता है, जहाँ कॉपी करने के लिए कोई "सही उत्तर" नहीं होता।
    • परिणाम: रोबले टूल्स का उपयोग करने और अपनी गलतियों को खुद ठीक करने में बहुत बेहतर हो गए, जिससे उनकी सफलता दर में 25% से अधिक का सुधार हुआ।
  2. GAIA: एक परीक्षण जहाँ रोबोटों को एक जटिल प्रश्न के लिए एक विशिष्ट, सही उत्तर खोजना होता है।
    • परिणाम: रोबोट न केवल अधिक बार सही उत्तर पाते हैं (73% से 81% तक), बल्कि वे दोगुनी तेज़ भी हो गए। कोच ने "बर्बाद समय" और "भ्रमित करने वाले चरणों" को हटाना सीख लिया।

मुख्य निष्कर्ष

TPGO एक ऐसा सिस्टम है जो AI टीमों को खुद को ठीक करना सिखाता है।

एक मानव इंजीनियर द्वारा निर्देशों को मैन्युअल रूप से ट्यून करने में हफ्तों बिताने के बजाय, TPGO एक स्वचालित, स्व-सुधार करने वाले कोच के रूप में कार्य करता है। यह सिस्टम को प्रबंधनीय टुकड़ों में तोड़ता है, हर विफलता से सीखता है, अतीत में जो काम आया उसे याद रखता है, और लगातार टीम की रणनीति को अपग्रेड करता है।

यह एक ऐसे मैकेनिक के बीच का अंतर है जो अंदाज़ा लगाता है कि कौन सा बोल्ट कसना है और एक ऐसे मैकेनिक के बीच है जिसके पास हर उस कार की सुपर-कंप्यूटर मेमोरी है जिसे उसने कभी ठीक किया है, जिससे वह सेकंडों में निदान और मरम्मत कर सकता है। यह ऐसे AI सिस्टम बनाने की दिशा में एक बड़ा कदम है जो वास्तव में विकसित हो सकें और अपने आप जटिल वास्तविक दुनिया के कार्यों को संभाल सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →