← नवीनतम पेपर
💻 computer science

AgentRadio: Passive Awareness for Long-Horizon Multi-Agent Collaboration

AgentRadio एक एसिंक्रोनस मैसेज-पासिंग लेयर पेश करता है जो एजेंटों को निष्पादन के दौरान अपने साथियों की खोजों के प्रति निष्क्रिय जागरूकता बनाए रखने की अनुमति देकर दीर्घ-क्षितिज बहु-एजेंट कोड समझ (long-horizon multi-agent code comprehension) को सक्षम बनाता है, जिससे निरंतर मध्य-मार्ग समन्वय (mid-course coordination) के माध्यम से SWE-Atlas QnA बेंचमार्क पर 62.1% सफलता दर प्राप्त होती है—जो सिंगल-एजेंट बेसलाइन और नए मॉडलों दोनों से काफी बेहतर प्रदर्शन करती है।

मूल लेखक: Xinxing Ren, Qianbo Zang, Ziyan Wang, Caelum Forder, Suman Deb, Peter Carroll, Zekun Guo

प्रकाशित 2026-07-31
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xinxing Ren, Qianbo Zang, Ziyan Wang, Caelum Forder, Suman Deb, Peter Carroll, Zekun Guo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, असंभव पहेली को सुलझाने की कोशिश कर रहे हैं, लेकिन आपको एक बार में केवल एक छोटा सा टुकड़ा देखने की अनुमति है। यह आधुनिक "AI एजेंटों" के लिए दैनिक संघर्ष है—ऐसे कंप्यूटर प्रोग्राम जिन्हें जटिल समस्याओं को हल करने के लिए मनुष्यों की तरह सोचने और कार्य करने के लिए डिज़ाइन किया गया है। ये एजेंट अविश्वसनीय रूप से स्मार्ट हैं, लेकिन उनका ध्यान बहुत कम समय के लिए रहता है। यदि आप उनसे एक विशाल सॉफ़्टवेयर प्रोजेक्ट (जैसे किसी लोकप्रिय ऐप के पीछे का कोड) को समझने के लिए कहते हैं, तो वे घबरा जाते हैं। वे एक साथ अपने "दिमाग" में जितनी अधिक जानकारी रखने की कोशिश करते हैं, वे कहानी की शुरुआत को भूलने लगते हैं या बीच में छिपे महत्वपूर्ण सुरागों को चूक जाते हैं।

इसे ठीक करने के लिए, वैज्ञानिकों ने काम को एजेंटों की एक टीम के बीच विभाजित करने की कोशिश की, जैसे एक विशाल हवेली के अलग-अलग कमरों में अलग-अलग लोगों को काम सौंपना। लेकिन यहाँ एक पेच है: यदि रसोई में मौजूद व्यक्ति को कोई ऐसा सुराग मिलता है जो बेडरूम में मौजूद व्यक्ति को क्या करना चाहिए, यह बदल देता है, तो वे एक-दूसरे को तब तक नहीं बता सकते जब तक कि वे दोनों अपना वर्तमान कार्य पूरा न कर लें और दरवाजे पर न मिलें। वास्तविक दुनिया में, हम किसी निर्धारित बैठक का इंतज़ार नहीं करते कि "अरे, मुझे कुछ महत्वपूर्ण मिला है!" हम काम करते समय ही बात कर देते हैं। अब तक, AI टीमें एक ऐसी दुनिया में फंसी हुई थीं जहाँ वे केवल निर्धारित ब्रेक के दौरान ही एक-दूसरे से बात कर सकती थीं, जिससे वे अपने साथियों द्वारा किए जा रहे कार्यों के दौरान नई खोजों के प्रति अंधे रहती थीं। यह शोध पत्र AI टीमों को एक-दूसरे के साथ काम करते समय बात करने का एक नया तरीका तलाशता है, जो अलग-थलग श्रमिकों के एक समूह को वास्तव में एक सहयोगात्मक टीम में बदल देता है।

समस्या: "मौन कार्यकर्ता" का जाल

शोधकर्ताओं ने एक कठिन चुनौती के साथ शुरुआत की: वास्तविक दुनिया के सॉफ़्टवेयर कोडबेस के बारे में गहरे प्रश्नों के उत्तर देना। उन्होंने इसका परीक्षण SWE-Atlas QnA नामक एक बेंचमार्क पर किया, जिसमें 11 विभिन्न सॉफ़्टवेयर प्रोजेक्ट्स के बारे में 124 कठिन प्रश्न शामिल हैं। जब उन्होंने एक एकल, बहुत स्मार्ट AI एजेंट (Claude Code Opus 4.6 नामक मॉडल का उपयोग करके) से इन्हें हल करने के लिए कहा, तो वह केवल 32.3% सही हल कर पाया। एजेंट सूचना की विशाल मात्रा में खो गया।

स्पष्ट समाधान काम को विभाजित करना लग रहा था। यदि आप काम को चार एजेंटों के बीच बांट देते हैं, तो प्रत्येक के पास करने के लिए एक छोटा, स्पष्ट काम होता है। लेकिन शोधकर्ताओं ने पाया कि इन टीमों के काम करने के तरीके में एक छिपा हुआ दोष है। अधिकांश सिस्टम एजेंटों को एक विशिष्ट चरण समाप्त होने तक "मौन" में काम करने के लिए मजबूर करते हैं। यह जासूसों के एक समूह जैसा है जो अपराध सुलझा रहे हैं: जासूस A गैरेज की तलाशी ले रहा है, और जासूस B अटारी की जांच कर रहा है। यदि जासूस A को एक कीचड़ भरा जूता मिलता है जो साबित करता है कि संदिग्ध कभी अटारी में नहीं गया था, तो वह जासूस B को तब तक नहीं बता सकता जब तक कि वे दोनों अपनी तलाशी पूरी न कर लें और ब्रीफिंग के लिए न मिलें। तब तक, जासूस B उन सुरागों की तलाश में घंटों बर्बाद कर चुका होगा जो अस्तित्व में ही नहीं हैं।

यह शोध पत्र तर्क देता है कि यही "रुकना और बात करना" (stop-and-talk) विधि समस्या है। वास्तविक दुनिया में, हमारे पास "पैसिव अवेयरनेस" (निष्क्रिय जागरूकता) होती है: हम अपने सहकर्मी की चेतावनी या खोज को बिना अपना काम रोके सुन सकते हैं। लेखक यह देखना चाहते थे कि क्या AI एजेंटों को यही क्षमता देने से खेल बदल जाएगा।

समाधान: AgentRadio

यहाँ AgentRadio आता है। शोधकर्ताओं ने एक नया "लेयर" बनाया है जो AI एजेंटों के लिए वॉकी-टॉकी सिस्टम की तरह काम करता है। यह उन्हें तीन सरल उपकरण देता है:

  1. थ्रेड्स (Threads): विभिन्न विषयों के लिए समर्पित चैट रूम।
  2. संदेश (Messages): समूह को नोट भेजने की क्षमता।
  3. मेंशन का इंतज़ार करना (Wait for Mentions): यह जादू का मंत्र है। संदेशों की जाँच करने के लिए काम रोकने के बजाय, एक एजेंट एक छोटा बैकग्राउंड टास्क चलाता है जो अपने नाम को पुकारे जाने का इंतज़ार करता है। यदि कोई साथी कहता है, "अरे, इसे देखो," तो संदेश एजेंट के कार्य चरणों के बीच एक फोन नोटिफिकेशन की तरह पॉप अप होता है, बिना एजेंट के वर्तमान कार्य में बाधा डाले।

इसे एक ड्राइवर की तरह समझें जो रेडियो सुन रहा है। ड्राइवर अपने हाथ स्टीयरिंग व्हील पर और आँखें सड़क पर रखता है (मुख्य कार्य करता है), लेकिन वह ट्रैफिक रिपोर्ट (साथी का संदेश) भी सुन सकता है और तुरंत अपना रास्ता बदल सकता है। उन्हें सुनने के लिए गाड़ी नहीं रोकनी पड़ती।

प्रयोग: एक पांच-चरणीय नृत्य

इसका परीक्षण करने के लिए, टीम ने चार एजेंटों के मिलकर काम करने के लिए एक सख्त पांच-चरणीय प्रोटोकॉल सेट किया:

  1. एक्सप्लोर (Explore): हर कोई स्वतंत्र रूप से कोडबेस को देखता है।
  2. डिवाइड (Divide): वे यह तय करने के लिए मिलते हैं कि कौन क्या करेगा।
  3. एग्जीक्यूट (Execute): वे वापस काम पर जाते हैं। यहीं AgentRadio चमकता है। यदि कोई एजेंट कुछ ऐसा पाता है जो योजना को बदल देता है, तो वह तुरंत चिल्लाकर सूचित करता है।
  4. रिव्यू (Review): वे एक-दूसरे के काम की समीक्षा करते हैं।
  5. सबमिट (Submit): वे सब कुछ एक अंतिम उत्तर में जोड़ देते हैं।

शोधकर्ताओं ने तीन सेटअपों की तुलना की:

  • एकल एजेंट (The Solo Agent): एक एजेंट जो अकेले सब कुछ करता है।
  • मौन टीम (The Silent Team): चार एजेंट जो समानांतर में काम करते हैं लेकिन केवल प्रत्येक चरण के अंत में बात करते हैं (पुराना तरीका)।
  • AgentRadio टीम: चार एजेंट जिनके पास नया "पैसिव अवेयरनेस" सिस्टम है।

परिणाम: एक बड़ी छलांग

परिणाम नाटकीय थे। जब एकल एजेंट ने 124 कार्यों को हल करने की कोशिश की, तो वह केवल 32.3% में सफल रहा।

जब उन्होंने "साइलेंट टीम" दृष्टिकोण का उपयोग किया (काम को विभाजित करना और बातचीत करना, लेकिन कार्य के बीच में बात न करना), तो सफलता दर बढ़कर 51.6% हो गई। इसने सिद्ध किया कि काम को विभाजित करना मदद करता है, लेकिन एजेंट अभी भी एक-दूसरे के सुरागों को मिस कर रहे थे।

फिर, उन्होंने AgentRadio को चालू किया। काम करते समय तुरंत खोजों को साझा करने की क्षमता के साथ, टीम की सटीकता उछलकर 62.1% हो गई।

यह केवल एक छोटा सुधार नहीं है। AgentRadio के साथ टीम ने सार्वजनिक लीडरबोर्ड पर उपलब्ध सबसे मजबूत एकल एजेंट (Opus 4.8 नामक एक नया, अधिक शक्तिशाली मॉडल) को भी पीछे छोड़ दिया, जिसने केवल 57.2% प्राप्त किया। दूसरे शब्दों में, एक अच्छा संचार प्रणाली वाला चार पुराने एजेंट मिलकर एक नए सुपर-एजेंट से बेहतर प्रदर्शन करते हैं जो अकेला काम कर रहा है।

यह क्यों मायने रखता है: "मिड-कोर्स करेक्शन" की शक्ति

शोधकर्ताओं ने यह समझने के लिए गहराई से जांच की कि यह क्यों काम कर रहा था। उन्होंने पाया कि सबसे बड़ी बढ़त सबसे कठिन कार्यों पर हुई। जब कोई कार्य कठिन था, तो "साइलेंट टीम" अक्सर गलत रास्ते पर बहुत लंबे समय तक चलती रही क्योंकि वे बहुत देर तक अपने साथी के सुधार को नहीं सुन सके।

AgentRadio के साथ, यदि किसी एजेंट को एहसास हुआ, "रुको, योजना गलत है," तो वे तुरंत दूसरों को सूचित कर सकते थे। इसने टीम को "मिड-कोर्स करेक्शन" (मार्ग में सुधार) करने की अनुमति दी। यह हाइकर्स के एक समूह जैसा है: यदि एक व्यक्ति ढलान के किनारे को देखता है, तो वे कैंपफायर पर इकट्ठा होने का इंतज़ार नहीं करते कि "उस तरफ मत जाओ।" वे चिल्लाते हैं, और सभी तुरंत रुक जाते हैं।

अध्ययन ने यह भी दिखाया कि यह केवल अधिक कंप्यूटर पावर के बारे में नहीं था। भले ही उन्होंने एकल एजेंट को कार्य को छह बार अलग-अलग बार करने और सबसे अच्छा परिणाम चुनने के लिए छह गुना बजट दिया, फिर भी वह केवल 37.9% सटीकता तक ही पहुँच सका। AgentRadio के साथ टीम का दृष्टिकोण कहीं अधिक कुशल और प्रभावी था।

सीमाएँ: यह जादू नहीं है

शोध पत्र सावधानीपूर्वक नोट करता है कि AgentRadio कोई जादुई छड़ी नहीं है जो सब कुछ ठीक कर दे। ग्राफाना (Grafana) कार्य से जुड़े एक विशिष्ट केस स्टडी में, एजेंटों ने दोनों (साइलेंट और रेडियो-सक्षम) संस्करणों में समस्या को हल करने में विफल रहे। क्यों? क्योंकि समाधान के लिए एक विशिष्ट नकारात्मक निष्कर्ष की आवश्यकता थी ("यह फीचर मौजूद नहीं है") जिसे किसी भी एकल एजेंट ने खुद नहीं समझा था। AgentRadio केवल वही साझा कर सकता है जो एक एजेंट पहले से ही खोज चुका है; यह शून्य से नए विचार पैदा नहीं कर सकता। यदि कमरे में किसी के पास उत्तर नहीं है, तो चिल्लाना मदद नहीं करेगा।

निष्कर्ष

यह शोध पत्र यह प्रदर्शित करता है कि जटिल, दीर्घकालिक कार्यों के लिए, एक टीम कैसे संवाद करती है यह उतना ही महत्वपूर्ण है जितना कि व्यक्तिगत सदस्य कितने बुद्धिमान हैं। AI एजेंटों को काम करते समय एक-दूसरे को सुनने की क्षमता देकर—"पैसिव अवेयरनेस" की स्थिति बनाकर—टीम गलतियों को जल्दी पकड़ सकती है, महत्वपूर्ण सुरागों को तुरंत साझा कर सकती है, और उन समस्याओं को हल कर सकती है जो पहले असंभव थीं। यह सुझाव देता है कि भविष्य के AI के लिए केवल बड़े, स्मार्ट दिमाग बनाने के बारे में नहीं है, बल्कि उन दिमागों के आपस में बात करने के बेहतर तरीके बनाने के बारे में भी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →