← नवीनतम पेपर
💬 NLP

AgentDropoutV2: Optimizing Information Flow in Multi-Agent Systems via Test-Time Rectify-or-Reject Pruning

AgentDropoutV2 एक टेस्ट-टाइम फ्रेमवर्क है जो रिट्रीवल-ऑगमेंटेड करेक्शन और फेल्योर-ड्रिवन इंडिकेटर्स का उपयोग करके त्रुटिपूर्ण एजेंट आउटपुट्स को गतिशील रूप से बीच में रोककर या उन्हें सुधारकर या हटाकर मल्टी-एजेंट सिस्टम के प्रदर्शन को अनुकूलित करता है, जिससे मॉडल को पुन: प्रशिक्षित किए बिना जटिल तर्क कार्यों पर सटीकता को महत्वपूर्ण रूप से बढ़ाया जाता है।

मूल लेखक: Yutong Wang, Siyuan Xiong, Xuebo Liu, Wenkang Zhou, Liang Ding, Miao Zhang, Min Zhang

प्रकाशित 2026-02-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yutong Wang, Siyuan Xiong, Xuebo Liu, Wenkang Zhou, Liang Ding, Miao Zhang, Min Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ AgentDropoutV2 पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी तस्वीर: "टीम प्रोजेक्ट" की समस्या

कल्पना कीजिए कि आप एक बहुत ही कठिन गणित की समस्या को हल करने के लिए विशेषज्ञों की एक टीम (Multi-Agent System) का नेतृत्व कर रहे हैं। आपके पास एक गणितज्ञ (Mathematician), एक कोडर (Coder), एक आलोचक (Critic) और दो अन्य सदस्य हैं। वे एक साथ काम करते हैं और आपस में नोट्स (notes) साझा करते हैं।

समस्या:
एक वास्तविक टीम में, यदि कोई एक व्यक्ति छोटी सी गलती करता है (जैसे कि माइनस साइन भूल जाना), तो वे वह गलत नोट अगले व्यक्ति को भेज सकते हैं। अगला व्यक्ति उस गलती के आधार पर आगे बढ़ता है, और अचानक, पूरी टीम एक पूरी तरह से गलत उत्तर पर काम करने लगती है। इसे एरर प्रोपेगेशन (error propagation) कहा जाता है।

पुराना समाधान:
पहले, शोधकर्ताओं ने इसे ठीक करने के लिए या तो:

  1. कठोर नियम: "गणितज्ञ कभी भी कोडर से बात नहीं कर सकता।" (यह टीम के काम करने के तरीके को सीमित करता है)।
  2. रीट्रेनिंग (Retraining): "आइए टीम को हफ्तों तक सिखाएं कि गलतियाँ कैसे न की जाएं।" (यह महंगा और धीमा है)।

नया समाधान (AgentDropoutV2):
यह पेपर एक स्मार्ट "क्वालिटी कंट्रोल मैनेजर" पेश करता है जो टीम के सदस्यों के बीच बैठता है। यह टीम को बात करने से रोकता नहीं है; यह बस हर नोट को आगे भेजने से पहले उसकी जाँच करता है।


यह कैसे काम करता है: "फायरवॉल" की उपमा

AgentDropoutV2 को ऑफिस के हर कमरे के दरवाजे पर खड़े एक सुपर-स्मार्ट सुरक्षा गार्ड के रूप में सोचें।

1. इंटरसेप्शन (सुरक्षा गार्ड)

हर बार जब कोई एजेंट किसी विचार या गणना (calculation) को पूरा करता है, तो गार्ड उन्हें रोकता है। गार्ड केवल यह नहीं कहता कि "अच्छा काम किया" या "बुरा काम किया।" गार्ड पूछता है: "रुको, क्या हमने पहले भी इस तरह की विशिष्ट गलती देखी है?"

2. "चीट शीट" (इंडिकेटर पूल)

गार्ड के पास एक विशाल, व्यवस्थित चीट शीट (जिसे Indicator Pool कहा जाता है) है। यह कोई पाठ्यपुस्तक नहीं है; यह हजारों पिछले टीम विफलताओं से संकलित एक "हॉल ऑफ शेम" (बदनामियों का हॉल) है।

  • उदाहरण प्रविष्टि: "वर्गमूल (square roots) की गणना करते समय, एजेंट अक्सर भूल जाते हैं कि परिणाम ऋणात्मक (negative) नहीं हो सकता।"
  • उदाहरण प्रविष्टि: "ज्यामिति (geometry) करते समय, एजेंट अक्सर डिग्री और रेडियन के बीच भ्रमित हो जाते हैं।"

गार्ड एजेंट के नोट को देखता है, चीट शीट की जाँच करता है, और कहता है: "हे, तुम वही 'वर्गमूल वाली गलती' कर रहे हो जो हमने पिछले मंगलवार को देखी थी। इसे ठीक करो!"

3. "दोबारा प्रयास" (Rectify)

यदि एजेंट ने गलती की है, तो गार्ड उन्हें विशिष्ट फीडबैक देता है: "तुमने माना कि उत्तर धनात्मक (positive) है, लेकिन यह शून्य भी हो सकता है। फिर से कोशिश करो।" एजेंट फिर से अपना नोट लिखता है। यही Rectify वाला हिस्सा है।

4. "तार काट देना" (Reject)

कभी-कभी, एजेंट इसे ठीक करने की कोशिश करता है, लेकिन वह कुछ प्रयासों के बाद भी इसे सही नहीं कर पाता। या फिर गलती इतनी मौलिक है कि उसे ठीक करने में बहुत समय लगेगा।
इस स्थिति में, गार्ड नोट को रिजेक्ट (Reject) कर देता है। वे उसे कचरे में फेंक देते हैं और बाकी टीम को बताते हैं: "इस नोट को अनदेखा करें। इस गलत विचार को फैलने न दें।" यही Dropout वाला हिस्सा है।

5. "सेफ्टी नेट" (ग्लोबल फॉलबैक)

क्या होगा यदि गार्ड बहुत सारे नोट्स फेंक देता है, और टीम के पास केवल एक ही व्यक्ति बात करता रह जाता है? यह खतरनाक है।
सिस्टम में एक सुरक्षा नियम है: यदि बहुत सारे नोट्स फेंक दिए जाते हैं, तो सिस्टम "रीसेट बटन" दबा देता है। यह कहता है, "ठीक है, यह टीम भ्रमित है। चलिए इस पूरे प्रोजेक्ट को नए दृष्टिकोण के साथ शुरू से शुरू करते हैं।"


यह बेहतर क्यों है? ("इटरेटिव" का जादू)

यह पेपर इसके पुराने संस्करण की तुलना करता है जिसे AgentDropout कहा जाता था।

  • पुराना तरीका: यदि किसी एजेंट ने गलती की, तो गार्ड उसे तुरंत कमरे से बाहर निकाल देता था। टीम ने एक दिमाग खो दिया।
  • नया तरीका (V2): गार्ड पहले एजेंट को सिखाने की कोशिश करता है। "तुमने एक गलती की, लेकिन यहाँ बताया गया है कि वास्तव में क्या गलत है। फिर से कोशिश करो।"
    • यदि वे इसे ठीक कर लेते हैं? बहुत बढ़िया! टीम ने दिमाग को बचा लिया।
    • यदि वे इसे ठीक नहीं कर पाते? तब उन्हें बाहर निकाला जाता है।

यह टीम की सामूहिक बुद्धिमत्ता को बचाते हुए भी गलत जानकारी के "वायरस" को फैलने से रोकता है।

परिणाम: क्या हुआ?

शोधकर्ताओं ने कठिन गणितीय समस्याओं (जैसे हाई स्कूल ओलंपियाड) और कोडिंग कार्यों पर इसका परीक्षण किया।

  • स्कोर: इस नए "सुरक्षा गार्ड" वाले सिस्टम का उपयोग करने वाली टीमों ने बिना इसके काम करने वाली टीमों की तुलना में 6.3% अधिक प्रश्न सही हल किए
  • अनुकूलन क्षमता: सिस्टम इतना स्मार्ट है कि वह जानता है कि कब सख्त होना है और कब उदार।
    • आसान कार्य: गार्ड बहुत कम जाँच करता है।
    • कठिन कार्य: गार्ड बहुत सख्त हो जाता है, यह सुनिश्चित करने के लिए कि कोई सूक्ष्म त्रुटि निकल न जाए, हर एक कदम की "हॉल ऑफ शेम" के विरुद्ध जाँच करता है।

एक वाक्य में सारांश

AgentDropoutV2 AI रोबोट्स की एक टीम के लिए एक स्मार्ट, रियल-टाइम एडिटर की तरह है जो उनकी गलतियों को पकड़ता है, उन्हें सुधारने का दूसरा मौका देता है, और उनके काम को तभी बाहर निकालता है जब वह वास्तव में खराब हो, जिससे यह सुनिश्चित होता है कि पूरी टीम सही रास्ते पर रहे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →