← नवीनतम पेपर
🤖 AI

When Does Multi-Agent RL Improve LLM Workflows? Workflow, Scale, and Policy-Sharing Tradeoffs

यह शोध पत्र इस बात की जांच करता है कि कैसे एंड-टू-एंड सुदृढीकरण लर्निंग (reinforcement learning) विभिन्न पैमानों और कार्यों में मल्टी-एजेंट एलएलएम (LLM) वर्कफ़्लो को बेहतर बनाती है, जो यह प्रकट करता है कि हालांकि साझा (shared) और पृथक (isolated) दोनों प्रकार के पॉलिसी प्रशिक्षण लाभ प्रदान करते हैं, वे केवल पॉलिसी-शेयरिंग के बजाय वर्कफ़्लो टोपोलॉजी और भूमिका-विशिष्ट ग्रेडिएंट डायनेमिक्स द्वारा संचालित विशिष्ट स्थिरता ट्रेड-ऑफ और विफलता मोड प्रदर्शित करते हैं।

मूल लेखक: Yifan Zeng, Yiran Wu, Yaolun Zhang, Wentian Zhao, Kun Wan, Qingyun Wu, Huazheng Wang

प्रकाशित 2026-05-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yifan Zeng, Yiran Wu, Yaolun Zhang, Wentian Zhao, Kun Wan, Qingyun Wu, Huazheng Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक कठिन पहेली, जैसे कि कोई जटिल गणित की समस्या या कोई पेचीदा कोडिंग बग, को हल करने के लिए काम करने वाले AI सहायकों की एक टीम है। केवल एक AI से उत्तर पूछने के बजाय, आप एक वर्कफ़्लो सेट करते हैं जहाँ वे अलग-अलग भूमिकाएँ निभाते हैं: एक विचार उत्पन्न करता है, दूसरा उनकी आलोचना करता है, और तीसरा सबसे अच्छे विचार को चुनता है। इसे मल्टी-एजेंट LLM वर्कफ़्लो (Multi-Agent LLM Workflow) कहा जाता है।

इस शोध पत्र के शोधकर्ताओं यह जानना चाहते थे: यदि हम इस पूरी टीम को एक साथ "करके सीखने" की विधि (रीइन्फोर्समेंट लर्निंग) का उपयोग करके प्रशिक्षित करते हैं, तो क्या यह वास्तव में अकेले काम करने वाले एकल AI से अधिक स्मार्ट हो जाती है?

वे यह भी जानना चाहते थे कि उन्हें कैसे प्रशिक्षित किया जाए। क्या प्रत्येक टीम के सदस्य को एक ही "मस्तिष्क" से सीखना चाहिए (साझा नीति/Shared Policy), या प्रत्येक भूमिका के पास अपना विशिष्ट मस्तिष्क होना चाहिए (पृथक नीति/Isolated Policy)?

यहाँ उनके निष्कर्षों का विवरण दिया गया है, जो सरल उपमाओं का उपयोग करता है।

1. दो प्रशिक्षण शैलियाँ: "झुंड" बनाम "विशेषज्ञ"

यह शोध पत्र इन टीमों को प्रशिक्षित करने के दो तरीकों की तुलना करता है:

  • साझा नीति (Shared Policy - "झुंड"): कल्पना कीजिए कि एक गाना गाने वाला समूह (choir) है जहाँ हर कोई संगीत के बिल्कुल एक ही पन्ने (sheet music) से गा रहा है। वे सभी फीडबैक के आधार पर अपनी आवाज़ों को अपडेट करते हैं। यदि कंडक्टर कहता है "ज़ोर से गाओ," तो सभी ज़ोर से गाते हैं।
    • परिणाम: यह एक "सुरक्षित" विकल्प है। यह स्थिर है और पागल नहीं होता, लेकिन इसकी एक सीमा (ceiling) है। यह शायद ही कभी उच्चतम संभव स्कोर तक पहुँच पाता है, और कभी-कभी, भले ही यह स्थिर दिखता हो, टीम धीरे-धीरे गलत गाना गाने लगती है और अंत तक किसी को पता भी नहीं चलता।
  • पृथक नीति (Isolated Policy - "विशेषज्ञ"): कल्पना कीजिए कि एक स्पोर्ट्स टीम है जहाँ गोलकीपर, स्ट्राइकर और डिफेंडर के पास अपने निजी कोच होते हैं। वे अपने विशिष्ट कार्यों के लिए विशिष्ट कौशल सीखते हैं।
    • परिणाम: यह दृष्टिकोण अक्सर उच्चतम शिखर स्कोर (टीम वास्तव में बहुत अच्छी हो जाती है) तक पहुँचता है। हालाँकि, यह जोखिम भरा है। कभी-कभी, प्रशिक्षण इतना कठिन हो जाता है कि टीम अंत में क्रैश हो जाती है, और खेल खेलना पूरी तरह से भूल जाती है। यह एक उच्च-प्रदर्शन वाली रेस कार की तरह है जो अविश्वसनीय रूप से तेज़ चलती है लेकिन उसका सस्पेंशन नाजुक होता है जो कुछ चक्करों के बाद टूट जाता है।

2. "सीलिंग और फ्लोर" का ट्रेड-ऑफ (The "Ceiling and Floor" Trade-off)

शोधकर्ताओं ने एक निरंतर पैटर्न पाया:

  • पृथक नीति (विशेषज्ञ) का एक उच्च सीलिंग (बहुत स्मार्ट हो सकती है) है लेकिन एक निम्न फ्लोर (प्रशिक्षण के अंत में क्रैश होने की अधिक संभावना) है।
  • साझा नीति (झुंड) की एक निम्न सीलिंग (उतनी स्मार्ट नहीं होती) है लेकिन एक उच्च फ्लोर (अधिक स्थिर, गिरने की संभावना कम) है।

पकड़ (The Catch): यह केवल एक शैली चुनने के बारे में नहीं है। "सर्वश्रेष्ठ" विकल्प पूरी तरह से इस पर निर्भर करता है कि वे क्या काम कर रहे हैं और AI मॉडल कितने बड़े हैं

  • कभी-कभी, विशेषज्ञ होना बहुत मदद करता है।
  • अन्य समय में, विशेषज्ञ टीम क्रैश हो जाती है, और "झुंड" वाली टीम वास्तव में जीत जाती है क्योंकि वह ढलान से नीचे नहीं गिरी।

3. वे क्यों विफल होते हैं? (छिपी हुई यांत्रिकी)

शोध पत्र में यह भी बताया गया है कि ये विफलताएं क्यों होती हैं, इसके लिए दो मुख्य रूपकों का उपयोग किया गया है:

A. "इको चैंबर" प्रभाव (Isolated Policy)

पृथक नीति सेटअप में, यदि आपके पास एक ही समय में काम करने वाले तीन AI "जनरेटर" हैं, तो उन सभी को एक ही समय में एक ही फीडबैक मिलता है।

  • उपमा: कल्पना कीजिए कि एक स्टडी ग्रुप में तीन छात्र हैं जिन्हें शिक्षक से एक ही गलत संकेत मिलता है। क्योंकि वे सभी एक ही समय में एक ही "गलत" संकेत से सीख रहे हैं, वे सभी मिलकर उस गलती को पुख्ता करते हैं। उनका "ग्रेडिएंट" (सीखने का संकेत) बढ़ जाता है, जैसे माइक्रोफ़ोन स्पीकर में फीडबैक देता है।
  • परिणाम: वे सभी बहुत तेज़ी से एक ही गलत उत्तर की ओर बढ़ जाते हैं। टीम आत्मविश्वासी तो हो जाती है लेकिन गलत होती है, जिससे प्रदर्शन में अचानक गिरावट आती है।

B. "प्रभावी व्यक्तित्व" प्रभाव (Shared Policy)

साझा नीति सेटअप में, सभी एक ही मस्तिष्क साझा करते हैं। लेकिन हर कोई समान रूप से योगदान नहीं देता है।

  • उपमा: कल्पना कीजिए कि एक समिति है जहाँ एक सदस्य 90% समय बोलता है और अन्य कभी-कभार ही बोलते हैं। समिति का "साझा मस्तिष्क" बिल्कुल उस शोर मचाने वाले सदस्य जैसा सुनाई देने लगता है। शांत सदस्य अपना काम करना बंद कर देते हैं और उसकी नकल करने लगते हैं।
  • परिणाम: टीम अपनी विविधता खो देती है।
    • उदाहरण: गणित के वर्कफ़्लो में, "इवैल्यूएटर" (जो केवल "सही" या "गलत" कहने के लिए है) लंबे, जटिल गणितीय प्रमाण लिखने लगना शुरू कर सकता है क्योंकि "जेनेरेटर" भूमिका (जो प्रमाण लिखता है) प्रशिक्षण में हावी है। इवैल्यूएटर अपना काम भूल जाता है और जेनेरेटर बनने की कोशिश करता है, जिससे पूरा वर्कफ़्लो बिगड़ जाता है।

4. मुख्य निष्कर्ष (The Big Takeaway)

शोध पत्र निष्कर्ष निकालता है कि AI टीमों को प्रशिक्षित करने के लिए कोई "एक आकार सभी के लिए उपयुक्त" (one size fits all) नियम नहीं है।

  • मल्टी-एजेंट RL आमतौर पर मदद करता है: एक टीम को एक साथ प्रशिक्षित करना आम तौर पर एक एकल AI का उपयोग करने से बेहतर होता है, लेकिन यह कोई जादुई समाधान नहीं है।
  • यह एक डिज़ाइन विकल्प है: आपको अपने विशिष्ट वर्कफ़्लो को देखना होगा।
    • यदि आपके वर्कफ़्लो में कई एजेंट एक ही चीज़ कर रहे हैं (जैसे तीन जनरेटर), तो पृथक नीति के साथ सावधान रहें क्योंकि वे एक-दूसरे की गलतियों को बढ़ा सकते हैं।
    • यदि आपके वर्कफ़्लो में बहुत अलग भूमिकाएँ हैं (जैसे एक बॉस और एक वर्कर), तो साझा नीति के साथ सावधान रहें क्योंकि "बॉस" अनजाने में "वर्कर" के मस्तिष्क को फिर से लिख सकता है।

संक्षेप में: AI टीमों को प्रशिक्षित करना एक जटिल ऑर्केस्ट्रा को प्रबंधित करने जैसा है। आप केवल सभी को एक ही वाद्य यंत्र बजाने के लिए नहीं कह सकते (साझा नीति), अन्यथा संगीत उबाऊ हो जाएगा। लेकिन यदि आप सभी को अलग-अलग वाद्य यंत्र देते हैं और उन्हें बिना समन्वय के बहुत अधिक अभ्यास करने देते हैं (पृथक नीति), तो वे एक ही समय में एक ही गलत नोट बजाना शुरू कर सकते हैं और संगीत कार्यक्रम खराब कर सकते हैं। आपको विशिष्ट कार्य (टास्क) और ऑर्केस्ट्रा के आकार (मॉडल स्केल) के आधार पर प्रशिक्षण को ट्यून करना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →