← नवीनतम पेपर
🤖 machine learning

Stronger-MAS: Multi-Agent Reinforcement Learning for Collaborative LLMs

यह शोध पत्र AT-GRPO का प्रस्ताव करता है, जो एक नवीन मल्टी-एजेंट सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) ढांचा है जो सहयोगी LLMs में मानक ऑन-पॉलिसी RL की सीमाओं को दूर करने के लिए एक एजेंट- और टर्न-वार ग्रुप्ड ऑप्टिमाइज़ेशन एल्गोरिदम और एक लचीली प्रशिक्षण प्रणाली पेश करता है, जिससे प्लानिंग, कोडिंग और गणित संबंधी कार्यों में पर्याप्त प्रदर्शन लाभ प्राप्त होता है।

मूल लेखक: Yujie Zhao, Lanxiang Hu, Yang Wang, Minmin Hou, Hao Zhang, Ke Ding, Jishen Zhao

प्रकाशित 2026-02-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yujie Zhao, Lanxiang Hu, Yang Wang, Minmin Hou, Hao Zhang, Ke Ding, Jishen Zhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करके पेपर STRONGER-MAS की व्याख्या दी गई है।

मुख्य विचार: एक टीम को मिलकर काम करना सिखाना

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान लेकिन थोड़ा अनाड़ी रोबोट (एक लार्ज लैंग्वेज मॉडल, या LLM) है। आप चाहते हैं कि यह जटिल पहेलियाँ सुलझाए, कोड लिखे, या गेम खेले।

लोग आमतौर पर इस रोबोट को बेहतर बनाने के लिए दो मुख्य तरीकों का उपयोग करते हैं:

  1. "विशेषज्ञ" टीम (Multi-Agent System): आप रोबोट को दोस्तों की एक टीम देते हैं। एक दोस्त "कोडर" (Coder) है, दूसरा "टेस्टर" (Tester) है, और तीसरा "प्लानर" (Planner) है। वे समस्या को हल करने के लिए एक-दूसरे से बात करते हैं। यह अच्छा काम करता है क्योंकि उनके पास विशिष्ट कार्य होते हैं।
  2. "अभ्यास ही पूर्णता लाता है" विधि (Reinforcement Learning): आप रोबोट को कोशिश करने, असफल होने, स्कोर प्राप्त करने और फिर से प्रयास करने देते हैं। समय के साथ, वह अपने काम में माहिर बनने के लिए अपनी गलतियों से सीखता है।

समस्या: अब तक, ये दोनों तरीके आपस में अच्छी तरह मेल नहीं खाते थे।

  • यदि आप "अभ्यास" विधि का उपयोग करके पूरी टीम को सिखाने की कोशिश करते हैं, तो प्रशिक्षण अस्त-व्यस्त हो जाता है। "कोडर" और "टेस्टर" एक-दूसरे से बात कर रहे हैं, इसलिए उनके प्रॉम्प्ट्स (निर्देश) लगातार बदल रहे हैं। मानक प्रशिक्षण विधियाँ भ्रमित हो जाती हैं क्योंकि वे उम्मीद करती हैं कि हर कोई एक ही समय में बिल्कुल एक ही प्रश्न का उत्तर दे रहा हो।
  • यदि आप उन्हें केवल अकेले अभ्यास करने देते हैं, तो वे प्रभावी ढंग से सहयोग करना नहीं सीख पाते हैं।

समाधान: लेखकों ने STRONGER-MAS बनाया है (विशेष रूप से एक एल्गोरिदम जिसे AT-GRPO कहा जाता है)। इसे एक नए, सुपर-स्मार्ट कोच के रूप में समझें जो विशेषज्ञों की एक पूरी टीम को एक साथ प्रशिक्षित करना जानता है।


यह कैसे काम करता है: "पेड़" (Tree) की उपमा

1. पुराना तरीका (Parallel Sampling)

कल्पना कीजिए कि एक कोच 4 अलग-अलग छात्रों से गणित की समस्या हल करने के लिए कहता है।

  • छात्र A एक समाधान लिखता है।
  • छात्र B एक समाधान लिखता है।
  • छात्र C एक समाधान लिखता है।
  • छात्र D एक समाधान लिखता है।

कोच उन सभी चार उत्तरों को देखता है और कहता है, "ठीक है, छात्र A ने सबसे अच्छा किया।"
दोष: एक टीम सेटिंग में, अगला कदम केवल "समस्या को फिर से हल करना" नहीं है। अगला कदम यह है: "छात्र A, यहाँ छात्र B ने क्या लिखा है; अब अपना उत्तर ठीक करें।" हर बार संदर्भ (context) बदल जाता है। यदि आप उन्हें केवल मूल समस्या को फिर से हल करने के लिए कहते हैं, तो आप उन्हें एक साथ काम करना नहीं सिखा रहे हैं।

2. नया तरीका (Tree-Structured Sampling)

STRONGER-MAS कोच एक पेड़ (Tree) दृष्टिकोण का उपयोग करता है।

  • चरण 1: टीम एक समस्या के साथ शुरू करती है।
  • चरण 2: "कोडर" कोड लिखने के 4 अलग-अलग तरीके आज़माता है। कोच तुरंत उन सभी 4 को ग्रेड देता है।
  • चरण 3: कोच उन 4 में से सबसे अच्छे कोड को चुनता है।
  • चरण 4: अब, "टेस्टर" उस विशिष्ट सर्वश्रेष्ठ कोड को देखता है और उसे टेस्ट करने के 4 अलग-अलग तरीके आज़माता है। कोच उन 4 को ग्रेड देता है।
  • चरण 5: कोच सबसे अच्छा टेस्ट चुनता है, और चक्र जारी रहता है।

यह क्यों मायने रखता है: यह सुनिश्चित करता है कि जब कोच "कोडर" के 4 प्रयासों की तुलना करता है, तो वे सभी बिल्कुल एक ही स्थिति पर प्रतिक्रिया दे रहे हों। यह सीखने की प्रक्रिया को निष्पक्ष और प्रभावी बनाता है। यह एक कोच की तरह है जो कहता है, "ठीक है, सभी लोग, इस विशिष्ट ड्राफ्ट को देखें। यहाँ 4 तरीके हैं जिनसे आप इसे सुधार सकते हैं। देखते हैं कि कौन सा सबसे अच्छा काम करता है।"


"विशेषज्ञ बनाम साझा" बहस

पेपर में दो अलग-अलग टीम संरचनाओं का भी परीक्षण किया गया:

  1. "साझा मस्तिष्क" (Role-Sharing): टीम में हर कोई एक ही मस्तिष्क (वही AI मॉडल) का उपयोग करता है। वे बस अलग-अलग निर्देश कार्ड (प्रॉम्प्ट्स) पढ़कर अलग-अलग लोग होने का नाटक करते हैं।
    • परिणाम: सरल गेम और प्लानिंग के लिए बहुत अच्छा काम करता है।
  2. "विशेषज्ञ मस्तिष्क" (Role-Specialized): "कोडर" के पास कोडिंग के लिए विशेष रूप से प्रशिक्षित मस्तिष्क है, और "टेस्टर" के पास टेस्टिंग के लिए विशेष रूप से प्रशिक्षित मस्तिष्क है। वे कभी भी अपनी भूमिकाएँ नहीं बदलते।
    • परिणाम: कोडिंग और गणित के लिए यह एक बड़ी जीत थी। "कोडर" कोड लिखने में बहुत अच्छा हो गया क्योंकि उसने केवल कोडिंग का अभ्यास किया, और "टेस्टर" बग खोजने में माहिर हो गया।

निष्कर्ष: पेपर ने पाया कि आपको हर काम के लिए हमेशा एक विशेषज्ञ मस्तिष्क की आवश्यकता नहीं होती है। कुछ कार्यों के लिए (जैसे सरल गेम), एक स्मार्ट मस्तिष्क जो सभी द्वारा साझा किया जाता है, पर्याप्त है। लेकिन कठिन कार्यों के लिए (जैसे जटिल सॉफ़्टवेयर लिखना), प्रत्येक भूमिका के लिए एक समर्पित विशेषज्ञ होना बहुत बेहतर है।


परिणाम: "ठीक" से "सुपरह्यूमन" तक

इस सिस्टम का परीक्षण चार प्रकार के कार्यों पर किया गया: गेम्स, प्लानिंग, कोडिंग और मैथ।

  • लॉन्ग-होरिज़न प्लानिंग (बड़ी जीत): कल्पना कीजिए कि एक गेम है जहाँ आपको 10 कदम आगे की योजना बनानी है।

    • पहले: एक अकेला रोबोट जो यह करने की कोशिश कर रहा था, वह केवल 14% से 47% बार सही होता था। वह आसानी से भटक जाता था।
    • बाद में: STRONGER-MAS टीम के साथ, वे इसे 96% से 99.5% बार सही करते हैं।
    • उपमा: यह एक मुड़े हुए नक्शे के साथ भटकते हुए पर्यटक से एक गाइडेड टूर ग्रुप में जाने जैसा है जहाँ हर कोई जानता है कि कहाँ जाना है।
  • कोडिंग और मैथ: टीम बग-फ्री कोड लिखने और कठिन गणित की समस्याओं को हल करने में भी काफी बेहतर हुई (पिछले सर्वोत्तम तरीकों से लगभग 4% से 18% का सुधार)।

सारांश

यह पेपर AI टीमों को प्रशिक्षित करने का एक नया तरीका पेश करता है। उन्हें व्यक्तिगत रूप से या एक भ्रमित समूह के रूप में प्रशिक्षित करने के बजाय, वे एक Tree-Structured पद्धति का उपयोग करते हैं जो टीम की बातचीत को केंद्रित और निष्पक्ष रखती है। यह उन्हें सहयोग करना सीखने की अनुमति देता है, जिसके परिणामस्वरूप रूट प्लानिंग, सॉफ़्टवेयर लिखने और गणितीय पहेलियों को हल करने जैसी जटिल, बहु-चरणीय समस्याओं को हल करने में भारी सुधार होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →