← नवीनतम पेपर
📊 statistics

Agent Q-Mix: Selecting the Right Action for LLM Multi-Agent Systems through Reinforcement Learning

एजेंट Q-Mix एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो QMIX वैल्यू फैक्टराइजेशन के माध्यम से विकेंद्रीकृत संचार टोपोलॉजी सीखकर मल्टी-एजेंट समन्वय को अनुकूलित करता है, और मौजूदा तरीकों की तुलना में विविध रीजनिंग और कोडिंग बेंचमार्क में बेहतर सटीकता, टोकन दक्षता और मजबूती प्राप्त करता है।

मूल लेखक: Eric Hanchen Jiang, Levina Li, Rui Sun, Xiao Liang, Yubei Li, Yuchen Wu, Haozheng Luo, Hengli Li, Zhi Zhang, Zhaolu Kang, Kai-Wei Chang, Ying Nian Wu

प्रकाशित 2026-04-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Eric Hanchen Jiang, Levina Li, Rui Sun, Xiao Liang, Yubei Li, Yuchen Wu, Haozheng Luo, Hengli Li, Zhi Zhang, Zhaolu Kang, Kai-Wei Chang, Ying Nian Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही कठिन पहेली को हल करने के लिए प्रतिभाशाली लेकिन महंगे जीनियसों (Large Language Models) की एक टीम है।

अतीत में, हमने उन्हें एक साथ काम करने के लिए दो मुख्य तरीके आज़माए थे:

  1. द रिजिड मैनेजर (कठोर प्रबंधक): हमने उन्हें ठीक बताया कि उन्हें कैसे बात करनी है। "आप व्यक्ति A से बात करेंगे, फिर व्यक्ति B से, फिर सब एक साथ चिल्लाएंगे।" यह सरल है, लेकिन यदि पहेली आसान है, तो वे चिल्लाने में समय बर्बाद करते हैं। यदि यह कठिन है, तो वे पर्याप्त रूप से बात नहीं कर पाते हैं।
  2. द सेंट्रलाइज्ड आर्किटेक्ट (केंद्रीकृत वास्तुकार): हमारे पास एक सुपर-स्मार्ट कंप्यूटर था जिसने उनके लिए बातचीत का नक्शा शुरू होने से पहले ही तैयार कर दिया। लेकिन यह धीमा है, और यदि टीम को वाक्य के बीच में ही अपनी योजना बदलने की आवश्यकता होती है, तो आर्किटेक्ट उतनी तेज़ी से प्रतिक्रिया नहीं दे पाता।

एजेंट Q-Mix इस टीम को चलाने का एक नया तरीका है। एक मैनेजर या आर्किटेक्ट के बजाय, हम टीम को सिखाते हैं कि "एक स्मार्ट रिवॉर्ड सिस्टम" का उपयोग करके, वास्तविक समय (real-time) में यह तय कैसे किया जाए कि कौन किससे बात करेगा।

यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:

1. मूल विचार: "डांस फ्लोर" बनाम "स्क्रिप्ट"

एक डांस फ्लोर की कल्पना करें।

  • पुराने तरीके एक कोरियोग्राफ किए गए नृत्य की तरह थे जहाँ हर कोई अपने स्टेप्स पहले से जानता है। यदि संगीत बदलता है, तो वे उसी तरह नाचते रहते हैं, जो अजीब लगता है।
  • Agent Q-Mix डांसर्स के एक समूह की तरह है जो संगीत को सुन सकते हैं और तुरंत निर्णय ले सकते हैं: "यह हिस्सा धीमा है, चलो बस जोड़ी बना लेते हैं," या "यह हिस्सा अराजक है, चलो सब हाथ पकड़कर एक घेरा बना लेते हैं!"

प्रत्येक एजेंट (जीनियस) के पास उनके द्वारा किए जा सकने वाले 6 मूव्स का एक छोटा मेनू है:

  • सोलो (Solo): "मैं इसे अकेले सुलझा लूँगा।" (पैसे/समय बचाता है)।
  • ब्रॉडकास्ट (Broadcast): "हे सबको, मेरी बात सुनो!" (बड़े विचार साझा करने के लिए अच्छा है)।
  • सिलेक्टिव क्वेरी (Selective Query): "हे तुम विशेष रूप से, तुम क्या सोचते हो?" (लक्षित मदद के लिए)।
  • डिबेट (Debate): "आइए हम इस एक व्यक्ति के साथ आगे-पीछे बहस करें।" (तथ्यों की जाँच करने के लिए अच्छा है)।
  • वेरिफाई (Verify): "मुझे तुम्हारा काम चेक करने दो।"
  • एग्रीगेट (Aggregate): "मुझे वह सब बताओ जो तुम जानते हो।"

जादू यह है कि प्रत्येक एजेंट अपने द्वारा देखे गए आधार पर अपना मूव चुनता है। परिणाम एक गतिशील "कन्वर्सेशन मैप" है जो हर सेकंड बदलता रहता है।

2. वे कैसे सीखते हैं: "वीडियो गेम कोच"

वे सही चुनाव करना कैसे सीखते हैं? हम रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) का उपयोग करते हैं, जो एक कुत्ते या वीडियो गेम के पात्र को प्रशिक्षित करने जैसा है।

  • खेल: टीम एक गणित की समस्या को हल करने या कोड लिखने का प्रयास करती है।
  • रिवॉर्ड (पुरस्कार):
    • यदि वे उत्तर सही पाते हैं: पॉइंट्स! 🌟
    • यदि वे बहुत अधिक बात करते हैं (बहुत अधिक कंप्यूटर "टोकन्स" का उपयोग करते हैं): पॉइंट्स काटे जाएंगे! 💸
  • कोच (QMIX): यह विशेष एल्गोरिदम है। यह पूरी टीम को खेलते हुए देखता है। यह केवल पूरे समूह को "अच्छा काम किया" नहीं कहता; यह पता लगाता है कि किस विशिष्ट एजेंट के किस विशिष्ट मूव ने जीत की ओर ले जाने में मदद की।

कोच उन्हें सिखाता है: "जब समस्या कठिन हो, तो 'ब्रॉडकास्ट' एक अच्छा मूव है। जब समस्या आसान हो, तो 'सोलो' बेहतर है क्योंकि यह पैसा बचाता है।"

3. सीक्रेट सॉस: "सेंट्रलाइज्ड ट्रेनिंग, डिसेंट्रलाइज्ड एक्जीक्यूशन"

यह एक सरल अवधारणा के लिए एक फैंसी शब्द है: साथ मिलकर अभ्यास करें, अकेले खेलें।

  • ट्रेनिंग (द डोजो): कोच के पास पूरी टीम का एक सुपर-पावरफुल दृश्य होता है। वह सब कुछ देखता है। वह एजेंटों को एक साथ काम करना सिखाता है, यह समझते हुए कि यदि एजेंट A, एजेंट B से बात करता है, तो यह एजेंट C की मदद करता है।
  • एक्जीक्यूशन (द रियल गेम): जब वास्तविक कार्य शुरू होता है, तो कोच पीछे हट जाता है। प्रत्येक एजेंट केवल अपनी स्क्रीन और अपने इतिहास को देखता है। वह तुरंत अपना निर्णय लेता है। क्योंकि उन्हें एक साथ इतनी अच्छी तरह से प्रशिक्षित किया गया था, उन्हें यह बताने के लिए किसी मैनेजर की आवश्यकता नहीं है कि उन्हें क्या करना है; वे बस जानते हैं कि उन्हें क्या करना है।

4. यह क्यों बेहतर है?

पेपर ने सात अलग-अलग प्रकार की चुनौतियों (कोडिंग, गणित, तर्क) पर इसका परीक्षण किया। यहाँ क्या हुआ:

  • यह स्मार्ट है: कठिन गणित समस्याओं पर, टीम स्वाभाविक रूप से एक "घेरे" में बदल गई जहाँ हर कोई काम को दोबारा जाँचने के लिए एक-दूसरे से बात करता है।
  • यह सस्ता है: आसान कोडिंग समस्याओं पर, टीम ने महसूस किया, "हे, हमें बात करने की ज़रूरत नहीं है!" और उन्होंने बस अकेले काम किया, जिससे कंप्यूटर के पैसे (टोकन्स) की भारी बचत हुई।
  • यह मजबूत है: पेपर में परीक्षण किया गया कि क्या होता है यदि एक एजेंट "बुरा" या बस काम में खराब है। क्योंकि यह सिस्टम लचीला है, अन्य एजेंटों ने बुरे एजेंट को अनदेखा करना और इसके बजाय एक-दूसरे से बात करना सीख लिया। पुराने कठोर सिस्टम विफल हो जाते क्योंकि उन्हें मजबूरन उस बुरे एजेंट को सुनना पड़ता।

निचोड़ (The Bottom Line)

Agent Q-Mix उन जीनियसों की एक टीम को संचार उपकरण और एक रिवॉर्ड सिस्टम देने जैसा है जो उन्हें सिखाता है कि कब बात करनी है, किससे बात करनी है, और कब चुप रहना है।

उन्हें एक कठोर संरचना में मजबूर करने के बजाय, यह उन्हें उस विशिष्ट समस्या के लिए एकदम सही बातचीत का प्रवाह बनाने की अनुमति देता है जिसे वे हल कर रहे हैं, जिससे वे तेज़, सस्ते और बहुत अधिक कठिन हो जाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →