← नवीनतम पेपर
🤖 AI

MARFT: Multi-Agent Reinforcement Fine-Tuning

यह शोधपत्र मल्टी-एजेंट रिइन्फोर्समेंट फाइन-ट्यूनिंग (MARFT) प्रस्तुत करता है, जो एक व्यापक ढांचा है जिसमें फ्लेक्स-एमजी (Flex-MG) नामक एक नया मार्कोव गेम फॉर्मूलेशन और एक सार्वभौमिक एल्गोरिद्मिक दृष्टिकोण शामिल है, जिसे लार्ज लैंग्वेज मॉडल-आधारित मल्टी-एजेंट सिस्टम पर रिइन्फोर्समेंट लर्निंग लागू करने की अनूठी चुनौतियों से निपटने के लिए डिज़ाइन किया गया है।

मूल लेखक: Junwei Liao, Muning Wen, Jun Wang, Weinan Zhang

प्रकाशित 2026-06-02
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junwei Liao, Muning Wen, Jun Wang, Weinan Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "MARFT: Multi-Agent Reinforcement Fine-Tuning" पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ हिंदी अनुवाद दिया गया है।

मुख्य विचार: AI विशेषज्ञों की एक टीम को मिलकर काम करना सिखाना

कल्पना कीजिए कि आपके पास बुद्धिमान रोबोटों (Large Language Models, या LLMs) की एक टीम है जो बात करने और लिखने में बहुत माहिर हैं। व्यक्तिगत रूप से, वे स्मार्ट हैं। लेकिन जब आप उन्हें मिलकर एक जटिल समस्या हल करने के लिए कहते हैं—जैसे यात्रा की योजना बनाना, एक जटिल कंप्यूटर प्रोग्राम लिखना, या वैज्ञानिक अनुसंधान करना—तो वे अक्सर संघर्ष करते हैं। वे एक-दूसरे की बातों को काट सकते हैं, भूल सकते हैं कि किसे क्या करना है, या लक्ष्य को लेकर भ्रमित हो सकते हैं।

यह पेपर एक नई प्रशिक्षण विधि पेश करता है जिसे MARFT (Multi-Agent Reinforcement Fine-Tuning) कहा जाता है। MARFT को एक विशेष "टीम कोचिंग" प्रणाली के रूप में समझें जिसे इन AI एजेंटों को उनकी व्यक्तिगत बुद्धिमत्ता खोए बिना प्रभावी ढंग से सहयोग करना सिखाने के लिए डिज़ाइन किया गया है।

समस्या: पुराने तरीके क्यों विफल होते हैं

लेखक बताते हैं कि हम इन नई AI टीमों पर रोबोट टीमों को प्रशिक्षित करने के पुराने नियमों (जिसे Multi-Agent Reinforcement Learning, या MARL कहा जाता है) का उपयोग नहीं कर सकते। इसके कारण यहाँ दिए गए हैं:

  1. "एक साथ" बनाम "क्रमवार" का अंतर (The "Simultaneous" vs. "Sequential" Mismatch):

    • पुराना तरीका: पारंपरिक प्रशिक्षण यह मानता है कि हर कोई बिल्कुल एक ही समय में कार्य करता है, जैसे एक फुटबॉल टीम एक साथ गेंद को किक करती है।
    • वास्तविक जीवन: AI एजेंट आमतौर पर एक क्रम (sequence) में काम करते हैं। एक एजेंट कह सकता है, "मुझे तारीख की आवश्यकता है," और अगला एजेंट यह सुनने के बाद ही कहता है, "ठीक है, मैं फ्लाइट बुक कर दूँगा।"
    • समाधान: MARFT टीम को एक रिले रेस या बातचीत की तरह मानता है जहाँ एक व्यक्ति बोलता है, फिर दूसरा, न कि हर कोई एक साथ चिल्लाता है।
  2. "पहचान का संकट" (The "Identity Crisis"):

    • पुराना तरीका: पारंपरिक प्रशिक्षण में, एजेंट अक्सर जुड़वा भाई-बहनों की तरह समान होते हैं।
    • वास्तविक जीवन: एक वास्तविक AI टीम में, एक एजेंट "प्लानर" (Planner) है, एक "कोडर" (Coder) है, और एक "चेकर" (Checker) है। उनके अलग-अलग काम और अलग-अलग "व्यक्तित्व" (prompts) होते हैं।
    • समाधान: MARFT सिस्टम को इन विशिष्ट भूमिकाओं का सम्मान करना सिखाता है। यह सुनिश्चित करता है कि "कोडर" "प्लानर" की तरह व्यवहार करने की कोशिश न करे।
  3. "भूलने" का जोखिम (The "Forgetting" Risk):

    • पुराना तरीका: यदि आप किसी रोबोट को गेम जीतने के लिए बहुत अधिक प्रशिक्षित करते हैं, तो वह मानव भाषा बोलना भूल सकता है।
    • वास्तविक जीवन: हम चाहते हैं कि ये AI एजेंट अपने मूल भाषा कौशल या संदर्भ को समझे बिना कार्यों को हल करने में बेहतर बनें।
    • समाधान: MARFT एक "फाइन-ट्यूनिंग" (Fine-Tuning) विधि है। यह एक भारी बदलाव के बजाय एक कोमल धक्के (gentle nudge) की तरह है। यह उनके टीम वर्क में सुधार करता है जबकि उनके मूल भाषाई कौशल को बरकरार रखता है।

समाधान: MARFT कैसे काम करता है

पेपर एक नया ढांचा प्रस्तावित करता है जिसे Flex-MG (Flexible Markov Game) कहा जाता है। यह कैसे काम करता है, इसे सरल शब्दों में यहाँ दिया गया है:

  • "डिपेंडेंसी मैप" (The "Dependency Map"): एक फ्लोचार्ट की कल्पना करें। MARFT एक ऐसा मैप बनाता है जो कहता है, "एजेंट B तब तक कार्य नहीं कर सकता जब तक एजेंट A समाप्त न कर दे।" यह इस तथ्य को संभालता है कि AI एजेंट अक्सर एक-दूसरे के आउटपुट पर निर्भर होते हैं।
  • "कोच" (The "Coach" - Central Critic): MARFT एक केंद्रीय "कोच" (एक न्यूरल नेटवर्क) का उपयोग करता है जो पूरी टीम को देखता है। केवल एक एजेंट को अपना काम अच्छी तरह करने के लिए प्रशंसा करने के बजाय, कोच उस एजेंट को प्रशंसा देता है जो पूरी टीम को जीतने में मदद करता है।
  • टोकन-लेवल ट्रेनिंग (Token-Level Training): केवल अंतिम उत्तर (जैसे "क्या फ्लाइट बुक हो गई?") देने के बजाय, MARFT एजेंटों द्वारा उत्पन्न प्रत्येक शब्द (टोकन) को देखता है। यह एक शिक्षक की तरह है जो छात्र के निबंध को केवल अंतिम ग्रेड के बजाय वाक्य-दर-वाक्य ग्रेड करता है। यह एजेंटों को यह सीखने में मदद करता है कि क्या कहना है, न कि केवल कैसे सोचना है।

प्रयोग: क्या यह वास्तव में काम करता है?

लेखकों ने दो कठिन कार्यों पर इस पद्धति का परीक्षण किया: गणित (Math) और कोडिंग (Coding)

  • सेटअप: उन्होंने AI एजेंटों की टीमें (2, 3, या 4 एजेंट) बनाईं जिनके अलग-अलग रोल थे (जैसे प्लानर, सॉल्वर, वेरीफायर)।
  • तुलना: उन्होंने MARFT की तुलना मानक पद्धति (Independent PPO) से की, जहाँ एजेंटों को अलग-अलग प्रशिक्षित किया जाता है और फिर एक साथ लाया जाता है।
  • परिणाम:
    • बेहतर स्कोर: MARFT टीमें मानक टीमों की तुलना में गणित और कोडिंग बेंचमार्क पर लगातार उच्च स्कोर करती हैं।
    • स्थिरता (Stability): मानक पद्धति प्रशिक्षण के दौरान कभी-कभी क्रैश हो जाती थी या भ्रमित हो जाती थी। MARFT ने लगातार और सुचारू रूप से सुधार किया।
    • "गुमनाम" आश्चर्य (The "Anonymous" Surprise): एक दिलचस्प प्रयोग में, उन्होंने टीमों को विशिष्ट जॉब टाइटल (जैसे प्लानर या सॉल्वर) दिए बिना प्रशिक्षित करने की कोशिश की। आश्चर्यजनक रूप से, गुमनाम टीमों ने अपनी भूमिकाएँ खुद समझने में सफलता पाई और कुछ मामलों में पूर्व-निर्धारित टीमों से भी बेहतर प्रदर्शन किया। यह सुझाव देता है कि MARFT इतना लचीला है कि यह AI को अपना संगठन खुद बनाने दे सकता है।

"Flex-MG" की अवधारणा

पेपर एक नया गणितीय मॉडल पेश करता है जिसे Flex-MG कहा जाता है। इसे एक बोर्ड गेम के नए नियम पुस्तिका के रूप में समझें।

  • पुराने नियम पुस्तिका में, हर कोई एक साथ चलता है।
  • Flex-MG नियम पुस्तिका में, खेल खेलते समय बदलता रहता है। कभी आप अकेले चलते हैं; कभी आपको अपने साथी का इंतज़ार करना पड़ता है। कभी पिछले टर्न में जो हुआ उसके आधार पर नियम बदल जाते हैं। यह नियम पुस्तिका विशेष रूप से वास्तविक AI टीमों के अस्त-व्यस्त और गतिशील तरीके के लिए डिज़ाइन की गई है।

आगे क्या है? (चुनौतियां)

लेखक स्वीकार करते हैं कि हालांकि MARFT एक बड़ा कदम है, फिर भी कुछ बाधाएं हैं:

  • अभ्यास के मैदान ढूंढना कठिन है: ऐसे यथार्थवादी, गतिशील वातावरण (जैसे सिम्युलेटेड शहर या जटिल कार्यालय) बनाना कठिन है जहाँ ये AI टीमें अभ्यास कर सकें।
  • डेटा की भूख: सभी AI प्रशिक्षण की तरह, इसे सीखने के लिए बहुत सारे उच्च-गुणवत्ता वाले उदाहरणों की आवश्यकता होती है।
  • कोई मानक टूल नहीं: अभी तक ऐसा कोई एकल, आसानी से उपयोग किया जाने वाला "टूलबॉक्स" नहीं है जो इन सभी विशेषताओं को मिलाकर सभी के लिए उपयोग के लिए उपलब्ध करा सके।

सारांश

संक्षेप में, MARFT AI एजेंटों की टीमों को प्रशिक्षित करने का एक नया तरीका है। उन्हें एक साथ चलने वाले समान रोबोटों के रूप में देखने के बजाय, यह उन्हें एक क्रम में काम करने वाले विविध मानव विशेषज्ञों के समूह के रूप में मानता है। यह उन्हें मार्गदर्शन देने के लिए एक "कोच" का उपयोग करता है, उनकी विशिष्ट भूमिकाओं का सम्मान करता है, और यह सुनिश्चित करता है कि वे मानव भाषा बोलना भूले बिना टीम वर्क में बेहतर बनें। परिणाम दर्शाते हैं कि यह विधि AI टीमों को गणित और कोडिंग जैसी जटिल समस्याओं को हल करने के लिए स्मार्ट, स्थिर और बेहतर बनाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →