← नवीनतम पेपर
💬 NLP

MARS: Co-evolving Dual-System Deep Research via Multi-Agent Reinforcement Learning

यह शोध पत्र MARS को प्रस्तुत करता है, जो एक नवीन मल्टी-एजेंट सुदृढीकरण शिक्षण (multi-agent reinforcement learning) ढांचा है जो लार्ज रीजनिंग मॉडल्स की टोकन अक्षमता और ज्ञान संबंधी सीमाओं को दूर करने के लिए दोहरी संज्ञानात्मक प्रणालियों (त्वरित अंतर्ज्ञान और विचारशील तर्क) को सह-विकसित करता है, जिससे बिना सुपरवाइज्ड फाइन-ट्यूनिंग के ज्ञान-गहन कार्यों पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Guoxin Chen, Zile Qiao, Wenqing Wang, Donglei Yu, Xuanzhong Chen, Hao Sun, Minpeng Liao, Kai Fan, Yong Jiang, Penguin Xie, Wayne Xin Zhao, Ruihua Song, Fei Huang

प्रकाशित 2026-02-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guoxin Chen, Zile Qiao, Wenqing Wang, Donglei Yu, Xuanzhong Chen, Hao Sun, Minpeng Liao, Kai Fan, Yong Jiang, Penguin Xie, Wayne Xin Zhao, Ruihua Song, Fei Huang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ MARS पेपर का विवरण है, जिसे रोज़मर्रा की भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवादित किया गया है।

बड़ी समस्या: "ज़्यादा सोचने वाला" और "पुराना हो चुका" पुस्तकालय

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, सुपर-स्मार्ट सहायक (एक AI) है जो कठिन पहेलियों को सुलझाने में माहिर है। हालाँकि, इस सहायक में दो बड़ी कमियाँ हैं:

  1. ज़्यादा सोचने वाला (The Over-Thinker): जब आप उनसे कोई साधारण समाचार लेख पढ़ने या वेबपेज का सारांश बनाने के लिए कहते हैं, तो वे कभी-कभी "गहन विचार" मोड में फंस जाते हैं। वे हर एक शब्द का विश्लेषण करने लगते हैं, जिससे उन चीज़ों पर समय और ऊर्जा बर्बाद होती है जिन्हें गहरे विश्लेषण की आवश्यकता नहीं होती। यह अखरोट तोड़ने के लिए हथौड़े का उपयोग करने जैसा है।
  2. पुराना हो चुका पुस्तकालय (The Out-of-Date Library): इस सहायक का ज्ञान उस दिन तक सीमित है जिस दिन उसे प्रशिक्षित (train) किया गया था। यदि आप उनसे कल हुई किसी घटना के बारे में पूछते हैं, तो वे पूरी तरह अनभिज्ञ होते हैं। वे नई जानकारी के भारी ढेर से भ्रमित हुए बिना अपने आप जानकारी नहीं खोज सकते।

समाधान: MARS (दो-मस्तिष्क वाली टीम)

शोधकर्ताओं ने MARS नामक एक नया सिस्टम बनाया है। एक ही AI के भीतर एक मस्तिष्क द्वारा सब कुछ करने के बजाय, उन्होंने दो अलग-अलग "व्यक्तित्वों" की एक टीम बनाई है, जो मानव मस्तिष्क के काम करने के तरीके से प्रेरित है:

  • सिस्टम 1 (तेज़ स्काउट - The Fast Scout): यह "सहज" (intuitive) मस्तिष्क है। यह तेज़, कुशल और स्कैन करने में माहिर है। इसका काम सूचना के पहाड़ (जैसे 10 अलग-अलग वेब पेज या रिसर्च पेपर) को देखना और तेज़ी से केवल सबसे महत्वपूर्ण तथ्यों को बाहर निकालना है। यह एक ऐसे स्काउट की तरह है जो आगे दौड़कर जाता है, उपयोगी सामान इकट्ठा करता है, और बेकार चीज़ों को पीछे छोड़ देता है।
  • सिस्टम 2 (गहन विचारक - The Deep Thinker): यह "विचारशील" मस्तिष्क है। यह धीमा, सावधान और जटिल तर्क पहेलियों को सुलझाने में माहिर है। यह सिस्टम 1 से प्राप्त साफ और निचोड़े हुए तथ्यों को लेता है और वास्तविक समस्या को हल करने के लिए उनका उपयोग करता है।

जादुई ट्रिक:
पिछले सिस्टमों में, "स्काउट" और "थिंकर" को अलग-अलग प्रशिक्षित किया जाता था। स्काउट को यह नहीं पता होता था कि थिंकर को क्या चाहिए, इसलिए वह ऐसी चीज़ों का सारांश बना सकता था जिनकी थिंकर को ज़रूरत नहीं थी, या उन विवरणों को छोड़ सकता था जिनकी थिंकर को सख्त ज़रूरत थी।

MARS में, वे सह-विकसित (co-evolve) होते हैं। वे एक साथ प्रशिक्षण लेते हैं। स्काउट ठीक से सीखता है कि किस प्रकार की जानकारी थिंकर को पहेली सुलझाने में मदद करती है, और थिंकर सीखता है कि सही चीज़ों के लिए स्काउट से कैसे मांगना है। वे एक ही "स्कोर" (रिवॉर्ड) साझा करते हैं, इसलिए वे दो अजनबियों के बजाय एक आदर्श टीम के रूप में काम करते हैं।

वे कैसे प्रशिक्षित करते हैं: "ग्रुप गेम"

इन दोनों सिस्टमों को बिना किसी मानव शिक्षक के (एक विधि जिसे "Zero RL" कहा जाता है, जिसका अर्थ है कि वे बिना किसी पूर्व-लिखित उदाहरण के शुरू होते हैं) एक साथ काम करना सिखाने के लिए, शोधकर्ताओं ने Group Relative Policy Optimization (GRPO) पर आधारित एक चतुर प्रशिक्षण खेल का उपयोग किया।

इसे एक स्पोर्ट्स टीम की तरह समझें जो चैंपियनशिप के लिए अभ्यास कर रही है:

  1. टीम की बैठक (बिन-पैकिंग - Bin-Packing): जब टीम जानकारी जुटाने के लिए बाहर जाती है, तो उन्हें 10 अलग-अलग वेब पेज मिल सकते हैं। एक साथ पढ़ने के लिए यह बहुत अधिक है। सिस्टम एक "बिन-पैकिंग" रणनीति (जैसे किराने के सामान को बैग में फिट करना) का उपयोग करता है। यह इन अव्यवस्थित, अलग-अलग आकार के पेजों को व्यवस्थित और प्रबंधनीय टुकड़ों में व्यवस्थित करता है ताकि स्काउट बिना अभिभूत हुए एक ही समय में उन सभी को पढ़ सके।
  2. स्कोरबोर्ड (साझा रिवॉर्ड - Shared Rewards): टीम बाहर जाती है और एक समस्या को हल करने की कोशिश करती है। यदि वे उत्तर सही पाते हैं, तो दोनों (स्काउट और थिंकर) को एक अंक मिलता है। यदि वे विफल होते हैं, तो किसी को भी अंक नहीं मिलता। यह उन्हें सहयोग करने के लिए मजबूर करता है।
  3. निष्पक्ष खेल (डिकपल्ड ग्रेडिएंट्स - Decoupled Gradients): यहाँ पेचीदा हिस्सा है। भले ही वे एक ही स्कोर साझा करते हैं, शोधकर्ताओं ने यह सुनिश्चित किया कि स्काउट को अच्छे सारांश के लिए श्रेय मिले और थिंकर को अच्छे तर्क के लिए श्रेय मिले। यह एक रिले रेस की तरह है: यदि टीम जीतती है, तो दोनों धावकों को पदक मिलता है, लेकिन कोच जानता है कि किसने पहला भाग दौड़ा और किसने दूसरा। यह सुनिश्चित करता है कि स्काउट एक बेहतर 'स्काउट' बनना सीखे, न कि केवल एक बेहतर 'थिंकर'।
  4. टीम का संतुलन (बैलेंस्ड सैंपलिंग - Balanced Sampling): कभी-कभी स्काउट को 5 पेज पढ़ने पड़ते हैं, और कभी केवल 1। यह प्रशिक्षण डेटा में असंतुलन पैदा करता है। सिस्टम एक विशेष सैंपलिंग विधि का उपयोग करता है ताकि स्काउट और थिंकर को समान अभ्यास का समय मिले, ताकि एक दूसरे के सीखने की प्रक्रिया पर हावी न हो जाए।

परिणाम: छोटी टीम, बड़ी जीत

शोधकर्ताओं ने MARS का परीक्षण HLE (Humanity's Last Exam) नामक एक बहुत कठिन परीक्षा पर किया, जो विज्ञान, गणित और इतिहास के उन्नत विषयों को कवर करती है।

  • अंडरडॉग (The Underdog): MARS ने एक अपेक्षाकृत छोटा मॉडल (8 बिलियन पैरामीटर्स) इस्तेमाल किया।
  • दिग्गज (The Giants): उन्होंने इसकी तुलना बहुत बड़े मॉडलों (32 बिलियन या 72 बिलियन पैरामीटर्स) और बड़ी टेक कंपनियों के कुछ महंगे, प्रोप्राइटरी "सुपर-इंटेलिजेंस" मॉडलों से की।
  • परिणाम: MARS ने उन बड़े मॉडलों को भी पीछे छोड़ दिया जिन्हें मानव उदाहरणों (Supervised Fine-Tuning) के साथ प्री-ट्रेन किया गया था। इसने शून्य मानव मार्गदर्शन के साथ शुरू करने और बहुत छोटे मस्तिष्क का उपयोग करने के बावजूद, उपलब्ध सबसे उन्नत व्यावसायिक मॉडलों के प्रदर्शन के बहुत करीब पहुँच लिया।

यह क्यों महत्वपूर्ण है (पेपर के अनुसार)

पेपर का दावा है कि असली सफलता का राज सिर्फ अधिक उपकरण (जैसे सर्च इंजन या कैलकुलेटर) होना नहीं है; बल्कि यह साझेदारी है।

  • "स् स्काउट" (सिस्टम 1) के बिना, "थिंकर" (सिस्टम 2) बहुत अधिक कच्चे डेटा से अभिभूत हो जाता है और गलतियाँ करता है।
  • "थिंकर" (सिस्टम 2) के बिना, "स्काउट" केवल वास्तविक समस्या को हल किए बिना चीजों का सारांश बनाता रहता है।
  • साथ मिलकर, वे एक ऐसा सिस्टम बनाते हैं जो भारी मात्रा में ताज़ा जानकारी पढ़ सकता है और जटिल, बहु-चरणीय तर्क समस्याओं को कुशलतापूर्वक हल करने के लिए उसका उपयोग कर सकता है।

संक्षेप में, MARS एक AI को यह सिखाता है कि कब "तेज़ी से स्कैन" करना है और कब "गहराई से सोचना" है, और बिना भ्रमित हुए दोनों को एक साथ कैसे करना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →