← नवीनतम पेपर
🤖 AI

ReM-MoA: Reasoning Memory Sustains Mixture-of-Agents Scaling

यह शोध पत्र ReM-MoA को प्रस्तुत करता है, जो एक मेमोरी-ऑगमेंटेड मिक्स्चर-ऑफ-एजेंट्स फ्रेमवर्क है जो अन्वेषण विविधता (exploration diversity) को बनाए रखने और उच्च-गुणवत्ता वाले रीजनिंग ट्रेसेस को प्रसारित करने के लिए रैंक किए गए रीजनिंग मेमोरी (Ranked Reasoning Memory) और क्यूरेटेड डाइवर्सिफाइड मेमोरी रूटिंग (Curated Diversified Memory Routing) का उपयोग करके बढ़ती गहराई के साथ इन्फरेंस-टाइम स्केलिंग को बनाए रखता है।

मूल लेखक: Heng Ping, Arijit Bhattacharjee, Peiyu Zhang, Shixuan Li, Wei Yang, Ali Jannesari, Nesreen Ahmed, Paul Bogdan

प्रकाशित 2026-06-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Heng Ping, Arijit Bhattacharjee, Peiyu Zhang, Shixuan Li, Wei Yang, Ali Jannesari, Nesreen Ahmed, Paul Bogdan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही कठिन पहेली को हल करने की कोशिश कर रहे हैं, जैसे कि कोई जटिल गणितीय समस्या या कोई पेचीदा तर्क वाला सवाल। आप अपने बुद्धिमान दोस्तों (AI एजेंटों) के एक समूह से मदद लेने का निर्णय लेते हैं।

अतीत में, शोधकर्ताओं ने इन दोस्तों को व्यवस्थित करने के दो मुख्य तरीके आजमाए थे:

  1. "ग्रुप चैट" विधि: हर कोई अपने विचार चिल्लाकर बताता है, और आप सबसे अच्छे विचार को चुन लेते हैं।
  2. "लेयर्ड टीम" (परतदार टीम) विधि: आप दोस्तों को पंक्तियों (rows) में रखते हैं। पंक्ति 1 सोचती है, फिर पंक्ति 2 को अपने नोट्स सौंपती है, पंक्ति 2 उनमें सुधार करती है, फिर पंक्ति 3 को सौंपती है, और इसी तरह आगे बढ़ता जाता है।

समस्या:
शोधपत्र में पाया गया कि "लेयर्ड टीम" विधि में एक दोष है। जैसे-जैसे आप अधिक पंक्तियाँ जोड़ते हैं (टीम को गहरा बनाते हैं), उत्तरों की गुणवत्ता वास्तव में खराब हो जाती है या सुधरना बंद हो जाती है। यह "टेलीफोन गेम" की तरह है जहाँ संदेश बिगड़ जाता है, या ऐसी टीम की तरह जहाँ हर कोई बिल्कुल एक जैसा सोचने लगता है और नए विचार लाना बंद कर देता है। टीम एक ढर्रे में फंस जाती है, गलतियों को दोहराती है या एक ही औसत समाधान पर टिक जाती है।

समाधान: ReM-MoA
लेखक एक नया सिस्टम प्रस्तावित करते हैं जिसे ReM-MoA (Reasoning Memory Mixture-of-Agents) कहा जाता है। इसे एक सुपर-पावर्ड, व्यवस्थित फाइलिंग कैबिनेट और एक स्मार्ट संपादक देने के रूप में समझें।

यह इस प्रकार काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "स्मार्ट फाइलिंग कैबिनेट" (Ranked Reasoning Memory)

पुराने सिस्टमों में, जब पंक्ति 2 पंक्ति 3 को नोट्स सौंपती थी, तो वे जो कुछ भी लिखा गया था, उसे बिना सोचे-समझे डाल देते थे। इसमें उनके शानदार विचार और बेवकूफी भरी गलतियाँ, दोनों मिले हुए होते थे।

ReM-MoA में, हर पंक्ति अपना काम पूरा करने के बाद, एक स्मार्ट संपादक (जिसे रिव्यूअर एजेंट कहा जाता है) सभी नोट्सों को देखता है।

  • संपादक हर एक विचार को ग्रेड देता है, "गोल्ड स्टार" से लेकर "सुधार की आवश्यकता" तक।
  • संपादक यह समझाने के लिए एक छोटा सा नोट लिखता है कि कोई विचार क्यों अच्छा था या क्यों बुरा था।
  • इन ग्रेड किए गए नोट्स को एक विशेष कैबिनेट में सुरक्षित रखा जाता है जिसे हर भविष्य की पंक्ति देख सकती है

यह कैसे मदद करता है: अनियंत्रित नोट्स के समुद्र में डूबने के बजाय, अगली टीम के सदस्य कैबिनेट को देख सकते हैं और समझ सकते हैं, "ओह, यह विशिष्ट रास्ता बहुत अच्छा रहा," या "ओह, उस रास्ते ने एक डेड एंड (बंद रास्ता) दिखाया।" उन्हें पहिया दोबारा बनाने या वही गलतियाँ दोहराने की आवश्यकता नहीं होती।

2. "क्यूरेटेड मेनू" (Diversified Memory Routing)

यहाँ दूसरा चतुर तरीका है। यदि आप पंक्ति 3 के प्रत्येक सदस्य को कैबिनेट से एक ही तरह के "सर्वश्रेष्ठ विचार" देते, तो वे सभी एक जैसा सोचने लगते और टीम अपनी रचनात्मकता खो देती।

ReM-MoA एक क्यूरेटेड मेनू प्रणाली का उपयोग करता है:

  • एजेंट A को एक मेनू दिया जाता है जिसमें ज्यादातर "गोल्ड स्टार" विचार होते हैं (उन्हें यह दिखाने के लिए कि सफलता कैसी दिखती है)।
  • एजेंट B को एक मेनू दिया जाता है जिसमें ज्यादातर "सुधार की आवश्यकता" वाले विचार होते हैं (उन्हें यह दिखाने के लिए कि किन गलतियों से बचना है)।
  • एजेंट C को दोनों का मिश्रण दिया जाता है (सफलता और विफलता की तुलना करने के लिए)।

यह कैसे मदद करता है: यह टीम को विविध बनाए रखता है। भले ही वे सभी एक ही कैबिनेट को देख रहे हों, लेकिन उन्हें अलग-अलग दृष्टिकोण दिया जाता है। यह पूरे समूह को एक ही, दोहराव वाले तरीके से सोचने से रोकता है।

3. "सुपर-एडिटर" (वैकल्पिक डिस्टिलेशन)

शोधपत्र में उल्लेख है कि "स्मार्ट संपादक" को और भी बेहतर बनाया जा सकता है। वे एक सुपर-स्मार्ट AI (जैसे कि एक जीनियस प्रोफेसर) को ले सकते हैं और एक छोटे, तेज़ AI को ठीक उसी तरह नोट्स को ग्रेड करना सिखा सकते हैं जैसे वह प्रोफेसर करेगा। इससे ग्रेडिंग और भी सटीक हो जाती है, जिससे टीम को विभिन्न प्रकार की पहेलियों (गणित, कोड, तर्क आदि) में बेहतर प्रदर्शन करने में मदद मिलती है।

परिणाम

शोधकर्ताओं ने पाँच अलग-अलग प्रकार की कठिन पहेलियों (गणित, तर्क, कोडिंग, सामान्य ज्ञान और सामान्य समझ) पर इस प्रणाली का परीक्षण किया।

  • पुराने सिस्टम: जैसे-जैसे उन्होंने अधिक परतें (पंक्तियाँ) जोड़ीं, प्रदर्शन गिर गया, स्थिर हो गया या सुधरना बंद हो गया।
  • ReM-MoA: जैसे-जैसे उन्होंने अधिक परतें जोड़ीं, प्रदर्शन बेहतर होता गया। टीम जितनी गहरी होती गई, उत्तर उतने ही स्मार्ट होते गए।

संक्षेप में:
ReM-MoA AI टीमों की "टेलीफोन गेम" वाली समस्या को एक ग्रेड किया गया मेमोरी और यह सुनिश्चित करके ठीक करता है कि वे सभी एक ही उदाहरणों को न देखें। यह AI एजेंटों के बड़े समूहों को प्रभावी ढंग से मिलकर काम करने की अनुमति देता है, जिससे वे भ्रमित होने या फंसने के बजाय, जितना गहरा उतरेंगे, उतने ही स्मार्ट बनते जाएंगे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →