← नवीनतम पेपर
💻 computer science

Collaborative Multi-Agent Optimization for Personalized Memory System

यह शोध पत्र CoMAM का प्रस्ताव करता है, जो एक सहयोगात्मक सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) ढांचा है जो मल्टी-एजेंट इंटरैक्शन को एक अनुक्रमिक मार्कोव निर्णय प्रक्रिया के रूप में मॉडल करके और व्यक्तिगत एजेंट सुधारों को समग्र प्रणाली प्रभावकारिता के साथ संरेखित करने के लिए स्थानीय कार्य पुरस्कारों को वैश्विक प्रदर्शन मेट्रिक्स के साथ एकीकृत करके व्यक्तिगत स्मृति प्रणालियों को अनुकूलित करता है।

मूल लेखक: Wenyu Mao, Haoyang Liu, Zhao Liu, Haosong Tan, Yaorui Shi, Jiancan Wu, An Zhang, Xiang Wang

प्रकाशित 2026-03-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenyu Mao, Haoyang Liu, Zhao Liu, Haosong Tan, Yaorui Shi, Jiancan Wu, An Zhang, Xiang Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ पेपर "Collaborative Multi-Agent Optimization for Personalized Memory System" (CoMAM) का स्पष्टीकरण दिया गया है, जिसे सरल अवधारणाओं और रचनात्मक उपमाओं (analogies) में विभाजित किया गया है।

बड़ी तस्वीर: "अतिभारित लाइब्रेरियन" (Overwhelmed Librarian) की समस्या

कल्पना कीजिए कि आपके पास एक व्यक्तिगत AI सहायक (एक सुपर-स्मार्ट लाइब्रेरियन की तरह) है जो आपके बारे में सब कुछ जानता है। आप सालों से इस लाइब्रेरियन के साथ चैट कर रहे हैं।

  • समस्या: लाइब्रेरियन के पास एक छोटी डेस्क है (जिसे "कॉन्टेक्स्ट विंडो" कहते हैं)। वे एक समय में आपकी बातचीत के केवल कुछ पन्ने ही रख सकते हैं। यदि आप पूछते हैं, "पाँच साल पहले मेरी पसंदीदा छुट्टियाँ कौन सी थीं?", तो लाइब्रेरियन घबरा जाता है क्योंकि वह पन्ना नए कागजों के ढेर के नीचे दब गया है।
  • वर्तमान समाधान: हम लाइब्रेरियन को एक फाइलिंग कैबिनेट (एक मेमोरी सिस्टम) देते हैं। इस कैबिनेट में मदद के लिए अलग-अलग कार्यकर्ता (एजेंट्स) होते हैं:
    1. द स्क्राइब (लेखक): आपकी चैट के कच्चे विवरणों को लिखता है।
    2. द समराइज़र (सारांशकर्ता): स्क्राइब के नोट्स पढ़ता है और एक "यूजर प्रोफाइल" लिखता है (जैसे, "जॉन को हाइकिंग पसंद है और तीखा खाना नापसंद है")।
    3. द सर्चर (खोजकर्ता): जब आप कोई प्रश्न पूछते हैं, तो उत्तर खोजने के लिए फाइलों को ढूँढता है।

वर्तमान प्रणालियों की खामी:
अभी, हम इन कार्यकर्ताओं को स्वतंत्र रूप से प्रशिक्षित करते हैं।

  • हम स्क्राइब से कहते हैं, "सब कुछ लिख दो! कोई विवरण छूटना नहीं चाहिए!"
  • हम सर्चर से कहते, "सटीक उत्तर जल्दी से खोजो!"

परिणाम: स्क्राइब आपके द्वारा कहे गए हर शब्द का 1,000 पन्नों का उपन्यास लिख देता है। सर्चर अभिभूत हो जाता है, वह घास के ढेर में सुई नहीं ढूँढ पाता, और आपको गलत उत्तर देता है। वे अपने काम के "विशेषज्ञ" तो हैं, लेकिन वे एक साथ काम करने में बहुत खराब हैं। यह एक ऐसे बैंड की तरह है जहाँ हर कोई अपने वाद्य यंत्र को पूरी तरह से बजा रहा है, लेकिन वे सभी अलग-अलग गाने अलग-अलग गति पर बजा रहे हैं। परिणाम शोर है, संगीत नहीं।


समाधान: CoMAM (द "कंडक्टर" अप्रोच)

लेखक CoMAM का प्रस्ताव देते हैं, जो इन कार्यकर्ताओं को प्रशिक्षित करने का एक नया तरीका है ताकि वे एकल विशेषज्ञों के संग्रह के बजाय एक सहयोगी टीम की तरह कार्य करें।

CoMAM को एक ऑर्केस्ट्रा के कंडक्टर के रूप में सोचें। प्रत्येक संगीतकार को अकेले अभ्यास करने देने के बजाय, कंडक्टर उन्हें एक साथ रिहर्सल करवाता है, जिससे वे सुनते हैं कि एक व्यक्ति के बजाने से दूसरे पर क्या प्रभाव पड़ता है।

यहाँ बताया गया है कि CoMAM कैसे काम करता है, तीन सरल चरणों का उपयोग करके:

1. "असेंबली लाइन" (MDP रेगुलराइजेशन)

पुराने तरीके में, स्क्राइब, समराइज़र और सर्चर अलग-थलग काम करते थे।
CoMAM में, उन्हें एक क्रमिक असेंबली लाइन पर काम करने के लिए मजबूर किया जाता है।

  • चरण 1: स्क्राइब एक नोट लिखता है।
  • चरण 2: समराइज़र तुरंत उस नोट को पढ़ता है और एक प्रोफाइल बनाता है।
  • चरण 3: सर्चर प्रश्न का उत्तर देने के लिए तुरंत उस प्रोफाइल का उपयोग करता है।

सिस्टम इस पूरी श्रृंखला को एक निरंतर कहानी के रूप में मानता है। यदि स्क्राइब बहुत अधिक कचरा लिखता है, तो समराइज़र भ्रमित हो जाता है, और सर्चर विफल हो जाता है। सिस्टम सीखता है कि पहले व्यक्ति द्वारा किया गया कार्य सीधे तौर पर अंतिम व्यक्ति की सफलता को प्रभावित करता है।

2. "टीम स्कोर" बनाम "व्यक्तिगत स्कोर" (लोकल बनाम ग्लोबल रिवॉर्ड्स)

  • पुराना तरीका: स्क्राइब को 1,000 पन्ने लिखने के लिए गोल्ड स्टार मिलता है (लोकल रिवॉर्ड)। सर्चर को तेजी से फाइल खोजने के लिए गोल्ड स्टार मिलता है (लोकल रिवॉर्ड)। लेकिन टीम को गलत उत्तर देने के लिए फेलिंग ग्रेड मिलता है।
  • CoMAM का तरीका:
    • लोकल रिवॉर्ड: "क्या आपने अपना विशिष्ट काम अच्छी तरह से किया?" (जैसे, क्या स्क्राइब ने तथ्यों को कैप्चर किया?)
    • ग्लोबल रिवॉर्ड: "क्या पूरी टीम ने उपयोगकर्ता के लिए सही उत्तर प्राप्त किया?"

CoMAM समझता है कि स्क्राइब के लिए गोल्ड स्टार बेकार है यदि वह सर्चर के काम को बिगाड़ देता है।

3. "उचित वेतन" (एडैप्टिव क्रेडिट असाइनमेंट)

यही जादू का मंत्र है। जब टीम को "ग्लोबल रिवॉर्ड" (एक सही उत्तर) मिलता है, तो श्रेय को कैसे विभाजित किया जाए?

  • पुराना तरीका: श्रेय को समान रूप से विभाजित करना। "आप सभी को 33%।" यह अनुचित है। हो सकता है कि स्क्राइब ने बहुत अच्छा काम किया हो, लेकिन सर्चर आलसी था। या शायद स्क्राइब ने कचरा लिखा, लेकिन सर्चर एक जीनियस था।
  • CoMAM का तरीका: यह एक स्मार्ट कैलकुलेटर का उपयोग करता है यह देखने के लिए कि वास्तव में किसने सबसे अधिक मदद की।
    • यह पूछता है: "जब स्क्राइब ने अच्छा किया, तो क्या टीम का स्कोर बढ़ा?"
    • यह पूछता है: "जब समराइज़र ने अच्छा किया, तो क्या टीम का स्कोर बढ़ा?"
    • यह उस कार्यकर्ता को अधिक श्रेय (और प्रशिक्षण इनाम) देता जिसका प्रदर्शन वास्तव में टीम की सफलता के साथ सह-संबंधित (correlate) था।

यदि स्क्राइब एक सटीक सारांश लिखता है जो सर्चर को जीतने में मदद करता है, तो स्क्राइब को भारी बोनस मिलता है। यदि स्क्राइब ऐसा कचरा लिखता है जो सर्चर को भ्रमित कर देता है, तो स्क्राइब को छोटा बोनस मिलता है, भले ही उन्होंने "कड़ी मेहनत" की हो।


यह क्यों महत्वपूर्ण है (परिणाम)

पेपर ने इसका परीक्षण लंबे संवादों (10 लाख शब्दों तक!) के एक विशाल डेटासेट पर किया।

  • परिणाम: CoMAM टीम (ऑर्केस्ट्रा जो एक साथ बज रहा है) "स्वतंत्र विशेषज्ञों" (सोलो कलाकारों) की तुलना में काफी बेहतर प्रदर्शन करती है।
  • उपमा: कल्पना कीजिए कि एक रिले रेस है।
    • स्वतंत्र अनुकूलन (Independent Optimization): प्रत्येक धावक अकेले सबसे तेज़ दौड़ने के लिए प्रशिक्षण लेता है। लेकिन जब वे बैटन (बैटन) पास करते हैं, तो वे इसे गिरा देते हैं क्योंकि उन्होंने कभी हैंडऑफ का अभ्यास नहीं किया था।
    • CoMM: वे एक साथ प्रशिक्षण लेते हैं। पहला धावक थोड़ा धीमा होने के बारे में सीखता है ताकि एक सटीक हैंडऑफ सुनिश्चित हो सके, क्योंकि वे जानते हैं कि दूसरे धावक को दौड़ जीतने के लिए एक सुचारू शुरुआत की आवश्यकता है।

एक वाक्य में सारांश

CoMAM AI मेमोरी वर्कर्स को अलग-थलग विशेषज्ञों के रूप में मानना बंद करता है और उन्हें एक सहयोगी टीम के रूप में प्रशिक्षित करना शुरू करता है, जो एक स्मार्ट सिस्टम का उपयोग करती है जो उन्हें इस आधार पर पुरस्कृत करती है कि उनका विशिष्ट कार्य वास्तव में पूरी टीम को खेल जीतने में कितनी मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →