← नवीनतम पेपर
💬 NLP

SMMBench: A Benchmark for Source-Distributed Multimodal Agent Memory

यह शोधपत्र SMMBench प्रस्तुत करता है, जो विषम और स्वतंत्र रूप से उत्पन्न स्रोतों में बिखरी हुई साक्ष्यों को खोजने, संरेखित करने और संयोजित करने की मल्टीमॉडल एजेंटों की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया एक नया बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान प्रणालियाँ इस महत्वपूर्ण स्रोत-वितरित स्मृति क्षमता (source-distributed memory capability) के साथ संघर्ष करती हैं।

मूल लेखक: Huacan Chai, Yukai Wang, Yingxuan Yang, Dan Peng, Yuanyi Song, Zhihui Fu, Weiwen Liu, Jianghao Lin, Jun Wang, Weinan Zhang

प्रकाशित 2026-05-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Huacan Chai, Yukai Wang, Yingxuan Yang, Dan Peng, Yuanyi Song, Zhihui Fu, Weiwen Liu, Jianghao Lin, Jun Wang, Weinan Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यक्तिगत सहायक (personal assistant) हैं जो अपने बॉस के लिए एक रहस्य सुलझाने की कोशिश कर रहे हैं। अतीत में, अधिकांश AI परीक्षणों में AI सहायकों को एक ही, विशाल नोटबुक दी जाती थी जिसमें उनके लिए आवश्यक हर सुराग व्यवस्थित रूप से एक ही जगह पर होता था। AI को बस पूरी किताब पढ़नी होती थी और उत्तर ढूँढना होता था।

लेकिन वास्तविक दुनिया में, जानकारी एक एकल नोटबुक की तरह नहीं होती है। यह हर जगह बिखरी हुई होती है। एक सुराग पिछले मंगलवार के एक टेक्स्ट मैसेज में हो सकता है, दूसरा किसी अलग प्रोजेक्ट के स्प्रेडशीट में, तीसरा उड़ान के यात्रा कार्यक्रम (itinerary) का एक फोटो हो सकता है, और चौथा एक निजी चैट में नोट हो सकता है।

समस्या: "बिखरे हुए सुरागों" की चुनौती
इस पेपर के लेखक, SMMBench, तर्क देते हैं कि वर्तमान AI सहायक एक लंबी, एकल नोटबुक पढ़ने में तो बहुत अच्छे हैं, लेकिन वे तब बेहद खराब साबित होते हैं जब सुराग अलग-अलग, असंबंधित स्रोतों में बिखरे हुए हों। वे इसे "सोर्स-डिस्ट्रीब्यूटेड मेमोरी" (source-distributed memory) कहते हैं।

इसे इस तरह समझें:

  • पुराने बेंचमार्क: आप AI को 100 पन्नों की एक कहानी देते हैं और पूछते हैं, "कार का रंग क्या था?" AI पूरी कहानी पढ़ता है और उत्तर देता है।
  • SMMBench: आप AI को एक टेक्स्ट मैसेज देते हैं जिसमें लिखा है "जॉन न्यूयॉर्क जा रहा है," एक अलग कैलेंडर का स्क्रीनशॉट जिसमें लिखा है "मीटिंग A, 13 नवंबर को है," और एक अलग दस्तावेज़ जिसमें लिखा है "मीटिंग A न्यूयॉर्क में है।" AI को यह समझने के लिए इन तीनों को जोड़ना होगा कि: "जॉन मीटिंग A के लिए 13 नवंबर को न्यूयॉर्क जा रहा है।"

नया बेंचमार्क: SMMBench
टीम ने SMMBench (सोर्स-डिस्ट्रीब्यूटेड मल्टीमॉडल मेमोरी बेंचमार्क) नामक एक नया परीक्षण बनाया है ताकि यह देखा जा सके कि क्या AI इस "बिखरे हुए सुरागों" वाली स्थिति को संभाल सकता है।

  • सेटअप: उन्होंने 264 अलग-अलग "स्रोतों" (जैसे ग्रुप चैट, निजी संदेश, टेबल, चित्र और दस्तावेज़) का उपयोग करके 1,877 टेस्ट केस बनाए।
  • नियम: परीक्षण पास करने के लिए, AI को कम से कम दो अलग-अलग स्रोतों से जानकारी निकालनी होनी चाहिए। यदि उत्तर केवल एक स्रोत में है, तो वह मान्य नहीं होगा।
  • परीक्षण किए गए चार कौशल:
    1. कड़ियों को जोड़ना (Connecting the Dots): क्या AI एक चैट और एक टेबल से सुराग ढूंढकर उन्हें मिला सकता है?
    2. तर्कों का समाधान करना (Resolving Arguments): क्या होगा यदि एक स्रोत कहता है "मीटिंग टोक्यो में है" और एक पुराना स्रोत कहता है "मीटिंग एलए (LA) में है"? क्या AI यह पता लगा सकता है कि कौन सा नया और सही है?
    3. परोक्ष अर्थ समझना (Reading Between the Lines): क्या AI अलग-अलग बातचीत में बिखरे हुए छोटे संकेतों को देखकर उपयोगकर्ता की पसंद का अनुमान लगा सकता है?
    4. कार्य करना (Taking Action): क्या AI केवल उत्तर दे सकता है, या वह अलग-अलग फाइलों से विवरण खोजकर वास्तव में किसी टूल (जैसे फ्लाइट बुक करना) का उपयोग कर सकता है?

उन्होंने क्या पाया
शोधकर्ताओं ने आज उपलब्ध कई सबसे स्मार्ट AI मेमोरी सिस्टम का परीक्षण किया। परिणाम बहुत अच्छे नहीं थे।

  • "गोल्ड स्टैंडर्ड" का अंतर: जब शोधकर्ताओं ने AI को सटीक सुराग दिए जिन्हें उसे देखना था (कठिन भाग को छोड़कर), तो AI ने बहुत अच्छा प्रदर्शन किया। लेकिन जब AI को उन बिखरे हुए ढेर के बीच खुद उन सुरागों को खोजना पड़ा, तो इसके प्रदर्शन में भारी गिरावट आई।
  • "खोज" बनाम "सोच" की समस्या: सबसे अच्छे सिस्टम भी सही स्रोतों को खोजने में संघर्ष करते रहे। यह एक ऐसी लाइब्रेरी की तरह है जहाँ किताबें अलमारियों पर तो हैं, लेकिन AI यह नहीं समझ पा रहा है कि किस अलमारी में देखना है।
  • "एक्शन" का अंतर: AI बहुविकल्पीय प्रश्नों के उत्तर देने में ठीक था, लेकिन जब उसे एक सटीक कार्य करने (जैसे सही नंबरों के साथ किसी विशिष्ट फंक्शन को कॉल करना) के लिए कहा गया, तो वह बुरी तरह विफल रहा। यह ऐसा है जैसे AI आपको बता सकता है कि क्या करना है, लेकिन जब निर्देश बिखरे हुए हों, तो वह वास्तव में इसे सही ढंग से कर नहीं पाता है।

मुख्य निष्कर्ष
पेपर यह निष्कर्ष निकालता है कि हम AI मेमोरी का परीक्षण बहुत आसानी से कर रहे हैं। हम उनसे लंबी किताबें पढ़ने के लिए कह रहे हैं, लेकिन हमने यह परीक्षण नहीं किया है कि क्या वे एक जासूस की तरह अलग-अलग नोट्स, फोटो और ईमेल के ढेर से एक कहानी को जोड़ने में सक्षम हैं।

वर्तमान में, AI एजेंट इस "सोर्स-डिस्ट्रीब्यूटेड" मेमोरी में बहुत खराब हैं। जब सबूत खंडित (fragmented) होते हैं, तो वे खो जाते हैं। यह एक बड़ी बाधा है जिसे ठीक करने की आवश्यकता है, इससे पहले कि AI सहायक वास्तव में हमारे जटिल, मल्टी-ऐप और मल्टी-चैट वाले वास्तविक जीवन में काम कर सकें।

संक्षेप में: AI एक लंबी कहानी पढ़ने में अच्छा है, लेकिन वह अभी भी यह सीख रहा है कि एक पहेली को कैसे सुलझाया जाए जब उसके टुकड़े घर के अलग-अलग कमरों में छिपे हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →