← नवीनतम पेपर
🤖 AI

One Token per Multimodal Evidence: Latent Memory for Resource-Constrained QA

यह शोध पत्र लेटेंट मेमोरी (Latent Memory) को प्रस्तुत करता है, जो एक संसाधन-कुशल प्रतिमान (paradigm) है जो रिट्रीवल और जनरेशन के लिए मल्टीमॉडल साक्ष्यों को एकल लेटेंट टोकन में संकुचित करता है, जिससे टेक्स्ट-ओनली और मल्टीमॉडल बेंचमार्क पर प्रतिस्पर्धी प्रश्न-उत्तर प्रदर्शन बनाए रखते हुए टोकन खपत और स्टोरेज लागत को काफी कम कर दिया जाता है।

मूल लेखक: Zhi Zheng, Ziqiao Meng, Hao Luan, Wei Liu, Wee Sun Lee

प्रकाशित 2026-06-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhi Zheng, Ziqiao Meng, Hao Luan, Wei Liu, Wee Sun Lee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "One Token per Multimodal Evidence: Latent Memory for Resource-Constrained QA" पेपर की एक व्याख्या सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करके दी गई है।

बड़ी समस्या: "भारी सूटकेस" (The Heavy Suitcase)

कल्पना कीजिए कि आप एक शानदार जासूस (AI) हैं जो एक रहस्य सुलझाने की कोशिश कर रहे हैं। अपना काम करने के लिए, आपको सुरागों की एक विशाल लाइब्रेरी (टेक्स्ट लेख और तस्वीरें) को पढ़ना होगा।

काम करने के मौजूदा तरीके में (मौजूदा RAG सिस्टम), जब भी आपको कोई नया सवाल मिलता है, लाइब्रेरियन आपको पूरी कच्ची लाइब्रेरी (raw library) थमा देता है।

  • यदि सुराग एक लंबा लेख है, तो आप उसका हर एक शब्द पढ़ते हैं।
  • यदि सुराग एक फोटो है, तो लाइब्रेरियन आपको केवल फोटो नहीं देता; वह उस फोटो के हर एक पिक्सेल का हजारों शब्दों में वर्णन करता है ताकि आप उसे "देख" सकें।

परिणाम: आप अभिभूत (overwhelmed) हो जाते हैं। आपकी ऊर्जा (स्टोरेज) और समय (प्रोसेसिंग स्पीड) खत्म हो जाता है क्योंकि आप कच्चे डेटा से भरे भारी, अनकंप्रेस्ड सूटकेस ढो रहे होते हैं, भले ही आपको उनमें से केवल एक छोटा सा तथ्य चाहिए था। यह इसे फोन या एज कंप्यूटर जैसे छोटे उपकरणों पर उपयोग करना असंभव बना देता है।

समाधान: "जादुई सारांश कार्ड" (The Magic Summary Card - Latent Memory)

लेखकों ने Latent Memory नामक एक नया सिस्टम प्रस्तावित किया है। आपको भारी कच्चे सूटकेस थमाने के बजाय, वे हर एक सबूत (चाहे वह टेक्स्ट का पैराग्राफ हो या फोटो) को एक एकल, छोटे, जादुई सारांश कार्ड में कंप्रेस (संक्षिप्त) कर देते हैं।

इसे इस तरह सोचें:

  • पुराना तरीका: आप एक वाक्य खोजने के लिए 500 पन्नों की किताब लेकर चलते हैं।
  • नया तरीका: आप एक एकल इंडेक्स कार्ड लेकर चलते हैं जिसमें उस किताब का सार (essence) समाहित है।

यह कैसे काम करता है: तीन-चरणीय प्रक्रिया (The Three-Step Process)

1. कंप्रेशन स्टेशन (द "ट्रांसलेटर")
इससे पहले कि AI कभी सबूतों को देखे, एक छोटा, विशेष सहायक (Compressor Model) हर सबूत को देखता है।

  • यह टेक्स्ट को पढ़ता है या फोटो को देखता है।
  • यह पूरे अर्थ को एक एकल "टोकन" (एक उच्च-आयामी नंबर वेक्टर) में सिकोड़ देता है।
  • यह मूल भारी किताब या फोटो को फेंक देता है और केवल इस छोटे कार्ड को रखता है।
  • उपमा: कल्पना कीजिए कि एक मास्टर शेफ एक जटिल स्टू (stew) का स्वाद चखता है और एक नैपकिन पर एक गुप्त कोड लिख देता है जो उस स्वाद को पूरी तरह से दर्शाता है। अब आपको पूरे सूप के बर्तन की आवश्यकता नहीं है; बस उस कोड की आवश्यकता है।

2. खोज (द "मैजिक कंपास")
जब आप कोई सवाल पूछते हैं, तो सिस्टम भारी किताबों में खोज नहीं करता। इसके बजाय, यह आपके सवाल को एक समान "कोड" में बदल देता है और दराज में मौजूद मैचिंग सारांश कार्डों को खोजने के लिए एक कंपास का उपयोग करता है।

  • क्योंकि अब सब कुछ एक एकल कार्ड है, खोज अविश्वसनीय रूप से तेज़ है और इसमें बहुत कम जगह लगती है।

3. उत्तर (द "डायरेक्ट फीड")
सिस्टम शीर्ष कुछ मैचिंग सारांश कार्डों को लेता है और उन्हें सीधे मुख्य AI (Generator) को सौंप देता है।

  • मुख्य AI को मूल टेक्स्ट पढ़ने या मूल फोटो देखने की आवश्यकता नहीं होती है। वह बस कार्ड पर लिखे "गुप्त कोड" को पढ़ता है और उत्तर देने के लिए संदर्भ को तुरंत समझ जाता है।
  • महत्वपूर्ण बिंदु: मुख्य AI को फिर से प्रशिक्षित (retrain) करने की आवश्यकता नहीं है। यह बस पुरानी किताबों के बजाय इन नए कार्डों को "पढ़ना" सीख जाता है।

यह एक बड़ी बात क्यों है?

1. अत्यधिक दक्षता (The "Lightweight Backpack")
पेपर का दावा है कि यह तरीका "टोकन लागत" (डेटा की मात्रा जिसे AI को प्रोसेस करना होता है) को 3 से 10 गुना कम कर देता है।

  • टेक्स्ट: AI को 200 शब्दों का संदर्भ भेजने के बजाय, यह केवल 1 टोकन प्रोसेस करता है।
  • इमेज: फोटो को सैकड़ों "विजुअल शब्दों" में विस्तारित करने के बजाय, AI केवल 1 टोकन प्रोसेस करता है।
  • परिणाम: आप छोटे उपकरणों (जैसे फोन) पर शक्तिशाली AI चला सकते हैं क्योंकि डेटा का "बैकपैक" अब बहुत हल्का हो गया है।

2. यह अभी भी काम करता है (The "Perfect Memory")
आप चिंतित हो सकते हैं: "यदि हम मूल किताब को फेंक देते हैं, तो क्या AI विवरण भूल जाएगा?"

  • लेखकों ने कंप्रेसर को तीन विशिष्ट ट्रिक्स का उपयोग करके प्रशिक्षित किया है ताकि यह सुनिश्चित हो सके कि "सारांश कार्ड" केवल एक अस्पष्ट विचार नहीं है, बल्कि एक सटीक कुंजी है:
    • पुनर्निर्माण (Reconstruction): सिस्टम कार्ड से मूल टेक्स्ट या इमेज विवरण को "पुनर्निर्मित" करने की कोशिश करता है ताकि विवरण वहां मौजूद रहें।
    • कंट्रास्ट (Contrast): यह यह सुनिश्चित करने के लिए सीखता है कि "Annie Morton" का कार्ड "Terry Richardson" के कार्ड से बहुत अलग हो ताकि वे आपस में मिक्स न हों।
    • डिस्टिलेशन (Distillation): यह कार्ड को यह सिखाता है कि वह बिल्कुल उसी तरह व्यवहार करे जैसे मूल सबूत ने किया होता यदि AI ने पूरी चीज़ पढ़ी होती।

3. परिणाम

  • टेक्स्ट प्रश्न: मानक रीडिंग कॉम्प्रिहेन्शन टेस्ट पर, यह तरीका भारी और धीमे तरीकों के समान ही प्रदर्शन करता है लेकिन इसमें 3 गुना कम टोकन का उपयोग होता है।
  • इमेज प्रश्न: तस्वीरों से संबंधित परीक्षणों (जैसे किसी चित्र में वस्तुओं की पहचान करना) में, यह 10 गुना अधिक कुशल था और वास्तव में अन्य तरीकों से बेहतर प्रदर्शन करता है क्योंकि यह उस विशाल डेटा से भ्रमित नहीं होता जो आमतौर पर छवियों को प्रोसेस करने के लिए आवश्यक होता है।

सीमाएं (जो पेपर कहता है)

पेपर नोट करता है कि यह तब सबसे अच्छा काम करता है जब सबूतों को व्यक्तिगत "परमाणु" इकाइयों (एक पैराग्राफ, एक फोटो) में तोड़ा जा सके।

  • यह उन चीजों के लिए संघर्ष कर सकता है जो जटिल संरचना पर निर्भर करती हैं, जैसे कि एक विशाल स्प्रेडशीट जहाँ पंक्तियों और कॉलमों के बीच का संबंध महत्वपूर्ण होता है, या एक लंबा वीडियो जहाँ घटनाओं का क्रम अत्यंत महत्वपूर्ण होता है। उन सबको एक एकल कार्ड में कंप्रेस करने से "बड़ी तस्वीर" की संरचना खो सकती है।

सारांश

Latent Memory भारी, कच्चे किताबों और फोटो की लाइब्रेरी को एक चिकने, डिजिटल कार्ड कैटलॉग में बदलने जैसा है जहाँ प्रत्येक वस्तु को एक एकल, छोटे, पूर्ण कोड द्वारा दर्शाया जाता है। यह AI को डेटा के एक अंश का उपयोग करके जटिल प्रश्नों के उत्तर देने में सक्षम बनाता है, जिससे शक्तिशाली AI उन उपकरणों पर भी सुलभ हो जाता है जो पहले इसे संभालने में असमर्थ थे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →