← नवीनतम पेपर
💬 NLP

Efficient and High-Fidelity Omni Modality Retrieval

यह शोध पत्र OmniRet को प्रस्तुत करता है, जो टेक्स्ट, विज़न और ऑडियो मोडैलिटीज़ के माध्यम से जटिल प्रश्नों को संभालने में सक्षम पहला रिट्रीवल मॉडल है, जो नवीन अटेंशन-आधारित रीसैंपलिंग और अटेंशन स्लाइसड वासरस्टीन पूलिंग तंत्रों के माध्यम से कुशल और उच्च-सटीकता वाला प्रदर्शन प्राप्त करता है, साथ ही ओम्नी-मोडल क्षमताओं का मूल्यांकन करने के लिए एक नया ऑडियो-सेंट्रिक मल्टीमॉडल बेंचमार्क भी स्थापित करता है।

मूल लेखक: Chuong Huynh, Manh Luong, Abhinav Shrivastava

प्रकाशित 2026-03-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chuong Huynh, Manh Luong, Abhinav Shrivastava

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल पुस्तकालय में एक विशिष्ट गाना खोजने की कोशिश कर रहे हैं। पुराने दिनों में, आप केवल शब्दों का उपयोग करके लाइब्रेरियन से मदद मांग सकते थे (जैसे, "मुझे बारिश के बारे में एक उदास गाना चाहिए")। बाद में, आप एक बरसाती सड़क की तस्वीर दिखा सकते थे, और लाइब्रेरियन उस मूड से मेल खाने वाले गाने ढूंढ लेता था।

लेकिन क्या होगा अगर आप कहना चाहें: "मैं एक ऐसा गाना चाहता हूँ जो कुत्ते के भौंकने की इस रिकॉर्डिंग जैसा सुनाई दे, लेकिन भौंकने की जगह एक सायरन की आवाज़ हो, और बैकग्राउंड म्यूजिक जैज़ (jazz) होना चाहिए"?

वर्तमान AI सिस्टम उन लाइब्रेरियन की तरह हैं जो टेक्स्ट पढ़ने या तस्वीरें देखने में तो माहिर हैं, लेकिन जब आप इन सबको एक साथ मिला देते हैं, तो वे भ्रमित हो जाते हैं। वे एक साथ टेक्स्ट (Text), इमेज (Images), वीडियो (Video) और ऑडियो (Audio) से जुड़ी जटिल अनुरोधों को समझने में संघर्ष करते हैं।

यह पेपर OmniRet पेश करता है, जो एक नया "सुपर लाइब्रेरियन" है जिसे इन जटिल, मिश्रित-मीडिया अनुरोधों को कुशलतापूर्वक और सटीकता से संभालने के लिए डिज़ाइन किया गया है।

यह कैसे काम करता है, सरल उपमाओं के माध्यम से यहाँ समझाया गया है:

1. समस्या: "बहुत अधिक जानकारी" की बाधा (The "Too Much Information" Bottleneck)

कल्पना कीजिए कि आप एक किताब खोजने के लिए एक लाइब्रेरियन से पूछते हैं।

  • पुराना तरीका: किसी वीडियो या साउंड क्लिप को समझने के लिए, AI उसे हजारों छोटे-छोटे टुकड़ों (टोकन) में तोड़ देता है। वह एक ही इमेज के 500+ टुकड़ों को एक साथ लाइब्रेरियन के दिमाग में ठूसने की कोशिश करता है। यह एक तेज़ धार वाली पानी की पाइप (firehose) से पानी पीने की कोशिश करने जैसा है; यह धीमा है, अव्यवस्थित है, और लाइब्रेरियन इससे घबरा जाता है।
  • फिडेलिटी (Fidelity) की समस्या: गति की समस्या को ठीक करने के लिए, अन्य सिस्टम उन सभी टुकड़ों का केवल "औसत" (average) ले लेते हैं। यह 3 घंटे की फिल्म को एक वाक्य में सारांशित करने जैसा है: "एक आदमी ड्रैगन से लड़ता है।" आप सभी शानदार विवरण खो देते हैं (ड्रैगन का रंग, संगीत, विशिष्ट लड़ाई के मूव्स)।

2. समाधान: OmniRet की दो महाशक्तियाँ (Two Superpowers)

लेखकों ने इन समस्याओं को हल करने के लिए OmniRet को दो विशेष उपकरणों के साथ बनाया है।

महाशक्ति A: "स्मार्ट स्क्वीज़" (Shared Media Resampler)

इमेज या साउंड के उन 500+ छोटे टुकड़ों के ढेर को लाइब्रेरियन के दिमाग में ठूसने के बजाय, OmniRet एक स्मार्ट स्क्वीज़ (Smart Squeeze) का उपयोग करता है।

  • यह कैसे काम करता है: यह इमेज या साउंड के उस विशाल ढेर को बुद्धिमानी से कुछ चुनिंदा "मुख्य हाइलाइट्स" (जैसे 64 सारांश बिंदुओं) में संकुचित (compress) कर देता है।
  • उपमा: कल्पना कीजिए कि आपके पास 100 पन्नों की एक रिपोर्ट है। हर शब्द पढ़ने के बजाय, एक स्मार्ट सहायक सबसे महत्वपूर्ण 10 वाक्यों को हाइलाइट करता है और आपको केवल वही सौंप देता है।
  • यह क्यों खास है: यह "स्क्वीज़" साझा (shared) है। यह इमेज, साउंड और वीडियो के लिए एक ही दिमागी शक्ति का उपयोग करता है, लेकिन इसमें प्रत्येक प्रकार के लिए एक छोटा "विशेष नोट" होता है ताकि यह जान सके कि कुत्ते के भौंकने को वॉयलिन के नोट से अलग कैसे संभालना है। यह सिस्टम को तेज़ और कुशल बनाता है।

महाशक्ति B: "हाई-डेफिनिशन स्नैपशॉट" (Attention Sliced Wasserstein Pooling)

अब, हम यह कैसे सुनिश्चित करें कि डेटा को संकुचित करते समय बारीक विवरण न खो जाएं?

  • पुराना तरीका: औसत लेना एक धुंधली फोटो देखने जैसा है।
  • OmniRet का तरीका: वे Attention Sliced Wasserstein Pooling नामक तकनीक का उपयोग करते हैं।
  • उपमा: कल्पना कीजिए कि आपके पास मिश्रित कंचों (लाल, नीले, हरे) का एक थैला है और आप अपने दोस्त को उस थैले के बारे में बताना चाहते हैं।
    • एवरेज पूलिंग (Average Pooling) कहता है: "यह एक बैंगनी थैला है।" (आपने रंग खो दिए)।
    • OmniRet कहता है: "मैं इस थैले को पतली परतों में काटूँगा। पहले हिस्से में, मैं ज्यादातर लाल देख रहा हूँ। दूसरे में, ज्यादातर नीला। तीसरे में, एक मिश्रण।" यह केवल एक रंग के बजाय कंचों का एक 3D मैप बनाता है।
  • परिणाम: यह डेटा को छोटा और तेज़ रखने के साथ-साथ "बारीक-दानेदार" विवरणों (जैसे सायरन की विशिष्ट पिच या कपड़े की बनावट) को सुरक्षित रखता है।

3. नया प्रशिक्षण मैदान (The ACM Benchmark)

इसे साबित करने के लिए, लेखकों ने महसूस किया कि ऑडियो के लिए कोई अच्छा "टेस्ट" नहीं था। मौजूदा टेस्ट मुख्य रूप से तस्वीरों और शब्दों के बारे में थे।

  • कमी: किसी के पास भी यह परीक्षण करने का मानक तरीका नहीं था कि क्या एक AI यह समझ सकता है: "एक कुत्ते का वीडियो ढूंढें, लेकिन उसके भौंकने को रोने (howl) में बदल दें।"
  • समाधान: उन्होंने ACM बेंचमार्क (Audio-Centric Multimodal) बनाया। उन्होंने इन जटिल "ध्वनि बदलने वाले" पहेलियों के हजारों उदाहरण उत्पन्न करने के लिए शक्तिशाली AI का उपयोग किया।
  • परिणाम: जब उन्होंने OmniRet का परीक्षण किया, तो इसने प्रतिस्पर्धा को पछाड़ दिया। यह एकमात्र मॉडल था जो जटिल "मिक्स-एंड-मैच" ऑडियो कार्यों को प्रभावी ढंग से संभाल सका, जबकि यह मानक इमेज और टेक्स्ट सर्च में भी उतना ही अच्छा था।

सारांश: यह क्यों मायने रखता है

OmniRet को इंटरनेट के यूनिवर्सल रिमोट कंट्रोल के रूप में सोचें।

  • पहले: आपको अपने टीवी (वीडियो), अपने स्पोटिफ़ाई (ऑडियो) और अपने गूगल सर्च (टेक्स्ट) के लिए अलग-अलग रिमोट की आवश्यकता थी। वे आपस में अच्छी तरह बात नहीं कर पाते थे।
  • अब: OmniRet एक ऐसा रिमोट है जो समझता है कि आप कह सकते हैं, "मुझे समुद्र तट का एक वीडियो दिखाएं, लेकिन इसकी आवाज़ गरजते तूफान जैसी होनी चाहिए, और मुझे एक ऐसा गाना ढूंढ कर दें जो उस मूड से मेल खाता हो।"

यह इसलिए संभव हुआ क्योंकि यह कुशल है (डेटा से अभिभूत नहीं होता) और हाई-फिडेलिटी (बारीक विवरणों को याद रखता है) है। यह हमें एक ऐसे AI की ओर एक बड़ा कदम है जो केवल टेक्स्ट पढ़ने या स्थिर चित्रों को देखने के बजाय, हमारे वास्तविक, बहु-संवेदी संसार को वास्तव में समझ सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →