← नवीनतम पेपर
💻 computer science

SAVE: Speech-Aware Video Representation Learning for Video-Text Retrieval

यह शोध पत्र SAVE का प्रस्ताव करता है, जो एक स्पीच-अवेयर वीडियो रिप्रजेंटेशन लर्निंग विधि है जो एक समर्पित स्पीच ब्रांच और अर्ली विजन-ऑडियो अलाइनमेंट के लिए सॉफ्ट-ALBEF को पेश करके वीडियो-टेक्स्ट रिट्रीवल को बेहतर बनाती है, जिससे पांच बेंचमार्क में अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Ruixiang Zhao, Zhihao Xu, Bangxiang Lan, Zijie Xin, Jingyu Liu, Xirong Li

प्रकाशित 2026-03-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ruixiang Zhao, Zhihao Xu, Bangxiang Lan, Zijie Xin, Jingyu Liu, Xirong Li

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल पुस्तकालय में एक टेक्स्ट विवरण का उपयोग करके एक विशिष्ट वीडियो खोजने की कोशिश कर रहे हैं। लंबे समय तक, बेहतरीन लाइब्रेरियन (AI मॉडल) चित्रों को शब्दों से मिलाने में माहिर रहे हैं, लेकिन वे कमरे में होने वाली आवाज़ के प्रति पूरी तरह से बहरे रहे हैं।

यह पेपर एक नए लाइब्रेरियन से परिचय कराता है जिसका नाम है SAVE (Speech-Aware Video rEpresentation learning)। SAVE को अंततः वीडियो में जो कहा जा रहा है उसे "सुनने" के लिए डिज़ाइन किया गया है, न कि केवल यह देखने के लिए कि क्या हो रहा है।

यहाँ SAVE कैसे काम करता है, इसकी कहानी सरल उपमाओं के साथ दी गई है:

समस्या: "बहरा" लाइब्रेरियन

वर्षों से, मानक AI लाइब्रेरियन (जिसे CLIP कहा जाता है) छवियों को टेक्स्ट से मिलाने में अद्भुत था। यदि आप "एक गेंद का पीछा करता हुआ कुत्ता" मांगते, तो वह वीडियो को पूरी तरह से ढूंढ लेता। लेकिन यदि वीडियो में कोई व्यक्ति कुत्ते के बारे में बात कर रहा होता, या यदि कुत्ता भौंक रहा होता, तो लाइब्रेरियन इसे पूरी तरह से अनदेखा कर देता।

बाद में, कुछ शोधकर्ताओं ने इसे ठीक करने के लिए लाइब्रेरियन को एक "कान" जोड़कर प्रयास किया। उन्होंने AI को ध्वनि सुनने के लिए एक ऑडियो एनकोडर दिया। हालाँकि, उन्हें दो बड़ी समस्याओं का सामना करना पड़ा:

  1. गलत कान: जो "कान" उन्होंने उपयोग किए थे, वे प्रकृति की आवाज़ों (जैसे बारिश, पक्षियों का चहचहाना, या कारों के इंजन) को सुनने के लिए प्रशिक्षित थे। वे मानवीय भाषण को समझने के लिए बहुत खराब थे। यह किसी जटिल बातचीत को पक्षियों की आवाज़ों के शब्दकोश का उपयोग करके समझने की कोशिश करने जैसा था। AI ने आवाज़ के शोर को तो सुना, लेकिन उसके अर्थ को नहीं।
  2. बेमेल नृत्य: जब AI ने जो देखा उसे जो सुना उसके साथ मिलाने की कोशिश की, तो वे आपस में तालमेल नहीं बिठा पाए (उदाहरण के लिए, कार दुर्घटना का एक वीडियो बैकग्राउंड म्यूजिक के साथ हो सकता है जिसका दुर्घटना से कोई लेना-देना नहीं है)। उन्हें तुरंत मैच करने के लिए मजबूर करने से AI भ्रमित हो गया और गलत सबक सीख लिया।

समाधान: मिलिए SAVE से

लेखकों ने इन दो समस्याओं को हल करने के लिए एक चतुर तीन-भाग वाली रणनीति के साथ SAVE बनाया।

1. "अनुवादक" शाखा (स्पीच शाखा)

केवल कच्ची ध्वनि तरंगों (raw sound waves) को सुनने के बजाय, SAVE के पास भाषण (speech) के लिए एक विशेष शाखा है।

  • उपमा: कल्पना कीजिए कि एक वीडियो में एक नैरेटर बोल रहा है। SAVE केवल आवाज़ रिकॉर्ड नहीं करता; इसके पास एक सुपर-फास्ट अनुवादक (Whisper जैसा एक ASR मॉडल) है जो बोले गए शब्दों को तुरंत एक लिखित स्क्रिप्ट में बदल देता है।
  • यह क्यों काम करता है: एक बार जब भाषण टेक्स्ट में बदल जाता है, तो SAVE अपने शक्तिशाली "पढ़ने वाले" मस्तिष्क (वही जिसका उपयोग मूल टेक्स्ट क्वेरी के लिए किया जाता है) का उपयोग यह समझने के लिए कर सकता है कि क्या कहा जा रहा है। अब वह केवल आवाज़ के शोर का अनुमान नहीं लगा रहा है; वह वास्तव में शब्दों को पढ़ रहा है।

2. "सॉफ्ट" मैचमेकर (Soft-ALBEF)

दूसरी समस्या यह थी कि वीडियो और ऑडियो हमेशा पूरी तरह से मेल नहीं खाते थे।

  • उपमा: कल्पना कीजिए कि आप समुद्र तट की एक फोटो को एक साउंड क्लिप के साथ मिलाने की कोशिश कर रहे हैं। कभी-कभी आवाज़ लहरों की होती है (परफेक्ट मैच), लेकिन कभी-कभी यह बैकग्राउंड में बजने वाला रेडियो होता है (खराब मैच)।
  • पुराना तरीका: पुराना AI जबरदस्ती मैच करने की कोशिश करता था, यह कहते हुए कि "इस समुद्र तट की फोटो को इस रेडियो की आवाज़ के साथ होना ही चाहिए", जिससे सिस्टम भ्रमित हो जाता था।
  • SAVE का तरीका: SAVE एक "सॉफ्ट मैचमेकर" (ImageBind नामक टूल पर आधारित) का उपयोग करता है। यह कहने के बजाय कि "हाँ, यह एक मैच है" या "नहीं, यह नहीं है," यह एक कॉन्फिडेंस स्कोर (विश्वास स्कोर) असाइन करता है। यह कहता है, "इस समुद्र तट की फोटो के लहरों से मेल खाने की संभावना 90% है, लेकिन रेडियो से मेल खाने की संभावना केवल 10% है।" यह AI को शोर के बीच बिना भ्रमित हुए डेटा से सीखने की अनुमति देता है।

3. तीन-तरफा फ्यूजन (Three-Way Fusion)

अंत में, SAVE सब कुछ एक साथ लाता है। इसके पास सूचना के तीन स्ट्रीम हैं:

  1. विज़न (दृष्टि): कैमरा जो देखता है।
  2. ऑडियो (ध्वनि): कच्ची आवाजें (भौंकना, इंजन, संगीत)।
  3. स्पीच (भाषण): बोले गए शब्दों का अर्थ

यह इन तीनों स्ट्रीम को एक शेफ की तरह सामग्री मिलाने के समान मिलाता है। विजुअल हिस्सा मुख्य व्यंजन है, लेकिन स्पीच और ऑडियो वे आवश्यक मसाले हैं जो स्वाद को पूर्ण बनाते हैं।

परिणाम: एक स्मार्ट लाइब्रेरियन

लेखकों ने पाँच अलग-अलग वीडियो डेटाबेस पर SAVE का परीक्षण किया। परिणाम प्रभावशाली थे:

  • SAVE ने पिछले सर्वश्रेष्ठ AI (AVIGATE) को बड़े अंतर से पीछे छोड़ दिया।
  • यह विशेष रूप से उन वीडियो को खोजने में अच्छा था जहाँ भाषण (speech) मुख्य सुराग था (जैसे, किसी विशिष्ट नाम या वाक्यांश को बोलने के कारण वीडियो खोजना)।
  • यहाँ तक कि जब ऑडियो शोर वाला था या भाषण सुनना कठिन था, तब भी SAVE की "सॉफ्ट मैचिंग" रणनीति ने इसे भटकने से बचाए रखा।

संक्षेप में

SAVE को एक ऐसे वीडियो सर्च इंजन के रूप में सोचें जिसने अंततः होंठों को पढ़ना (lip reading) और संदर्भ (context) को समझना सीख लिया है।

  • पहले: "मैं एक कुत्ता देख रहा हूँ। मैं एक भौंकने की आवाज़ सुन रहा हूँ। मैं बात करने वाले इंसान को अनदेखा कर देता हूँ।"
  • अब (SAVE): "मैं एक कुत्ता देख रहा हूँ। मैं भौंकने की आवाज़ सुन रहा हूँ। मैंने उस ट्रांसक्रिप्ट को भी पढ़ लिया है जहाँ मालिक कहता है, 'गुड बॉय, सिट!' अब मुझे पता है कि यह वीडियो वास्तव में किस बारे में है।"

भाषण को केवल बैकग्राउंड शोर के बजाय एक अलग, महत्वपूर्ण भाषा के रूप में मानकर, SAVE ने कंप्यूटर द्वारा वीडियो को समझने के नए मानक स्थापित किए हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →