← नवीनतम पेपर
🤖 machine learning

Revisiting Uncertainty: On Evidential Learning for Partially Relevant Video Retrieval

यह शोध पत्र होम्स (Holmes) का प्रस्ताव करता है, जो एक पदानुक्रमित साक्ष्य शिक्षण ढांचा (hierarchical evidential learning framework) है, जो अंतर-वीडियो डिरिचलेट-आधारित समानता मॉडलिंग (inter-video Dirichlet-based similarity modeling) के माध्यम से बहु-स्तर की क्रॉस-मोडल साक्ष्यों को एकत्रित करके और अनुकूलन योग्य इष्टतम परिवहन (adaptive optimal transport) के माध्यम से इंट्रा-वीडियो सॉफ्ट संरेखण द्वारा आंशिक रूप से प्रासंगिक वीडियो पुनर्प्राप्ति में अनिश्चितता को स्पष्ट रूप से मॉडल करता है।

मूल लेखक: Jun Li, Peifeng Lai, Xuhang Lou, Jinpeng Wang, Yuting Wang, Ke Chen, Yaowei Wang, Shu-Tao Xia

प्रकाशित 2026-05-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jun Li, Peifeng Lai, Xuhang Lou, Jinpeng Wang, Yuting Wang, Ke Chen, Yaowei Wang, Shu-Tao Xia

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप हजारों क्लिप्स के एक विशाल पुस्तकालय में से एक विशिष्ट, बिना संपादित (unedited) होम वीडियो खोजने की कोशिश कर रहे हैं। आपके पास इसे खोजने के लिए केवल एक छोटा, अस्पष्ट नोट है, जैसे "एक व्यक्ति तैर रहा है।"

यह पार्शियलली रेलिवेंट वीडियो रिट्रीवल (PRVR) की चुनौती है। वीडियो लंबा और अव्यवस्थित (untrimmed) है, लेकिन आपका नोट केवल एक छोटे से क्षण का वर्णन करता है। समस्या यह है कि आपका नोट इतना संक्षिप्त हो सकता है कि यह गलती से दर्जनों अलग-अलग वीडियो से मेल खा जाए, या यह इतना अस्पष्ट हो सकता है कि कंप्यूटर को पता ही न चले कि आप क्या ढूंढ रहे हैं।

यह शोध पत्र एक नया सिस्टम पेश करता है जिसे होम्स (Holmes) कहा जाता है (नाम प्रसिद्ध जासूस के नाम पर रखा गया है) ताकि इसे हल किया जा सके। केवल "हाँ" या "नहीं" का अनुमान लगाने के बजाय, होम्स एक ऐसे जासूस की तरह काम करता है जो पूछता है, "मैं इस बारे में कितना आश्वस्त हूँ?"

होम्स कैसे काम करता है, इसके लिए यहाँ सरल उपमाएँ दी गई हैं:

1. समस्या: "अस्पष्ट नोट" और "शोर भरा पुस्तकालय"

शोध पत्र दो मुख्य समस्याओं की पहचान करता है जो सही वीडियो खोजने को कठिन बनाती हैं:

  • अस्पष्ट नोट (Inter-video Ambiguity): यदि आप लिखते हैं "एक व्यक्ति तैर रहा है," तो कंप्यूटर पूल में तैरते व्यक्ति का वीडियो, समुद्र में तैरते व्यक्ति का दूसरा वीडियो, और तीसरे वीडियो को ढूंढ सकता है जहाँ कोई बस तैरने का नाटक कर रहा है। कंप्यूटर भ्रमित हो जाता है क्योंकि यह नोट बहुत सी चीजों पर फिट बैठता है।
  • शोर भरा पुस्तकालय (Intra-video Sparse Supervision): एक लंबे वीडियो के भीतर, केवल कुछ सेकंड ही आपके नोट से मेल खाते हैं। बाकी सब शोर (जैसे लोग चलना, बात करना आदि) है। पारंपरिक तरीके अक्सर केवल एक एकल "सर्वश्रेष्ठ" सेकंड को देखते हैं और बाकी को अनदेखा कर देते हैं, जो कि एक पूरी फिल्म का निर्णय केवल एक धुंधले फ्रेम को देखकर करने जैसा है।

2. समाधान: "जासूसी टूलकिट"

होम्स एविडेंशियल लर्निंग (Evidential Learning) नामक गणित के एक विशेष प्रकार का उपयोग करता है। एक एकल स्कोर देने के बजाय, यह "साक्ष्य" (evidence) एकत्र करता है और गणना करता है कि यह उस साक्ष्य पर कितना भरोसा करता है।

भाग अ: सुरागों को छाँटना (Inter-video Level)

होम्स "अस्पष्ट नोट" को देखता है और उसे एक "थ्री-फोल्ड प्रिंसिपल" (Three-Fold Principle) का उपयोग करके तीन श्रेणियों में वर्गीकृत करता है:

  1. सटीक सुराग (The Precise Clue): नोट स्पष्ट है (जैसे, "एक लड़की अपने लाल बैलेट जूते बाँध रही है")। होम्स बहुत आश्वस्त है। यह इसे एक ठोस फिंगरप्रिंट की तरह मानता है।
  2. बहुअर्थी सुराग (The Polysemous Clue): नोट के कई अर्थ हैं (जैसे, "एक आदमी दौड़ रहा है")। यह एक जॉगर भी हो सकता है या एक भागता हुआ अपराधी भी। होम्स समझ जाता है, "मैं पूरी तरह से आश्वस्त नहीं हूँ कि आपका मतलब क्या है," इसलिए यह एक एकल उत्तर देने के लिए मजबूर नहीं होता। यह संभावनाओं को खुला रखता है।
  3. अनिर्धारित सुराग (The Under-determined Clue): नोट बहुत छोटा या टूटा हुआ है (जैसे, "तैरना...")। होम्स स्वीकार करता है, "मेरे पास हल करने के लिए पर्याप्त जानकारी नहीं है।" यह बेतहाशा अनुमान नहीं लगाता; यह साक्ष्य की कमी को स्वीकार करता है।

जादुई ट्रिक: एक बार जब होम्स सुरागों को छाँट लेता है, तो यह "प्रशिक्षण नियमों" (training rules) को समायोजित करता है। यदि सुराग अस्पष्ट है, तो यह कंप्यूटर को बताता है, "उन वीडियोों के प्रति बहुत सख्त न हों जो कुछ हद तक सही हैं।" यदि सुराग सटीक है, तो यह कहता है, "सख्त रहें और सटीक मिलान खोजें।" यह कंप्यूटर को अस्पष्ट नोट्स से भ्रमित होने से रोकता है।

भाग ब: वीडियो की सफाई करना (Intra-video Level)

अब, होम्स विशिष्ट क्षण को खोजने के लिए लंबे वीडियो के अंदर देखता है।

  • पुराना तरीका: कल्पना कीजिए कि आप केवल उस एक फ्रेम को देखकर एक वाक्य को वीडियो से मिलाने की कोशिश कर रहे हैं जो सबसे अच्छा मेल खाता है। यदि वह फ्रेम एक तकनीकी खराबी (glitch) या रैंडम शोर है, तो पूरी खोज विफल हो जाती है।
  • होम्स का तरीका (फ्लेक्सिबल ऑप्टिमल ट्रांसपोर्ट): होम्स एक "डस्टबिन बाल्टी" (Dustbin Bucket) का उपयोग करता है। कल्पना कीजिए कि आप कपड़े छाँट रहे हैं। आपके पास कपड़ों का एक ढेर (वीडियो क्लिप्स) है और आपकी ज़रूरत की चीज़ों की एक सूची है।
    • अधिकांश कपड़े "मैच" (Match) वाले ढेर में जाते हैं।
    • लेकिन कुछ कपड़े कचरा या असंबंधित होते हैं (जैसे एक मोज़ा जो वहां नहीं होना चाहिए)।
    • होम्स के पास एक विशेष डस्टबिन है। कचरे वाले मोज़े को आपकी सूची से मिलाने के बजाय, यह उसे डस्टबिन में फेंक देता है। यह कंप्यूटर को बीच के "शोर" से विचलित हुए बिना केवल प्रासंगिक भागों पर ध्यान केंद्रित करने की अनुमति देता है।

3. परिणाम: एक स्मार्ट जासूस

इन दोनों चरणों को जोड़कर, होम्स पिछले तरीकों की तुलना में वीडियो खोजने में बहुत बेहतर बन जाता है।

  • यह केवल यह नहीं कहता कि "यह वीडियो मेल खाता है।" बल्कि यह कहता है, "यह वीडियो मेल खाता है, और मैं इसके बारे में 90% आश्वस्त हूँ," या "यह वीडियो मेल खाता है, लेकिन नोट अस्पष्ट था, इसलिए मैं केवल 60% आश्वस्त हूँ।"
  • यह वीडियो के उन "कचरा" हिस्सों को अनदेखा कर देता है जो अन्य सिस्टम को भ्रमित करते हैं।

सारांश

पिछले वीडियो सर्च इंजन को एक ऐसे छात्र के रूप में सोचें जो उत्तर रट लेता है लेकिन कठिन सवालों से भ्रमित हो जाता है। होम्स एक ऐसे जासूस की तरह है जो:

  1. स्वीकार करता है कि सुराग बहुत अस्पष्ट है (ताकि वह गलत अनुमान न लगाए)।
  2. सुरागों को उनकी स्पष्टता के आधार पर छाँटता है (ताकि उसे पता चले कि कितनी गहराई से देखना है)।
  3. कचरे को फेंक देता है (वीडियो के अप्रासंगिक हिस्से) ताकि वह वास्तविक साक्ष्य पर ध्यान केंद्रित कर सके।

शोध पत्र दिखाता है कि यह दृष्टिकोण कंप्यूटर को बहुत तेज़ी से और अधिक सटीकता से सही वीडियो खोजने में मदद करता है, भले ही खोज नोट छोटे, बिखरे हुए या अस्पष्ट हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →