← नवीनतम पेपर
💻 computer science

CEZSAR: A Contrastive Embedding Method for Zero-Shot Action Recognition

यह शोध पत्र CEZSAR का प्रस्ताव करता है, जो एक नवीन कंट्रास्टिव लर्निंग विधि है ज़ीरो-शॉट एक्शन रिकग्निशन के लिए, जो एक ऑटोमैटिक नेगेटिव सैंपलिंग प्रक्रिया का उपयोग करके एक संयुक्त स्थान में वीडियो और टेक्स्ट एम्बेडिंग्स को संरेखित करके सिमेंटिक गैप और डोमेन शिफ्ट की समस्याओं का समाधान करता है, और UCF-101 और Kinetics-400 डेटासेट्स पर अत्याधुनिक परिणाम प्राप्त करता है।

मूल लेखक: Valter Estevam, Rayson Laroca, Helio Pedrini, David Menotti

प्रकाशित 2026-05-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Valter Estevam, Rayson Laroca, Helio Pedrini, David Menotti

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को मानव क्रियाओं को पहचानना सिखा रहे हैं, जैसे कि "घोड़े की सवारी करना" या "बास्केटबॉल खेलना।" आमतौर पर, एक रोबोट को सिखाने के लिए, आपको उसे उन विशिष्ट चीजों के हजारों वीडियो दिखाने होते हैं और उन्हें एक-एक करके लेबल करना होता है। लेकिन क्या होगा यदि आप एक रोबोट को एक नई क्रिया पहचानना चाहते हैं, जैसे कि "आरा (chainsaws) के साथ करतब दिखाना (juggling)," जो उसने पहले कभी नहीं देखी है? आप उसे उदाहरण नहीं दिखा सकते क्योंकि वे उसके प्रशिक्षण डेटा में मौजूद नहीं हैं। यह जीरो-शॉट एक्शन रिकग्निशन (Zero-Shot Action Recognition) की चुनौती है।

यह शोध पत्र इस समस्या को हल करने के लिए CEZSAR नामक एक नई विधि पेश करता है। यह कैसे काम करता है, इसका सरल विवरण यहाँ दिया गया है:

दो बड़ी समस्याएँ

लेखक कहते हैं कि बिना उदाहरण दिखाए रोबोट को नई क्रियाएं सिखाना कठिन है क्योंकि इसमें दो "रास्ते की बाधाएं" आती हैं:

  1. सिमेंटिक गैप (भाषा की बाधा - The Semantic Gap):
    कल्पना कीजिए कि आपके पास एक रोबोट है जो "विजुअल" (वह पिक्सेल और आकृतियाँ देखता है) बोलता है और दूसरा जो "टेक्स्ट" (वह शब्दों को समझता है) बोलता है। यदि आप टेक्स्ट-रोबोट को कहते हैं, "यह एक घुड़दौड़ है," तो वह इस अवधारणा को समझ जाता है। लेकिन विजुअल-रोबोट घोड़े और ट्रैक की एक धुंधली छवि देखता है। समस्या यह है कि टेक्स्ट की दुनिया में "घुड़दौड़ का विचार" विजुअल दुनिया में "घुड़दौड़ की तस्वीर" से पूरी तरह मेल नहीं खाता। वे दो अलग-अलग बोलियाँ बोलने वाले लोगों की तरह हैं; वे एक ही चीज़ को समझते हैं, लेकिन अनुवाद के दौरान विवरण खो जाते हैं।
  • पेपर का समाधान: CEZSAR एक यूनिवर्सल ट्रांसलेटर (सार्वभौमिक अनुवादक) बनाता है। यह विजुअल रोबोट और टेक्स्ट रोबोट को एक साझा भाषा सीखने के लिए मजबूर करता है जहाँ घुड़दौड़ की तस्वीर और "घुड़दौड़" वाक्य उनकी स्मृति में एक साथ रखे जाते हैं।
  1. डोमेन शिफ्ट (संदर्भ का जाल - The Domain Shift):
    कल्पना कीजिए कि आपने एक रोबोट को केवल पार्क में दौड़ते हुए लोगों के वीडियो पर प्रशिक्षित किया है। यदि आप फिर उससे जिम में ट्रेडमिल पर दौड़ रहे किसी व्यक्ति को पहचानने के लिए कहते हैं, तो वह भ्रमित हो सकता है क्योंकि बैकग्राउंड (डोमेन) पूरी तरह से अलग है। रोबोट ने दौड़ने की क्रिया के बजाय पार्क को याद कर लिया था।
  • पेपर का समाधान: लेखकों ने महसूस किया कि जबकि विजुअल दुनिया बहुत बदल जाती है (अलग-अलग पार्क, अलग-अलग जिम), "दौड़ना" के टेक्स्ट विवरण में कोई बदलाव नहीं होता है। टेक्स्ट विवरण के साथ विजुुअल लर्निंग को जोड़कर, रोबोट भ्रमित करने वाले बैकग्राउंड को अनदेखा करना और क्रिया पर ध्यान केंद्रित करना सीख जाता है।

CEZSAR कैसे काम करता है (विधि/रेसिपी)

यह विधि एक "कॉन्ट्रास्टिव" (तुलनात्मक) दृष्टिकोण का उपयोग करती है, जो "हॉट एंड कोल्ड" (पास या दूर) के खेल जैसा है।

  1. सेटअप: सिस्टम एक वीडियो और उसका वर्णन करने वाला एक वाक्य लेता है।
  2. लक्ष्य: यह कोशिश करता है कि वीडियो और उसका मिलान करने वाला वाक्य गणितीय स्थान में एक-दूसरे को "गले लगाएँ" (बहुत करीब आ जाएँ)।
  3. ट्विस्ट (हार्ड नेगेटिव सैंपलिंग): यह सबसे चतुर हिस्सा है। सिस्टम को यह भी सीखना होता है कि क्या मेल नहीं खाता है। इंसानों द्वारा मैन्युअल रूप से खराब मिलान खोजने के बजाय, कंप्यूटर स्वचालित रूप से उन्हें उत्पन्न करता है।
    • यह "घोड़े की सवारी करने" वाले व्यक्ति का एक वीडियो लेता है।
    • यह "घोड़े की सवारी करने" के बारे में एक वाक्य (अच्छा मिलान) लेता है।
    • यह "साइकिल चलाने" या "पास्ता पकाने" के बारे में एक वाक्य (खराब मिलान) लेता है।
    • यह कंप्यूटर को "घोड़े" वाले वीडियो से "खाना पकाने" वाले वाक्य को दूर धकेलने के लिए मजबूर करता है।
    • जादू: वे बिना मानवीय मदद के इन "खराब मिलानों" को स्वचालित रूप से खोजने के लिए एक स्मार्ट ट्रिक का उपयोग करते हैं, जिससे वे केवल एक कंप्यूटर पर कुछ ही घंटों में लाखों प्रशिक्षण उदाहरण बना लेते हैं।

परिणाम

लेखकों ने इसे दो प्रसिद्ध वीडियो डेटासेट (UCF-101 और Kinetics-400) पर परखा।

  • स्कोर: उनकी विधि ने पिछले तरीकों की तुलना में काफी अधिक सटीकता प्राप्त की। उदाहरण के लिए, 101 अलग-अलग क्रियाओं वाले परीक्षण में, इसने अगली सर्वश्रेष्ठ विधि की तुलना में सटीकता में लगभग 10 प्रतिशत अंकों का सुधार किया।
  • यह क्यों काम किया: टेक्स्ट विवरणों का उपयोग करके विजुअल लर्निंग को निर्देशित करने से, रोबोट समान दिखने वाली क्रियाओं (जैसे "घोड़े की सवारी" बनाम "घुड़दौड़") के बीच अंतर करने में बहुत बेहतर हो गया और वह अलग-अलग बैकग्राउंड से भ्रमित नहीं हुआ।

संक्षेप में

CEZSAR कंप्यूटर को उन क्रियाओं को पहचानने के लिए सिखाने का एक नया तरीका है जिन्हें उसने पहले कभी नहीं देखा है। केवल चित्रों को याद करने के बजाय, यह कंप्यूटर को चित्रों को उनके विवरणों के साथ जोड़ने के लिए सिखाता है, जिसका उपयोग "मैच और मिसमैच" के एक स्मार्ट खेल के माध्यम से दृश्य और पाठ के बीच के अंतर को पाटने के लिए किया जाता है। यह कंप्यूटर को नई क्रियाओं को जल्दी और सटीक रूप से समझने में सक्षम बनाता है, भले ही उसने उनका कोई वीडियो पहले कभी न देखा हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →