← नवीनतम पेपर
💻 computer science

MOSA: Motion-Guided Semantic Alignment for Dynamic Scene Graph Generation

यह शोध पत्र MoSA का प्रस्ताव करता है, जो एक मोशन-गाइडेड सिमेंटिक अलाइनमेंट फ्रेमवर्क है जो ऑब्जेक्ट-पेयर मोशन एट्रिब्यूट्स को स्थानिक विशेषताओं के साथ एकीकृत करके, क्रॉस-मोडल मैचिंग के माध्यम से विजुअल रिप्रेजेंटेशन्स को टेक्स्ट एम्बेडिंग्स के साथ अलाइन करके, और टेल रिलेशनशिप की मॉडलिंग को बेहतर बनाने के लिए एक कैटेगरी-वेटेड लॉस का उपयोग करके डायनेमिक सीन ग्राफ जनरेशन को बढ़ाता है।

मूल लेखक: Xuejiao Wang, Bohao Zhang, Changbo Wang, Gaoqi He

प्रकाशित 2026-04-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xuejiao Wang, Bohao Zhang, Changbo Wang, Gaoqi He

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त फिल्म का दृश्य देख रहे हैं। एक व्यक्ति मेज पर बैठा है, हाथ में सैंडविच पकड़े हुए है, और एक कुत्ते की ओर देख रहा है।

पुराने कंप्यूटर प्रोग्राम जो इस दृश्य को समझने की कोशिश करते हैं, वे एक खराब दृष्टि वाले और बिना गति की समझ वाले रोबोट की तरह हैं। वे व्यक्ति और सैंडविच को तो देखते हैं, लेकिन भ्रमित हो सकते हैं। क्या व्यक्ति सैंडविच को पकड़े हुए है, या सिर्फ उसे छू रहा है? क्या कुत्ता व्यक्ति की ओर देख रहा है, या बस उसके पास है? क्योंकि रोबक केवल स्थिर तस्वीरों (जैसे एक फोटो) को देखता है, वह सूक्ष्म संकेतों को चूक जाता है: जैसे हाथ का मुंह की ओर बढ़ना, या कुत्ते के सिर का मुड़ना।

यह पेपर MoSA (मोशन-गाइडेड सिमेंटिक अलाइनमेंट) नामक एक नई प्रणाली पेश करता है। MoSA को एक सुपर-स्मार्ट फिल्म क्रिटिक (फिल्म समीक्षक) के रूप में समझें, जो न केवल अभिनेताओं को देखता है, बल्कि यह भी देखता है कि वे कैसे हिलते-डुलते हैं और सुनता भी है कि स्क्रिप्ट में क्या कहा गया है।

यहाँ बताया गया है कि MoSA कैसे काम करता है, जिसे तीन सरल चरणों में विभाजित किया गया है:

1. "मोशन डिटेक्टिव" (MFE - मोशन डिटेक्टिव)

समस्या: पुराने सिस्टम वीडियो को स्थिर तस्वीरों के ढेर की तरह मानते हैं। वे एक्शन (क्रिया) को मिस कर देते हैं।
MoSA का समाधान: MoSA के पास एक विशेष "मोशन डिटेक्टिव" मॉड्यूल है। केवल "वह क्या है?" पूछने के बजाय, यह पूछता है:

  • "वे कितनी तेजी से हिल रहे हैं?"
  • "क्या वे करीब आ रहे हैं या दूर जा रहे हैं?"
  • "क्या वे एक ही दिशा में बढ़ रहे हैं?"

उपमा: कल्पना कीजिए कि आप यह अनुमान लगाने की कोशिश कर रहे हैं कि दो लोग गले मिलने वाले हैं या बस एक-दूसरे के पास से गुजरने वाले हैं। यदि आप केवल एक फ्रेम देखते हैं, तो वे करीब लग सकते हैं। लेकिन यदि आप उन्हें चलते हुए देखते हैं, तो आप देखते हैं कि एक व्यक्ति अंदर की ओर झुक रहा है (गले मिलना) जबकि दूसरा दूर हट रहा है (पास से गुजरना)। MoSA इन "मोशन संकेतों" (गति, दिशा, दूरी) की गणना करता है ताकि वास्तविक संबंध को समझा जा सके।

2. "मोशन-एन्हांस्ड ट्रांसलेटर" (MIM - मोशन-एन्हांस्ड ट्रांसलेटर)

समस्या: भले ही रोबोट गति को देख ले, लेकिन उसे यह नहीं पता होगा कि इसे विजुअल पिक्चर (दृश्य चित्र) के साथ कैसे मिलाना है।
MoSA का समाधान: यह मॉड्यूल एक अनुवादक (ट्रांसलेटर) की तरह है जो "मोशन डिटेक्टिव" के नोट्स को "विजुअल कैमरा" की तस्वीरों के साथ जोड़ता है। यह उन्हें एक साथ मिला देता है ताकि कंप्यूटर समझ सके कि "करीब आना + किसी वस्तु को पकड़ना" = "खाना," न कि केवल "पकड़ना।"

उपमा: यह एक नृत्य देखने जैसा है। यदि आप केवल नर्तकों की स्थिति (स्थानिक/spatial) देखते हैं, तो आपको लग सकता है कि वे बस खड़े हैं। लेकिन यदि आप उनकी स्थिति को उनके कदमों की लय (गति/motion) के साथ जोड़ते हैं, तो आपको एहसास होता है कि वे एक विशिष्ट नृत्य मुद्रा (डांस मूव) कर रहे हैं। MoSA "कहाँ" को "कैसे" के साथ जोड़ता है।

3. "स्क्रिप्ट रीडर" (ASM - स्क्रिप्ट रीडर)

समस्या: कभी-कभी, दो क्रियाएं दिखने में बहुत समान होती हैं। उदाहरण के लिए, "कप से पीना" और "कप को छूना" एक धुंधले वीडियो में लगभग एक जैसा दिख सकता है।
MoSA का समाधान: यह मॉड्यूल भाषा के ज्ञान को सामने लाता है। यह वीडियो में जो देख रहा है उसकी तुलना टेक्स्ट विवरणों की एक लाइब्रेरी (जैसे कि एक स्क्रिप्ट) से करता है। यह पूछता है, "क्या यह विजुअल पैटर्न 'छूने' की तुलना में 'पीने' के टेक्स्ट विवरण से बेहतर मेल खाता है?"

उपमा: कल्पना कीजिए कि आप कुछ सुर गुनगुनाकर एक गाने को पहचानने की कोशिश कर रहे हैं। यह कठिन है। लेकिन यदि आपके पास बोल (टेक्स्ट) की एक सूची है और आप अपने गुनगुनाने को उन शब्दों से मिलाते हैं, तो यह आसान हो जाता है। MoSA वीडियो एक्शन को "बोलों" (टेक्स्ट विवरण) से मिलाता है ताकि यह सुनिश्चित हो सके कि वह सही शब्द चुने।

यह एक बड़ी बात क्यों है? ("लॉन्ग-टेल" समस्या)

डेटा की दुनिया में, कुछ चीजें हर समय होती हैं (जैसे "व्यक्ति का खड़ा होना"), लेकिन कुछ दुर्लभ चीजें बहुत कम होती हैं (जैसे "व्यक्ति का करतब दिखाना/जगलिंग करना")। इन दुर्लभ चीजों को "लॉन्ग टेल" (Long Tail) कहा जाता है।
पुराने कंप्यूटर आलसी होते हैं; वे सामान्य चीजों का अनुमान लगाते हैं क्योंकि वे आसान हैं। वे अक्सर दुर्लभ और दिलचस्प क्रियाओं को अनदेखा कर देते हैं।

  • MoSA का गुप्त हथियार: यह एक विशेष स्कोरिंग सिस्टम का उपयोग करता है जो कंप्यूटर को उन दुर्लभ और कठिन संबंधों पर अतिरिक्त ध्यान देने के लिए मजबूर करता है। यह एक ऐसे शिक्षक की तरह है जो कठिन समस्याओं को हल करने के लिए एक्स्ट्रा क्रेडिट देता है, जिससे यह सुनिश्चित होता है कि कंप्यूटर दुर्लभ चीजों को भी सीखे।

परिणाम

(Action Genome) के वीडियो क्लिप्स के एक विशाल डेटासेट पर परीक्षण किए जाने पर, MoSA इन चीजों में सर्वश्रेष्ठ साबित हुआ:

  1. विवरणों को पकड़ना: "छूने" और "पीने" के बीच अंतर करना।
  2. कहानी को समझना: यह जानना कि सैंडविच को मुंह की ओर ले जाना "खाना" है, न कि केवल "पकड़ना।"
  3. दुर्लभ रत्नों को खोजना: उन अजीब और दुर्लभ क्रियाओं की सटीक पहचान करना जिन्हें अन्य सिस्टम मिस कर देते हैं।

संक्षेप में: MoSA एक वीडियो समझने वाली प्रणाली है जो न केवल यह नहीं देखती कि क्या हो रहा है, बल्कि यह भी देखती है कि यह कैसे हिल रहा है और यह सुनिश्चित करने के लिए स्क्रिप्ट की जांच करती है कि कहानी सही हो, यहाँ तक कि कठिन हिस्सों के लिए भी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →