← नवीनतम पेपर
💻 computer science

Frequency-guided Multi-level Reasoning for Scene Graph Generation in Video

यह शोधपत्र FReMuRe का प्रस्ताव करता है, जो एक फ्रीक्वेंसी-गाइडेड मल्टी-लेवल रीजनिंग मॉडल है जो रिलेशन-स्पेसिफिक ब्रांचेस, एक फ्रीक्वेंसी-अवेयर डुअल-ब्रांच एम्बेडिंग नेटवर्क और नवीन क्लासिफिकेशन हेड्स का उपयोग करके वीडियो सीन ग्राफ जनरेशन में लॉन्ग-टेल डिस्ट्रीब्यूशन चुनौती को संबोधित करता है ताकि दुर्लभ संबंधों के रिकॉल और समग्र रीजनिंग रोबस्टनेस में महत्वपूर्ण सुधार किया जा सके।

मूल लेखक: Chenxing Li, Yiping Duan, Xiaoming Tao

प्रकाशित 2026-04-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chenxing Li, Yiping Duan, Xiaoming Tao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप पार्क में लोगों का एक व्यस्त वीडियो देख रहे हैं। आपका काम ठीक से वर्णन करना है: "एक व्यक्ति बेंच पर बैठा है," "एक कुत्ता गेंद का पीछा कर रहा है," या "एक बच्चा आइसक्रीम खा रहा है।"

AI की दुनिया में, इस कार्य को सीन ग्राफ जनरेशन (Scene Graph Generation) कहा जाता है। AI इस वीडियो को "कौन, क्या कर रहा है, किसके साथ" की एक संरचित सूची में बदलने की कोशिश करता है।

हालाँकि, इसमें एक बड़ी समस्या है। अधिकांश वीडियो सामान्य क्रियाओं (जैसे "पकड़ना" या "देखना") से भरे होते हैं, लेकिन बहुत कम वीडियो दुर्लभ क्रियाएं (जैसे "जगलिंग करना" या "कुश्ती लड़ना") दिखाते हैं। इस कारण, मानक AI मॉडल आलसी हो जाते हैं। वे सामान्य चीजों का अनुमान लगाने में विशेषज्ञ बन जाते हैं, लेकिन दुर्लभ चीजों के मामले में पूरी तरह विफल हो जाते हैं। यह एक ऐसे छात्र की तरह है जिसने केवल पाठ्यपुस्तक के सबसे लोकप्रिय अध्यायों का अध्ययन किया है और परीक्षा में असफल हो जाता है क्योंकि शिक्षक ने एक दुर्लभ विषय पर प्रश्न पूछा है।

यह शोध पत्र इस समस्या को ठीक करने के लिए FReMuRe (फ्रीक्वेंसी-गाइडेड रिलेशनल मल्टी-लेवल रीजनिंग) नामक एक नया AI मॉडल पेश करता है। यह कैसे काम करता है, इसे सरल उपमाओं के साथ समझाया गया है:

1. समस्या: "लोकप्रिय बच्चे" का पूर्वाग्रह (The "Popular Kid" Bias)

कल्पना कीजिए कि एक कक्षा है जहाँ शिक्षक प्रश्न पूछ रहे हैं।

  • पुराना तरीका: शिक्षक पूरी कक्षा के लिए एक ही माइक्रोफ़ोन का उपयोग करते हैं। "लोकप्रिय बच्चे" (सामान्य संबंध जैसे "पकड़ना") बहुत शोर मचाते हैं और बाकी सभी को दबा देते हैं। "शांत बच्चे" (दुर्लभ संबंध जैसे "ले जाना") दब जाते हैं। AI केवल शोर मचाने वाली आवाजों को सुनने के लिए सीख जाता है, इसलिए वह कभी भी शांत आवाजों को नहीं सीख पाता।
  • परिणाम: AI यह कहने में बहुत अच्छा है कि "व्यक्ति कप पकड़े हुए है" लेकिन यह बताने में बहुत खराब है कि "व्यक्ति भारी बॉक्स ले जा रहा है।"

2. समाधान: FReMuRe की तीन जादुई तरकीबें

लेखकों ने तीन मुख्य रणनीतियों का उपयोग करके एक स्मार्ट सिस्टम बनाया है:

अ. "फ्रीक्वेंसी गेट" (आवाज़ का नियंत्रण - The Volume Knob)

सबको एक साथ चिल्लाने देने के बजाय, FReMuRe हर संबंध पर एक विशेष वॉल्यूम नॉब लगाता है।

  • यदि कोई संबंध सामान्य है (जैसे "पकड़ना"), तो यह नॉब वॉल्यूम को थोड़ा कम कर देता है ताकि वह हावी न हो।
  • यदि कोई संबंध दुर्लभ है (जैसे "जगलिंग करना"), तो यह नॉब वॉल्यूम को बढ़ा देता है।
  • उपमा: यह एक कॉन्सर्ट में साउंड इंजीनियर की तरह है जो स्वचालित रूप से शांत गायक के माइक्रोफ़ोन को बढ़ाता है ताकि दर्शक उन्हें सुन सकें, जबकि तेज़ गायक को स्पीकर फटने से रोकने के लिए उसकी आवाज़ को नियंत्रित रखता है। यह सुनिश्चित करता है कि AI दुर्लभ चीजों पर ध्यान दे।

ब. "डुअल-ब्रांच" नेटवर्क (विशेष कक्षाएं - The Specialized Classrooms)

पुराने सिस्टम में, सभी छात्र (संबंध) एक बड़े कमरे में बैठते थे और एक ही शिक्षक से सीखते थे। इससे अराजकता पैदा होती थी क्योंकि "पकड़ने" के लिए शिक्षण शैली "जगलिंग" के लिए काम नहीं करती थी।

FReMure क्लास को दो अलग-अलग कमरों में विभाजित करता है:

  1. "हेड" रूम: सामान्य संबंधों के लिए।
  2. "टेल" रूम: दुर्लभ संबंधों के लिए।
  • उपमा: एक ऐसे स्कूल की कल्पना करें जहाँ लोकप्रिय विषयों के लिए "सामान्य अध्ययन" ट्रैक है और दुर्लभ प्रतिभाओं के लिए "विशेष कला" ट्रैक है। उन्हें अलग करके, AI सामान्य चीजों से भ्रमित हुए बिना दुर्लभ क्रियाओं के विशिष्ट नियमों को सीख सकता है। यह उस "ग्रेडिएंट संघर्ष" (ध्यान के लिए लड़ाई) को रोकता है जो पहले होता था।

स. "स्मार्ट गेसिंग" हेड्स (अनिश्चितता के जासूस - The Uncertainty Detectives)

अंत में, जब AI कोई अनुमान लगाता है, तो उसे यह जानने की आवश्यकता होती है कि वह कितना आश्वस्त है।

  • बेयसियन हेड (The Bayesian Head): यह एक जासूस की तरह है जो कहता है, "मुझे 80% यकीन है कि यह एक कुत्ता है, लेकिन 20% संभावना है कि यह एक बिल्ली है।" यह स्वीकार करता है कि वह अनिश्चित है, जिससे इसे दुर्लभ वस्तुओं पर गलत अनुमान लगाने से बचने में मदद मिलती है।
  • GMM-प्लस हेड (The GMM-Plus Head): यह एक शेफ की तरह है जो जानता है कि "पिज्जा" कई अलग-अलग तरीकों से दिख सकता है (चीज़ी, पतला क्रस्ट, डीप डिश)। AI को यह सोचने के लिए मजबूर करने के बजाय कि किसी दुर्लभ वस्तु को देखने का केवल एक ही तरीका है, यह हेड उस दुर्लभ वस्तु के कई अलग-अलग "फ्लेवर्स" या विविधताओं की अनुमति देता है।

3. परिणाम: एक बेहतर कहानीकार

शोधकर्ताओं ने इस नए मॉडल का परीक्षण एक्शन जीनोम (Action Genome) डेटासेट (वीडियो क्लिप्स का एक विशाल पुस्तकालय) पर किया।

  • पहले: AI आसान चीजों में अच्छा था लेकिन कठिन, दुर्लभ चीजों को मिस कर देता था।
  • बाद में (FReMuRe): AI दुर्लभ और कठिन संबंधों को पहचानने में बहुत बेहतर हो गया। इसने न केवल सामान्य उत्तर सही दिए; बल्कि इसने आखिरकार "लॉन्ग-टेल" (दुर्लभ) उत्तरों को भी सही ढंग से पकड़ना शुरू कर दिया।

सारांश

FReMuRe को एक निष्पक्ष शिक्षक के रूप में सोचें जो:

  1. शांत छात्रों (दुर्लभ संबंधों) की आवाज़ बढ़ाता है।
  2. कक्षा को विभाजित करता है ताकि सामान्य और दुर्लभ छात्र ध्यान के लिए आपस में न लड़ें।
  3. छात्रों को प्रोत्साहित करता है कि वे स्वीकार करें कि वे 100% निश्चित नहीं हैं, जिससे अधिक स्मार्ट और सटीक अनुमान लगते हैं।

ऐसा करके, AI अंततः वीडियो की पूरी कहानी को समझ सकता है, न कि केवल उसके उबाऊ और दोहराव वाले हिस्सों को।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →