← नवीनतम पेपर
💻 computer science

AV-Unified: A Unified Framework for Audio-visual Scene Understanding

यह शोध पत्र AV-Unified का प्रस्ताव करता है, जो एक नवीन फ्रेमवर्क है जो विषम इनपुट और आउटपुट को विविक्त टोकन अनुक्रमों (discrete token sequences) में परिवर्तित करके और क्रॉस-मोडल जुड़ाव को प्रभावी ढंग से कैप्चर करने के लिए मल्टी-स्केल स्पैटियोटेम्पोरल परसेप्शन मॉड्यूल का उपयोग करके विविध ऑडियो-विजुअल सीन अंडरस्टैंडिंग कार्यों को एक एकल आर्किटेक्चर में एकीकृत करता है।

मूल लेखक: Guangyao Li, Xin Wang, Wenwu Zhu

प्रकाशित 2026-03-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guangyao Li, Xin Wang, Wenwu Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त शहर के चौक से गुजर रहे हैं। आप केवल एक सड़क कलाकार को वायलिन बजाते हुए देखते ही नहीं हैं; आप उस संगीत को सुनते हैं, धनुष (bow) की गति को देखते हैं, और आपका मस्तिष्क तुरंत दोनों को जोड़ देता है। आप जानते हैं कि वह ध्वनि उसी विशिष्ट व्यक्ति से आ रही है, न कि उनके पीछे के ट्रैफिक से। आप यहाँ तक भी अनुमान लगा सकते हैं कि गाना कितनी देर तक चलेगा या वे कब रुकने वाले हैं।

इंसान यह काम सहजता से करता है। हम "देखने" को "सुनने" से अलग-अलग मानसिक फोल्डरों में नहीं बांटते। लेकिन दशकों से, कंप्यूटर वैज्ञानिक एआई (AI) को ये चीजें अलग-अलग करने के लिए सिखा रहे हैं। एक प्रोग्राम सीखता है कि कोई घटना कब होती है (जैसे कुत्ते का भौंकना)। दूसरा सीखता है कि वह घटना कहाँ होती है (कुत्ते का स्थान)। तीसरा उसके बारे में प्रश्न पूछना सीखता है। यह ऐसा है जैसे तीन अलग-अलग विशेषज्ञ हों जो आपस में कभी बात नहीं करते, और एक बड़े पहेली को सुलझाने की कोशिश कर रहे हों।

प्रवेश होता है "AV-Unified" का।

AV-Unified को एक सुपर-इंटेलिजेंट, बहु-प्रतिभाशाली कंडक्टर (संचालक) के रूप में सोचें जो स्ट्रिंग्स, ब्रास और पर्कशनन के लिए अलग-अलग कंडक्टर रखने के बजाय, एक साथ पूरे ऑर्केस्ट्रा का नेतृत्व कर सकता है।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. यूनिवर्सल ट्रांसलेटर (The "Sequence-to-Sequence" Magic)

वर्तमान एआई के साथ सबसे बड़ी समस्या यह है कि विभिन्न कार्य अलग-अलग "भाषाएं" बोलते हैं।

  • इवेंट लोकलाइजेशन (घटना का स्थान निर्धारण) कहता है: "कुत्ता 2 सेकंड से 5 सेकंड तक भौंका।"
  • सेगमेंटेशन (खंडन) कहता है: "ये कुत्ते के सटीक पिक्सेल हैं।"
  • क्वेश्चन अनसरिंग (प्रश्न उत्तर) कहता है: "कुत्ता बाईं ओर है।"

AV-Unified एक यूनिवर्सल ट्रांसलेटर की तरह कार्य करता है। यह इन सभी विभिन्न प्रारूपों को लेता है और उन्हें एक एकल, मानक भाषा में बदल देता है: टोकन्स का एक अनुक्रम (sequence of tokens) (इन्हें वाक्य में शब्दों की तरह समझें)।

  • "2 से 5 सेकंड" कहने के बजाय, यह कह सकता है: [घटना] [कुत्ता] [भौंकना] [शुरुआत] [अंत]
  • मास्क (mask) बनाने के बजाय, यह कह सकता है: [पिक्सेल] [कुत्ता] [यहाँ]

चूंकि अब सब कुछ डेटा का एक "वाक्य" बन गया है, इसलिए एआई एक ही समय में इन सभी कार्यों को सीखने के लिए एक ही मस्तिष्क का उपयोग कर सकता है, ठीक वैसे ही जैसे इंसान एक साथ पढ़ना, लिखना और बोलना सीखता है।

2. मल्टी-स्केल टाइम मशीन (सामयिक धारणा - Temporal Perception)

एक वीडियो देखने की कल्पना करें। कुछ चीजें तेजी से होती हैं (एक ताली), जबकि कुछ लंबे समय तक चलती हैं (एक बातचीत)।

  • पुराने एआई मॉडल अक्सर वीडियो को कठोर, एक-सेकंड के टुकड़ों में देखते थे। यह एक सेकंड में एक फ्रेम देखकर फिल्म को समझने की कोशिश करने जैसा है; आप प्रवाह को मिस कर देते हैं।
  • AV-Unified के पास एक मल्टी-स्केल टाइम मशीन है। यह तेज, सूक्ष्म विवरणों (जैसे ड्रम की एक थाप) को देखने के लिए ज़ूम इन कर सकता है और बड़े परिदृश्य (जैसे एक पूरा संगीत प्रदर्शन) को देखने के लिए ज़ूम आउट कर सकता है। यह समझता है कि घटनाओं की अलग-अलग "अवधियाँ" होती हैं और यह उनके अनुसार अपना फोकस समायोजित करता है, जिससे यह सुनिश्चित होता है कि वह किसी घटना की शुरुआत या अंत को मिस न करे।

3. क्रॉस-मोडल डिटेक्टिव (स्थानिक धारणा - Spatial Perception)

यहीं पर "सुनने" और "देखने" का जादू वास्तव में मिलता है।

  • समस्या: एक वीडियो में, आप एक व्यक्ति को गिटार बजाते हुए देख सकते हैं, लेकिन एआई को स्वतः यह पता नहीं चलता कि कौन सी ध्वनि किस व्यक्ति से संबंधित है यदि वहां कई वाद्य यंत्र हों।
  • समाधान: AV-Unified एक क्रॉस-मोडल डिटेक्टिव का उपयोग करता है। यह आंखों को मार्गदर्शन देने के लिए ध्वनि का उपयोग करता है, और कानों को मार्गदर्शन देने के लिए आंखों का।
    • यदि एआई "वायलिन" सुनता है, तो यह तुरंत विजुअल पैचेस (छवि के छोटे टुकड़े) को स्कैन करता है ताकि वायलिन को ढूंढ सके।
    • यदि यह वायलिन देखता है, तो यह वायलिन की विशिष्ट ध्वनि के लिए सुनता है।
    • वे एक-दूसरे की मदद करते हैं, जैसे एक जासूस दूसरे गवाह से मिले सुराग का उपयोग करके दूसरे का स्थान ढूंढता है। यह इस समस्या को हल करता है कि "वह ध्वनि कहाँ से आ रही है?" बिना किसी इंसान द्वारा पहले बॉक्स बनाने की आवश्यकता के।

4. टास्क-स्पेसिफिक प्रॉम्प्ट (मस्तिष्क के लिए "मेन्यू")

चूंकि एआई एक साथ सब कुछ कर रहा है, तो उसे कैसे पता चलता है कि अभी किस पर ध्यान केंद्रित करना है?

  • कल्पना कीजिए कि आप एक रेस्तरां में हैं। आपके पास एक मेन्यू है जिसमें सब कुछ (स्टार्टर, मुख्य भोजन, मिठाई) है।
  • AV-Unified टास्क प्रॉम्प्ट्स का उपयोग "ऑर्डर" के रूप में करता है।
    • यदि आप जानना चाहते हैं कि कुछ कब हुआ, तो प्रॉम्प्ट है: "मुझे समय बताओ।" एआई स्थानिक स्थान (spatial location) को अनदेखा कर देता है और टाइमलाइन पर ध्यान केंद्रित करता है।
    • यदि आप जानना चाहते हैं कि कोई चीज़ कहाँ है, तो प्रॉम्प्ट है: "मुझे स्थान दिखाओ।" एआई समय (timing) को अनदेखा कर देता है और पिक्सेल पर ध्यान केंद्रित करता है।
    • यदि आप कोई प्रश्न पूछना चाहते हैं, तो प्रॉम्प्ट स्वयं वह प्रश्न है।

यह एकल मॉडल को तुरंत गियर बदलने की अनुमति देता है, जो एक स्विस आर्मी नाइफ की तरह कार्य करता है जो दिए गए काम के आधार पर अपना उपकरण बदल लेता है।

यह क्यों मायने रखता है?

AV-Unified से पहले, यदि आप चाहते थे कि एआई ये सभी चीजें करे, तो आपको पांच अलग-अलग मॉडल बनाने, प्रशिक्षित करने और बनाए रखने पड़ते थे। यह महंगा था, धीमा था, और मॉडल आपस में ज्ञान साझा नहीं कर पाते थे।

AV-Unified को एकल-उपयोग वाले उपकरणों से भरे टूलबॉक्स से एक एकल, स्मार्ट रोबोटिक हाथ में अपग्रेड करने के रूप में देखा जा सकता है जो एक साथ वेल्डिंग, पेंटिंग और स्क्रू लगाने का काम कर सकता है।

विभिन्न डेटासेट्स (कुत्तों के वीडियो, संगीत प्रदर्शन, सड़क के दृश्य) के मिश्रण पर प्रशिक्षण प्राप्त करके, मॉडल दुनिया की गहरी, अधिक मानवीय समझ विकसित करता है। यह महसूस करता है कि "भौंकता हुआ कुत्ता" केवल एक ध्वनि और एक छवि नहीं है; यह एक विशिष्ट समय, स्थान और अर्थ वाली एक एकीकृत घटना है।

संक्षेप में: AV-Unified एआई को दृष्टि और ध्वनि को अलग-अलग विषयों के रूप में मानना बंद करने और उन्हें एक एकल, बहती हुई कहानी के रूप में देखना सिखाता है, बिल्कुल वैसे ही जैसे हम करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →