← नवीनतम पेपर
⚡ electrical engineering

AVSD-Scenes: A Dataset for Audio-Visual Description of Urban Scenes

यह शोध पत्र AVSD-Scenes को प्रस्तुत करता है, जो उन्नत एआई मॉडलों के मोडैलिटी-विशिष्ट आउटपुट को संयोजित करके निर्मित शहरी वातावरण के 12,291 युग्मित ऑडियो-विजुअल विवरणों का एक नवीन डेटासेट है, जो यूनिमोडल दृष्टिकोणों की तुलना में सिमेंटिक अलाइनमेंट, क्रॉस-मोडल रिट्रीवल और सीन क्लासिफिकेशन में बेहतर प्रदर्शन प्रदर्शित करता है।

मूल लेखक: Dhanunjaya Varma Devalraju, Arshdeep Singh, Mark D. Plumbley

प्रकाशित 2026-10-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dhanunjaya Varma Devalraju, Arshdeep Singh, Mark D. Plumbley

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

शहर कभी शांत नहीं होते, और न ही वे कभी स्थिर होते हैं। वे ध्वनि और दृष्टि का एक निरंतर, बदलता हुआ ताना-बाना हैं, जहाँ एक बस की गड़गड़ाहट, भीड़ की चहचहाहट और एक पार्क बेंच का दृश्य विस्तार, सब एक साथ घटित होते हैं। दशकों से, वैज्ञानिकों ने कंप्यूटर को इन वातावरणों को समझने के लिए सिखाने की कोशिश की है, लेकिन वे अक्सर सरल लेबल पर निर्भर रहे हैं, जैसे कि किसी रिकॉर्डिंग को केवल "पार्क" या "सड़क" के रूप में टैग करना। ये लेबल उपयोगी तो हैं, लेकिन वे बहुत सतही हैं; वे हमें स्थान तो बताते हैं लेकिन कहानी को छोड़ देते हैं। वे पत्तियों की विशिष्ट सरसराहट, किसी राहगीर के कोट के रंग, या किसी इमारत से टकराकर आती ध्वनि के प्रतिध्वनि को नहीं पकड़ पाते। शहर को वास्तव में समझने के लिए, एक कंप्यूटर को केवल एक नाम की आवश्यकता नहीं है; उसे एक ऐसे विवरण की आवश्यकता है जो देखे गए और सुने गए दृश्यों को एक एकल, सुसंगत वृत्तांत में बुन सके।

यही वह चुनौती है जिसे आईआईटी मद्रास और किंग्स कॉलेज लंदन के शोधकर्ताओं ने AVSD-Scenes नामक एक नए प्रोजेक्ट के साथ हल किया है। टीम ने शहरी दृश्यों का एक विशाल संग्रह बनाने का लक्ष्य रखा, जिसमें से प्रत्येक दृश्य को एक समृद्ध, प्राकृतिक भाषा के विवरण के साथ जोड़ा गया जो यह समझाता है कि ऑडियो और वीडियो दोनों में वास्तव में क्या हो रहा है। उन्होंने दस यूरोपीय शहरों के 12,291 रिकॉर्डिंग्स की एक मौजूदा लाइब्रेरी से शुरुआत की, जहाँ प्रत्येक क्लिप में सिंक्रोनाइज़्ड (एक साथ चलने वाली) ध्वनि और वीडियो शामिल थे। हालाँकि, मूल लाइब्रेरी केवल बुनियादी श्रेणी टैग प्रदान करती थी। शोधकर्ता उन रिक्तियों को भरना चाहते थे, उन सरल टैगों को विस्तृत अनुच्छेदों में बदलना चाहते थे जो प्रत्येक दृश्य में होने वाली विशिष्ट घटनाओं, वस्तुओं और क्रियाओं का वर्णन करते हैं।

इसे प्राप्त करने के लिए, उन्होंने एक स्वचालित पाइपलाइन बनाई जो विशेषज्ञ पर्यवेक्षकों की एक टीम की तरह कार्य करती है। सबसे पहले, उन्होंने ध्वनि और वीडियो को अलग-अलग देखने के लिए शक्तिशाली आर्टिफिशियल इंटेलिजेंस मॉडल का उपयोग किया। एक मॉडल ने ऑडियो सुना, विशिष्ट ध्वनियाँ जैसे पक्षियों की चहचहाहट या यातायात के शोर की पहचान की, और जो उसने सुना उसका एक संक्षिप्त सारांश लिखा। दूसरे मॉडल ने वीडियो देखा, लोगों, वाहनों और गतिविधियों को पहचाना, और जो उसने देखा उसका एक सारांश लिखा। इन दो अलग-अलग विवरणों को फिर एक तीसरे, अधिक उन्नत भाषा मॉडल को दिया गया। यह अंतिम मॉडल एक संपादक के रूप में कार्य करता था, जो ऑडियो नोट्स और विजुअल नोट्स को एक एकल, एकीकृत कहानी में जोड़ता था। इसे यह सुनिश्चित करने का निर्देश दिया गया था कि कहानी तर्कसंगत हो, यह कुछ भी मनगढ़ंत न बनाए, और यह ध्वनि एवं चित्र द्वारा प्रदान किए गए वास्तविक साक्ष्यों पर आधारित हो। परिणाम स्वरूप एक ऐसा डेटासेट प्राप्त हुआ जहाँ प्रत्येक शहरी दृश्य एक ऐसे पैराग्राफ के साथ है जो एक मानवीय अवलोकन की तरह पढ़ता है, जो क्षण के पूर्ण संदर्भ को पकड़ता है।

शोधकर्ताओं ने फिर यह परीक्षण किया कि क्या ये कंप्यूटर-जनरेटेड विवरण वास्तव में उपयोगी थे। उन्होंने यह देखने के लिए प्रश्नों की एक श्रृंखला पूछी कि क्या ये विवरण एक कंप्यूटर को दुनिया को बेहतर ढंग से समझने में मदद कर सकते हैं। एक परीक्षण में यह देखा गया कि क्या एक कंप्यूटर एक बड़े पुस्तकालय से सही वीडियो या ऑडियो क्लिप खोजने के लिए टेक्स्ट विवरण का उपयोग कर सकता है। परिणामों ने दिखाया कि नए मल्टीमॉडल विवरण केवल ध्वनि या केवल दृष्टि पर आधारित विवरणों की तुलना में इस कार्य में काफी बेहतर थे। जब कंप्यूटर ने संयुक्त विवरण का उपयोग किया, तो वह मिलान करने वाले ऑडियो क्लिप को बहुत अधिक बार खोज सका, जिससे पता चलता कि टेक्स्ट ने सफलतापूर्वक ध्वनि के सार को पकड़ना सीख लिया था।

उन्होंने यह भी परीक्षण किया कि क्या ये विवरण कंप्यूटर को यह पहचानने में मदद कर सकते हैं कि वह किस प्रकार के शहरी दृश्य को देख रहा है, जैसे कि एक व्यस्त मेट्रो स्टेशन और एक शांत सार्वजनिक चौक के बीच अंतर करना। केवल टेक्स्ट विवरणों का उपयोग करते हुए, सिस्टम ने सही दृश्य की पहचान करने में 94.5 प्रतिशत सटीकता प्राप्त की। जब शोधकर्ताओं ने टेक्स्ट को मूल ऑडियो और वीडियो डेटा के साथ जोड़ा, तो सटीकता थोड़ी बढ़कर 95.4 प्रतिशत हो गई। यह केवल ऑडियो या वीडियो का उपयोग करने की तुलना में एक उल्लेखनीय सुधार था, जो समान स्तर की सटीकता तक पहुँचने में संघर्ष कर रहे थे। निष्कर्ष बताते हैं कि लिखित विवरणों ने वातावरण के बारे में गहरे, अर्थपूर्ण विवरणों को पकड़ लिया था जो कच्चे डेटा ने अकेले छोड़ दिए थे।

अध्ययन का सबसे खुलासा करने वाला हिस्सा एक परीक्षण था जिसे यह देखने के लिए डिज़ाइन किया गया था कि क्या कंप्यूटर केवल दृश्य के नामों को याद कर रहा है या वास्तव में सामग्री को समझ रहा है। शोधकर्ताओं ने विवरण बनाने की प्रक्रिया के दौरान AI को दिए गए निर्देशों से दृश्य लेबल हटा दिए थे, जिससे उसे केवल ऑडियो और विजुअल कंटेंट पर निर्भर रहने के लिए मजबूर होना पड़ा। दृश्य के नाम बताए बिना भी, विवरण विभिन्न प्रकार के दृश्यों के बीच अंतर करने में अत्यधिक प्रभावी रहे। यह इंगarित करता कि AI केवल इसलिए "पार्क" लेबल को नहीं दोहरा रहा था क्योंकि उसे बताया गया था; बल्कि वह वास्तव में घास वाले क्षेत्रों, लकड़ी की बाड़ों और वातावरण की विशिष्ट ध्वनियों का वर्णन कर रहा था। विवरण दृश्य की वास्तविकता को पकड़ रहे थे, न कि केवल उसकी श्रेणी को।

टीम ने लेखन की गुणवत्ता का भी मूल्यांकन किया। उन्होंने विवरणों को प्रवाह, व्याकरण और यह कि वे ऑडियो और वीडियो के साथ कितनी अच्छी तरह मेल खाते हैं, जैसे कारकों पर रेट करने के लिए स्वचालित उपकरणों और मानव न्यायाधीशों दोनों का उपयोग किया। मानव न्यायाधीशों ने पाया कि विवरण आम तौर पर सटीक और सूचनात्मक थे, और इस बात के लिए उच्च अंक दिए कि वे जो देखा गया उसका वर्णन कितनी अच्छी तरह करते हैं और कितने सुचारू रूप से लिखे गए हैं। हालांकि कुछ क्षण ऐसे भी थे जहाँ विवरणों में सुधार की गुंजाइश थी, समग्र गुणवत्ता जटिल कार्यों के लिए पर्याप्त रूप से मजबूत थी।

यह कार्य मशीनों द्वारा दुनिया को समझने के तरीके में एक महत्वपूर्ण प्रगति का प्रतिनिधित्व करता है। सरल लेबल से समृद्ध, वर्णनात्मक वृत्तांतों की ओर बढ़ते हुए, शोधकर्ताओं ने दिखाया है कि कंप्यूटर हमारे दैनिक जीवन के जटिल अंतर्संबंधों को समझ सकते हैं। यह डेटासेट, जो अब दूसरों के उपयोग के लिए उपलब्ध है, उन प्रणालियों के निर्माण के लिए एक नया आधार प्रदान करता है जो वास्तव में हमारे समान दुनिया को "देख" और "सुन" सकती हैं। यह सुझाव देता है कि शहरी वातावरण में आर्टिफिशियल इंटेलिजेंस का भविष्य बेहतर लेबल में नहीं, बल्कि बेहतर कहानियों में निहित है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →