← नवीनतम पेपर
💻 computer science

EgoAVU: Egocentric Audio-Visual Understanding

यह शोध पत्र EgoAVU को प्रस्तुत करता है, जो एक स्केलेबल डेटा इंजन है जो EgoAVU-Instruct डेटासेट और EgoAVU-Bench बनाने के लिए उच्च-गुणवत्ता वाले एगोसेंट्रिक ऑडियो-विजुअल नैरेशन को स्वचालित रूप से उत्पन्न करता है, जो यह प्रदर्शित करता है कि इस डेटा पर मल्टी-मोडल लार्ज लैंग्वेज मॉडल्स को फाइन-ट्यून करने से एगोसेंट्रिक वीडियो में ऑडियो और विजुअल संकेतों को संयुक्त रूप से समझने की उनकी क्षमता में महत्वपूर्ण सुधार होता है।

मूल लेखक: Ashish Seth, Xinhao Mei, Changsheng Zhao, Varun Nagaraja, Ernie Chang, Gregory P. Meyer, Gael Le Lan, Yunyang Xiong, Vikas Chandra, Yangyang Shi, Dinesh Manocha, Zhipeng Cai

प्रकाशित 2026-02-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ashish Seth, Xinhao Mei, Changsheng Zhao, Varun Nagaraja, Ernie Chang, Gregory P. Meyer, Gael Le Lan, Yunyang Xiong, Vikas Chandra, Yangyang Shi, Dinesh Manocha, Zhipeng Cai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने हाई-टेक चश्मा पहना हुआ है जो आपके पूरे दिन की हर देखी और सुनी गई चीज़ को रिकॉर्ड करता है—जैसे खाना बनाना, साइकिल ठीक करना, या किसी व्यस्त सड़क पर चलना। यह एक "एगोसेंट्रिक" (egocentric) वीडियो है जिसे शोधकर्ता देखते हैं। यह एक फर्स्ट-पर्सन व्यू है, जो हलचल और शोर से भरा होता है।

यह पेपर एक नए प्रोजेक्ट EgoAVU (एगोसेंट्रिक ऑडियो-विजुअल अंडरस्टैंडिंग) को पेश करता है। इसे इन व्यस्त, शोर भरे लाइफ-लॉग्स को समझने की कोशिश कर रहे AI मॉडल्स के लिए एक "अनुवादक" (translator) और "शिक्षक" (teacher) के रूप में समझें।

यहाँ इस पेपर की कहानी सरल रूप में दी गई है:

1. समस्या: AI "बहरा" और "भटका हुआ" है

लेखकों ने पाया कि वर्तमान सुपर-स्मार्ट AI मॉडल्स (जिन्हें मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स कहा जाता है) तस्वीरें और वीडियो देखने में तो बहुत अच्छे हैं, लेकिन जब कैमरा इंसान के सिर की तरह इधर-उधर घूम रहा हो, तो वे सुनने में बहुत खराब होते हैं।

  • पक्षपात (The Bias): ये AI उन लोगों की तरह हैं जो केवल वही देखते हैं जो उनके सामने है। यदि आप उन्हें प्याज काटते हुए किसी व्यक्ति का वीडियो दिखाते हैं, तो AI चाकू और प्याज का तो सटीक वर्णन कर देगा, लेकिन काटने की आवाज़ को पूरी तरह से अनदेखा कर देगा।
  • भ्रम (The Hallucination): इससे भी बुरा यह है कि यदि वीडियो में कोई आवाज़ है (जैसे बैकग्राउंड में कार का हॉर्न बजना), तो AI यह अनुमान लगा सकता है कि यह कुत्ते के भौंकने की आवाज़ है, सिर्फ इसलिए क्योंकि उसे लगता है कि वहाँ एक कुत्ता होना चाहिए। वह चीजें बना रहा है क्योंकि वह आवाज़ को उसके वास्तविक स्रोत से जोड़ नहीं पाता।
  • डेटा की कमी: AI को सिखाने के लिए, आपको एक पाठ्यपुस्तक की आवश्यकता होती है। लेकिन इन वीडियो के लिए मौजूदा पाठ्यपुस्तकें मुख्य रूप से उन टेक्स्ट विवरणों पर आधारित हैं जो केवल यह बताते हैं कि लोग अपने हाथों से क्या कर रहे हैं, परिवेश की आवाजों को नजरअंदाज करते हुए।

2. समाधान: "EgoAVU" फैक्ट्री

इसे ठीक करने के लिए, टीम ने EgoAVU नामक एक विशाल, स्वचालित फैक्ट्री बनाई। लाखों विवरण लिखने के लिए इंसानों को काम पर रखने के बजाय (जो धीमा और महंगा है), उन्होंने अपने लिए एक मशीन बनाई जो यह काम कर सके।

EgoAVU को एक तीन-चरणीय असेंबली लाइन के रूप में सोचें:

  • चरण 1: जासूस (संवर्धन/Enhancement): फैक्ट्री कच्चे वीडियो क्लिप लेती है और अलग-अलग AI "जासूसों" से वीडियो को बिना आवाज़ के देखने और ऑडियो को बिना वीडियो के सुनने के लिए कहती है। यह AI को भ्रमित होने से रोकता है। एक जासूस हर वस्तु की सूची बनाता है; दूसरा हर ध्वनि की सूची बनाता है।
  • चरण 2: संपादक (फिल्टरिंग/Filtering): सभी वीडियो सिखाने के लिए अच्छे नहीं होते। कुछ बहुत उबाऊ या दोहराव वाले होते हैं। फैक्ट्री यह जांचने के लिए कि एक वीडियो में कितने अलग-अलग शब्द और ध्वनियाँ हैं, एक "लेक्सिकन मीटर" (जिसे MATTR कहा जाता है) का उपयोग करती है। यदि कोई वीडियो बस दीवार को घूरने वाला है, तो उसे बाहर कर दिया जाता है। यदि यह एक शोर भरा किचन है जिसमें काटने, छनछनाने और बातचीत की आवाज़ें हैं, तो उसे रखा जाता है।
  • चरण 3: कहानीकार (ग्राफ जनरेशन/Graph Generation): यही जादू वाला चरण है। फैक्ट्री वस्तुओं की सूची और ध्वनियों की सूची लेती है और एक मैप (जिसे मल्टीमॉडल कॉन्टेक्स्ट ग्राफ कहा जाता है) बनाती है। यह मैप बिंदुओं को जोड़ता है: "चाकू (वस्तु) बोर्ड से टकराया (क्रिया) जिससे टैपिंग की आवाज़ (ध्वनि) हुई।" यह AI को यह समझने के लिए मजबूर करता है कि वह ध्वनि उस विशिष्ट क्रिया से संबंधित है।

3. परिणाम: एक नई पाठ्यपुस्तक और एक नया टेस्ट

इस फैक्ट्री का उपयोग करके, उन्होंने दो चीजें बनाईं:

  • EgoAVU-Instruct (पाठ्यपुस्तक): 3 मिलियन प्रश्न और उत्तरों का एक विशाल पुस्तकालय। ये केवल "यह क्या है?" जैसे प्रश्न नहीं हैं। ये जटिल पहेलियाँ हैं जैसे, "व्यक्ति के फ्रिज खोलने से ठीक पहले कौन सी आवाज़ हुई थी?" या "दृश्य का वर्णन करें, बैकग्राउंड के शोर सहित।"
  • EgoAVU-Bench (फाइनल एग्जाम): 3,000 सत्यापित प्रश्नों के साथ एक सख्त टेस्ट, यह देखने के लिए कि क्या AI ने वास्तव में सीखा है।

4. बड़ी खोज

जब उन्होंने मौजूदा AI मॉडल्स को इस नए एग्जाम पर रखा, तो वे बुरी तरह विफल रहे।

  • उन्होंने ऑडियो को अनदेखा किया।
  • वे यह नहीं बता सके कि कौन सी आवाज़ किस वस्तु से आई।
  • उन्होंने ऐसी आवाजें बना दीं जो वहाँ थीं ही नहीं।

हालाँकि, जब उन्होंने इन्हीं AI मॉडल्स को EgoAVU पाठ्यपुस्तक का अध्ययन कराया, तो वे सुपरस्टार बन गए।

  • सुधार: इस नए टेस्ट पर उनका प्रदर्शन 113% तक बढ़ गया।
  • ट्रांसफर: यह नया कौशल केवल उनके विशिष्ट टेस्ट के लिए नहीं था। वे अन्य मौजूदा टेस्ट (जैसे वीडियो टाइमिंग को समझना या भ्रम को पहचानना) में भी बेहतर हो गए, जिनमें सुधार 28% तक हुआ।

निचोड़

यह पेपर साबित करता है कि वर्तमान AI मॉडल्स "विज़न-केंद्रित" (vision-centric) हैं और उन्हें सुनना सीखने की आवश्यकता है। उच्च-गुणवत्ता वाला प्रशिक्षण डेटा बनाने के लिए एक मशीन बनाकर, जो ध्वनियों को विशिष्ट दृश्य क्रियाओं से जोड़ती है, लेखकों ने इन मॉडल्स को आखिरकार यह "सुनना" सिखाया कि वे क्या देख रहे हैं।

संक्षेप में: उन्होंने एक ऐसी मशीन बनाई जो AI को जीवन के साउंडट्रैक को अनदेखा करना बंद करने और शोर को क्रिया से जोड़ने के लिए सिखाती है, जिससे AI वास्तविक दुनिया के फर्स्ट-पर्सन वीडियो को समझने में बहुत अधिक स्मार्ट हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →