← नवीनतम पेपर
⚡ electrical engineering

Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

यह शोध पत्र ऑडियो-विजुअल फ्लेमिंगो (AV-Flamingo) को प्रस्तुत करता है, जो एक पूर्णतः ओपन स्टेट-ऑफ-द-आर्ट लार्ज लैंग्वेज मॉडल है जिसे एक विशाल नए डेटासेट, एक प्रगतिशील तीन-चरणीय प्रशिक्षण पाठ्यक्रम और एक नवीन टेम्पोरल इंटरलीव्ड चेन-ऑफ-थॉट फ्रेमवर्क का लाभ उठाकर लंबे, जटिल वास्तविक दुनिया के वीडियो पर संयुक्त समझ और तर्क के लिए डिज़ाइन किया गया है।

मूल लेखक: Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit Anand, Siddharth Gururani, Hanrong Ye, Pritam Biswas, Yuanhang Su, Ehsan Hosseini-Asl, Sang-gil Lee, Zhifeng Kong, Jaehyeon K
प्रकाशित 2026-07-20
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit Anand, Siddharth Gururani, Hanrong Ye, Pritam Biswas, Yuanhang Su, Ehsan Hosseini-Asl, Sang-gil Lee, Zhifeng Kong, Jaehyeon Kim, Sungwon Kim, S Sakshi, Ramani Duraiswami, Dinesh Manocha, Andrew Tao, Mohammad Shoeybi, Bryan Catanzaro, Ming-Yu Liu, Wei Ping

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक फिल्म देख रहे हैं। आप अभिनेताओं के चेहरे, परिवेश और क्रियाओं को देखते हैं, लेकिन आप संवाद, बैकग्राउंड म्यूजिक, कदमों की आहट और पत्तों की सरसराहट भी सुनते हैं। लंबे समय तक, कंप्यूटर उन लोगों की तरह थे जिन्होंने अपनी आँखें बंद करके फिल्म देखी हो, केवल ऑडियो ट्रैक सुन रहे हों, या इसके विपरीत। वे एक तस्वीर में बिल्ली को पहचानने या किसी भाषण को ट्रांसक्राइब करने में माहिर थे, लेकिन वे उस पूरे दृश्य को समझने में संघर्ष करते थे जहाँ एक बिल्ली स्क्रीन पर दौड़ते हुए म्याऊँ करती है। इस अध्ययन के क्षेत्र को "मल्टीमॉडल" (multimodal) इंटेलिजेंस कहा जाता है, जहाँ मशीनें विभिन्न इंद्रियों—जैसे दृष्टि और ध्वनि—को मिलाने की कोशिश करती हैं ताकि वे दुनिया को वैसे ही समझ सकें जैसे इंसान समझते हैं। बड़ा सवाल जो शोधकर्ता पूछ रहे हैं, वह यह है: क्या हम एक ऐसा AI बना सकते हैं जो न केवल एक वीडियो देखे या पॉडकास्ट सुने, बल्कि वास्तव में इस बारे में सोच सके कि ध्वनि और चित्र एक साथ कैसे काम करते हैं, खासकर जब कहानी लंबी और जटिल हो?

यहाँ नेमोट्रोन-लैब्स-ऑडियो-विजुअल फ्लेमिंगो (या संक्षेप में AV-Flamingo) आता है, जो NVIDIA और यूनिवर्सिटी ऑफ मैरीलैंड के शोधकर्ताओं द्वारा डिज़ाइन किया गया एक नए प्रकार का AI मस्तिष्क है। पिछले वीडियो AI को ऐसे छात्रों के रूप में सोचें जो केवल पाठ्यपुस्तक का एक पन्ना पढ़ सकते हैं और उस पर एक त्वरित प्रश्न का उत्तर दे सकते हैं। यदि आप उनसे पूरी फिल्म का सारांश देने या 15 मिनट में बदलने वाले एक जटिल दृश्य को समझाने के लिए कहते, तो वे खो जाते, शुरुआत को भूल जाते, या पात्रों को आपस में मिला देते। AV-Flamingo अलग है। यह एक अत्यंत चौकस छात्र की तरह है जो पूरी फिल्म देख सकता है, साउंडट्रैक सुन सकता है, और फिर यह विस्तृत निबंध लिखने के लिए बैठ सकता है कि संगीत ने मूड को कैसे बदला, एक पात्र ने एक निश्चित तरीके से प्रतिक्रिया क्यों दी, या किसी विशिष्ट ध्वनि के दौरान दृश्य घटना के संबंध में सटीक समय क्या था।

शोधकर्ताओं ने पाया कि इसे संभव बनाने के लिए, वे केवल AI को पुराने डेटा का अधिक हिस्सा नहीं दे सकते थे। उन्हें इसे तीन नई तरकीबें सिखानी पड़ीं। सबसे पहले, उन्होंने लगभग 7 मिलियन वास्तविक दुनिया के वीडियो उदाहरणों (जिसमें 4.8 मिलियन प्रश्न-उत्तर जोड़े शामिल थे) का एक विशाल पुस्तकालय बनाया, जिसे विशेष रूप से AI की समय के साथ ध्वनि और दृष्टि को जोड़ने की क्षमता का परीक्षण करने के लिए डिज़ाइन किया गया था। उन्होंने इसे ऑडियो-विजुअल-स्किल्स (Audio-Visual-Skills) नाम दिया। दूसरा, उन्होंने AI को सीधे गहरे पानी में नहीं फेंका; उन्होंने एक "पाठ्यक्रम" (curriculum) का उपयोग किया जो बुनियादी कौशल सिखाने के लिए छोटी क्लिप्स से शुरू हुआ, और फिर धीरे-धीरे लंबी, अधिक जटिल वीडियो की ओर बढ़ा ताकि उसे समय के साथ एक कहानी का पता लगाने के लिए सिखाया जा सके। तीसरा, और शायद सबसे चतुराई से, उन्होंने AI को एक "सोचने की प्रक्रिया" सिखाई जिसे टेम्पोरल ऑडियो-विजुअल इंटरलीव्ड चेन-ऑफ-थॉट (Temporal Audio-Visual Interleaved Chain-of-Thought) कहा जाता है। कल्पना कीजिए कि AI एक वीडियो देख रहा है और हर कुछ सेकंड में रुककर कहता है, "ठीक है, इस सटीक सेकंड पर, ड्रम बजा, और फिर, पात्र कूदा।" यह AI को अपने विचारों को समय के साथ जमीन से जोड़े रखने में मदद करता है, ताकि वह इस बात को लेकर भ्रमित न हो कि पहले क्या हुआ या बाद में क्या हुआ।

इसके परिणाम काफी प्रभावशाली हैं। 15 से अधिक विभिन्न चुनौतियों पर परीक्षण किए जाने पर—जिसमें संगीत और भाषण को समझने से लेकर लंबे वीडियो का विश्लेषण करने और कठिन प्रश्नों के उत्तर देने तक शामिल है—AV-Flamingo ने अपने समान आकार के अन्य ओपन-सोर्स मॉडलों को एक स्पष्ट अंतर से पीछे छोड़ दिया। वास्तव में, इसने उन बहुत बड़े और महंगे "क्लोज्ड" मॉडलों (जिनका कोड आप नहीं देख सकते) के साथ प्रतिस्पर्धा करने और कभी-कभी उन्हें हराने में भी सफलता प्राप्त की जो वर्तमान में दुनिया के सर्वश्रेष्ठ हैं। यह पेपर सुझाव देता है कि यह मॉडल विशेष रूप से लंबे, जटिल वास्तविक दुनिया के वीडियो को संभालने में अच्छा है जहाँ सुराग समय के साथ बिखरे होते हैं, जो यह साबित करता है कि सही डेटा और प्रशिक्षण विधियों के साथ, ओपन-सोर्स AI दिग्गजों की बराबरी कर सकता है। यह कंप्यूटरों को दुनिया को केवल देखने के बजाय, वास्तव में "देखने और सुनने" की क्षमता देने की दिशा में एक बड़ा कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →