Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos
यह शोध पत्र ऑडियो-विजुअल फ्लेमिंगो (AV-Flamingo) को प्रस्तुत करता है, जो एक पूर्णतः ओपन स्टेट-ऑफ-द-आर्ट लार्ज लैंग्वेज मॉडल है जिसे एक विशाल नए डेटासेट, एक प्रगतिशील तीन-चरणीय प्रशिक्षण पाठ्यक्रम और एक नवीन टेम्पोरल इंटरलीव्ड चेन-ऑफ-थॉट फ्रेमवर्क का लाभ उठाकर लंबे, जटिल वास्तविक दुनिया के वीडियो पर संयुक्त समझ और तर्क के लिए डिज़ाइन किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक फिल्म देख रहे हैं। आप अभिनेताओं के चेहरे, परिवेश और क्रियाओं को देखते हैं, लेकिन आप संवाद, बैकग्राउंड म्यूजिक, कदमों की आहट और पत्तों की सरसराहट भी सुनते हैं। लंबे समय तक, कंप्यूटर उन लोगों की तरह थे जिन्होंने अपनी आँखें बंद करके फिल्म देखी हो, केवल ऑडियो ट्रैक सुन रहे हों, या इसके विपरीत। वे एक तस्वीर में बिल्ली को पहचानने या किसी भाषण को ट्रांसक्राइब करने में माहिर थे, लेकिन वे उस पूरे दृश्य को समझने में संघर्ष करते थे जहाँ एक बिल्ली स्क्रीन पर दौड़ते हुए म्याऊँ करती है। इस अध्ययन के क्षेत्र को "मल्टीमॉडल" (multimodal) इंटेलिजेंस कहा जाता है, जहाँ मशीनें विभिन्न इंद्रियों—जैसे दृष्टि और ध्वनि—को मिलाने की कोशिश करती हैं ताकि वे दुनिया को वैसे ही समझ सकें जैसे इंसान समझते हैं। बड़ा सवाल जो शोधकर्ता पूछ रहे हैं, वह यह है: क्या हम एक ऐसा AI बना सकते हैं जो न केवल एक वीडियो देखे या पॉडकास्ट सुने, बल्कि वास्तव में इस बारे में सोच सके कि ध्वनि और चित्र एक साथ कैसे काम करते हैं, खासकर जब कहानी लंबी और जटिल हो?
यहाँ नेमोट्रोन-लैब्स-ऑडियो-विजुअल फ्लेमिंगो (या संक्षेप में AV-Flamingo) आता है, जो NVIDIA और यूनिवर्सिटी ऑफ मैरीलैंड के शोधकर्ताओं द्वारा डिज़ाइन किया गया एक नए प्रकार का AI मस्तिष्क है। पिछले वीडियो AI को ऐसे छात्रों के रूप में सोचें जो केवल पाठ्यपुस्तक का एक पन्ना पढ़ सकते हैं और उस पर एक त्वरित प्रश्न का उत्तर दे सकते हैं। यदि आप उनसे पूरी फिल्म का सारांश देने या 15 मिनट में बदलने वाले एक जटिल दृश्य को समझाने के लिए कहते, तो वे खो जाते, शुरुआत को भूल जाते, या पात्रों को आपस में मिला देते। AV-Flamingo अलग है। यह एक अत्यंत चौकस छात्र की तरह है जो पूरी फिल्म देख सकता है, साउंडट्रैक सुन सकता है, और फिर यह विस्तृत निबंध लिखने के लिए बैठ सकता है कि संगीत ने मूड को कैसे बदला, एक पात्र ने एक निश्चित तरीके से प्रतिक्रिया क्यों दी, या किसी विशिष्ट ध्वनि के दौरान दृश्य घटना के संबंध में सटीक समय क्या था।
शोधकर्ताओं ने पाया कि इसे संभव बनाने के लिए, वे केवल AI को पुराने डेटा का अधिक हिस्सा नहीं दे सकते थे। उन्हें इसे तीन नई तरकीबें सिखानी पड़ीं। सबसे पहले, उन्होंने लगभग 7 मिलियन वास्तविक दुनिया के वीडियो उदाहरणों (जिसमें 4.8 मिलियन प्रश्न-उत्तर जोड़े शामिल थे) का एक विशाल पुस्तकालय बनाया, जिसे विशेष रूप से AI की समय के साथ ध्वनि और दृष्टि को जोड़ने की क्षमता का परीक्षण करने के लिए डिज़ाइन किया गया था। उन्होंने इसे ऑडियो-विजुअल-स्किल्स (Audio-Visual-Skills) नाम दिया। दूसरा, उन्होंने AI को सीधे गहरे पानी में नहीं फेंका; उन्होंने एक "पाठ्यक्रम" (curriculum) का उपयोग किया जो बुनियादी कौशल सिखाने के लिए छोटी क्लिप्स से शुरू हुआ, और फिर धीरे-धीरे लंबी, अधिक जटिल वीडियो की ओर बढ़ा ताकि उसे समय के साथ एक कहानी का पता लगाने के लिए सिखाया जा सके। तीसरा, और शायद सबसे चतुराई से, उन्होंने AI को एक "सोचने की प्रक्रिया" सिखाई जिसे टेम्पोरल ऑडियो-विजुअल इंटरलीव्ड चेन-ऑफ-थॉट (Temporal Audio-Visual Interleaved Chain-of-Thought) कहा जाता है। कल्पना कीजिए कि AI एक वीडियो देख रहा है और हर कुछ सेकंड में रुककर कहता है, "ठीक है, इस सटीक सेकंड पर, ड्रम बजा, और फिर, पात्र कूदा।" यह AI को अपने विचारों को समय के साथ जमीन से जोड़े रखने में मदद करता है, ताकि वह इस बात को लेकर भ्रमित न हो कि पहले क्या हुआ या बाद में क्या हुआ।
इसके परिणाम काफी प्रभावशाली हैं। 15 से अधिक विभिन्न चुनौतियों पर परीक्षण किए जाने पर—जिसमें संगीत और भाषण को समझने से लेकर लंबे वीडियो का विश्लेषण करने और कठिन प्रश्नों के उत्तर देने तक शामिल है—AV-Flamingo ने अपने समान आकार के अन्य ओपन-सोर्स मॉडलों को एक स्पष्ट अंतर से पीछे छोड़ दिया। वास्तव में, इसने उन बहुत बड़े और महंगे "क्लोज्ड" मॉडलों (जिनका कोड आप नहीं देख सकते) के साथ प्रतिस्पर्धा करने और कभी-कभी उन्हें हराने में भी सफलता प्राप्त की जो वर्तमान में दुनिया के सर्वश्रेष्ठ हैं। यह पेपर सुझाव देता है कि यह मॉडल विशेष रूप से लंबे, जटिल वास्तविक दुनिया के वीडियो को संभालने में अच्छा है जहाँ सुराग समय के साथ बिखरे होते हैं, जो यह साबित करता है कि सही डेटा और प्रशिक्षण विधियों के साथ, ओपन-सोर्स AI दिग्गजों की बराबरी कर सकता है। यह कंप्यूटरों को दुनिया को केवल देखने के बजाय, वास्तव में "देखने और सुनने" की क्षमता देने की दिशा में एक बड़ा कदम है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।