AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression
यह शोध पत्र AVOC का प्रस्ताव करता है, जो एक रिट्रीवल-प्रेरित (retrieval-inspired) टोकन कंप्रेशन फ्रेमवर्क है जो प्रासंगिकता, महत्व और विविधता के आधार पर टोकन चयन को एक टॉप- रिट्रीवल समस्या के रूप में पुनर्गठित करके ओम्नी-मोडल LLMs में घंटे-स्तर की ऑडियो-वीडियो समझ को बढ़ाता है, जिससे लंबे समय के बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है और घंटे-लंबे संदर्भों में मजबूती बनाए रखी जाती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास फिल्मों और मीटिंग रिकॉर्डिंग की एक विशाल लाइब्रेरी है जो घंटों लंबी चलती है। आप एक बहुत ही बुद्धिमान AI असिस्टेंट से एक लंबे वीडियो के बारे में एक विशिष्ट प्रश्न पूछना चाहते हैं, जैसे, "उस विशेष संवाद के बाद बेसमेंट में कितने लोग आए?"
समस्या यह है कि AI का "दिमाग" (उसकी मेमोरी विंडो) एक बार में पूरे वीडियो को रखने के लिए बहुत छोटा है। यदि आप पूरे वीडियो को डालने की कोशिश करते हैं, तो वह चोक हो जाता है। यदि आप केवल कुछ रैंडम फ्रेम चुनकर उसे छोटा करने की कोशिश करते हैं, तो आप उस महत्वपूर्ण क्षण को मिस कर सकते हैं। यदि आप हर एक विवरण को रखने की कोशिश करते हैं, तो आपके पास जगह खत्म हो जाएगी।
AVOC: द स्मार्ट लाइब्रेरियन (एक बुद्धिमान पुस्तकालयाध्यक्ष)
इस पेपर के लेखकों ने AVOC नामक एक नई प्रणाली बनाई है। AVOC को एक अत्यधिक कुशल लाइब्रेरियन के रूप में समझें जिसे एक 1-घंटे की फिल्म का 10-पेज का 'चीट शीट' (संक्षिप्त नोट्स) बनाना है, लेकिन एक बहुत ही विशिष्ट लक्ष्य के साथ: उस चीट शीट में केवल वही जानकारी होनी चाहिए जो आपके प्रश्न का उत्तर देने के लिए आवश्यक है।
AVOC कैसे काम करता है, इसे सर्च इंजन द्वारा सबसे अच्छे परिणाम खोजने के तीन सरल नियमों का उपयोग करके समझा जा सकता है:
1. प्रासंगिकता (Relevance): "क्या यह प्रश्न से मेल खाता है?"
कल्पना कीजिए कि आप लाइब्रेरियन से पूछते हैं, "बेसमेंट में कौन आया?"
- पुराना तरीका: लाइब्रेरियन आपको रसोई या बाहर के मौसम के बारे में एक पेज दिखा सकता है क्योंकि वे दृश्य शोर वाले या रंगीन थे।
- AVOC का तरीका: AVOC पहले आपके प्रश्न को देखता है। यह वीडियो और ऑडियो को स्कैन करता है और कहता है, "ठीक है, मुझे वह हिस्सा ढूंढना है जहाँ लोग बेसमेंट के बारे में बात कर रहे हैं।" यह वीडियो में विशिष्ट क्षणों और ऑडियो में विशिष्ट शब्दों को हाइलाइट करता है जो सीधे आपके प्रश्न से संबंधित हैं। इसे टेक्स्ट-गाइडेड स्कोरिंग (Text-Guided Scoring) कहा जाता है।
2. महत्व (Importance): "क्या यह बिना प्रश्न के भी दिलचस्प है?"
कभी-कभी, आपका प्रश्न अस्पष्ट होता है, या उत्तर उस चीज़ पर निर्भर करता है जो वीडियो दिखाता है लेकिन स्पष्ट रूप से बोलता नहीं है।
- उपमा: कल्पना कीजिए कि आप भीड़ में किसी विशिष्ट व्यक्ति को ढूंढ रहे हैं। भले ही आप उनका नाम न जानते हों, फिर भी आप उन्हें पहचान सकते हैं क्योंकि उन्होंने एक चमकीली लाल टोपी (एक अद्वितीय दृश्य संकेत) पहनी है या क्योंकि वे अकेले नाच रहे हैं (एक अद्वितीय ऑडियो संकेत)।
- AVOC का तरीका: AVOC यह जांचता है कि क्या कोई क्षण अपने आप में "महत्वपूर्ण" है। यह देखता है कि वीडियो और ऑडियो एक-दूसरे से कैसे संवाद करते हैं। यदि किसी व्यक्ति का चेहरा (वीडियो) एक विशिष्ट ध्वनि (ऑडियो) से मेल खाता है, तो उस क्षण को उच्च "महत्व" स्कोर मिलता है, भले ही आपके प्रश्न में इसका उल्लेख न किया गया हो। यह सुनिश्चित करता है कि AI छिपे हुए सुरागों को मिस न करे।
3. विविधता (Diversity): "मुझे एक ही चीज़ दो बार मत दिखाओ!"
यह सबसे कठिन हिस्सा है। यदि आपके पास एक दृश्य है जहाँ एक पात्र कमरे में प्रवेश करता है, फिर बाहर जाता है, और फिर वापस आता है, तो एक मूर्ख सिस्टम इन तीनों क्षणों को चुन सकता है क्योंकि वे सभी समान दिखते हैं। इससे जगह बर्बाद होती है।
- उपमा: कल्पना कीजिए कि आप यात्रा के लिए एक सूटकेस पैक कर रहे हैं। आपको बिल्कुल एक जैसी तीन लाल जुराबों की आवश्यकता नहीं है। आपको अलग-अलग जरूरतों को पूरा करने के लिए एक लाल जोड़ी, एक नीली जोड़ी और एक हरी जोड़ी की आवश्यकता है।
- AVOC का तरीका: AVOC एक विशेष नियम का उपयोग करता है जिसे टेम्पोरल-अवेयर डायवर्सिटी (Temporal-Aware Diversity) कहा जाता है। यह कहता है, "यदि मैंने पहले ही वह क्षण चुन लिया है जहाँ कोई कमरे में प्रवेश करता है, तो मैं अगला सेकंड नहीं चुनूँगा जहाँ वे बिल्कुल वैसा ही करते हैं।" हालाँकि, यदि वही चीज़ फिल्म में एक घंटे बाद होती है, तो AVOC उसे भी चुनेगा, क्योंकि यह समय के अनुसार एक अलग घटना है। यह खुद को दोहराए बिना पूरे टाइमलाइन को कवर करता है और जानकारी को ताज़ा रखता है।
परिणाम: एक सुपर-स्मार्ट सारांश
इन तीन नियमों को मिलाकर, AVOC एक विशाल, एक घंटे लंबे वीडियो और ऑडियो स्ट्रीम को एक छोटे, अत्यंत कुशल "टोकन" अनुक्रम में संकुचित करता है। यह उबाऊ, दोहराव वाले या अप्रासंगिक हिस्सों को हटा देता है और केवल जानकारी के "गोल्डन नगेट्स" (कीमती अंशों) को रखता है।
उन्होंने क्या पाया?
- यह अन्य सभी से बेहतर काम करता है: लंबे वीडियो (90 मिनट तक) पर परीक्षण करने पर, AVOC ने अन्य शीर्ष मॉडलों की तुलना में प्रश्नों के बहुत अधिक सटीक उत्तर दिए। इसने दूसरे सबसे अच्छे मॉडल को एक बड़े अंतर से (औसतन लगभग 5 अंक अधिक) पीछे छोड़ दिया।
- यह "घास के ढेर में सुई" (Needle in the Haystack) को ढूंढ लेता है: उन्होंने परीक्षण किया कि क्या AI एक 1-घंटे के वीडियो में कहीं छिपे एक विशिष्ट गुप्त नंबर को ढूंढ सकता है। AVOC लगभग पूरी तरह से इसे ढूंढ सका, यहाँ तक कि एक घंटे लंबे वीडियो में भी, जबकि अन्य मॉडल लंबे वीडियो होने पर विफल होने लगे।
- यह तेज़ है: इतनी जटिल छंटनी करने के बावजूद, यह AI को बहुत अधिक धीमा नहीं करता है। वास्तव में, क्योंकि यह बहुत सारा बेकार डेटा हटा देता है, AI वास्तव में पहले की तुलना में वीडियो को तेज़ी से प्रोसेस कर सकता है।
संक्षेप में, AVOC AI को एक बेहतर पाठक बनना सिखाता है: यह केवल 500 पन्नों की किताब के हर शब्द को नहीं पढ़ता; यह स्किम करना (सरसरी तौरता से पढ़ना), महत्वपूर्ण हिस्सों को हाइलाइट करना और फालतू बातों को अनदेखा करना सीखता है, ताकि यह आपके प्रश्न का उत्तर पूरी तरह से दे सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।