← नवीनतम पेपर
💬 NLP

APB-V: Accelerating Long-Video Understanding via Sequence-Parallelism-aware Approximate Attention

APB-V एक सीक्वेंस-पैरेलल फ्रेमवर्क है जो एप्रोक्सिमेट अटेंशन को कई GPUs में वितरित करके लार्ज मल्टीमॉडल मॉडल्स में लॉन्ग-वीडियो इन्फरेंस को तेज़ करता है, जिससे विजुअल कंप्रेशन की आवश्यकता के बिना और प्रदर्शन से समझौता किए बिना मौजूदा तरीकों की तुलना में महत्वपूर्ण गति प्राप्त होती है।

मूल लेखक: Yuxiang Huang, Mingye Li, Xu Han, Chaojun Xiao, Weilin Zhao, Ao Sun, Ziqi Yuan, Hao Zhou, Fandong Meng, Zhiyuan Liu

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuxiang Huang, Mingye Li, Xu Han, Chaojun Xiao, Weilin Zhao, Ao Sun, Ziqi Yuan, Hao Zhou, Fandong Meng, Zhiyuan Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास वीडियो क्लिप्स का एक विशाल पुस्तकालय है, और आप चाहते हैं कि एक सुपर-स्मार्ट AI असिस्टेंट उन सभी को देखे और एक विशिष्ट प्रश्न का उत्तर दे, जैसे "कार में फुसफुसाया गया गुप्त शब्द क्या था?"

समस्या यह है कि ये वीडियो इतने लंबे और विस्तृत हैं कि AI उनसे अभिभूत हो जाता है। यह ऐसा है जैसे एक अकेले लाइब्रेरियन से लाखों किताबों के हर एक पन्ने को पढ़ने के लिए कहना ताकि वह एक वाक्य ढूंढ सके। यह प्रक्रिया धीमी, महंगी है, और अक्सर इसे पूरा करने के लिए लाइब्रेरियन को पन्ने छोड़ देने (सारांश बनाने) पर मजबूर करती है, जिसका अर्थ है कि वे महत्वपूर्ण विवरणों को मिस कर सकते हैं।

यह पेपर APB-V पेश करता है, जो इन "लाइब्रेरियन" (कंप्यूटरों) को व्यवस्थित करने का एक नया तरीका है ताकि वे इन लंबे वीडियो को एक साथ, तेजी से और बिना कुछ भी मिस किए देख सकें।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए, यहाँ दिया गया है:

1. पुरानी समस्या: "एकल लाइब्रेरियन" की बाधा (The "Single Librarian" Bottleneck)

वर्तमान में, जब एक AI एक लंबा वीडियो देखता है, तो उसे हर एक फ्रेम को प्रोसेस करना पड़ता है। यदि वीडियो 1440p (हाई डेफिनेशन) है और उसमें कई फ्रेम्स हैं, तो डेटा की मात्रा बहुत अधिक होती है।

  • बाधा (The Bottleneck): यह एक पूरे समुद्र को एक ही कप में भरने की कोशिश करने जैसा है। कंप्यूटर की मेमोरी खत्म हो जाती है या गणना करने में बहुत समय लगता है।
  • पुराना समाधान: इसे तेज़ बनाने के लिए, लोग AI को कहते थे, "बस हर 10वें फ्रेम को देखो" या "धुंधले हिस्सों को हटा दो।"
  • नुकसान: यह एक किताब पढ़ने लेकिन हर दूसरा पन्ना छोड़ने जैसा है। आप तेजी से समाप्त करते हैं, लेकिन आप कहानी के मोड़ या गुप्त शब्द को मिस कर सकते हैं। AI तेज़ तो हो जाता है लेकिन "बेवकूफ" हो जाता है।

2. नया समाधान: APB-V (एक "लाइब्रेरियनों की टीम")

APB-V एकाधिक कंप्यूटरों (GPUs) का उपयोग करके खेल बदल देता है जो एक विशाल कार्य को विभाजित करने के लिए मिलकर काम करते हैं, जैसे लाइब्रेरियनों की एक टीम। लेकिन केवल काम को बेतरतीब ढंग से बांटने के बजाय, वे सीक्वेंस-पैरेललिज्म (Sequence-Parallelism) नामक एक चतुर रणनीति का उपयोग करते हैं।

वीडियो को ट्रेन के डिब्बों की एक लंबी ट्रेन के रूप में सोचें।

  • फ्रेम पैरेललिज्म (Frame Parallelism): सबसे पहले, टीम वीडियो फ्रेम्स को विभाजित करती है। एक लाइब्रेरियन डिब्बे 1-10 को देखता है, दूसरा 11-20 को, और इसी तरह। वे सभी एक ही समय में देखना शुरू करते हैं।
  • "एंकर" और "पासिंग" ट्रिक: यहाँ जादू वाला हिस्सा है। एक सामान्य टीम में, यदि लाइब्रेरियन A को यह जानने की आवश्यकता है कि लाइब्रेरियन B ने 10 मिनट पहले क्या देखा था, तो उन्हें रुकना होगा और कमरे के पार चिल्लाना होगा। इसमें समय लगता है।
    • APB-V की ट्रिक: सब कुछ चिल्लाकर बताने के बजाय, लाइब्रेरियन A केवल सबसे महत्वपूर्ण हिस्सों ("पासिंग ब्लॉक्स") को दूसरों को बताता है। वे वीडियो की शुरुआत का एक छोटा, स्थायी "एंकर" रखते हैं।
    • परिणाम: उन्हें पूरा वीडियो वापस और आगे-पीछे भेजने की आवश्यकता नहीं है। वे केवल "हाइलाइट रील" भेजते हैं जो महत्वपूर्ण है। इससे बहुत अधिक समय और डेटा ट्रैफिक बचता है।

3. भार संतुलित करना (The "ZigZag" Strategy)

यदि आप काम को समान रूप से विभाजित करते हैं, तो कुछ लाइब्रेरियन भारी काम (जटिल दृश्यों की गणना) में फंस सकते हैं जबकि अन्यों के पास आसान कार्य हो सकते हैं।

  • समाधान: APB-V ZigZag पैटर्न का उपयोग करता है। कल्पना करें कि लाइब्रेरियन एक पंक्ति में व्यवस्थित हैं। पहले लाइब्रेरियन को पहला और अंतिम हिस्सा मिलता है, दूसरे को दूसरा और दूसरा-से-अंतिम हिस्सा मिलता है, और इसी तरह।
  • क्यों? यह सुनिश्चित करता है कि सभी के पास "सोचने" का समान कार्य हो, ताकि कोई भी व्यक्ति सबसे धीमे काम करने वाले व्यक्ति के समाप्त होने का इंतजार न करे।

4. परिणाम: तेज़ और सटीक

लेखकों ने विशाल वीडियो (जैसे 64 फ्रेम्स का 1440p रेजोल्यूशन) पर इसका परीक्षण किया।

  • गति: यह वर्तमान मानक विधि (FlashAttention) की तुलना में 12.7 गुना तेज़ था।
  • सटीकता: पुराने तरीकों के विपरीत जो पन्ने छोड़कर गलत उत्तर देते थे, APB-V ने सभी दृश्य विवरणों को बनाए रखा। इसने ठीक वैसे ही सही उत्तर दिए जैसे कि इसने पूरे वीडियो को धीरे-धीरे देखा होता, लेकिन इसने इसे बहुत कम समय में कर दिखाया।

सारांश

APB-V एक मैराथन वीडियो देखने के लिए विशेषज्ञों की एक टीम को व्यवस्थित करने जैसा है। एक व्यक्ति द्वारा हर पन्ने को पढ़ने के संघर्ष या तेज़ पूरा करने के लिए सबके द्वारा पन्ने छोड़ने के बजाय, यह टीम काम को विभाजित करती है, केवल महत्वपूर्ण हाइलाइट्स साझा करती है, और लोड को पूरी तरह से संतुलित करती है। परिणाम यह है कि वे एक भी महत्वपूर्ण विवरण को मिस किए बिना सुपर फास्ट उत्तर ढूंढ लेते हैं।

पेपर का दावा है कि यह विशेष रूप से लंबे-वीडियो को समझने (long-video understanding) के लिए है जो एकाधिक कंप्यूटरों (जैसे निगरानी या स्वायत्त ड्राइविंग के लिए डेटा सेंटरों में) पर आधारित है, और यह एक एकल कंप्यूटर पर काम नहीं करता है क्योंकि इसका जादू टीम वर्क पर निर्भर करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →