← नवीनतम पेपर
🤖 AI

One Trajectory, One Token: Grounded Video Tokenization via Panoptic Sub-object Trajectory

यह शोध पत्र TrajViT को प्रस्तुत करता है, जो एक ग्राउंडेड वीडियो टोकेनाइजेशन विधि है जो अक्षम स्पेस-टाइम पैचेस को पैनऑप्टिक सब-ऑब्जेक्ट ट्रैजेक्टरीज से बदल देता है ताकि पारंपरिक ViT3D एनकोडर्स की तुलना में वीडियो रिट्रीवल और अंडरस्टैंडिंग कार्यों में बेहतर प्रदर्शन हासिल करते हुए कम्प्यूटेशनल लागत को महत्वपूर्ण रूप से कम किया जा सके।

मूल लेखक: Chenhao Zheng, Jieyu Zhang, Mohammadreza Salehi, Ziqi Gao, Vishnu Iyengar, Norimasa Kobori, Quan Kong, Ranjay Krishna

प्रकाशित 2026-05-12
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Chenhao Zheng, Jieyu Zhang, Mohammadreza Salehi, Ziqi Gao, Vishnu Iyengar, Norimasa Kobori, Quan Kong, Ranjay Krishna

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक दोस्त को फिल्म के बारे में बताने की कोशिश कर रहे हैं, लेकिन आपको केवल शब्दों की एक सीमित संख्या का उपयोग करने की अनुमति है।

पुराना तरीका: "ग्रिड" दृष्टिकोण
वर्तमान में, अधिकांश AI मॉडल वीडियो को एक सुरक्षा गार्ड की तरह देखते हैं जो स्क्रीन पर छोटे-छोटे वर्गों (पिक्सेल) के एक विशाल ग्रिड को देख रहा होता है। हर बार जब वीडियो चलता है, तो AI को हर एक फ्रेम में हर एक वर्ग के लिए एक नोट लिखना पड़ता है।

  • समस्या: यदि वीडियो लंबा है, या यदि कैमरा बस एक स्थिर दीवार के सामने घूम रहा है, तो AI खाली जगह या एक ही दीवार के बारे में हजारों नोट्स लिख रहा होता है। यह एक मिनट के वीडियो के लिए "दीवार, दीवार, दीवार, दीवार" लिखने जैसा है जहाँ कुछ भी नहीं हो रहा है। यह कंप्यूटर की बहुत सारी मेमोरी और ऊर्जा बर्बाद करता है।
  • खामी: भले ही AI "बोरिंग" नोट्स को हटाने की कोशिश करे, फिर भी यह भ्रमित हो जाता है जब कैमरा हिलता है, क्योंकि यह अभी भी केवल वर्गों को देख रहा है, वास्तविक वस्तुओं को नहीं।

नया तरीका: "एक प्रक्षेपवक्र (ट्रैजेक्टरी), एक टोकन"
इस शोध पत्र (TrajViT) के पीछे के शोधकर्ताओं ने वीडियो देखने का एक स्मार्ट तरीका निकाला है। ग्रिड के वर्गों को देखने के बजाय, वे गति की कहानियों को देखते हैं।

वे वीडियो को एक दृश्य के माध्यम से चलने वाले पात्रों (वस्तुओं) के संग्रह के रूप में देखते हैं।

  • उपमा: एक फुटबॉल मैच की कल्पना करें।
    • पुराना AI: घास के हर तिनके, मिट्टी के हर कण और आकाश के हर हिस्से को हर फ्रेम में गिनता है। यदि कैमरा घूमता है, तो यह घास को दोबारा गिनता है।
    • TrajViT: कहता है, "ठीक है, मैं देख रहा हूँ कि एक फुटबॉल बाईं से दाईं ओर जा रही है, और एक खिलाड़ी उसके पीछे दौड़ रहा है।" यह गेंद के पूरे पथ के लिए एक एकल नोट बनाता है और खिलाड़ी के पथ के लिए एक एकल नोट बनाता है।
  • परिणाम: वीडियो के हजारों नोट्स के बजाय, AI को केवल कुछ दर्जन नोट्स की आवश्यकता हो सकती है—प्रत्येक वस्तु की यात्रा के लिए एक।

उन्होंने इसे कैसे किया (एक "जासूसी" पाइपलाइन)
इसे काम करने के योग्य बनाने के लिए, उन्होंने तीन-चरणीय प्रक्रिया बनाई:

  1. शुरुआत को पहचानना: वे वीडियो को स्कैन करते हैं ताकि उन "प्रमुख क्षणों" को खोजा जा सके जहाँ नई चीजें दिखाई देती हैं (जैसे फ्रेम में गेंद का प्रवेश)।
  2. निशान का पीछा करना: वे उन वस्तुओं का पीछा करने के लिए एक ट्रैकिंग सिस्टम का उपयोग करते हैं, भले ही वे अस्थायी रूप से छिप जाएं या कैमरा हिल जाए।
  3. यात्रा का सारांश बनाना: वे किसी वस्तु के पूरे पथ (ट्रैजेक्टरी) को एक एकल, स्मार्ट "टोकन" (एक डिजिटल सारांश) में संकुचित कर देते हैं जो AI को बताता है कि वह वस्तु कैसी दिखती थी और वह कहाँ गई।

यह क्यों एक बड़ी बात है
शोध पत्र का दावा है कि यह नया तरीका दो मुख्य कारणों से गेम-चेंजर है:

  1. यह बहुत तेज़ और हल्का है: क्योंकि वे पिक्सेल गिनने के बजाय पूरी गतिविधियों का सारांश दे रहे हैं, वे 10 गुना कम नोट्स (टोकन) का उपयोग करते हैं। इसका मतलब है कि कंप्यूटर बहुत कम ऊर्जा और मेमोरी का उपयोग करता है।
  2. यह वास्तव में स्मार्ट है: कम नोट्स का उपयोग करने के बावजूद, AI वीडियो को बेहतर समझता है। परीक्षणों में, यह निम्नलिखित कार्यों में बेहतर था:
    • टेक्स्ट विवरण के आधार पर वीडियो खोजना (जैसे, "वह वीडियो ढूँढें जहाँ कुत्ता गेंद का पीछा कर रहा है")।
    • वीडियो के बारे में पूछे गए सवालों के जवाब देना।
    • लंबे वीडियो में क्रियाओं (एक्शन) को पहचानना।

"वीडियोLLM" परीक्षण
शोधकर्ताओं ने इस नए सिस्टम को एक "वीडियो लार्ज लैंग्वेज मॉडल" (एक AI जो वीडियो के बारे में चैट कर सकता है) में भी जोड़ा।

  • परिणाम: उनके नए सिस्टम का उपयोग करने वाला AI मानक सिस्टम की तुलना में 4 गुना तेज़ी से प्रशिक्षित हुआ और इसे चलाने के लिए 18 गुना कम कंप्यूटिंग पावर की आवश्यकता पड़ी। फिर भी, इसने वीडियो के बारे में सवालों के अधिक सटीक जवाब दिए।

संक्षेप में
पुराने तरीके को समझने की कोशिश करना एक किताब के हर पन्ने पर लिखे हर एक अक्षर को गिनने जैसा है। नया तरीका (TrajViT) वाक्यों को पढ़ता है और कथानक (प्लॉट) को समझता है। यह खाली स्थान को अनदेखा करता है और पात्रों और उनकी यात्राओं पर ध्यान केंद्रित करता है, जिससे यह वास्तव में क्या हो रहा है इसे समझने के लिए बहुत तेज़, सस्ता और अधिक सटीक बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →