← नवीनतम पेपर
💻 computer science

How Should Video LLMs Output Time? An Analysis of Efficient Temporal Grounding Paradigms

यह शोध पत्र एक नियंत्रित अनुभवजन्य अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि तीन प्रमुख वीडियो टेम्पोरल ग्राउंडिंग आउटपुट प्रतिमानों के बीच, निरंतर टेम्पोरल डिकोडिंग सबसे अनुकूल दक्षता-सटीकता व्यापार-बंद (एफिशिएंसी-एक्यूरेसी ट्रेड-ऑफ) प्रदान करती है, जो परिनियोजन-तैयार (डिप्लॉयमेंट-रेडी) वीडियो एलएलएम (Video LLMs) को डिजाइन करने के लिए वस्तुनिष्ठ दिशा-निर्देश प्रदान करती है।

मूल लेखक: Shengji Jin, Yuanhao Zou, Victor Zhu, Zhengping Ji, Chen Chen

प्रकाशित 2026-04-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shengji Jin, Yuanhao Zou, Victor Zhu, Zhengping Ji, Chen Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य चित्र: एक रोबोट को वीडियो की ओर इशारा करना सिखाना

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट (एक वीडियो लार्ज लैंग्वेज मॉडल) है जो वीडियो देख सकता है और उसके बारे में सवालों के जवाब दे सकता है। आप उससे पूछते हैं, "वीडियो में व्यक्ति केक बनाना कब शुरू करता है?"

रोबोट को वीडियो देखना होगा और कहना होगा, "यह 1 मिनट और 2 मिनट के बीच होता है।"

समस्या क्या है? रोबोट "1 मिनट और 2 मिनट" कैसे कहेगा?

यह पेपर एक वैज्ञानिक स्वाद परीक्षण (taste test) की तरह है। शोधकर्ताओं ने यह पता लगाने की कोशिश की कि रोबोट के लिए समय को "बोलने" का सबसे अच्छा तरीका क्या है। उन्होंने अलग-अलग आकार के रोबोटों (छोटे पॉकेट-साइज वाले से लेकर विशाल बुद्धिमान वाले तक) का उपयोग करके तीन अलग-अलग तरीकों का परीक्षण किया, ताकि यह देखा जा सके कि कौन सा तरीका सबसे अच्छा काम करता है, विशेष रूप से फोन या ड्रोन जैसे छोटे, सस्ते उपकरणों के लिए।


समय की तीन "भाषाएं"

शोधकर्ताओं ने तीन अलग-अलग तरीकों का परीक्षण किया जिनसे रोबोट उत्तर दे सकता था। इन्हें दिशा-निर्देश देने के तीन अलग-अलग तरीकों के रूप में सोचें:

1. "टेक्स्ट नंबर" विधि (बातूनी रोबोट)

  • यह कैसे काम करता है: रोबोट समय के साथ बिल्कुल सामान्य शब्दों की तरह व्यवहार करता है। वह उत्तर को एक वाक्य के रूप में लिखता है: "घटना 52.0 से 63.0 सेकंड तक होती है।"
  • उपमा: कल्पना कीजिए कि आप किसी दोस्त से रास्ता पूछ रहे हैं, और वह कहता है, "पाँच तक गाड़ी चलाएं, फिर बाएं मुड़ें, फिर तीन तक गाड़ी चलाएं।" वह संख्याओं को शब्दों के रूप में लिख रहा है।
  • समस्या: यह धीमा और बोझिल है। रोबोट को हर एक अंक के बारे में एक-एक करके "सोचना" पड़ता है (जैसे शब्द की स्पेलिंग लिखना)। यदि वीडियो लंबा है, तो रोबोट भ्रमित हो जाता है और गलत नंबरों का अनुमान लगा सकता है, जैसे कि "500 मीटर" कहने के बजाय "500 साल" कहना।

2. "स्पेशल टोकन" विधि (कोड-स्विचिंग रोबोट)

  • यह कैसे काम करता है: रोबोट के पास समय के लिए एक विशेष डिक्शनरी होती है। "52" लिखने के बजाय, वह एक गुप्त कोड जैसे <TIME_52> का उपयोग करता है। वह उत्तर को एक पहेली की तरह, टुकड़ों में बनाता है।
  • उपमा: कल्पना कीजिए कि एक रोबोट गुप्त कोड में बात करता है। "52" कहने के बजाय, वह एक विशिष्ट बटन दबाता है जिसका अर्थ "52" है। यह पहले तरीके की तुलना में अधिक व्यवस्थित है।
  • समस्या: यह अभी भी धीमा है। रोबोट को क्रम में एक-एक करके बटन दबाना पड़ता है। यह एक लंबे ईमेल को टाइप करने जैसा है जहाँ आप बहुत धीरे-धीरे एक समय में एक कुंजी दबाते हैं। साथ ही, यह कठोर है; यदि सटीक समय उसकी गुप्त डिक्शनरी में नहीं है, तो वह संघर्ष करता है।

3. "कंटीन्यूअस वेव" विधि (स्मूथ स्लाइडर)

  • यह कैसे काम करता है: नंबर लिखने या कोड क्लिक करने के बजाय, रोबोट वीडियो को देखता है और एक स्मूथ प्रोबेबिलिटी कर्व (संभावना वक्र) बनाता है। वह कहता है, "मैं 90% सुनिश्चित हूँ कि यह 52 सेकंड के आसपास शुरू होता है और 90% सुनिश्चित हूँ कि यह 63 सेकंड के आसपास समाप्त होता है।" वह एक ही सुचारू गति में उत्तर की गणना करता है।
  • उपमा: कल्पना कीजिए कि एक लाइट का डिमर स्विच (dimmer switch)। "लेवल 1," "लेवल 2," "लेवल 3" पर क्लिक करने के बजाय, आप बस अपनी उंगली को सुचारू रूप से उस सटीक चमक तक स्लाइड करते हैं जिसे आप चाहते हैं।
  • विजेता: यह विधि शो की स्टार है। यह तेज़ है, सटीक है, और लंबे वीडियो में भ्रमित नहीं होती है।

बड़ी खोज: "पैराडाइम डिविडेंड" (Paradigm Dividend)

इस पेपर की सबसे रोमांचक खोज वह है जिसे वे "पैराडाइम डिविडेंड" कहते हैं।

आमतौर पर, AI में, यदि आप बेहतर परिणाम चाहते हैं, तो आपको एक बड़ा, अधिक महंगा रोबोट (एक बड़ा मॉडल) बनाना पड़ता है। लेकिन इस पेपर ने पाया कि रोबोट के समय बोलने का तरीका बदलना, रोबोट को बड़ा बनाने से अधिक शक्तिशाली है।

  • जादू: एक छोटा रोबोट (0.5 बिलियन पैरामीटर्स) जो "स्मूथ स्लाइडर" विधि (कंटीन्यूअस डिकोडिंग) का उपयोग करता है, वह एक विशाल रोबोट (8 बिलियन पैरामीटर्स) से बेहतर प्रदर्शन करता है जो "बातूनी" विधि (टेक्स्ट नंबर) का उपयोग करता है।
  • सबक: यह इस बारे में नहीं है कि आपका दिमाग कितना बड़ा है; यह इस बारे में है कि आप उसका उपयोग कैसे करते हैं। सही टूल के साथ एक छोटा दिमाग बड़े दिमाग को हरा सकता है।

यह आपके फोन के लिए क्यों मायने रखता है?

अभी, कंपनियाँ इन AI रोबोटों को एज डिवाइसेस (edge devices) पर डालना चाहती हैं—जैसे आपका फोन, आपकी कार, या सुरक्षा कैमरा। इन उपकरणों में सीमित बैटरी और कंप्यूटिंग पावर होती है।

  • पुराना तरीका: अच्छे परिणाम प्राप्त करने के लिए, आपको एक विशाल, महंगे कंप्यूटर की आवश्यकता थी।
  • नया तरीका: क्योंकि "स्मूथ स्लाइडर" विधि इतनी कुशल है, आप बैटरी खत्म किए या लैग (lag) पैदा किए बिना एक छोटे, सस्ते डिवाइस पर उच्च-गुणवत्ता वाला वीडियो विश्लेषण चला सकते हैं।

परिणामों का सारांश

विधि गति सटीकता किसके लिए सर्वश्रेष्ठ है
टेक्स्ट नंबर धीमी कम कोई नहीं (यह इस कार्य के लिए पुराना है)
स्पेशल टोकन्स बहुत धीमी मध्यम जब आपको विशिष्ट "कोड" का अनुमान लगाने की आवश्यकता हो
कंटीन्यूअस वेव तेज़ उच्च वास्तविक दुनिया के ऐप्स (फोन, कार, ड्रोन)

निष्कर्ष

यदि आप एक ऐसा वीडियो AI बनाना चाहते हैं जो रोज़मर्रा के उपकरणों पर तेज़ी से और सटीक रूप से काम करे, तो उसे समय की स्पेलिंग बताने के लिए कहना बंद करें। इसके बजाय, उसे एक स्मूथ, कंटीन्यूअस कर्व की तरह समय का अनुमान लगाना सिखाएं। डिज़ाइन में यह सरल बदलाव छोटे, कुशल मॉडलों को विशाल, महंगे मॉडलों से बेहतर प्रदर्शन करने की अनुमति देता है, जिससे उन्नत वीडियो तकनीक सभी के लिए सुलभ हो जाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →