← नवीनतम पेपर
💻 computer science

TimeProVe: Propose, then Verify for Efficient Long Video Temporal Reasoning in Activities of Daily Living

यह शोधपत्र TimeProVe को प्रस्तुत करता है, जो एक लागत-कुशल हाइब्रिड फ्रेमवर्क है जो लंबे वीडियो में अत्याधुनिक टेम्पोरल रीजनिंग (temporal reasoning) प्राप्त करने के लिए हल्के एक्शन-ग्राउंडेड परिकल्पना निर्माण (action-grounded hypothesis generation) को लक्षित VLM सत्यापन (VLM verification) के साथ जोड़ता है और साथ ही कंप्यूटिंग लागतों को काफी कम करता है, साथ ही दैनिक जीवन की गतिविधियों (Activities of Daily Living) के परिदृश्यों के मूल्यांकन के लिए OpenTSUBench बेंचमार्क का प्रस्ताव देता है।

मूल लेखक: Arkaprava Sinha, Dominick Reilly, Siddharth Krishnan, Hieu Le, Srijan Das

प्रकाशित 2026-06-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Arkaprava Sinha, Dominick Reilly, Siddharth Krishnan, Hieu Le, Srijan Das

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ TIMEPROVE पेपर का स्पष्टीकरण दिया गया है, जिसे रोज़मर्रा के उदाहरणों के साथ सरल अवधारणाओं में विभाजित किया गया है।

बड़ी समस्या: घास के ढेर में सुई ढूँढना

कल्पना कीजिए कि आपके पास किसी के घर पर पूरे दिन की एक घंटे लंबी वीडियो रिकॉर्डिंग है। आप एक सवाल पूछते हैं, "क्या उस व्यक्ति ने दवा ली और फिर पानी पिया?"

इसका उत्तर देने के लिए, एक कंप्यूटर को उस 60 मिनट के वीडियो में कहीं छिपे हुए एक विशिष्ट 10 सेकंड के क्षण को ढूँढना होगा।

  • पुराना तरीका (द "ब्रूट फ़ोर्स" विधि): कल्पना कीजिए कि एक बहुत ही बुद्धिमान, महंगे जासूस (एक बड़ा AI मॉडल) को पूरे एक घंटे के वीडियो को फ्रेम-दर-फ्रेम देखने के लिए काम पर रखना। यह अविश्वसनीय रूप से धीमा है, कंप्यूटिंग पावर में बहुत अधिक खर्च होता है, और अक्सर जासूस को बहुत सारी अप्रासंगिक जानकारी (जैसे कि व्यक्ति को सोते हुए या रसोई में चलते हुए देखना) से अभिभूत कर देता है।
  • कैप्शन वाला तरीका: एक अन्य विधि यह है कि पहले एक सस्ते रोबोट से वीडियो का सारांश लिखवाया जाए, और फिर जासूस को वह सारांश पढ़ने के लिए कहा जाए। लेकिन यह जोखिम भरा है। यदि रोबोट एक सूक्ष्म विवरण (जैसे हाथ की हल्की सी हरकत) को मिस कर देता है, तो जासूस उसे कभी देख ही नहीं पाता और गलत उत्तर दे देता है।

समाधान: TIMEPROVE (द "स्मार्ट स्काउट" सिस्टम)

लेखक TIMEPROVE का प्रस्ताव देते हैं, जो एक नए दो-सदस्य टीम की तरह काम करता है: एक तेज़, सस्ता "स्काउट" (Scout) और एक धीमा, महंगा "एक्सपर्ट" (Expert)।

एक्सपर्ट से पूरा एक घंटा दिखाने के बजाय, स्काउट पहले भारी काम करता है।

1. द स्काउट: एक्शन-बेस्ड कैंडिडेट एविडेंस (ACE)

स्काउट को एक तेज़, हल्के सुरक्षा गार्ड के रूप में सोचें जो वीडियो को एक बार देखता है।

  • वे क्या करते हैं: वे हर विवरण का विश्लेषण नहीं करते हैं। इसके बजाय, वे केवल कार्यों (actions) की एक टाइमलाइन नोट करते हैं: "1:05 पर, व्यक्ति चला। 1:15 पर, उन्होंने फ्रिज खोला। 1:20 पर, उन्होंने पानी पिया।"
  • जादुई कदम: जब आप अपना सवाल पूछते हैं ("क्या उन्होंने दवा ली?"), तो स्काउट उस टाइमलाइन को देखने के लिए एक छोटे, सस्ते दिमाग (एक हल्का AI) का उपयोग करता है। वह अनुमान लगाता है: "हम्म, दवा की बोतल आमतौर पर सिंक के पास होती है। चलिए 'पीने' वाले क्षण और उससे 10 सेकंड पहले के समय को देखते हैं।"
  • आउटपुट: स्काउट परिकल्पनाओं (अनुमानों) की एक छोटी सूची बनाता है और बहुत छोटे, विशिष्ट वीडियो क्लिप्स (जैसे कि केवल 5 सेकंड लंबे) की ओर इशारा करता है जहाँ उत्तर छिपा हो सकता है।

2. द एक्सपर्ट: द टेम्पोरल वेरीफायर

अब, एक्सपर्ट (महंगा, शक्तिशाली AI) केवल एक पल के लिए ही शामिल होता है।

  • वे क्या करते हैं: स्काउट एक्सपर्ट को केवल वह छोटा 5-सेकंड का क्लिप भेजता है। एक्सपर्ट बारीकी से विजुअल विवरणों (बोतल का लेबल, हाथ की गति) को देखता है ताकि पुष्टि की जा सके कि स्काउट का अनुमान सही था या नहीं।
  • परिणाम: यदि एक्सपर्ट कहता है, "हाँ, यह निश्चित रूप से दवा है," तो सिस्टम आपको उत्तर दे देता है। यदि नहीं, तो यह जल्दी से स्काउट की सूची के अगले छोटे क्लिप की जाँच करता है।

यह क्यों एक गेम-चेंजर है

पेपर का दावा है कि यह विधि तीन कारणों से एक बड़ा अपग्रेड है:

  1. यह सस्ता है: क्योंकि महंगा एक्सपर्ट पूरे एक घंटे के बजाय केवल छोटे क्लिप्स को देखता है, इसलिए लागत 93% कम हो जाती है। यह 60 घंटे की शिफ्ट के बजाय 5 मिनट की सलाह के लिए भुगतान करने जैसा है।
  2. यह तेज़ है: सिस्टम को घंटों के डेटा को प्रोसेस करने के लिए एक्सपर्ट का इंतज़ार नहीं करना पड़ता। यह प्रतीक्षा समय को काफी कम कर देता है।
  3. यह स्मार्ट है: पहले कार्यों (जैसे "पीना" या "चलना") पर ध्यान केंद्रित करके, सिस्टम उन सूक्ष्म विवरणों को मिस नहीं करता है जिन्हें एक साधारण टेक्स्ट सारांश छोड़ सकता है।

नया टेस्ट: OPENTSUBENCH (OTB)

लेखकों को एहसास हुआ कि इन AI सिस्टम के लिए मौजूदा टेस्ट बहुत आसान थे (जैसे बहुविकल्पीय प्रश्न जहाँ AI अनुमान लगा सकता है)। इसलिए, उन्होंने OPENTSUBENCH नामक एक नया टेस्ट बनाया।

  • उपमा: कल्पना कीजिए कि ड्राइविंग टेस्ट में आपसे यह पूछने के बजाय कि, "क्या ड्राइवर ने रेड लाइट पर रोका? (A) हाँ, (B) नहीं," आप पूछते हैं, "बताइए कि ड्राइवर ने दोपहर 2:00 से 2:15 के बीच वास्तव में क्या किया।"
  • यह नया टेस्ट AI को यह साबित करने के लिए मजबूर करता है कि उसने वास्तव में साक्ष्य (evidence) देखा है, न कि केवल अनुमान लगाया है। TIMEPROVE ने इस कठिन नए टेस्ट पर मौजूदा सर्वोत्तम सिस्टमों से 7.3% अधिक स्कोर किया।

सारांश

TIMEPROVE एक स्मार्ट वर्कफ़्लो है जो पैसा और समय बचाता है। यह एक तेज़, सस्ते स्काउट का उपयोग करता है जो लंबे वीडियो में सबसे संभावित क्षणों को ढूँढता है, और फिर केवल उन विशिष्ट क्षणों की दोबारा जाँच करने के लिए एक शक्तिशाली, महंगे एक्सपर्ट को बुलाता है। यह सुनिश्चित करता है कि पूरी फिल्म देखने में संसाधन बर्बाद किए बिना उत्तर सटीक हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →