← नवीनतम पेपर
💻 computer science

TRACE: Evidence Grounding-Guided Multi-Video Event Understanding and Claim Generation

TRACE एक साक्ष्य-आधारित (evidence grounding-guided) ढांचा है जो OCR और ऑब्जेक्ट डिटेक्शन के माध्यम से खोजने योग्य टाइमलाइन बनाकर मल्टी-वीडियो इवेंट समझ और क्लेम जनरेशन को बढ़ाता है, ताकि विजुअल रीजनिंग से पहले सटीक, क्वेरी-जागरूक साक्ष्य स्थानीयकरण (evidence localization) सक्षम किया जा सके, जिससे तथ्यात्मक पूर्णता, साइटेशन रिकॉल और MAGMaR 2026 जैसे बेंचमार्क पर अत्याधुनिक प्रदर्शन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Pengyu Yan, Akhil Gorugantu, Mahesh Bhosale, Abdul Wasi, Vishvesh Trivedi, David Doermann

प्रकाशित 2026-05-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pengyu Yan, Akhil Gorugantu, Mahesh Bhosale, Abdul Wasi, Vishvesh Trivedi, David Doermann

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक भीषण तूफान से जुड़ी एक गुत्थी सुलझाने की कोशिश कर रहे हैं। आपके पास हजारों घंटों के वीडियो फुटेज वाला एक पुस्तकालय है, जिसमें विभिन्न समाचार चैनलों, सोशल मीडिया और सरकारी प्रसारणों के वीडियो शामिल हैं। आपका बॉस आपसे एक विशिष्ट प्रश्न पूछता है: "कितने लोग लापता थे, और क्या सरकार ने सहायता भेजी?"

यदि आप एक मानक AI होते (जैसे कि "पुराने तरीके" में वर्णित AI), तो आपको वीडियो का एक विशाल ढेर थमा दिया जाता और कहा जाता, "इन सभी को देखो और उत्तर बताओ।" समस्या क्या है? AI अभिभूत (overwhelmed) हो जाता है। वह वीडियो के हर एक सेकंड को देखने की कोशिश करता है, लेकिन क्योंकि वह एक साथ इतना सारा डेटा अपने "दिमाग" में नहीं रख सकता, इसलिए उसे वीडियो को बहुत तेज़ी से छोड़ते हुए आगे बढ़ना पड़ता है। ऐसा करने में, वह छोटे लेकिन महत्वपूर्ण विवरणों को चूक जाता—जैसे कि न्यूज़ टिकर पर लिखा धुंधला टेक्स्ट "300 लापता" या सहायता संख्या दिखाने वाला स्कोरबोर्ड—क्योंकि वह तूफान के नाटकीय दृश्यों को देखने में बहुत व्यस्त होता है।

TRACE इसे हल करने का एक नया, स्मार्ट तरीका है। लेखक इसे "ग्राउंड-बिफोर-रीज़निंग" (Ground-Before-Reasoning) रणनीति कहते हैं। इसे इस तरह समझें:

समस्या: "अंधाधुंध खोज" (The "Blind Search")

वर्तमान AI मॉडल ऐसे जासूसों की तरह हैं जो लोगों से भरे कमरे में जाते हैं और केवल सबसे तेज़ आवाज़ों को सुनकर एक विशिष्ट तथ्य खोजने की कोशिश करते हैं। वे उन शांत फुसफुसाहटों (स्क्रीन पर लिखे टेक्स्ट) को मिस कर देते हैं जिनमें वास्तव में उत्तर छिपा होता है। वे भी थक जाते हैं (अपना "कॉन्टेक्स्ट बजट" खत्म कर देते) यदि कमरा बहुत बड़ा हो।

TRACE समाधान: "इंडेक्स प्रथम" दृष्टिकोण (The "Index First" Approach)

वीडियोओं को अंधाधुंध देखने के बजाय, TRACE एक ऐसे लाइब्रेरियन की तरह काम करता है जो जासूस के पढ़ने शुरू करने से पहले एक खोजने योग्य इंडेक्स (searchable index) बनाता है।

यह प्रक्रिया चरण-दर-चरण इस प्रकार काम करती है:

1. "स्कैनर" (Grounding)
AI द्वारा "सोचने" या "तर्क करने" से पहले, यह वीडियो पर एक तेज़, सस्ता स्कैनर चलाता है।

  • यह क्या करता है: यह दो सरल उपकरणों का उपयोग करता है: OCR (ऑप्टिकल कैरेक्टर रिकग्निशन, जो न्यूज़ टिकर और स्कोरबोर्ड जैसे स्क्रीन पर मौजूद टेक्स्ट को पढ़ता है) और ऑब्जेक्ट डिटेक्शन (जो माइक्रोफ़ोन, पोडियम या भीड़ जैसी चीज़ों को पहचानता है)।
  • उपमा: कल्पना कीजिए कि एक रोबोट किताब के हर पन्ने को तेज़ी से पलट रहा है और जो भी नंबर, नाम और वस्तु उसे दिख रही है, उसे उनके समय (time) के साथ लिख रहा है। वह अभी कहानी समझने की कोशिश नहीं कर रहा है; वह बस एक टेक्स्ट-आधारित टाइमलाइन बना रहा है।
  • यह कैसे मदद करता है: यह एक बिखरे हुए वीडियो को तथ्यों की एक साफ, खोजने योग्य सूची में बदल देता है।

2. "सर्च इंजन" (Localization)
अब, इंसान (या उपयोगकर्ता) अपना प्रश्न पूछता है: "लापता लोगों के बारे में जानकारी कहाँ है?"

  • यह क्या करता है: एक टेक्स्ट-ओनली AI (जो बहुत तेज़ और सस्ता है) चरण 1 में बनाई गई उस खोजने योग्य टाइमलाइन को देखता है। यह प्रश्न का मिलान संख्याओं और वस्तुओं की सूची से करता है।
  • उपमा: पूरी किताब को दोबारा पढ़ने के बजाय, लाइब्रेरियन इंडेक्स का उपयोग करके कहता है, "आह, उत्तर पेज 45, 82 और 110 पर है।" वह बाकी किताब को अनदेखा कर देता है।
  • यह कैसे मदद करता है: यह अप्रासंगिक दृश्यों पर समय बर्बाद किए बिना सटीक क्षणों को खोज लेता है।

3. "कहानीकार" (Claim Generation)
अब, शक्तिशाली वीडियो AI (जो "स्टोरीटेलर" है) अपना काम शुरू करता है।

  • यह क्या करता है: इसे चरण 2 द्वारा पहचाने गए केवल विशिष्ट वीडियो क्लिप्स और इंडेक्स के नोट्स दिए जाते हैं। इसे निर्देश दिया जाता है, "इन विशिष्ट क्षणों को देखो और तथ्य बताओ।"
  • उपमा: अब जासूस को किताब के केवल तीन प्रासंगिक पन्ने सौंप दिए गए हैं, जिनमें महत्वपूर्ण नंबर हाइलाइट किए गए हैं। वे उन पन्नों पर अपना 100% ध्यान केंद्रित कर सकते हैं ताकि एक सटीक रिपोर्ट लिखी जा सके।
  • परिणाम: AI एक दावा उत्पन्न करता है (जैसे, "300 लोग लापता हैं") और महत्वपूर्ण रूप से, यह सटीक रूप से उद्धृत (cite) करता है कि किन वीडियो क्लिप्स ने इस तथ्य को प्रमाणित किया।

4. "संपादक" (Consolidation)
चूंकि आपके पास 10 अलग-अलग वीडियो हो सकते हैं, इसलिए आपको 10 थोड़े अलग-अलग रिपोर्ट मिल सकते हैं।

  • यह क्या करता है: एक अंतिम चरण इन रिपोर्टों को जोड़ता है। यदि वीडियो A कहता है "300 लापता" और वीडियो B कहता है "300 लापता", तो सिस्टम उन्हें एक मजबूत तथ्य में मिला देता है और दोनों वीडियो के संदर्भों (citations) को सुरक्षित रखता है।
  • उपमा: एक संपादक सभी अलग-अलग रिपोर्टरों के नोट्स लेता है, जांचता है कि वे सहमत हैं या नहीं, और एक अंतिम, आधिकारिक लेख लिखता है जो हर एक स्रोत को श्रेय देता है।

यह क्यों महत्वपूर्ण है (परिणाम)

इस पेपर ने वास्तविक दुनिया की घटनाओं (MAGMaR 2026) पर इस सिस्टम का परीक्षण किया और पाया कि:

  • इसने अधिक तथ्य खोजे: इसने टेक्स्ट ओवरले में छिपे छोटे विवरणों को मिस नहीं किया।
  • यह बेहतर उद्धरण (cite) देता था: यह अपने दावों को साबित करने के लिए सटीक वीडियो साक्ष्य की ओर इशारा करने में बहुत बेहतर था (जिससे "साइटेशन रिकॉल" में काफी सुधार हुआ)।
  • यह अधिक सटीक था: इसने पिछले सर्वश्रेष्ठ सिस्टमों को बड़े अंतर से पीछे छोड़ दिया।

निष्कर्ष

TRACE खेल बदल देता है क्योंकि यह कहता है: "पूरे वीडियो को एक साथ समझने की कोशिश न करें। पहले, सुराग खोजने के लिए इसे स्कैन करें, फिर उन सुरागों का उपयोग करके उत्तर खोजें।" यह एक अराजक, भारी कार्य को एक संरचित, चरण-दर-चरण जांच में बदल देता है, जिससे यह सुनिश्चित होता है कि AI उन छोटे लेकिन महत्वपूर्ण विवरणों को न छोड़े जो सच्चाई को थामे हुए हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →