← नवीनतम पेपर
🤖 AI

CRAFT: Critic-Refined Adaptive Key-Frame Targeting for Multimodal Video Question Answering

यह शोध पत्र CRAFT को प्रस्तुत करता है, जो एक क्वेरी-कंडीशन्ड पाइपलाइन है जो डायनेमिक कीफ्रेम चयन, बहुभाषी ASR और एक हाइब्रिड क्रिटिक लूप को जोड़ता है ताकि दावों को पुनरावृत्ति से सत्यापित करके और सटीक स्रोत एट्रिब्यूशन के साथ साक्ष्य को समेकित करके ग्राउंडेड मल्टी-वीडियो क्वेश्चन आंसरिंग में अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

मूल लेखक: Mahesh Bhosale, Abdul Wasi, Vishvesh Trivedi, Pengyu Yan, Akhil Gorugantu, David Doermann

प्रकाशित 2026-05-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mahesh Bhosale, Abdul Wasi, Vishvesh Trivedi, Pengyu Yan, Akhil Gorugantu, David Doermann

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक समाचार संपादक (news editor) हैं जो दुनिया भर के दर्जनों अलग-अलग वीडियो क्लिप्स के आधार पर किसी बड़ी घटना (जैसे भूकंप या चुनाव) के बारे में एक सटीक लेख लिखने की कोशिश कर रहे हैं। इनमें से कुछ क्लिप अंग्रेजी में हैं, कुछ बर्मी (Burmese) में, कुछ घंटों लंबी हैं, और कई में अप्रासंगिक फुटेज है।

आपका लक्ष्य एक ऐसी रिपोर्ट लिखना है जहाँ हर एक वाक्य एक विशिष्ट वीडियो क्लिप द्वारा समर्थित हो, और आपको यह बताने के लिए सटीक रूप से उद्धृत (cite) करना होगा कि किस क्लिप ने उस तथ्य को सिद्ध किया। यदि आप किसी विवरण का अनुमान लगाते हैं या गलत वीडियो का हवाला देते हैं, तो आपका लेख "हैलुसिनेटेड" (भ्रामक/झूठा) माना जाएगा।

यही वह चुनौती है जिसे CRAFT हल करता है। इसे सरल शब्दों में यहाँ समझाया गया है:

समस्या: "भूसे के ढेर में सुई" (The Needle in a Haystack)

वास्तविक दुनिया के समाचार वीडियो अव्यवस्थित होते हैं।

  1. बहुत लंबे: 2 घंटे का वीडियो कंप्यूटर के लिए एक साथ "देखने" के लिए बहुत बड़ा होता है। यदि आप केवल यादृच्छिक (random) फ्रेम चुनते हैं (जैसे हर 10 सेकंड में एक फोटो लेना), तो आप भूकंप के ठीक उस क्षण को मिस कर सकते हैं जब वह हुआ था।
  2. ऑडियो की कमी: बहुत सारी सच्चाई बोली जाती है, न कि केवल दिखाई जाती है। यदि एक रिपोर्टर कहता है, "पुल दोपहर 3 बजे गिरा," लेकिन कैमरा केवल मलबे को दिखाता है, तो केवल चित्रों को देखने वाला कंप्यूटर इस महत्वपूर्ण विवरण को चूक जाएगा।
  3. झूठ बोलने वाली मशीनें: यहाँ तक कि स्मार्ट AI मॉडल भी कभी-कभी मनगढ़ंत बातें बना लेते हैं। वे आत्मविश्वास के साथ एक तथ्य बता सकते हैं जो वास्तव में वीडियो में नहीं है, या दो अलग-अलग घटनाओं को आपस में मिला सकते हैं।

समाधान: CRAFT (स्मार्ट न्यूज़रूम)

लेखकों ने CRAFT (Critic-Refined Adaptive Key-Frame Targeting) नामक एक प्रणाली बनाई है। इसे एक अत्यधिक व्यवस्थित न्यूज़रूम के रूप में समझें जिसमें एक ओवरवर्क्ड एडिटर के बजाय विशेषज्ञों की एक टीम है।

यहाँ चरण-दर-चरण वर्कफ़्लो दिया गया है:

1. "स्मार्ट कैमरा" (Dynamic Keyframe Selection)

पूरे वीडियो को देखने या यादृच्छिक फ्रेम चुनने के बजाय, CRAFT एक स्मार्ट कैमरा ऑपरेटर की तरह कार्य करता है।

  • उपमा (Analogy): कल्पना करें कि आप 2 घंटे की फिल्म में एक विशिष्ट दृश्य खोज रहे हैं। पूरा वीडियो देखने के बजाय, आप AI से पूछते हैं, "मुझे केवल वे फ्रेम दिखाएं जहाँ भूकंप दिखाई दे रहा है।"
  • यह कैसे काम करता है: सिस्टम वीडियो को स्कैन करता है और केवल उन फ्रेमों को चुनता है जो आपके विशिष्ट प्रश्न के लिए प्रासंगिक हैं। यह समय बचाता है और सुनिश्चित करता है कि AI सही साक्ष्य पर ध्यान केंद्रित करे।

2. "अनुवादक" (ASR & Translation)

सिस्टम केवल देखता नहीं है; यह सुनता भी है।

  • उपमा: यह कमरे में मौजूद एक अनुवादक की तरह है जो वीडियो में बोले गए हर शब्द (भले ही वे बर्मी या नेपाली जैसी विदेशी भाषाओं में हों) को सुनता है और उन्हें अंग्रेजी में लिख देता है।
  • यह कैसे काम करता है: यह बोले गए शब्दों को ट्रांसक्रिप्ट में बदलने के लिए स्पीच-टू-टेक्स्ट तकनीक का उपयोग करता है। यदि ऑडियो शोर वाला है या किसी दुर्लभ भाषा में है, तो इसके पास एक "बैकअप अनुवादक" तैयार रहता है। यह ट्रांसक्रिप्ट की जांच भी करता है ताकि यह सुनिश्चित हो सके कि AI एक ही शब्द को बार-बार दोहराने में नहीं फंस गया है (जो कि एक सामान्य ग्लिच है)।

3. "फैक्ट-चेकर" लूप (The Critic)

यह सबसे महत्वपूर्ण हिस्सा है। सिस्टम केवल एक बार लेख नहीं लिखता; यह इसे संशोधित (revise) करता है।

  • उपमा: कल्पना करें कि एक जूनियर रिपोर्टर ने एक ड्राफ्ट लिखा है। फिर, एक सीनियर एडिटर ("क्रिटिक") उसे पढ़ता है और तीन कठिन सवाल पूछता है:
    1. समय की जाँच (Time Check): "क्या यह वास्तव में उसी समय हुआ था जैसा आपने कहा था?" (Temporal Grounding)।
    2. विरोधाभास की जाँच (Contradiction Check): "क्या यह वाक्य उस बात का खंडन करता है जो आपने पिछले पैराग्राफ में कही थी?" (Cross-Claim Screening)।
    3. अंतिम निर्णय (Final Verdict): "क्या यह दावा वास्तव में वीडियो द्वारा समर्थित है, या आप इसे मनगढ़ंत बना रहे हैं?" (Adjudication)।
  • यह कैसे काम करता है: यदि क्रिटिक को कोई गलती मिलती है, तो वह ड्राफ्ट को सुधारने के निर्देशों के साथ AI को वापस भेज देता है। यह तब तक चार बार तक हो सकता है जब तक कि तथ्य ठोस न हो जाएं।

4. "मुख्य संपादक" (Citation Merging)

अंत में, सिस्टम सभी सत्यापित तथ्यों को एक रिपोर्ट में जोड़ देता है।

  • उपमा: कल्पना करें कि पांच अलग-अलग रिपोर्टरों ने एक ही तथ्य पाया (जैसे, "पुल ढह गया")। उस वाक्य को पांच बार लिखने के बजाय, मुख्य संपादक इसे एक बार लिखता है लेकिन प्रमाण के रूप में सभी पांच वीडियो क्लिप संलग्न करता है।
  • यह कैसे काम करता है: यह सुनिश्चित करता है कि अंतिम रिपोर्ट संक्षिप्त है लेकिन मिले हुए हर साक्ष्य से पूरी तरह समर्थित है।

परिणाम: क्या यह काम कर गया?

टीम ने MAGMaR 2026 नामक एक कठिन बेंचमार्क पर CRAFT का परीक्षण किया, जिसमें वास्तविक दुनिया की समाचार घटनाएँ शामिल हैं।

  • स्कोर: CRAFT ने परीक्षण किए गए सभी सिस्टमों में उच्चतम स्कोर प्राप्त किया। यह अन्य शक्तिशाली AI मॉडलों की तुलना में सही तथ्यों को खोजने (Recall) और वीडियो को सही ढंग से उद्धृत करने (Citation F1) में बेहतर था।
  • सीक्रेट सॉस (Secret Sauce): शोध में पाया गया कि सबसे बड़े सुधार इन चीजों से आए:
    1. तथ्यों को छोटे, परमाणु टुकड़ों (Atomic Claims) में तोड़ना।
    2. ऑडियो सुनना (ASR)।
    3. "क्रिटिक" लूप जिसने AI को अपने काम की जांच करने के लिए मजबूर किया।

सारांश

CRAFT एक अत्यधिक कुशल, बहुभाषी न्यूज़रूम की तरह है जो न केवल वीडियो देखता है, बल्कि उन्हें सुनता भी है, सबसे महत्वपूर्ण क्षणों को चुनता है, त्रुटियों को खोजने के लिए खुद से बहस करता है, और एक ऐसी अंतिम रिपोर्ट तैयार करता है जहाँ प्रत्येक वाक्य एक विशिष्ट वीडियो क्लिप द्वारा समर्थित होता है। यह साबित करता है कि एक "क्रिटिक" को अपने काम की जांच करने के लिए जोड़ने से, AI वास्तविक दुनिया की घटनाओं के बारे में सच बताने में बहुत अधिक विश्वसनीय बन सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →