← नवीनतम पेपर
🤖 AI

Confidence-Aware Tool Orchestration for Robust Video Understanding

यह शोध पत्र Robust-TO को प्रस्तुत करता है, जो एक एजेंटिक वीडियो समझ ढांचा (framework) है जो प्रति-फ्रेम विश्वसनीयता स्कोर को एक एकीकृत टूल ऑर्केस्ट्रेशन सिस्टम में एकीकृत करके "ब्लाइंड ट्रस्ट प्रॉब्लम" को कम करता है, जिससे अत्याधुनिक मॉडलों की तुलना में सटीकता और दृश्य भ्रष्टाचार (visual corruptions) के विरुद्ध मजबूती में महत्वपूर्ण सुधार होता है।

मूल लेखक: Yangfan He, Yujin Choi, Jaehong Yoon

प्रकाशित 2026-06-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yangfan He, Yujin Choi, Jaehong Yoon

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो सुरक्षा कैमरे के वीडियो के आधार पर एक अपराध को सुलझाने की कोशिश कर रहे हैं। लेकिन यहाँ एक पेंच है: वीडियो बहुत खराब है। कुछ हिस्से कैमरे के हिलने के कारण धुंधले हैं, कुछ सूरज की तेज़ रोशनी से बहुत चमकीले हो गए हैं, और कुछ हिस्सा लेंस के सामने से गुजरने वाले ट्रक द्वारा बाधित है।

समस्या: "अंधा विश्वास" (Blind Trust)
अधिकांश वर्तमान AI जासूस, जैसा कि लेखकों ने कहा है, "ब्लाइंड ट्रस्ट प्रॉब्लम" से ग्रस्त होते हैं। वे वीडियो के हर एक फ्रेम को देखते हैं और मानते हैं, "यह तस्वीर एकदम सही है, और मैं इस पर पूरी तरह भरोसा कर सकता हूँ।" उन्हें यह समझ नहीं आता कि एक धुंधला फ्रेम वास्तव में एक बुरा सुराग है। क्योंकि वे बुरे सुरागों पर भी उतने ही विश्वास करते हैं जितना कि अच्छे सुरागों पर, वे अक्सर गलत उत्तर देते हैं, फिर भी वे अपनी गलती पर 100% आश्वस्त रहते हैं। यह एक जासूस की तरह है जो गंदे विंडशील्ड के माध्यम से लाइसेंस प्लेट पढ़ने की कोशिश कर रहा है और ज़ोर देकर कह रहा है, "मैं इसे स्पष्ट रूप से देख पा रहा हूँ!"

समाधान: Robust-TO
यह शोध पत्र Robust-TO पेश करता है, जो AI के वीडियो देखने का एक नया तरीका है। हर फ्रेम पर अंधा विश्वास करने के बजाय, Robust-TO एक स्मार्ट, संदेही संपादक (editor) की तरह काम करता है जिसे पता है कि एक खराब वीडियो को कैसे संभालना है। यह तीन चरणों में काम करता है:

1. "गुणवत्ता निरीक्षक" (फ्रेम चयन - Frame Selection)

रहस्य सुलझाने से पहले, Robust-TO वीडियो को स्कैन करता है और हर एक फ्रेम को रेटिंग देता है।

  • उपमा (Analogy): कल्पना कीजिए कि एक फिल्म संपादक फुटेज के रील को देख रहा है। वे उन फ्रेम्स को चिह्नित करते हैं जो धुंधले हैं, बहुत अंधेरे हैं, या किसी वस्तु द्वारा बाधित हैं, और उन्हें "कचरा" (Trash) के रूप में चिह्नित करते हैं। वे केवल "गोल्ड" फ्रेम्स को रखते हैं—वे जो स्पष्ट हैं और वास्तव में वह दिखाते हैं जो प्रश्न पूछ रहा है।
  • परिणाम: यदि प्रश्न है "किस कार ने रेड लाइट जंप की?", तो AI उन फ्रेम्स को अनदेखा कर देता है जहाँ एक ट्रक दृश्य को बाधित कर रहा है या वाइपर विंडशील्ड को धुंधला कर रहे हैं। यह केवल स्पष्ट क्षणों का उपयोग करता है।

2. "विशेषज्ञ टीम" (कॉन्फिडेंस-गाइडेड टूल रूटिंग - Confidence-Guided Tool Routing)

एक बार जब AI के पास अच्छे फ्रेम्स आ जाते हैं, तो वह केवल अनुमान नहीं लगाता। यह बड़े प्रश्न को छोटे, विशिष्ट कार्यों में तोड़ देता है और उन्हें विभिन्न "टूल्स" (विशेषज्ञ AI प्रोग्रामों) के पास भेज देता है।

  • उपमा: एक मेडिकल टीम के बारे में सोचें। यदि किसी मरीज का पैर टूट गया है, तो आप उसे नेत्र रोग विशेषज्ञ के पास नहीं, बल्कि हड्डी विशेषज्ञ (orthopedist) के पास भेजते हैं।
  • यह कैसे काम करता है: यदि वीडियो धुंधला है, तो Robust-TO जानता है कि एक "डिटेक्शन टूल" (जो तीखे किनारों को देखता है) विफल हो सकता है। इसलिए, यह कार्य को "कैप्शनिंग टूल" (जो धुंधलेपन में भी क्या हो रहा है इसका अनुमान लगाने में बेहतर है) की ओर मोड़ देता है।
  • कॉन्फिडेंस स्कोर: प्रत्येक टूल एक उत्तर और एक कॉन्फिडेंस स्कोर देता है। लेकिन यहाँ एक ट्रिक है: स्कोर को इस आधार पर समायोजित किया जाता है कि वीडियो कितना खराब था। यदि कोई टूल एक धुंधले फ्रेम के आधार पर उत्तर देता है, तो उसका कॉन्फिडेंस स्कोर स्वचालित रूप से कम हो जाता है, जैसे कि एक चेतावनी लेबल हो जो कहता है, "इसे सावधानी के साथ लें।"

3. "मुख्य जासूस" (टियर्ड एविडेंस सिंथेसिस - Tiered Evidence Synthesis)

अंत में, मुख्य AI टूल्स के सभी उत्तरों को इकट्ठा करता है। यह उन्हें तीन श्रेणियों में वर्गीकृत करता है:

  • उच्च श्रेणी (High Tier): स्पष्ट फ्रेमों से प्राप्त स्पष्ट साक्ष्य। यह "सत्य" है।
  • मध्यम श्रेणी (Medium Tier): ठीक-ठाक साक्ष्य। इनका उपयोग तभी किया जाता है जब ये उच्च श्रेणी से मेल खाते हों।
  • निम्न श्रेणी (Low Tier): खराब फ्रेमों से प्राप्त कचरा साक्ष्य। इन्हें फेंक दिया जाता है जब तक कि वास्तव में और कुछ भी न बचा हो।
  • परिणाम: AI अपना अंतिम उत्तर केवल "उच्च श्रेणी" के तथ्यों का उपयोग करके बनाता है। यदि साक्ष्य संदिग्ध है, तो यह बेतहाशा अनुमान लगाने के बजाय अनिश्चितता स्वीकार करता है।

यह क्यों महत्वपूर्ण है (परिणाम)

लेखकों ने इन कठिन परीक्षणों पर इस सिस्टम का परीक्षण किया जिसमें जानबूझकर धुंधलेपन, चमक और रुकावट (जैसे बारिश में चलती कार) के साथ वास्तविक दुनिया के वीडियो दिए गए थे।

  • पुराना तरीका: जब वीडियो खराब होता था, तो मानक AI मॉडल विफल हो जाते थे। उनकी सटीकता 15-30% तक गिर जाती थी, लेकिन उन्हें पता नहीं चलता था कि वे विफल हो रहे हैं।
  • Robust-TO का तरीका: इन अस्त-व्यस्त वीडियो के साथ भी, Robust-TO ने अपनी सटीकता को उच्च बनाए रखा। इसने वास्तव में इन कठिन परीक्षणों पर कुछ सबसे महंगे, प्रसिद्ध AI मॉडल (जैसे Gemini-2.5-Pro) से बेहतर प्रदर्शन किया।
  • दक्षता (Efficiency): क्योंकि यह खराब फ्रेमों को अनदेखा कर देता है, इसलिए इसे बहुत अधिक डेटा प्रोसेस करने की आवश्यकता नहीं होती है। इसने समस्याओं को तेज़ी से हल किया और कम कंप्यूटर पावर का उपयोग किया, फिर भी सही उत्तर अधिक बार प्राप्त किए।

संक्षेप में
Robust-TO AI को एक "अंधा आशावादी" बनने के बजाय एक "आलोचनात्मक विचारक" बनना सिखाता है। यह यह कहना सीखता है कि, "मैं वीडियो के इस हिस्से पर भरोसा नहीं कर सकता, इसलिए मैं इसे अनदेखा करूँगा और स्पष्ट हिस्सों पर ध्यान केंद्रित करूँगा," जिससे यह सुनिश्चित होता है कि जब यह कोई उत्तर देता है, तो वह वास्तव में ठोस साक्ष्यों पर आधारित होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →