← नवीनतम पेपर
💻 computer science

CuriosAI Submission to the CASTLE Challenge at EgoVis 2026

क्यूरियोसएआई (CuriosAI) टीम ईगोविस (EgoVis) 2026 के कास्टल (CASTLE) चैलेंज के लिए एसवीए (SVA) और टीएमकेजी (TMKG) दृष्टिकोण प्रस्तुत करती है, जो उनके तीन-चरणीय सर्च-वेरिफाई-आंसर (Search-Verify-Answer) पाइपलाइन के माध्यम से 600+ घंटों के सिंक्रोनाइज़्ड मल्टी-व्यू एर्गोसेंट्रिक वीडियो से प्राप्त 185 बहुविकल्पीय प्रश्नों पर 0.50 लीडरबोर्ड सटीकता प्राप्त करती है।

मूल लेखक: Yuto Kanda, Hayato Tanoue, Takayuki Hori

प्रकाशित 2026-05-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuto Kanda, Hayato Tanoue, Takayuki Hori

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप 12 लोगों के जीवन पर आधारित 600 घंटों के वीडियो फुटेज से एक बहुत बड़ा रहस्य सुलझाने की कोशिश कर रहे हैं, जिसे एक साथ 15 अलग-अलग कैमरों से फिल्माया गया है। चुनौती क्या है? यह पता लगाना कि क्या हुआ, किसने किया, और कब हुआ, इसके लिए 185 विशिष्ट बहुविकल्पीय (multiple-choice) प्रश्नों के उत्तर देना।

यह CASTLE चैलेंज है, और सॉफ्टबैंक (CuriosAI) की टीम ने इसे हल करने के लिए आर्टिफिशियल इंटेलिजेंस का उपयोग करके दो अलग-अलग तरीके आजमाए। वे अपने तरीकों को SVA और TMKG कहते हैं।

यहाँ बताया गया है कि उन्होंने इसे कैसे काम किया, जिसे सरल भाषा में समझाया गया है:

सामान्य आधार: "लाइब्रेरी" (The Library)

प्रश्नों को हल करने की कोशिश करने से पहले, दोनों तरीकों ने वीडियो की एक विशाल, व्यवस्थित लाइब्रेरी बनाई। उन्होंने केवल कच्चे वीडियो को नहीं देखा; बल्कि उन्होंने इसे पांच सहायक परतों में विभाजित किया:

  1. कौन कौन है: 12 लोगों की पहचान करना।
  2. क्या हो रहा है: दृश्यों के लिए कैप्शन लिखना।
  3. वहाँ कौन सी वस्तुएँ हैं: बोर्ड गेम या रसोई के औजारों जैसी विशिष्ट वस्तुओं को पहचानना।
  4. क्या कहा गया: ऑडियो को ट्रांसक्राइब करना और यह समझना कि किसने क्या बोला।
  5. समयरेखा (Timeline): प्रत्येक व्यक्ति के कार्यों का एक शेड्यूल बनाना।

दोनों तरीकों ने इसी "लाइब्रेरी" का उपयोग किया, लेकिन वे उत्तर खोजने के लिए बहुत अलग रास्तों पर चले।


दृष्टिकोण A: SVA (खोज – सत्यापन – उत्तर)

उपमा: कड़े नियमों वाली किताब के साथ एक जासूस

SVA को एक सख्त असेंबली लाइन में काम करने वाली तीन जासूसों की टीम के रूप में सोचें:

  1. खोज (द स्काउट - द खोजकर्ता): सबसे पहले, वे पूरी लाइब्रेरी को देखते हैं और अनुमान लगाते हैं कि वीडियो का कौन सा 15 मिनट का हिस्सा संभवतः उत्तर से संबंधित है। वे घंटों को एक छोटे से अंतराल तक सीमित कर देते हैं।
  2. सत्यापन (द स्केप्टिक - संदेह करने वाला): यह सबसे महत्वपूर्ण हिस्सा है। वे उस 15 मिनट के अंतराल को लेते हैं और उसे छोटे 5-मिनट के क्लिप में तोड़ देते हैं। वे एक AI को इन क्लिप्स को देखने के लिए कहते हैं, लेकिन वे उसे झूठ बोलने (मनगढ़ंत बातें बनाने) से रोकने के लिए एक सख्त नियम पुस्तिका देते हैं।
    • नियम 1: प्रश्न को केवल वापस न दोहराएं।
    • नियम 2: यदि वीडियो शांत या खाली है, तो स्वीकार करें कि आप नहीं जानते।
    • नियम 3: यदि आप कुछ गिनते हैं, तो आपको ठीक से बताना होगा कि वह वीडियो में कहाँ है।
    • नियम 4: यदि आप कुछ देख नहीं पा रहे हैं, तो तथ्य न बनाएं।
  3. उत्तर (द जज - न्यायाधीश): अंत में, एक स्मार्ट "जज" AI, संदेह करने वाले द्वारा एकत्र किए गए सभी सबूतों को देखता है, उनका वजन करता है (वह अस्पष्ट दृश्य अनुमानों की तुलना में ऑडियो उद्धरणों पर अधिक भरोसा करता है), और अंतिम उत्तर चुनता है।

परिणाम: यह तरीका बहुत सावधान था। इसने AI से बहुत सारे सवाल पूछे (प्रति रहस्य लगभग 28 बार), लेकिन इसने 50% बार सही उत्तर दिया। यह उनका विजेता सबमिशन था।


दृष्टिकोण B: TMKG (टेम्पोरल–मल्टीमॉडल–नॉलेज–ग्राफ)

उपमा: संबंधों का जाल

TMKG को तथ्यों के एक विशाल, 3D मकड़जाल के रूप में सोचें।

  • हर 5 मिनट में, सिस्टम एक "नोड" (एक बिंदु) बनाता है जिसमें सब कुछ शामिल होता है: कौन वहाँ था, उन्होंने क्या कहा, और कौन सी वस्तुएँ दिखाई दे रही थीं।
  • यह सिस्टम इन बिंदुओं को धागों (edges) से जोड़ता है जो दिखाते हैं कि किसने क्या किया, वे कहाँ थे, और आगे क्या हुआ।
  • जब कोई प्रश्न आता है, तो सिस्टम इस वेब में सही बिंदुओं के समूह को खोजने के लिए इस जाल की खोज करता है।
  • एक बार जब इसे सही स्थान मिल जाता है, तो यह वीडियो और वेब-डेटा को तुरंत उत्तर देने के लिए एक एकल AI को सौंप देता है।

परिणाम: यह तरीका तेज़ था और इसने AI से कम सवाल पूछे (प्रति रहस्य केवल लगभग 1 बार), लेकिन यह कम सटीक था, जिसने केवल 35% बार सही उत्तर दिया।


मुख्य निष्कर्ष

टीम ने दोनों की तुलना की और पाया कि एक स्पष्ट सबक है:

  • SVA (जासूस) इसलिए जीता क्योंकि यह अनुशासित था। AI को अपना काम दोबारा जांचने और तथ्य बनाने से बचने के लिए सख्त नियमों का पालन करने के लिए मजबूर करके, इसने मूर्खतापूर्ण गलतियों से बचने में सफलता पाई।
  • TMKG (जाल) संघर्ष कर रहा था क्योंकि यह बिना किसी अतिरिक्त "फैक्ट-चेकिंग" परत के, एक ही AI पर सब कुछ एक साथ करने के लिए निर्भर था।

निष्कर्ष:
इस बड़े पैमाने पर (600 घंटों के वीडियो), केवल एक स्मार्ट डेटाबेस बनाना पर्याप्त नहीं है। असली सफलता सत्यापन (verification) में थी। भले ही "जासूस" तरीके को चलाने के लिए अधिक कंप्यूटिंग पावर और समय की आवश्यकता थी, लेकिन AI को उत्तर देने से पहले अपने तथ्यों को साबित करने के लिए मजबूर करने वाले अतिरिक्त कदम ने 35% स्कोर और 50% स्कोर के बीच का अंतर पैदा किया।

टीम ने नोट किया कि दोनों तरीके कभी-कभी विफल हो जाते थे क्योंकि वे शुरू करने के लिए गलत 15-मिनट का विंडो चुन लेते थे। लेकिन उन्होंने निष्कर्ष निकाला कि यदि आप सही विंडो ढूंढ सकते हैं, तो एक "अनुशासित सत्यापनकर्ता" जोड़ना सही उत्तर पाने का सबसे अच्छा तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →