EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs
यह शोध पत्र EgoCoT-Bench प्रस्तुत करता है, जो एक सूक्ष्म-स्तरीय (fine-grained) इगोसेंट्रिक वीडियो बेंचमार्क है जिसमें स्पष्ट चरण-दर-चरण तर्क संबंधी एनोटेशन के साथ 3,172 सत्यापन योग्य QA जोड़े शामिल हैं, जिसे मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स की ग्राउंडेड, ऑपरेशन-केंद्रित तर्क क्षमताओं का मूल्यांकन करने और उन्हें सुधारने के लिए डिज़ाइन किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप किसी के नज़रिए से खाना बनाने का वीडियो देख रहे हैं (जैसे कि माथे पर गोप्रो पहना हो)। आप चाकू, एक बर्तन और एक चम्मच पकड़ते हुए हाथ देखते हैं। अब, कल्पना कीजिए कि आप एक सुपर-स्मार्ट AI रोबोट से पूछते हैं: "शेफ द्वारा नमक की डिब्बी को नीचे रखने के बाद वह कहाँ है?"
रोबोट कह सकता है, "यह काउंटर पर है।" और यह सही भी हो सकता है! लेकिन यहाँ एक पेंच है: क्या रोबोट ने वास्तव में नमक की डिब्बी को वहाँ जाते हुए देखा, या उसने सिर्फ अंदाज़ा लगाया?
यही वह समस्या है जिसे पेपर EgoCoT-Bench हल करने की कोशिश कर रहा है।
समस्या: "तुक्केबाज़" रोबोट (The "Lucky Guess" Robot)
अभी, कई AI मॉडल उन छात्रों की तरह हैं जो उत्तर कुंजी (answer key) रट लेते हैं लेकिन गणित को नहीं समझते। वे एक वीडियो देख सकते हैं और प्रश्न का सही उत्तर दे सकते हैं, लेकिन उनका स्पष्टीकरण (उनका तर्क/reasoning) बनावटी, असंगत, या ऐसी चीज़ों पर आधारित हो सकता है जो वास्तव में वीडियो में नहीं हुईं।
"फर्स्ट-पर्सन" (एगोसेंट्रिक) वीडियो की दुनिया में, यह और भी कठिन हो जाता है क्योंकि:
- हाथ अक्सर दृश्य को बाधित करते हैं।
- वस्तुएं गायब होती हैं और फिर से प्रकट होती हैं।
- कैमरा हिलता है और तेज़ी से घूमता है।
मौजूदा AI परीक्षण केवल यह देखते हैं कि अंतिम उत्तर सही है या नहीं। यह पेपर कहता है, "यह काफी नहीं है! हमें यह भी जांचने की ज़रूरत है कि AI का 'कथानक' (story) वास्तव में वीडियो के प्रति सत्य है या नहीं।"
समाधान: EgoCoT-Bench (द "ट्रुथ डिटेक्टिव" टेस्ट)
लेखकों ने एक नया, अत्यंत विस्तृत परीक्षण बनाया है जिसे EgoCoT-Bench कहा जाता है। इसे AI के लिए एक "ड्राइविंग टेस्ट" की तरह समझें, लेकिन कार चलाने के बजाय, AI को हाथों से कार्य करने वाले वीडियो को समझना होता है।
उन्होंने इसे कैसे बनाया:
- मैप (STTG): केवल वीडियो देखने के बजाय, उन्होंने पहले वीडियो का एक "मैप" बनाया। यह मैप हर वस्तु, हर हाथ और समय के हर सेकंड को ट्रैक करता है, जैसे कि किसी नाटक की विस्तृत पटकथा।
- प्रश्न: उन्होंने इस मैप का उपयोग करके 3,172 प्रश्न बनाए। ये केवल "कप का रंग क्या है?" जैसे प्रश्न नहीं हैं। ये पेचीदा प्रश्न हैं जैसे: "हाथ ने 1:00 बजे नीला कप पकड़ा, फिर 1:05 पर लाल कप। 1:03 पर मेज पर कौन सा था?"
- प्रमाण: प्रत्येक प्रश्न के साथ एक "रसीद" आती है। इस परीक्षण में सटीक समय, स्थान और वह दृश्य प्रमाण शामिल है जिसकी उत्तर देने के लिए आवश्यकता है। इस प्रकार, हम यह जांच सकते हैं कि क्या AI का तर्क उस रसीद से मेल खाता है।
4 प्रकार की चुनौतियाँ
परीक्षण को चार मुख्य श्रेणियों में विभाजित किया गया है, जैसे कि एक वीडियो गेम के स्तर:
- एक्शन को पहचानना (Grounding & Perception): "हाथ अभी किस चीज़ को छू रहा है?" (क्या AI देख पा रहा है कि अभी क्या हो रहा है?)
- टाइम मशीन (Retrospection): "चम्मच को उठाने से पहले वह कहाँ था?" (क्या AI अतीत को याद रख सकता है?)
- भविष्यवक्ता (Prediction & Causal Inference): "हाथ ने ढक्कन पकड़ा हुआ है। आगे क्या होगा?" या "कॉफी क्यों गिरी?" (क्या AI भविष्य का अनुमान लगा सकता है या कारण समझा सकता है?)
- बड़ी तस्वीर (High-Level Reasoning): "क्या शेफ सैंडविच बनाना पूरा कर चुका है, या अभी एक और चरण बाकी है?" (क्या AI पूरे लक्ष्य को समझ सकता है?)
जब उन्होंने AI का परीक्षण किया तो क्या हुआ?
लेखकों ने उपलब्ध सबसे स्मार्ट AI मॉडल्स (जैसे GPT-5, Qwen, और LLaVA) को इस परीक्षण से गुज़ारा। यहाँ उन्हें क्या मिला:
- "तुक्का मारने की घटना" (The "Lucky Guess" Phenomenon): कई मॉडल्स ने सही उत्तर (जैसे, "बोतल शेल्फ पर है") दिया, लेकिन जब पूछा गया कि क्यों, तो उनका स्पष्टीकरण गलत था। वे कह सकते थे, "क्योंकि मैंने एक बोतल देखी," जबकि वीडियो में वास्तव में प्रश्न के समय के बाद बोतल को हटाया गया था।
- अंतर (The Gap): यहाँ तक कि सर्वश्रेष्ठ AI मॉडल भी लगभग 60-70% सही स्कोर करते हैं। इंसान लगभग 96% स्कोर करते हैं। इसका मतलब है कि हाथों के सामान इधर-उधर करने के मामले में मानव समझ और AI समझ के बीच अभी भी एक बड़ा अंतर है।
- सबसे कठिन हिस्सा: AI अगले कदम का अनुमान लगाने में ठीक था, लेकिन किसी वस्तु के इतिहास को ट्रैक करने में (जैसे कि शर्ट के एक विशिष्ट टैग का पीछा करना जब उसे उतारा जा रहा हो) बहुत खराब था।
निचोड़ (The Bottom Line)
यह पेपर AI को ग्रेड करने का एक नया तरीका पेश करता है। केवल अंतिम उत्तर के आधार पर ग्रेड देने के बजाय, वे अब तर्क (reasoning) को भी ग्रेड देते हैं।
उन्होंने पाया कि कई AI "स्पूरियस करेक्ट" (spurious correct) हैं—वे गलत कारणों से सही उत्तर प्राप्त करते हैं। यह खतरनाक है क्योंकि यदि आप किसी रोबोट को रसोई में मदद करने के लिए AI से कहते हैं, और AI सही उत्तर का अनुमान लगाता है लेकिन उसके पास चाकू के स्थान के बारे में गलत विचार है, तो रोबोट ऐसी चीज़ काट सकता है जिसे उसे नहीं काटना चाहिए।
EgoCoT-Bench एक ऐसा उपकरण है जो AI को केवल अंदाज़ा लगाने के बजाय, वीडियो में मौजूद वास्तविक साक्ष्यों पर ध्यान केंद्रित करने के लिए मजबूर करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।