ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning
ReVSI एक नया प्रस्तावित बेंचमार्क और मूल्यांकन प्रोटोकॉल है जो 381 दृश्यों को पुन: एनोटेट करके और प्रश्न-उत्तर युग्मों को पुन: उत्पन्न करके वर्तमान VLM 3D रीजनिंग आकलन की व्यवस्थित अमान्यता को संबोधित करता है ताकि यह सुनिश्चित किया जा सके कि प्रश्न वास्तविक, विरल रूप से नमूना लिए गए वीडियो इनपुट के तहत उत्तर देने योग्य और सटीक हैं, जिससे स्थानिक बुद्धिमत्ता में पहले से छिपे हुए विफलता मोड प्रकट होते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक छात्र की घर में नेविगेट करने और उसके अंदर के फर्नीचर को गिनने की क्षमता का परीक्षण करने की कोशिश कर रहे हैं। आप छात्र को घर का एक वीडियो देते हैं और पूछते हैं, "सोफे पर कितने तकिए हैं?"
आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, शोधकर्ता यह जांचने के लिए एक मानक परीक्षण का उपयोग कर रहे हैं जिसे VSI-Bench कहा जाता है कि AI मॉडल (विशेष रूप से विजन-लैंग्वेज मॉडल्स, या "VLMs") 3D स्थानों को कितनी अच्छी तरह समझते हैं। लेकिन, इस पेपर के अनुसार, वह परीक्षण दोषपूर्ण है। यह एक छात्र के गणित कौशल को ऐसे टेस्ट पेपर का उपयोग करके ग्रेड देने जैसा है जहाँ नंबर धुंधले हैं, प्रश्न महत्वपूर्ण विवरणों से गायब हैं, और उत्तर कुंजी (answer key) गलत है।
लेखक इस समस्या को ठीक करने के लिए एक नया, पुनर्निर्मित परीक्षण पेश करते हैं जिसे ReVSI कहा जाता है। यहाँ बताया गया है कि उन्होंने क्या पाया और उन्होंने क्या किया, सरल उपमाओं (analogies) का उपयोग करते हुए।
1. समस्या: "टूटा हुआ नक्शा" और "आंखों पर पट्टी"
पेपर में दो मुख्य कारणों की पहचान की गई है जिनसे पुराना परीक्षण (VSI-Bench) भ्रामक ग्रेड दे रहा था:
"टूटा हुआ नक्शा" (Annotation Drift):
पुराने परीक्षण ने उन "नक्शों" (3D डेटा) पर भरोसा किया जो अलग-अलग उद्देश्यों के लिए वर्षों पहले बनाए गए थे। इसे आज के शहर में नेविगेट करने के लिए 1990 के एक स्केची, हाथ से बने नक्शे का उपयोग करने जैसा समझें।- गायब वस्तुएं: पुराने नक्शे में शायद कोई कुर्सी नहीं है क्योंकि स्कैनर उसे मिस कर गया, लेकिन वास्तविक वीडियो में वह कुर्सी स्पष्ट रूप से दिखाई दे रही है। AI को कुर्सी देखने के लिए दंडित किया जाता है, भले ही "उत्तर कुंजी" कहती हो कि वह वहां नहीं होनी चाहिए।
- गलत लेबल: नक्शा किसी "कप" को "नोटबुक" के रूप में लेबल कर सकता है क्योंकि 3D आकार विकृत था। AI भ्रमित हो जाता है क्योंकि वीडियो स्पष्ट रूप से एक कप दिखाता है।
- खराब ज्यामिति (Geometry): नक्शा कमरे के आकार को 20 वर्ग मीटर के रूप में गणना कर सकता है क्योंकि स्कैनर एक दर्पण (mirror) के कारण भ्रमित हो गया था, लेकिन वीडियो दिखाता है कि यह वास्तव में 40 वर्ग मीटर है।
"आंखों पर पट्टी" (Frame Sampling):
आधुनिक AI मॉडल अक्सर पूरा वीडियो नहीं देखते; वे समय बचाने के लिए केवल कुछ स्नैपशॉट (फ्रेम्स) देखते हैं।- कल्पना कीजिए कि आप किसी से पूछते हैं, "इस कमरे में कितने लोग हैं?" लेकिन आप उन्हें केवल एक फोटो दिखाते हैं जब कमरा खाली था।
- पुराने परीक्षण ने माना कि AI पूरा वीडियो देख सकता है। लेकिन वास्तव में, यदि AI 1,000 में से केवल 16 स्नैपशॉट देखता है, तो वह वस्तु को पूरी तरह से मिस कर सकता है। पुराने परीक्षण ने इस बात का ध्यान नहीं रखा, इसलिए उसने ऐसे प्रश्न पूछे जो AI के पास उपलब्ध सीमित दृश्य के साथ उत्तर देना असंभव था।
2. समाधान: ReVSI (एक "नया सजाया गया घर")
लेखकों ने केवल पुराने परीक्षण में मामूली बदलाव नहीं किए; उन्होंने इसे पूरी तरह से ध्वस्त कर दिया और शून्य से फिर से बनाया। वे इसे ReVSI कहते हैं।
- घर का पुन: एनोटेशन (Re-annotating the House): उन्होंने मानव विशेषज्ञों को कच्चे वीडियो को देखने और मैन्युअल रूप से नए, सटीक "नक्शे" बनाने के लिए काम पर रखा। उन्होंने गायब कुर्सियों को ठीक किया, गलत लेबल को सुधारा, और कमरों को वास्तव में वीडियो में जो दिख रहा है उसके आधार पर सटीक रूप से मापा, न कि उस शोर-शराबे वाले स्कैनर के आधार पर जो वहां था।
- "फ्रेम-अवेयर" नियम: उन्होंने खेल के नियम बदल दिए। अब, यदि एक AI को केवल 16 फ्रेम देखने की अनुमति है, तो प्रश्न विशेष रूप से उन 16 फ्रेमों के लिए तैयार किए जाते हैं। यदि वस्तु उन 16 फ्रेमों में नहीं है, तो प्रश्न बदल जाता है या हटा दिया जाता है। यह सुनिश्चित करता है कि AI का परीक्षण केवल उसी पर किया जाए जिसे वह वास्तव में देख सकता है।
- "डमी वीडियो" स्ट्रेस टेस्ट: यह उनका सबसे रचनात्मक उपकरण है। उन्होंने "डमी वीडियो" बनाए जहाँ उन्होंने उस वस्तु को डिजिटल रूप से मिटा दिया जिसे AI को खोजना था।
- परीक्षण: वे AI को एक लिविंग रूम का वीडियो दिखाते हैं लेकिन उन सभी फ्रेमों को हटा देते हैं जिनमें "तकिए" मौजूद थे।
- लक्ष्य: एक स्मार्ट AI को कहना चाहिए, "मैं कोई तकिया नहीं देख सकता, इसलिए उत्तर शून्य है।"
- परिणाम: कई AI मॉडल, "शून्य" कहने के बजाय, "2" या "3" का अनुमान लगाने लगे क्योंकि उन्होंने याद कर लिया था कि लिविंग रूम में आमतौर पर तकिए होते हैं। इसने खुलासा किया कि ये मॉडल हैलुसिनेट (hallucinating) कर रहे थे (याददाश्त के आधार पर अनुमान लगा रहे थे) बजाय देखने (seeing) के (साक्ष्य के आधार पर देखना)।
3. चौंकाने वाले परिणाम
जब उन्होंने नया परीक्षण चलाया, तो AI मॉडल की रैंकिंग नाटकीय रूप से बदल गई:
- "प्रोपराइटरी" मॉडल (बड़ी टेक कंपनियाँ): GPT-5.2 और Gemini 3 जैसे मॉडल वास्तव में काफी अच्छा प्रदर्शन करते हैं। वे वास्तव में वीडियो में जो देखा जा रहा है उस पर अधिक निर्भर लगते हैं, बजाय केवल अनुमान लगाने के।
- "ओपन-सोर्स" मॉडल: कई मॉडल जो पुराने परीक्षण पर बहुत अच्छे दिखते थे, अचानक बहुत खराब दिखने लगे। उनके स्कोर में भारी गिरावट आई क्योंकि वे पुराने परीक्षण के "टूटे हुए नक्शे" और "पूर्वाग्रहों" (biases) पर निर्भर थे।
- "विशेषज्ञ" (Specialized) मॉडल: कुछ मॉडल जिन्हें विशेष रूप से 3D कार्यों के लिए प्रशिक्षित किया गया था, वे नए परीक्षण पर अपने बिना प्रशिक्षित संस्करणों की तुलना में वास्तव में बदतर प्रदर्शन करते पाए गए। यह सुझाव देता है कि वे पुराने परीक्षण के खराब डेटा के प्रति "ओवर-फिट" (over-fitted) हो गए थे, यानी उन्होंने सही तर्क सीखने के बजाय "गलत उत्तरों" को रट लिया था।
मुख्य निष्कर्ष (The Bottom Line)
यह पेपर तर्क देता है कि हम AI की स्थानिक बुद्धिमत्ता (spatial intelligence) के वर्तमान स्कोर पर भरोसा नहीं कर सकते क्योंकि परीक्षण दोषपूर्ण थे। ReVSI एक नया, अधिक सख्त और अधिक ईमानदार परीक्षा है। यह AI को यह साबित करने के लिए मजबूर करता है कि वह वास्तव में प्रदान किए गए वीडियो फ्रेम को देख रहा है, न कि केवल इस आधार पर अनुमान लगा रहा है कि एक कमरे को कैसा दिखना चाहिए।
संक्षेप में: पुराना परीक्षण एक शिक्षक द्वारा एक धुंधली फोटो और गलत उत्तर कुंजी के आधार पर छात्र को ग्रेड देने जैसा था। ReVSI एक ऐसा शिक्षक है जो छात्र को एक स्पष्ट, हाई-डेफिनिशन वीडियो देता है और ऐसे प्रश्न पूछता है जो उस वीडियो में जो दिखाई दे रहा है उससे बिल्कुल मेल खाते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।