VistaHop: Benchmarking Multi-hop Visual Reasoning for Visual DeepSearch
यह शोध पत्र VistaHop प्रस्तुत करता है, जो एक नया बेंचमार्क और मूल्यांकन वातावरण है जिसे विज़ुअल डीपसर्च (Visual DeepSearch) के लिए जटिल, मल्टी-हॉप विज़ुअल रीजनिंग और पुनरावृत्ति इमेज निरीक्षण करने में मल्टीमॉडल लार्ज रीजनिंग मॉडल्स की क्षमताओं का आकलन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि वर्तमान अत्याधुनिक मॉडल्स अभी भी इन कार्यों के साथ महत्वपूर्ण रूप से संघर्ष करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रहस्य सुलझाने के लिए एक जासूस को काम पर रख रहे हैं। अतीत में, अधिकांश "डिटेक्टिव टेस्ट" एआई (AI) के लिए सरल पहेलियों की तरह थे: आप एआई को एक फोटो दिखाते और पूछते, "कार का रंग क्या है?" एआई बस एक बार देखता, रंग का अनुमान लगाता और आगे बढ़ जाता।
लेकिन वास्तविक दुनिया की जांच बहुत कठिन होती है। कभी-कभी, किसी मामले को सुलझाने के लिए, आपको जूते पर बने एक छोटे से लोगो को ज़ूम करके देखना पड़ता है, उस ब्रांड के इतिहास को खोजना पड़ता है, यह पता लगाना पड़ता है कि उसका कारखाना कहाँ है, वहाँ के मौसम की जाँच करनी पड़ती है, और फिर उन सभी कड़ियों को जोड़ने के लिए होता है कि घटनास्थल पर कौन मौजूद था।
यह शोध पत्र, VistaHop, एक बहुत कठिन परीक्षण बनाने के बारे में है ताकि यह देखा जा सके कि क्या एआई जासूस वास्तव में इस तरह का गहरा, बहु-चरणीय (multi-step) काम कर सकते हैं।
समस्या: "एक नज़र" का जाल (The "One-Glance" Trap)
लेखकों का तर्क है कि वर्तमान एआई परीक्षण बहुत आसान हैं। वे ऐसे हैं जैसे किसी जासूस को एक फोटो देना और पूछना, "क्या इस तस्वीर में एक कुत्ता है?" एआई बस एक नज़र डालता है और कहता है "हाँ।"
वास्तविक "विजुअल डीपसर्च" (Visual DeepSearch) अलग है। इसके लिए एआई को आवश्यक है:
- बारीकी से देखना: छवि के विशिष्ट हिस्सों पर ज़ूम करना (जैसे किसी साइन बोर्ड पर लिखा छोटा सा टेक्स्ट)।
- आगे-पीछे जाना: यह महसूस करना कि उससे कोई सुराग छूट गया है, फिर से ज़ूम करना, और तस्वीर के दूसरे हिस्से को देखना।
- कड़ियों को जोड़ना: जो वह फोटो में देख रहा है उसे बाहरी ज्ञान (जैसे डेटाबेस चेक करना) के साथ कई चरणों में जोड़ना।
लेखकों का कहना है कि मौजूदा परीक्षण विफल हो जाते हैं क्योंकि वे एआई को टेक्स्ट संकेतों का उपयोग करके या बिना वास्तव में विवरणों को "देखे" केवल अनुमान लगाकर धोखाधड़ी करने देते हैं।
समाधान: VistaHop (एक "बाधा दौड़")
इसे ठीक करने के लिए, टीम ने VistaHop बनाया, जो एक जटिल बाधा दौड़ (obstacle course) की तरह डिज़ाइन किया गया एक नया बेंचमार्क (परीक्षण सूट) है।
- सेटअप: उन्होंने 300 उच्च गुणवत्ता वाली तस्वीरें एकत्र कीं (जैसे एक व्यस्त शहर की सड़क या संग्रहालय)।
- कार्य: उन्होंने 350 प्रश्न बनाए जो एआई को एक लंबी यात्रा करने के लिए मजबूर करते हैं।
- उदाहरण: "नीचे दाईं ओर स्थित नारंगी शिपिंग कंटेनर को देखें। कंपनी का लोगो ढूंढें। पता लगाएं कि वह कंपनी कब स्थापित की गई थी। अब, उस शहर को खोजें जहाँ उनका मुख्यालय है। वह शहर किस वर्ष में स्थापित हुआ था? दोनों वर्षों को घटाएं।"
- नियम: एआई केवल अनुमान नहीं लगा सकता। उसे यह साबित करना होगा कि उसने छवि के विशिष्ट भाग को देखा, लोगो पाया, और सुरागों की श्रृंखला का पालन किया। यदि वह प्रश्न के टेक्स्ट का उपयोग करके उत्तर देने की कोशिश करता है (बिना छवि को देखे), तो परीक्षण उसे पकड़ लेता है और उत्तर को खारिज कर देता है।
उन्होंने VistaArena भी बनाया, एक "जिम" जहाँ वे एआई को प्रशिक्षित होते देख सकते हैं। यह एआई को टूल्स का उपयोग करने की अनुमति देता है जैसे कि आवर्धक लेंस (इमेज को क्रॉप/ज़ूम करने के लिए), एक सर्च इंजन (तथ्य खोजने के लिए), और एक कैलकुलेटर।
परिणाम: एआई अभी भी एक नौसिखिया है
लेखकों ने उपलब्ध सबसे स्मार्ट एआई मॉडल्स (जैसे SenseNova, GPT-5, और Gemini) को इस बाधा दौड़ के माध्यम से गुजारा।
फैसला? एआई काफी संघर्ष करता रहा।
- सबसे अच्छे मॉडल ने भी पहली बार में केवल लगभग 24% उत्तर सही दिए।
- जब एआई को सर्च टूल्स का उपयोग किए बिना केवल छवि को देखने के लिए मजबूर किया गया, तो उसने 8% से भी कम सही उत्तर दिए।
- जब एआई को टूल्स (ज़ूमिंग और सर्चिंग) का उपयोग करने की अनुमति दी गई तो वह बेहतर हुआ, लेकिन जब "सुरागों की श्रृंखला" बहुत लंबी हो गई या जिसमें फोटो के कई अलग-अलग स्थानों को देखने की आवश्यकता थी, तो वह अक्सर विफल रहा।
मुख्य निष्कर्ष (The Takeaway)
शोध पत्र निष्कर्ष निकालता है कि हालांकि एआई चित्रों को "देखने" में अच्छा हो रहा है, लेकिन यह एक दृढ़ निश्चयी अन्वेषक (persistent investigator) बनने में अभी भी बहुत खराब है। यह बहुत जल्दी हार मान लेता है, सूक्ष्म विवरणों को छोड़ देता है, या वापस जाकर छवि को फिर से जांचना भूल जाता है।
लेखकों ने VistaHop किसी उत्पाद को बेचने के लिए नहीं, बल्कि यह दिखाने के लिए बनाया है कि यदि हम चाहते हैं कि एआई वास्तव में जटिल दृश्य रहस्यों को समझे, तो हमें बेहतर परीक्षणों और बेहतर प्रशिक्षण विधियों की आवश्यकता है। उन्होंने अपना डेटा और कोड सार्वजनिक कर दिया है ताकि अन्य शोधकर्ता बेहतर "जासूस" बनाने का प्रयास कर सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।