← नवीनतम पेपर
🤖 AI

V-REX: Benchmarking Exploratory Visual Reasoning via Chain-of-Questions

मूल लेखक: Chenrui Fan, Yijun Liang, Shweta Bhardwaj, Kwesi Cobbina, Ming Li, Tianyi Zhou

प्रकाशित 2026-06-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chenrui Fan, Yijun Liang, Shweta Bhardwaj, Kwesi Cobbina, Ming Li, Tianyi Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ V-REX पेपर का स्पष्टीकरण दिया गया है, जिसे सरल अवधारणाओं और रोज़मर्रा के उदाहरणों में विभाजित किया गया है।

बड़ी समस्या: AI एक "आलसी जासूस" है

कल्पना कीजिए कि आपने एक रहस्य सुलझाने के लिए एक जासूस (एक AI) को काम पर रखा है, जैसे कि "यह कार दुर्घटना किसकी वजह से हुई?"

अधिकांश वर्तमान AI मॉडल उन जासूसों की तरह हैं जो अपराध स्थल की फोटो को एक बार देखते हैं, तुरंत उत्तर का अनुमान लगाते हैं, और कहते हैं, "यह काली कार थी!" वे अक्सर गलत होते हैं क्योंकि उन्होंने बारीकी से नहीं देखा। वे केवल एक अंदाज़ या शॉर्टकट के आधार पर अनुमान लगा सकते हैं, बजाय इसके कि वे वास्तव में सुरागों की जांच करें।

समस्या यह है कि वास्तविक दुनिया का विजुअल रीजनिंग (दृश्य तर्क) केवल एक अनुमान नहीं है; यह एक प्रक्रिया है। आपको गीली ज़मीन को देखना होगा, टायर के निशान चेक करने होंगे, यह देखना होगा कि क्या ब्रेक लॉक थे, और फिर तय करना होगा कि कौन जिम्मेदार है। वर्तमान AI इस तरह के स्टेप-बाय-स्टेप "सक्रिय अन्वेषण" (active exploration) करने में संघर्ष करते हैं।

समाधान: V-REX ("प्रश्नों की श्रृंखला" का खेल)

शोधकर्ताओं ने एक नया टेस्ट बनाया जिसे V-REX कहा जाता है, ताकि यह देखा जा सके कि क्या AI वास्तव में एक अच्छे जासूस की तरह काम कर सकता है। केवल AI से अंतिम उत्तर पूछने के बजाय, वे इसे Chain-of-Questions (CoQ) नामक एक खेल खेलने के लिए मजबूर करते हैं।

CoQ को जासूसों के लिए एक "चुनें अपना रोमांच" (choose-your-own-adventure) वाली किताब की तरह समझें।

  • लक्ष्य: मुख्य रहस्य को सुलझाना (जैसे, "कौन जिम्मेदार है?")।
  • नियम: आप सीधे उत्तर पर नहीं कूद सकते। आपको पहले सुराग इकट्ठा करने के लिए छोटे-छोटे प्रश्नों की एक श्रृंखला पूछनी होगी।

इस टेस्ट को निष्पक्ष और ग्रेड करने में आसान बनाने के लिए, शोधकर्ताओं ने AI को अपनी मर्जी का कोई भी प्रश्न पूछने की अनुमति नहीं दी (क्योंकि इसे ग्रेड करना बहुत कठिन होता)। इसके बजाय, उन्होंने हर चरण में AI को विकल्पों का एक मेनू दिया।

दो कौशल जिनका परीक्षण किया गया

पेपर जासूसी के काम को दो अलग-अलग कौशलों में विभाजित करता है: प्लानिंग (योजना बनाना) और फॉलोइंग (अनुसरण करना)

1. प्लानिंग: "मैप रीडर" (नक्शा पढ़ने वाला)

  • परिदृश्य: AI को मुख्य रहस्य और अगले प्रश्न पूछने के लिए 5 संभावित विकल्पों की एक सूची दी जाती है। कुछ प्रश्न सहायक होते हैं (जैसे, "क्या ज़मीन गीली है?"), और कुछ भटकाने वाले होते हैं (जैसे, "आसमान का रंग क्या है?")।
  • टेस्ट: क्या AI अगला प्रश्न पूछने के लिए सही प्रश्न चुन सकता है?
  • उदाहरण: कल्पना कीजिए कि आप एक छिपे हुए खजाने को खोजने की कोशिश कर रहे हैं। आपके पास एक नक्शा है जिसमें पांच संभावित रास्ते हैं।
    • अच्छी प्लानिंग: आप उस रास्ते को चुनते हैं जो उस जंगल की ओर ले जाता है जहाँ खजाना दबे होने की संभावना है।
    • खराब प्लानिंग: आप उस रास्ते को चुनते हैं जो एक बंद तालाब की ओर ले जाता है, भले ही वह देखने में दिलचस्प लग रहा हो।
  • निष्कर्ष: पेपर में पाया गया कि AI इसमें वास्तव में काफी खराब है। यह अक्सर उपयोगी रास्ते के बजाय "सुंदर" लेकिन बेकार रास्ते (भटकाव) को चुन लेता है।

2. फॉलोइंग: "सुराग का पीछा करने वाला"

  • परिदृश्य: AI को बताया जाता है, "ठीक है, अब इन विशिष्ट प्रश्नों का क्रमवार उत्तर दें: क्या ज़मीन गीली है? हाँ। क्या ब्रेक लॉक हैं? हाँ।"
  • टेस्ट: क्या AI तस्वीर को देख सकता है और इन विशिष्ट प्रश्नों का सही उत्तर दे सकता है?
  • उदाहरण: कल्पना कीजिए कि एक टूर गाइड म्यूजियम में आपका मार्गदर्शन कर रहा है और विशेष पेंटिंग्स की ओर इशारा करते हुए कह रहा है, "बताओ इसका रंग क्या है।"
    • अच्छा फॉलोइंग: आप पेंटिंग को देखते हैं और कहते हैं, "यह नीला है।"
    • खराब फॉलोइंग: आप दूसरी तरफ देखते हैं और अनुमान लगाते हैं, "यह लाल है।"
  • निष्कर्ष: AI इसमें वास्तव में काफी अच्छा है। यदि आप उसे बताते हैं कि उसे क्या देखना है, तो वह आमतौर पर इसे सही ढंग से देख लेता है।

शोधकर्ताओं ने क्या खोजा

कई अलग-अलग AI मॉडल (छोटे से लेकर बड़े और महंगे मॉडलों तक) का परीक्षण करके, उन्होंने कुछ आश्चर्यजनक बातें पाईं:

  1. अन्वेषण मदद करता है (Exploration Helps): जब AI को पहले सही प्रश्न पूछने (Planning) और फिर उनका उत्तर देने (Following) के लिए मजबूर किया गया, तो इसने अंतिम उत्तर बहुत अधिक बार सही दिया। इसने साबित किया कि "बोलने से पहले सोचना" AI के लिए भी काम करता है।
  2. आकार मायने रखता है, लेकिन समान रूप से नहीं:
    • छोटे AI Following (विशिष्ट प्रश्नों के उत्तर देना) में बहुत अच्छे हैं लेकिन Planning (अगला क्या पूछना है यह तय करना) में बहुत खराब हैं। वे एक बेहतरीन नोट-टेकर की तरह हैं जिन्हें नहीं पता कि किस विषय पर लिखना है।
    • बड़े AI Planning में बहुत बेहतर होते हैं। वे अधिक संतुलित होते हैं, जैसे एक ऐसा जासूस जो जांच करने और सुराग पढ़ने दोनों में माहिर हो।
  3. "रिकवरी" का तरीका (The "Recovery" Trick): यदि AI प्लानिंग चरण में गलती करता है (एक बुरा प्रश्न पूछता है), तो वह कभी-कभी अभी भी सही अंतिम उत्तर देकर रिकवर कर सकता है। लेकिन अगर वह फॉलोइंग चरण में गलती करता है (एक विशिष्ट सुराग का गलत उत्तर देता है), तो वह लगभग हमेशा अंतिम उत्तर गलत देगा। एक खराब रणनीति से उबरना एक खराब तथ्य से उबरने की तुलना में आसान है।
  4. "ब्लाइंडफोल्ड" टेस्ट: जब उन्होंने तस्वीरें हटा दीं और केवल AI को टेक्स्ट प्रश्न दिए, तो AI बुरी तरह विफल रहा। यह साबित करता है कि यह टेस्ट वास्तव में देखने और तर्क करने के बारे में है, न कि केवल टेक्स्ट याद करने के बारे में।

निचोड़ (The Bottom Line)

यह पेपर तर्क देता है कि AI को विजुअल कार्यों में वास्तव में स्मार्ट बनाने के लिए, हमें केवल यह परीक्षण नहीं करना चाहिए कि क्या वह अंतिम उत्तर सही देता है। हमें यह भी परीक्षण करना होगा कि वह वहां कैसे पहुँचता है।

V-REX एक ड्राइविंग टेस्ट की तरह है जो न केवल यह जाँचता है कि आप गंतव्य तक पहुँचे या नहीं, बल्कि यह भी जाँचता है कि क्या आप जानते थे कि चौराहे पर कौन सा मोड़ लेना है (Planning) और क्या आप वास्तव में वहाँ पहुँचने पर स्टॉप साइन देख पा रहे थे (Following)। परिणाम बताते हैं कि हालांकि AI संकेतों को देखने में बेहतर हो रहा है, लेकिन उसे अभी भी यह सीखने की ज़रूरत है कि सही मोड़ कैसे चुना जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →