← नवीनतम पेपर
🤖 machine learning

GroundBench: A Factorized, Counterfactual Benchmark for Locating VLM Affordance Failures

GroundBench एक फैक्टराइज्ड (factorized), काउंटरफैक्चुअल (counterfactual) बेंचमार्क है जिसे विजन-लैंग्वेज मॉडल की अफॉर्डेंस विफलताओं के विशिष्ट कारणों को अलग करने और निदान करने के लिए डिज़ाइन किया गया है, जो यह प्रदर्शित करता है कि कई स्पष्ट ग्राउंडिंग सफलताएँ वास्तव में वास्तविक दृश्य या यांत्रिक तर्क के बजाय श्रेणी-से-क्रिया (category-to-action) जुड़ाव द्वारा संचालित होती हैं।

मूल लेखक: Sarthak Sattigeri

प्रकाशित 2026-09-15
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sarthak Sattigeri

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक रोबोटिक हाथ कॉफी के मग की ओर बढ़ रहा है। सफल होने के लिए, मशीन को एक साथ तीन अलग-अलग पहेलियों को हल करना होगा: उसे यह तय करना होगा कि मग का कौन सा हिस्सा महत्वपूर्ण है (हैंडल, न कि रिम), उसे दृश्य दुनिया में वह हिस्सा ठीक कहाँ स्थित है, और यह समझना होगा कि वह हिस्सा किस तरह की क्रिया को आमंत्रित करता है (पकड़ना, न कि धक्का देना)। वर्षों तक, शोधकर्ताओं ने कृत्रिम बुद्धिमत्ता (AI) प्रणालियों का इन कार्यों पर परीक्षण करने के लिए उनसे यह बताने को कहा कि मशीन को किसी वस्तु के साथ क्या करना चाहिए। एक हालिया सहयोगी अध्ययन ने सुझाव दिया कि यदि आप केवल AI को लक्ष्य भाग का नाम बता देते हैं—जैसे कि केवल "मग पकड़ो" कहने के बजाय "हैंडल पकड़ो" कहना—तो सिस्टम का प्रदर्शन नाटकीय रूप से बढ़ जाता है। इससे एक आशावादी निष्कर्ष निकला: AI अंततः छवि को देखने और वस्तु के भौतिक यांत्रिकी (mechanics) के बारे में तर्क करने में सक्षम हो रहा था।

हालाँकि, 'ग्राउंडबेंच' (GroundBench) नामक एक नया अन्वेषण बताता है कि यह निष्कर्ष समय से पहले का हो सकता है। मनिपाल यूनिवर्सिटी जयपुर के सत्तीगेरी के नेतृत्व में शोधकर्ताओं ने संदेह किया कि AI वास्तव में वस्तु को बेहतर तरीके से देखना नहीं सीख रहा है। इसके बजाय, उन्होंने परिकल्पना की कि सिस्टम एक शॉर्टकट पर निर्भर हो सकता है: केवल यह याद रखना कि "हैंडल" जैसे शब्द लगभग हमेशा "पकड़ने" की क्रिया के साथ जुड़े होते हैं, चाहे चित्र में वास्तव में कुछ भी दिखाया गया हो। इस परीक्षण को करने के लिए, उन्होंने एक कठोर नया बेंचमार्क बनाया जिसे किसी छवि में एक भाग को खोजने की क्षमता और शब्द के आधार पर क्रिया का अनुमान लगाने की क्षमता को अलग करने के लिए डिज़ाइन किया गया था। उन्होंने केवल AI को कार्य करने के लिए नहीं कहा; उन्होंने व्यवस्थित रूप से जानकारी को एक-एक करके हटाया, यह देखने के लिए कि वास्तव में सफलता किस विशिष्ट संकेत से मिल रही थी।

शोधकर्ताओं ने तीन अलग-अलग AI मॉडल के परीक्षण के लिए छह अलग-अलग परिदृश्य या स्थितियाँ बनाईं। पहले परिदृश्य में, AI के पास बिना किसी टेक्स्ट निर्देश के किसी वस्तु, जैसे कीबोर्ड या दरवाजे की केवल छवि थी। दूसरे में, उन्होंने वस्तु का नाम जोड़ा, जैसे "कीबोर्ड"। तीसरे में, उन्होंने विशिष्ट भाग का नाम दिया, जैसे "स्पेसबार"। चौथे में, उन्होंने स्क्रीन पर उस भाग का सटीक स्थान दिया—एक विशिष्ट बिंदु और उसके चारों ओर एक बॉक्स—लेकिन जानबूझकर भाग का नाम नहीं बताया। पांचवें में, उन्होंने नाम और स्थान दोनों दिए। अंत में, छठे में, उन्होंने वस्तु के हिलने-डुलने के बारे में तकनीकी विवरण जोड़े, जैसे कि कोई जोड़ (joint) हिंज (hinge) है या स्लाइडर।

परिणाम चौंकाने वाले और विरोधाभासी थे। जब शोधकर्ताओं ने AI को लक्ष्य भाग का सटीक स्थान दिया लेकिन उसे यह बताने से मना कर दिया कि उस भाग को क्या कहा जाता है, तो सिस्टम का प्रदर्शन ढह गया। परीक्षण किए गए तीनों मॉडलों में, सही क्रिया चुनने की सटीकता गिरकर एक रैंडम अनुमान (random guess) के स्तर पर या उससे भी नीचे आ गई। एक मॉडल ने, बटन का स्थान दिए जाने पर लेकिन उसका नाम न मिलने पर, केवल 0.26 स्कोर किया, जबकि एक साधारण बेसलाइन जिसने पूरी तरह से छवि को अनदेखा कर दिया था, उसने 0.53 स्कोर किया। AI उस स्थान को पूरी तरह से पुनरुत्पादित (reproduce) कर सकता था जिसे शोधकर्ताओं ने दिखाया था, अपने "फिंगर" को ठीक वहीं रख सकता था जहाँ शोधकर्ता इशारा कर रहे थे, फिर भी वह उस स्थान के साथ क्या करना है, यह समझने में विफल रहा। यह ऐसा था मानो रोबोट बटन को देख सकता था लेकिन उसे पता ही नहीं था कि बटन दबाने के लिए होते हैं।

इसके विपरीत, जब शोधकर्ताओं ने AI को भाग का नाम दिया लेकिन उसका स्थान छिपा लिया, तो प्रदर्शन बहुत बढ़ गया। जिन मॉडलों ने केवल स्थान वाले डेटा के साथ विफल होने के बाद, नाम दिए जाने पर 0.68 और 0.74 के बीच सटीकता दर हासिल की, जब उन्हें बताया गया कि वह एक "बटन" या "दरवाजा" है, भले ही उन्होंने उसे देखा न हो। यह पैटर्न हर जगह सही रहा: जैसे ही AI को भाग का श्रेणी नाम दिया गया, वह लगभग हमेशा सही क्रिया का अनुमान लगा सकता था। शोधकर्ताओं ने पाया कि उनके सावधानीपूर्वक तैयार किए गए वस्तुओं के सेट में, भाग का नाम अकेले उत्तर निर्धारित करने के लिए पर्याप्त था। AI भौतिकी को समझने के लिए छवि को नहीं देख रहा था, बल्कि वह एक शब्द को पढ़ रहा था और एक पूर्व-सीखे गए जुड़ाव को याद कर रहा था।

इस संदेह की पुष्टि करने के लिए, शोधकर्ताओं ने एक नियंत्रण परीक्षण (control test) चलाया जहाँ उन्होंने छवि को पूरी तरह हटा दिया और मॉडलों से केवल टेक्स्ट के आधार पर उत्तर देने को कहा। परीक्षण किए गए सबसे उन्नत मॉडल के लिए, छवि को हटाने से उन स्थितियों में प्रदर्शन पर कोई अंतर नहीं पड़ा जहाँ भाग का नाम दिया गया था। छवि के बिना भी मॉडल ने उतना ही अच्छा या थोड़ा बेहतर प्रदर्शन किया। इसने इस बात का पुख्ता सबूत दिया कि सिस्टम 'विजुअल ग्राउंडिंग' (visual grounding)—शब्दों को छवि के विशिष्ट पिक्सेल से जोड़ने की प्रक्रिया—का उपयोग नहीं कर रहा था, बल्कि एक टेक्स्ट-आधारित शॉर्टकट पर निर्भर था। मॉडल जानता था कि "हिंज डोर" का अर्थ "खींचना" है और "स्लाइडर बटन" का अर्थ "धक्का देना" है क्योंकि उसने अपने प्रशिक्षण डेटा में उन जोड़ियों को देखा था, न कि इसलिए कि वह सामने मौजूद विशिष्ट दरवाजे या बटन की यांत्रिकी को समझता था।

अध्ययन ने यह भी परीक्षण किया कि क्या AI एक पेचीदा सवाल का पालन कर सकता है। शोधकर्ताओं ने एक ऐसी वस्तु की छवि ली जिसमें कई भाग थे, जैसे कि कई कुंजियों (keys) वाला कीबोर्ड, और AI को एक गैर-मानक भाग पर क्रिया करने को कहा, जैसे कि एक विशिष्ट कुंजी जिसका उपयोग शायद ही कभी किया जाता है। वे देखना चाहते थे कि क्या AI वास्तव में उस विशिष्ट कुंजी को देखेगा या वह पूरे ऑब्जेक्ट के लिए सबसे सामान्य क्रिया पर लौट जाएगा। हालांकि मॉडल आमतौर पर नए निर्देश का पालन करते थे, लेकिन वे असामान्य क्रियाओं, जैसे कि किसी भाग को लंबवत (vertically) उठाने के मामले में काफी संघर्ष करते थे। इन मामलों में, मॉडल अक्सर मानक क्रिया पर वापस आ जाते थे, जिससे पता चलता है कि वे अभी भी वास्तविक दृश्य का विश्लेषण करने के बजाय अपने सबसे सामान्य जुड़ावों पर निर्भर थे।

शायद सबसे आश्चर्यजनक खोज यह थी कि अधिक जानकारी देने से हमेशा मदद नहीं मिली। जब शोधकर्ताओं ने AI को स्थान और भाग का नाम दिया, और फिर वस्तु के हिलने-डुलने के बारे में विस्तृत यांत्रिक विवरण जोड़ा, तो प्रदर्शन वास्तव में कम हो गया। मॉडल बेहतर नहीं हुए; वे कम सटीक हो गए। यह सुझाव देता है कि अतिरिक्त जानकारी ने सिस्टम को भ्रमित किया या उसे केवल भाग के नाम के सरल और प्रभावी शॉर्टकट से भटका दिया। शोधकर्ताओं ने निष्कर्ष निकाला कि इन विशिष्ट कार्यों के लिए, अधिक डेटा का अर्थ बेहतर तर्क नहीं था।

इस कार्य के निहितार्थ रोबics और आर्टिफिशियल इंटेलिजेंस के क्षेत्र के लिए महत्वपूर्ण हैं। यह प्रकट करता है कि कुछ परीक्षणों पर उच्च स्कोर भ्रामक हो सकते हैं। एक AI भौतिक तर्क का मास्टर प्रतीत हो सकता है, जबकि वास्तव में वह केवल शब्द-संबंधों (word associations) का मास्टर होता है। शोधकर्ताओं ने पाया कि पिछले अध्ययनों में देखा गया नाटकीय सुधार, जहाँ भाग का नाम देने से सटीकता में बड़ा उछाल आया था, संभवतः इसलिए नहीं था कि AI अचानक बेहतर देखना सीख गया था। इसके बजाय, यह इसलिए था क्योंकि नाम में ही उत्तर छिपा था। यह अध्ययन यह दावा नहीं करता कि ये मॉडल दृश्य तर्क (visual reasoning) में अक्षम हैं, लेकिन यह दिखाता है कि इन विशिष्ट स्थितियों में, वे इसका उपयोग नहीं कर रहे थे।

ग्राउंडबेंच एक नैदानिक उपकरण (diagnostic tool) के रूप में कार्य करता है, जो AI के प्रदर्शन की परतों को हटाने का एक तरीका है ताकि यह देखा जा सके कि वास्तव में नीचे क्या हो रहा है। दृश्य स्थान को अर्थपूर्ण नाम (semantic name) से अलग करके, शोधकर्ताओं ने उस अंतर को उजागर किया जो मॉडलों द्वारा किए जाने वाले काम और उनके वास्तविक काम के बीच था। उन्होंने पाया कि जब भाग का नाम हटा दिया गया, तो मॉडल क्रिया को नहीं ढूंढ सके, भले ही स्थान पूरी तरह से स्पष्ट था। यह सुझाव देता है कि इन प्रणालियों के लिए, वास्तविक यांत्रिक तर्क का मार्ग पहले की तुलना में अधिक लंबा है। उन्होंने अभी तक किसी वस्तु को देखकर उसके कार्य को समझना नहीं सीखा है; उन्होंने केवल एक शब्द को सुनकर उसके कार्य का अनुमान लगाना सीखा है। यह अध्ययन विफलता की घोषणा के साथ समाप्त नहीं होता है, बल्कि एक स्पष्ट मानचित्र के साथ होता है कि आगे कहाँ काम करने की आवश्यकता है: ऐसे सिस्टम बनाने के लिए जो वास्तव में उनके द्वारा सुने गए शब्दों को उनके द्वारा देखी गई भौतिक दुनिया से जोड़ सकें, न कि उन शॉर्टकट पर निर्भर रहें जिन्होंने अब तक उन्हें इतनी अच्छी तरह से सेवा दी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →