← नवीनतम पेपर
🤖 AI

CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models

यह शोधपत्र CompareBench प्रस्तुत करता है, जो एक व्यापक बेंचमार्क सुइट है जिसमें TallyBench, OmniCaps और 1,200-प्रश्नों का एक विज़ुअल तुलनात्मक डेटासेट शामिल है, ताकि ऑब्जेक्ट काउंटिंग (वस्तु गणना), ज्यामितीय, स्थानिक और टेम्पोरल (सामयिक) तर्क के संबंध में वर्तमान विज़न-लैंग्वेज मॉडल्स की व्यवस्थित कमजोरियों का मूल्यांकन और अनावरण किया जा सके।

मूल लेखक: Jie Cai

प्रकाशित 2026-08-31✓ Author reviewed
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jie Cai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मानवीय दृष्टि केवल देखने के बारे में नहीं है; यह तुलना करने के बारे में है। जब हम एक कमरे को देखते हैं, तो हम केवल यह दर्ज नहीं करते कि कुर्सियाँ और मेजें मौजूद हैं; हम तुरंत यह निर्णय लेते हैं कि कौन सी कुर्सी ऊँची है, कौन सी मेज करीब है, काउंटर पर कितने कप हैं, या क्या कोई तस्वीर अतीत के दृश्य को दिखाती है या वर्तमान के। एक चीज़ की तुलना दूसरी से करने की यह क्षमता दुनिया को समझने में हमारी एक मौलिक भूमिका है। हाल के वर्षों में, कंप्यूटरों ने उल्लेखनीय कौशल के साथ देखना सीख लिया है, वे छवियों का वर्णन करने और उनमें क्या है, इसके बारे में उत्तर देने में सक्षम हैं। ये प्रणालियाँ, जिन्हें विज़न-लैंग्वेज मॉडल (vision-language models) के रूप में जाना जाता है, उन आधुनिक उपकरणों के पीछे के इंजन हैं जो एक चार्ट पढ़ सकते हैं, एक फोटो का वर्णन कर सकते हैं, या एक दृश्य पहेली को हल कर सकते हैं। फिर भी, जबकि ये मशीनें पहचान और वर्णन में कुशल हो गई हैं, यह स्पष्ट नहीं रहा है कि क्या उनके पास वही सहज तुलनात्मक समझ है जिसका उपयोग मनुष्य हर सेकंड करते हैं।

एक शोधकर्ता ने इस प्रश्न का उत्तर देने के लिए एक विशेष परीक्षण बनाया है, जिसमें एक नया मूल्यांकन सूट तैयार किया गया है जो दृश्य जानकारी की तुलना करने के विशिष्ट कार्य को अलग करता है। उन्होंने पाया कि जबकि सबसे उन्नत कंप्यूटर प्रणालियाँ सामान्य कार्यों पर अच्छा प्रदर्शन करती हैं, वे मात्रा, आकार, दूरी या समय के बारे में प्रत्यक्ष तुलना करने के लिए पूछे जाने पर काफी संघर्ष करती हैं। अध्ययन से पता चलता है कि सबसे स्मार्ट मॉडल भी स्पष्ट रूप से दिखाई देने वाली वस्तुओं की गिनती करने में विफल हो सकते हैं, यह तय करने में गलत हो सकते हैं कि कौन सी दो वस्तुएं लंबी हैं, या इस बात में भ्रमित हो सकते हैं कि कौन सा व्यक्ति कैमरे के अधिक करीब खड़ा है। शोधकर्ता ने पाया कि ये प्रणालियाँ अक्सर उन कार्यों में लड़खड़ा जाती हैं जो एक मनुष्य के लिए बहुत सरल होते हैं, जो यह सुझाव देता है कि दृश्य विवरणों की तुलना करने की क्षमता वर्तमान कृत्रिम बुद्धिमत्ता (AI) में एक व्यवस्थित कमजोरी बनी हुई है।

इस अंतर की जांच करने के लिए, शोधकर्ता ने 'कम्पेयरबेंच' (CompareBench) नामक परीक्षणों का एक व्यापक सेट बनाया है, जो उनके द्वारा विकसित दो अन्य संसाधनों—'टैलीबेंच' (TallyBench) और 'ओमनीकैप्स' (OmniCaps)—द्वारा समर्थित है। टैलीबेंच दो हजार छवियों का एक संग्रह है, जिसमें से प्रत्येक के साथ एक सरल प्रश्न है जो कंप्यूटर से किसी विशिष्ट प्रकार की वस्तु, जैसे कि कुत्ते, किताबें या चम्मचों को गिनने के लिए कहता है। यह संसाधन यह परीक्षण करने के लिए एक आधार के रूप में कार्य करता है कि एक मॉडल व्यक्तिगत वस्तुओं को कितनी अच्छी तरह गिन सकता है और मात्रा तुलना कार्य के लिए स्रोत चित्र भी प्रदान करता है। ओमनीकैप्स सात सौ सोलह छवियों का एक छोटा सेट है जिसमें ऐतिहासिक घटनाएँ, प्रसिद्ध स्थल और उल्लेखनीय व्यक्ति शामिल हैं, जिनमें से प्रत्येक के साथ एक विशिष्ट तिथि टैग की गई है। यह संग्रह शोधकर्ता को यह परीक्षण करने की अनुमति देता है कि क्या एक मॉडल छवियों को कालानुक्रमिक क्रम में व्यवस्थित करके समय के बीतने को समझ सकता है। मुख्य परीक्षण, कंपेयरबेंच, इन तत्वों को बारह सौ प्रश्नों में एक साथ लाता है जो कंप्यूटर को प्रत्यक्ष तुलना करने के लिए कहते हैं। ये प्रश्न चार श्रेणियों में विभाजित हैं: मात्राओं की तुलना करना, लंबाई और मोटाई जैसे ज्यामितीय गुणों की तुलना करना, गहराई और ऊंचाई जैसे स्थानिक संबंधों का निर्णय लेना, और घटनाओं को समय के क्रम में रखना। मात्रा तुलना उपसमूह विशेष रूप से मात्रा की तुलना करने के लिए छह सौ प्रश्न बनाने हेतु टैलीबेंच से लिया गया है।

शोधकर्ता ने तीन प्रमुख प्रौद्योगिकी कंपनियों के नौ अलग-अलग वर्ज़न वाले अग्रणी कंप्यूटर विज़न सिस्टम का परीक्षण किया। उन्होंने इन मॉडलों को बारह सौ तुलनात्मक प्रश्नों और दो हजार गिनती वाले कार्यों को हल करने के लिए कहा। परिणामों ने मानव प्रदर्शन और मशीन प्रदर्शन के बीच एक स्पष्ट विभाजन दिखाया। मनुष्यों ने लगभग हर कार्य पर लगभग पूर्ण अंक प्राप्त किए, वस्तुओं को गिनने और आकार का निर्णय लेने में आसानी से सफल रहे। हालाँकि, कंप्यूटर मॉडल निरंतर त्रुटियों को दर्शाते हैं। गिनती वाले कार्यों पर, सर्वश्रेष्ठ मॉडलों ने लगभग सत्तासी प्रतिशत उत्तर सही दिए, जिसका अर्थ है कि उन्होंने दस में से एक से अधिक छवियों में वस्तुओं को पहचानने या गिनने में चूक की। तुलनात्मक कार्यों पर, प्रदर्शन श्रेणी के अनुसार भिन्न था। मॉडल मात्राओं की तुलना करने में काफी अच्छे थे, लेकिन वे स्थानिक तर्क (spatial reasoning) के साथ काफी संघर्ष करते थे, अक्सर यह निर्धारित करने में विफल रहे कि कौन सी वस्तु कैमरे के करीब थी या कौन सा बिंदु जमीन से ऊँचा था। उन्हें ज्यामितीय तुलनाओं के साथ भी समस्या हुई, जैसे कि यह तय करना कि दो किताबों में से कौन सी अधिक मोटी थी।

सबसे आश्चर्यजनक निष्कर्षों में से एक 'टेम्पोरल' (temporal), या समय-आधारित, तुलना की श्रेणी में सामने आया। इस खंड में, मॉडलों को ऐतिहासिक दृश्यों, स्थलों या प्रसिद्ध व्यक्तियों की छवियों को देखने और यह तय करने के लिए कहा गया था कि कौन सा इतिहास में पहले आया था। यहाँ, कंप्यूटर मॉडल वास्तव में मानव परीक्षण विषयों से बेहतर प्रदर्शन कर रहे थे। मनुष्य, जो केवल चित्रों में मौजूद दृश्य साक्ष्यों को देखने तक सीमित थे, अक्सर सही क्रम निर्धारित नहीं कर सके क्योंकि चित्र बहुत समान दिख रहे थे। हालाँकि, कंप्यूटर मॉडलों के पास इतिहास, वास्तुकला और प्रसिद्ध हस्तियों के बारे में विशाल पूर्व-मौजूद ज्ञान तक पहुँच थी। वे छवियों को सही ढंग से क्रमबद्ध करने के लिए अपने आंतरिक डेटाबेस का उपयोग कर सकते थे, भले ही दृश्य संकेत अपर्याप्त हों। यह सुझाव देता है कि जबकि मॉडलों में स्थान और आकार की वास्तविक दृश्य समझ की कमी है, वे बाहरी ज्ञान की आवश्यकता वाले समस्याओं को हल करने के लिए अपने तथ्यों के विशाल मेमोरी का उपयोग करके इसकी भरपाई कर सकते हैं।

इन सामयिक सफलताओं के बावजूद, अध्ययन इस बात पर प्रकाश डालता है कि दृश्य तत्वों की तुलना करने की मूल क्षमता को कृत्रिम बुद्धिमत्ता द्वारा अभी तक पूरी तरह से महारत हासिल नहीं की गई है। शोधकर्ता ने देखा कि मॉडल अक्सर किसी वस्तु की लंबाई को उसकी ऊंचाई के साथ भ्रमित कर देते थे, या अग्रभूमि (foreground) की वस्तु और पृष्ठभूमि (background) की वस्तु के बीच अंतर करने में विफल रहते थे। उन्होंने यह भी पाया कि मॉडल गिनती करते समय आंशिक रूप से छिपी हुई वस्तुओं को अक्सर मिस कर देते थे, एक ऐसा कार्य जिसे मनुष्य स्वाभाविक रूप से संभालते हैं। शोधकर्ता ने निष्कर्ष निकाला कि वर्तमान प्रणालियाँ अभी तक उन कार्यों के लिए विश्वसनीय नहीं हैं जिनमें सूक्ष्म दृश्य तुलना की आवश्यकता होती है, और ये विफलताएं केवल यादृच्छिक गलतियाँ नहीं हैं बल्कि यह कि मॉडल दृश्य जानकारी को कैसे संसाधित करते हैं, इसमें व्यवस्थित सीमाएँ हैं। इन विशिष्ट कौशलों को अलग करने वाले केंद्रित परीक्षणों का सेट प्रदान करके, नया बेंचमार्क इस क्षेत्र में प्रगति को मापने का एक स्पष्ट तरीका प्रदान करता है। शोधकर्ता को उम्मीद है कि अपने डेटा और विधियों को सार्वजनिक करके, अन्य वैज्ञानिक इन उपकरणों का उपयोग बेहतर मॉडल बनाने के लिए कर सकेंगे जो अंततः दुनिया को देखने, तुलना करने और समझने की मानवीय क्षमता के साथ मेल खा सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →