GUI-Primitives: Diagnosing Spatial Reasoning Failures in Vision-Language GUI Grounding
यह शोध पत्र GUI-Primitives को प्रस्तुत करता है, जो एक ऐसा बेंचमार्क है जो यह प्रकट करता है कि विजन-लैंग्वेज मॉडल मुख्य रूप से उम्मीदवार इंटरफ़ेस तत्वों को स्थानीयकृत करने में विफल होते हैं न कि स्थानिक संबंधों को समझने में, जैसा कि सही क्षेत्रों तक सीमित होने पर उनकी उच्च सटीकता और अनियंत्रित निर्देशांक भविष्यवाणी (unconstrained coordinate prediction) पर खराब प्रदर्शन से प्रमाणित होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसे कंप्यूटर की कल्पना करें जो किसी सॉफ़्टवेयर प्रोग्राम के स्क्रीनशॉट को देख सके, "सेव आइकन के दाईं ओर स्थित बटन पर क्लिक करें" जैसा एक वाक्य पढ़ सके, और फिर माउस कर्सर को ठीक उसी स्थान पर ले जा सके। यह उन नए पीढ़ी के आर्टिफिशियल इंटेलिजेंस एजेंटों का वादा है जिन्हें हमारे लिए हमारे कंप्यूटर चलाने के लिए डिज़ाइन किया गया है। उन्हें फॉर्म भरने से लेकर जटिल मेनू को नेविगेट करने जैसे कार्यों को करने के लिए बनाया जा रहा है, जो डिजिटल सहायकों के रूप में कार्य करते हैं जो उन ग्राफिकल इंटरफेस के साथ देख और संवाद कर सकते हैं जिनका हम रोज़ाना उपयोग करते हैं। इन एजेंटों के काम करने के लिए, उनके पास "ग्राउंडिंग" नामक एक मौलिक कौशल होना चाहिए: एक वाक्य के विशिष्ट शब्द को स्क्रीन पर एक विशिष्ट आकार या बटन से जोड़ने की क्षमता। यदि एजेंट "दाईं ओर का बटन" खोजने में विश्वसनीय नहीं है, तो वह कार्य को पूरा नहीं कर सकता, चाहे वह योजना बनाने या टाइप करने में कितना भी स्मार्ट क्यों न हो।
शोधकर्ता लंबे समय से जानते हैं कि ये कंप्यूटर एजेंट कभी-कभी गलतियाँ करते हैं, लेकिन वे सटीक रूप से यह पहचानने के लिए संघर्ष करते रहे हैं कि वे क्यों हो रही हैं। क्या कंप्यूटर इसलिए विफल हो रहा है क्योंकि वह स्क्रीन पर लिखे टेक्स्ट को नहीं पढ़ पा रहा है? क्या वह "दाएं" या "बाएं" के अर्थ को लेकर भ्रमित है? या क्या वह केवल बटनों को खोजने में ही असमर्थ है? इन प्रणालियों के लिए मौजूदा परीक्षण अक्सर इन सभी कौशलों को एक साथ मिला देते हैं, जिससे यह बताना असंभव हो जाता है कि जब एजेंट गलत जगह क्लिक करता है, तो उसके मस्तिष्क का कौन सा हिस्सा खराब है। इस पहेली को सुलझाने के लिए, वैज्ञानिकों की एक टीम ने एक नया, अत्यधिक नियंत्रित परीक्षण बनाया जो एक एकल, बुनियादी क्षमता को अलग करने के लिए डिज़ाइन किया गया है: कंप्यूटर इंटरफेस में स्थानिक संबंधों (spatial relationships) को समझना।
शोधकर्ताओं ने GUI-PRIMITIVES नामक एक डेटासेट बनाया, जिसमें लगभग एक हजार प्रश्नों के जोड़े शामिल हैं। प्रत्येक जोड़ा बिल्कुल एक ही स्क्रीनशॉट और बिल्कुल एक ही शुरुआती बिंदु, या "एंकर" का उपयोग करता है, लेकिन निर्देश में केवल एक शब्द बदलता है। एक संस्करण में, कंप्यूटर को एक विशिष्ट आइकन के बाईं ओर स्थित तत्व पर क्लिक करने के लिए कहा जाता है; युग्मित (paired) संस्करण में, उसे उसी आइकन के दाईं ओर के तत्व पर क्लिक करने के लिए कहा जाता है। क्योंकि छवि और एंकर समान हैं, एकमात्र अंतर दिशा का है। यदि कंप्यूटर वास्तव में भाषा को समझ रहा है, तो उसे पहले प्रश्न के लिए बाएं बटन पर और दूसरे के लिए दाएं बटन पर क्लिक करना चाहिए। यदि वह दोनों के लिए एक ही बटन पर क्लिक करता है, या किसी पूरी तरह से अलग क्षेत्र में क्लिक करता है, तो यह स्थानिक संबंध को समझने में विफलता को प्रकट करता है। टीम ने इस चुनौती पर उन्नीस अलग-अलग आर्टिफिशियल इंटेलिजेंस मॉडल का परीक्षण किया, जिनमें शक्तिशाली, महंगे व्यावसायिक सिस्टम से लेकर छोटे, ओपन-सोर्स संस्करण तक शामिल थे।
परिणाम चौंकाने वाले थे। सबसे उन्नत मॉडल भी खराब प्रदर्शन करते हैं, जिसमें सर्वश्रेष्ठ प्रणाली केवल लगभग बत्तीस प्रतिशत मामलों में सही उत्तर दे पाती है। यह मानव प्रदर्शन की तुलना में एक बड़ा अंतर है, जहाँ लोग लगभग संतानत निन्यानवे प्रतिशत बार सही उत्तर देते हैं। शोधकर्ताओं ने यह समझने के लिए गहराई से जांच की कि विफलताएं कहाँ हो रही थीं। उन्होंने पाया कि समस्या मुख्य रूप से यह नहीं थी कि मॉडल "बाएं" या "दाएं" शब्दों से भ्रमित थे। इसके बजाय, मॉडल स्क्रीन पर सही क्षेत्र को खोजने में विफल हो रहे थे। साठ से बानवे प्रतिशत त्रुटियों में, कंप्यूटर का अनुमानित क्लिक सही लक्ष्य और गलत डिस्ट्रैक्टर (distractor) दोनों के बाहर, अक्सर छवि के पूरी तरह से खाली हिस्से में होता था।
जब शोधकर्ताओं ने इन "खोए हुए" भविष्यवाणियों को फ़िल्टर किया और केवल उन समयों को देखा जब कंप्यूटर ने वास्तव में दो संभावित बटनों में से एक की ओर इशारा किया था, तो तस्वीर बदल गई। क्षैतिज (horizontal) और ऊर्ध्वाधर (vertical) दिशाओं के लिए, मॉडल एक बार सही क्षेत्र तक पहुँच जाने के बाद सही विकल्प चुनने में काफी अच्छे थे। हालाँकि, अधिक जटिल संबंधों के लिए, जैसे कि यह निर्धारित करना कि कोई वस्तु एक पैनल के अंदर है या पॉप-अप विंडो के पीछे छिपी हुई है, मॉडल रैंडम गेसिंग (random guessing) से बेहतर प्रदर्शन नहीं कर पाए, भले ही वे सही उम्मीदवारों को देख रहे थे। यह सुझाव देता है कि हालांकि मॉडल कभी-कभी शब्दों को समझ सकते हैं, लेकिन वे एक जटिल स्क्रीन पर उन शब्दों को लागू करने वाले स्थान को खोजने के दृश्य कार्य के साथ काफी संघर्ष करते हैं।
अध्ययन ने यह भी परीक्षण किया कि क्या ये स्थानिक कौशल वास्तविक दुनिया के प्रदर्शन के लिए मायने रखते हैं। उन्होंने एक मजबूत संबंध पाया: मॉडल जो इन बुनियादी स्थानिक परीक्षणों में बेहतर थे, वे वास्तविक डेस्कटॉप एप्लिकेशन पर क्लिक करने के एक अलग, अधिक जटिल बेंचमार्क में भी बेहतर थे। यह पुष्टि करता है कि कंप्यूटर के उपयोग के लिए उन्नत कार्यों के लिए स्थानिक निर्देशों को समझना एक बुनियादी निर्माण खंड (building block) है। शोधकर्ताओं ने मॉडलों की मदद करने के लिए कई तरीके भी आजमाए, जैसे कि उन्हें चरण-दर-चरण सोचने के लिए कहना या विकल्पों को हाइलाइट करने के लिए स्क्रीन पर विजुअल मार्कर जोड़ना। एक विधि, जिसमें उम्मीदवार बटनों पर सीधे क्रमांकित टैग लगाना शामिल था, ने स्कोर में नाटकीय रूप से सुधार किया, जिससे कुछ मॉडल तीस प्रतिशत से बढ़कर लगभग नब्बे प्रतिशत तक पहुँच गए। हालाँकि, यह एक नैदानिक उपकरण (diagnostic tool) था न कि एक व्यावहारिक समाधान, क्योंकि टैग लगाने के लिए कंप्यूटर को पहले से ही पता होना चाहिए कि बटन कहाँ हैं।
अंततः, यह अध्ययन प्रकट करता है कि कंप्यूटर का उपयोग करने वाले एजेंटों की वर्तमान पीढ़ी एक महत्वपूर्ण कड़ी को मिस कर रही है। वे इसलिए विफल नहीं हो रहे हैं क्योंकि वे भाषा के बारे में तर्क नहीं कर सकते या वे स्क्रीन को नहीं देख सकते; वे इसलिए विफल हो रहे हैं क्योंकि वे एक सरल स्थानिक निर्देश को भीड़भाड़ वाले, जटिल इंटरफेस के विशिष्ट स्थान से विश्वसनीय रूप से मैप नहीं कर सकते। जब तक शब्दों को दृश्य स्थानों से जोड़ने के इस मौलिक कौशल को ठीक नहीं किया जाता, तब तक ये डिजिटल सहायक हमारे डिजिटल जगत को नेविगेट करने के सबसे बुनियादी कार्यों के साथ संघर्ष करते रहेंगे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।