VISTA: View-Consistent Self-Verified Training for GUI Grounding
VISTA एक GRPO-आधारित प्रशिक्षण ढांचा है जो GUI ग्राउंडिंग के लिए, एक ही इंस्टेंस के कई लक्ष्य-संरक्षित दृश्यों (target-preserving views) से तुलनात्मक समूह बनाकर और समन्वय पीढ़ी (coordinate generation) को स्थिर करने के लिए एक स्व-सत्यापित क्रॉस-व्यू एंकर को शामिल करके मॉडल के प्रदर्शन और मजबूती को बढ़ाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को कंप्यूटर स्क्रीन पर बटन क्लिक करना सिखा रहे हैं। रोबोट का काम है एक कमांड सुनना जैसे "Export बटन पर क्लिक करें" और अपने माउस को बिल्कुल सही जगह पर ले जाना।
यह पेपर इस काम को बेहतर बनाने के लिए एक नया प्रशिक्षण तरीका पेश करता है जिसे VISTA कहा जाता है। यह समझने के लिए कि VISTA क्यों खास है, हमें पहले उस समस्या को देखना होगा जिसे यह हल करता है।
समस्या: "वही पुराना दृश्य" का जाल (The "Same Old View" Trap)
पहले, शोधकर्ता इन रोबोटों को GRPO नामक एक तरीके से सिखाते थे। GROTO को ऐसे समझें जैसे कोई शिक्षक छात्र को कंप्यूटर स्क्रीन की वही सटीक फोटो बार-बार दिखा रहा हो और उससे बटन खोजने के लिए कह रहा हो।
- आसान मामला: यदि बटन बहुत बड़ा और स्पष्ट है, तो छात्र हर बार इसे सही ढंग से ढूँढ लेता है। शिक्षक सोचता है, "बहुत बढ़िया!" लेकिन इसमें कुछ भी नया नहीं सीखा जाता क्योंकि प्रयासों के बीच कोई अंतर नहीं होता।
- कठिन मामला: यदि बटन बहुत छोटा या छिपा हुआ है, तो छात्र हर बार इसे चूक जाता है। शिक्षक सोचता है, "ओह नहीं," लेकिन यहाँ भी कुछ नया नहीं सीखा जाता क्योंकि हर प्रयास बिल्कुल एक ही तरह से विफल होता है।
दोनों ही मामलों में, शिक्षक छात्र को यह नहीं बता सकता कि कैसे सुधार किया जाए क्योंकि फीडबैक में कोई विविधता नहीं है। यह टेनिस सीखने की कोशिश करने जैसा है जहाँ आप 100 बार एक ही गेंद को एक ही जगह पर मारते हैं; आप कभी भी चलती हुई गेंद के अनुसार खुद को ढालना नहीं सीख पाते।
समाधान: VISTA (द "ज़ूम एंड क्रॉप" टीचर)
VISTA खेल बदल देता है क्योंकि यह इस बात को समझता है कि एक बटन वही बटन रहता है, चाहे आप उसे किसी भी तरह से देखें। पूरी स्क्रीन को बार-बार दिखाने के बजाय, VISTA एक ही स्क्रीन के कई अलग-अलग "क्रॉप्स" (ज़ूम किए हुए या शिफ्ट किए गए दृश्य) बनाता है, यह सुनिश्चित करते हुए कि लक्षित बटन हमेशा दिखाई दे।
VISTA कैसे काम करता है, इसे एक सरल उदाहरण से समझते हैं:
1. "ग्रुप फोटो" का उदाहरण (व्यू-कंसिस्टेंट ग्रुप्स)
कल्पना कीजिए कि आप अपने दोस्त को पार्किंग लॉट में एक विशिष्ट लाल कार ढूँढना सिखा रहे हैं।
- पुराना तरीका: आप उन्हें पूरे लॉट की एक चौड़ी फोटो 8 बार दिखाते हैं। यदि वे कार को मिस करते हैं, तो वे 8 बार मिस करते हैं। यदि वे उसे ढूँढ लेते हैं, तो वे 8 बार ढूँढ लेते हैं। कोई सीखना नहीं होता।
- VISTA तरीका: आप उन्हें उसी पार्किंग लॉट की 8 अलग-अलग तस्वीरें दिखाते हैं। कुछ में कैमरा ज़ूम किया गया है; अन्य में यह बाएं या दाएं खिसका हुआ है। लाल कार उन सभी में मौजूद है, लेकिन फोटो में उसकी स्थिति बदल जाती है।
- एक फोटो में, कार को पहचानना आसान है।
- दूसरी फोटो में, वह एक पेड़ के पीछे आंशिक रूप से छिपी हुई है।
- तीसरी में, वह कोने में है।
अब, रोबोट को यह समझना होगा, "ठीक है, कार वही है, लेकिन इस विशिष्ट तस्वीर में वह कहाँ है?" यह रोबोट को केवल एक निश्चित निर्देशांक (coordinate) को रटने के बजाय, बटन की अवधारणा (concept) को समझने के लिए मजबूर करता है। यह उत्तरों का एक ऐसा "समूह" बनाता है जहाँ कुछ सही और कुछ गलत होते हैं, जिससे शिक्षक को रोबोट को सुधारने के लिए उपयोगी डेटा मिलता है।
2. "सेफ्टी नेट" (सेल्फ-वेरिफाइड एंकर)
इस नए तरीके के साथ एक जोखिम है: यदि रोबोट ज़ूम किए गए फोटो के अजीब कोणों से भ्रमित हो जाता है, तो वह बेतरतीब ढंग से अंदाज़ा लगाना शुरू कर सकता है और अधिक बार विफल हो सकता है।
इसे ठीक करने के लिए, VISTA एक सेल्फ-वेरिफाइड एंकर (Self-Verified Anchor) जोड़ता है। इसे एक सुरक्षा जाल (safety net) के रूप में समझें जो केवल तभी तैनात होता है जब रोबोट तैयार हो।
- शिक्षक (कंप्यूटर) रोबोट के प्रयासों को देखता है।
- यदि रोबोट 8 में से किसी भी फोटो में बटन खोजने में पूरी तरह विफल रहता है, तो शिक्षक कुछ नहीं करता। वह उत्तर को जबरदस्ती नहीं थोपता, क्योंकि रोबोट अभी तैयार नहीं है।
- हालाँकि, यदि रोबोट में से कम से कम एक फोटो में बटन को सही ढंग से ढूँढने में सफल रहता है, तो शिक्षक कहता है, "आहा! तुमने साबित कर दिया कि तुम यह कर सकते हो!"
- केवल तभी शिक्षक रोबोट को "परफेक्ट उत्तर" (बटन का सटीक केंद्र) दिखाता है ताकि सफलता को स्थिर (lock in) किया जा सके।
यह रोबोट को उन उत्तरों की नकल करने के लिए मजबूर होने से रोकता है जिन्हें वह अभी तक समझ नहीं पाया है, जबकि जब वह सक्षम दिखता है, तो उसे बढ़ावा भी देता है।
परिणाम
इस पेपर ने कई बेंचमार्क (जैसे ScreenSpot-Pro, जो छोटे बटनों को खोजने का एक कठिन परीक्षण है) पर इस तरीके का परीक्षण किया।
- VISTA से पहले: रोबोट (विशेष रूप से Qwen3-VL मॉडल) कठिन क्लिकों को लगभग 55% सही कर पा रहे थे।
- VISTA के बाद: वे 63% से 67% (मॉडल के आकार के आधार पर) तक पहुँच गए।
पेपर यह भी नोट करता है कि रोबोट अधिक "रोबस्ट" (मजबूत) हो गए। परीक्षण के दौरान यदि स्क्रीन को क्रॉप किया गया या किसी अजीब कोण से देखा गया, तो भी रोबोट के भ्रमित होने या अपना उत्तर बदलने की संभावना कम थी।
सारांश
VISTA बटन क्लिक करने के लिए AI को प्रशिक्षित करने का एक स्मार्ट तरीका है। एक ही स्थिर छवि पर बार-बार अभ्यास करने के बजाय, यह एक ही छवि के कई अलग-अलग "दृश्यों" पर अभ्यास करता है। यह AI को "चीट शीट" (परफेक्ट उत्तर) केवल तभी देता है जब AI पहले से ही खुद पहेली को हल करने की क्षमता दिखा चुका हो। यह AI को स्मार्ट, अधिक अनुकूलन योग्य और वास्तविक दुनिया की जटिल कंप्यूटर स्क्रीन में बटन खोजने में बेहतर बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।