← नवीनतम पेपर
💬 NLP

Learning GUI Grounding with Spatial Reasoning from Visual Feedback

यह शोध पत्र GUI-Cursor को प्रस्तुत करता है, जो एक ऐसा मॉडल है जो GUI ग्राउंडिंग को रेंडर किए गए कर्सर से प्राप्त विजुअल फीडबैक और विजन लैंग्वेज मॉडल्स की कोऑर्डिनेट प्रेडिक्शन सीमाओं को दूर करने के लिए रीइन्फोर्समेंट लर्निंग का उपयोग करके एक इंटरैक्टिव सर्च टास्क के रूप में पुनर्गठित करता है, जिससे कम प्रशिक्षण डेटा के साथ स्थानिक तर्क (spatial reasoning) और एजेंटिक कार्यों में बेहतर प्रदर्शन प्राप्त होता है।

मूल लेखक: Yu Zhao, Wei-Ning Chen, Huseyin Atahan Inan, Samuel Kessler, Lu Wang, Lukas Wutschitz, Fangkai Yang, Chaoyun Zhang, Pasquale Minervini, Saravan Rajmohan, Robert Sim

प्रकाशित 2026-05-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yu Zhao, Wei-Ning Chen, Huseyin Atahan Inan, Samuel Kessler, Lu Wang, Lukas Wutschitz, Fangkai Yang, Chaoyun Zhang, Pasquale Minervini, Saravan Rajmohan, Robert Sim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र "Learning GUI Grounding with Spatial Reasoning from Visual Feedback" का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी समस्या: "अंधा आर्किटेक्ट" (The Blind Architect)

कल्पना कीजिए कि आप एक आर्किटेक्ट हैं और आपको एक रोबोट को यह बताना है कि एक विशाल, जटिल दीवार (कंप्यूटर स्क्रीन) पर एक विशिष्ट ईंट कहाँ रखनी है। वह दीवार बहुत बड़ी है, और ईंटें बहुत छोटी हैं।

लंबे समय तक, शोधकर्ताओं ने रोबलों को यह सिखाने की कोशिश की कि वे एक ही बार में सटीक निर्देशांक (coordinates) का अनुमान लगाएं (जैसे "रो 45, कॉलम 12")। यह शोध पत्र तर्क देता है कि यह आर्किटेक्ट से बिना दीवार या ईंट को देखे ही उसका स्थान बताने के लिए कहने जैसा है। यहाँ तक कि सबसे स्मार्ट AI मॉडल भी इसमें विफल हो जाते हैं क्योंकि वे इस बात में तो माहिर हैं कि चीजें क्या हैं, लेकिन इस बात में बहुत खराब हैं कि वे हाई-रेज़ोल्यूशन स्क्रीन पर वास्तव में कहाँ हैं। वे "स्थानिक रूप से अंधे" (spatially blind) हैं।

समाधान: "खजाने की खोज" (The Treasure Hunt - GUI-CURSOR)

लेखक, यू झाओ (Yu Zhao) और उनकी टीम ने AI को तुरंत उत्तर का अनुमान लगाने के लिए कहने के बजाय, कार्य को एक खजाने की खोज (Treasure Hunt) में बदलने का निर्णय लिया।

उन्होंने एक नई विधि पेश की जिसे GUI-CURSOR कहा जाता है। केवल यह कहने के बजाय कि "बटन (500, 500) पर है," AI को एक वर्चुअल माउस कर्सर दिया जाता है। इसे लक्ष्य को खोजने के लिए कदम-दर-कदम स्क्रीन पर इस कर्सर को घुमाना होता है।

यह "खजाने की खोज" कैसे काम करती है:

  1. मूव (The Move): AI स्क्रीन को देखता है और कहता है, "मुझे लगता है कि लक्ष्य वहाँ है," और कर्सर को मूव करता है।
  2. फीडबैक (The Feedback): कंप्यूटर AI को एक नई तस्वीर दिखाता है जहाँ कर्सर अब उस नए स्थान पर स्थित है।
  3. चेक (The Check): AI नई तस्वीर को देखता है और खुद से पूछता है, "क्या कर्सर सही बटन पर है? नहीं? ठीक है, मुझे बाईं ओर जाने की जरूरत है।"
  4. दोहराव (The Repeat): यह तब तक मूव करता रहता है और चेक करता रहता है जब तक कि वह यह न कह दे, "हाँ, मैं इस पर हूँ!" और रुक जाता है।

गुप्त सूत्र: गलतियों से सीखना (The Secret Sauce: Learning from Mistakes)

शोध पत्र बताता है कि यह प्रक्रिया रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) द्वारा संचालित है। इसे एक कुत्ते को प्रशिक्षित करने की तरह समझें।

  • यदि कुत्ता कर्सर को लक्ष्य के करीब ले जाता है, तो उसे एक "ट्रीट" (इनाम) मिलता है।
  • यदि वह गलत दिशा में जाता है, जल्दी रुक जाता है, या गोल-गोल घूमता रहता है, तो उसे "ना" (दंड/पेनल्टी) मिलता है।

लेखकों ने AI को कुशलतापूर्वक शिकार करना सिखाने के लिए विशेष नियमों (रिवॉर्ड फंक्शन) का एक सेट बनाया:

  • जल्दी हार न मानें: यदि आप लक्ष्य तक पहुँचने से पहले ही रुक जाते हैं, तो यह एक दंड है।
  • गोल-गोल न घूमें: यदि आप उसी स्थान पर वापस जाते हैं जहाँ आप पहले जा चुके हैं, तो यह एक दंड है।
  • दूर न भागें: यदि आप लक्ष्य से और दूर चले जाते हैं, तो यह एक दंड है।

यह बेहतर क्यों काम करता है

शोध पत्र का दावा है कि यह विधि दो मुख्य कारणों से श्रेष्ठ है:

  1. विजुअल फीडबैक लूप (Visual Feedback Loop): पुराने तरीके में, AI एक नंबर का अनुमान लगाता था और कभी नहीं देख पाता था कि वह सही था या नहीं। इस नए तरीके में, AI देखता है कि उसका अनुमान कहाँ पहुँचा। यह मानचित्र पर स्थान का अनुमान लगाने और वास्तव में वहाँ चलकर यह देखने के बीच का अंतर है कि क्या आपने खजाना पा लिया है। यह AI को "संख्याओं" और "दृश्य स्थानों" के बीच संबंध समझने में मदद करता है।
  2. बेहतर स्थानिक तर्क (Better Spatial Reasoning): लेखकों ने एक साधारण खेल पर AI का परीक्षण किया: "क्या एक काला बिंदु लाल बॉक्स के अंदर है?" उन्होंने पाया कि मानक AI मॉडल इस सरल कार्य में आश्चर्यजनक रूप से खराब हैं, और अक्सर तब तक विफल रहते हैं जब तक कि बॉक्स स्क्रीन के केंद्र में न हो। हालाँकि, "खजाने की खोज" पद्धति से प्रशिक्षित AI इस कार्य में बहुत बेहतर हो गया, भले ही उन्हें स्पष्ट रूप से यह खेल नहीं सिखाया गया था। ऐसा लगता है कि कर्सर चलाने से सीखना AI को स्थान और दूरी को बेहतर ढंग से समझने में मदद करता है।

परिणाम: तेज़, स्मार्ट और सस्ता

टीम ने अपने नए AI (GUI-CURSOR) का अन्य शीर्ष मॉडलों के साथ परीक्षण किया।

  • सटीकता (Accuracy): इसने कठिन, हाई-रेज़ोल्यूशन स्क्रीन पर पिछले सर्वश्रेष्ठ मॉडलों को पछाड़ दिया।
  • दक्षता (Efficiency): इसने केवल दो मूव्स में 95% समस्याओं को हल करना सीख लिया।
  • डेटा की बचत (Data Savings): इसने ये परिणाम केवल 8,000 प्रशिक्षण उदाहरणों का उपयोग करके प्राप्त किए, जबकि पिछले लीडर को 64,000 की आवश्यकता थी। यह एक छोटे ट्रैक पर कुछ घंटों तक अभ्यास करके कार चलाना सीखने जैसा है, बजाय इसके कि दिनों तक गाड़ी चलाई जाए।

सारांश

शोध पत्र प्रस्तावित करता है कि AI को कंप्यूटर निर्देशांकों के लिए "एक बार में अनुमान लगाने वाला" बनाने के बजाय, हमें उसे एक "जिज्ञासु खोजकर्ता" बनने देना चाहिए। AI को एक वर्चुअल माउस देकर और उसे मूव करने, देखने और खुद को सुधारने देने से, AI स्क्रीन के लेआउट को बहुत बेहतर तरीके से समझना सीख जाता है। यह उसे बटन और आइकन खोजने में स्मार्ट बनाता है, और आश्चर्यजनक रूप से, यह AI को बुनियादी स्थानिक संबंधों को बेहतर ढंग से समझने में भी सक्षम बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →