← नवीनतम पेपर
🤖 AI

DRS-GUI: Dynamic Region Search for Training-Free GUI Grounding

DRS-GUI एक प्रशिक्षण-मुक्त ढांचा है जो एक हल्के UI परसेप्टर और एक MCTS-आधारित एक्शन प्लानर का उपयोग करके मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में GUI ग्राउंडिंग को बढ़ाता है, ताकि जटिल स्क्रीनशॉट में निर्देश-प्रासंगिक तत्वों को कुशलतापूर्वक खोजने के लिए मानव-समान अनुदेशात्मक क्रियाओं (फोकस, शिफ्ट और स्कैटर) को गतिशील रूप से सिम्युलेट किया जा सके।

मूल लेखक: Yichao Liu, Huawen Shen, Liu Yu, Shiyu Liu, Zeyu Chen, Yu Zhou

प्रकाशित 2026-05-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yichao Liu, Huawen Shen, Liu Yu, Shiyu Liu, Zeyu Chen, Yu Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप कंप्यूटर स्क्रीन पर एक विशिष्ट, बहुत छोटे बटन को खोजने की कोशिश कर रहे हैं। लेकिन यह केवल एक सामान्य स्क्रीन नहीं है; यह सैकड़ों आइकन, मेनू और टेक्स्ट बॉक्स से भरा एक उच्च-रिज़ॉल्यूशन वाला, अव्यवस्थित ढेर है। यदि आप एक मानक AI से "सेव बटन पर क्लिक करें" कहते हैं, तो वह विजुअल शोर (visual noise) से घबरा सकता है, जैसे कोई व्यक्ति धुंधले चश्मे पहने हुए घास के ढेर में सुई खोजने की कोशिश कर रहा हो।

यह शोध पत्र DRS-GUI पेश करता है, जो एक नया "ट्रेनिंग-फ्री" (बिना पुनः प्रशिक्षण के) तरीका है जो एक स्मार्ट, मानव-समान मार्गदर्शक के रूप में कार्य करता है ताकि AI को बिना किसी नए कौशल को सीखे या फिर से प्रशिक्षित किए, स्क्रीन पर सही जगह खोजने में मदद मिल सके।

यह कैसे काम करता है, इसके लिए सरल उपमाओं (analogies) का उपयोग किया गया है:

समस्या: "वन-शॉट" (एक बार में प्रयास करने की) गलती

वर्तमान AI मॉडल आमतौर पर एक ही बड़े कदम में बटन के स्थान का अनुमान लगाने की कोशिश करते हैं। यदि वे पूरे बिखरे हुए स्क्रीन को देखते हैं और गलत अनुमान लगाते हैं, तो वे फंस जाते हैं। यह एक विशाल शहर में मानचित्र पर एक एकल निर्देशांक (coordinate) का अनुमान लगाकर एक विशिष्ट सड़क खोजने की कोशिश करने जैसा है बिना ज़ूम किए। यदि आप गलत मोहल्ले का अनुमान लगा लेते हैं, तो आप सुधार नहीं कर सकते।

समाधान: DRS-GUI (स्मार्ट जासूस)

DRS-GUI खेल बदल देता है। तुरंत अनुमान लगाने के बजाय, यह एक ऐसे जासूस की तरह काम करता है जो पहले खोजता है, फिर समाधान करता है। यह प्रक्रिया को तीन मुख्य भागों में विभाजित करता है:

1. "UI परसेप्टर" (जासूस का आवर्धक लेंस/Magnifying Glass)

AI द्वारा उत्तर का अनुमान लगाने से पहले, यह मॉड्यूल स्क्रीन को स्कैन करता है और इसे वस्तुओं (बटन, टेक्स्ट, आइकन) की एक सूची में तोड़ देता है। फिर यह पूछता है: "इनमें से कौन सी वस्तु वास्तव में उस चीज़ से मेल खाती है जो उपयोगकर्ता ने मांगी है?"

  • उपमा: कल्पना कीजिए कि आप फलों के कटोरे में "लाल सेब" की तलाश कर रहे हैं। परसेप्टर वह हाथ है जो कटोरे में से चीजों को छाँटता है, केले और संतरों को अनदेखा करता है, और केवल लाल फलों को हाइलाइट करता है।

2. तीन "मानव-समान" चालें

एक बार जब परसेप्टर के पास संभावित उम्मीदवारों की सूची आ जाती है, तो सिस्टम केवल एक स्थान को घूरता नहीं है। यह अपने दृश्य को समायोजित करने के लिए तीन गतिशील चालों का उपयोग करता है, ठीक वैसे ही जैसे एक इंसान करता है:

  • फोकस (ज़ूम इन): यदि AI को प्रासंगिक वस्तुओं का एक समूह दिखाई देता है, तो वह बाकी कचरे को अनदेखा करते हुए बेहतर दृश्य के लिए ज़ूम इन करता है।
    • उपमा: मेनू पर छोटे टेक्स्ट को पढ़ने के लिए अपनी आँखों को सिकोड़ना।
  • शिफ्ट (स्थानांतरण): यदि AI को एहसास होता है कि वह स्क्रीन के गलत हिस्से को देख रहा है (जैसे, शीर्ष मेनू देख रहा है जबकि बटन नीचे है), तो वह तुरंत अपने दृश्य को एक नए क्षेत्र में स्थानांतरित कर देता है।
    • उपमा: यह महसूस करना कि आप लाइब्रेरी के गलत शेल्फ को देख रहे हैं और सही शेल्फ की ओर चलना।
  • स्कैटर (ज़ूम आउट): यदि AI बहुत अधिक सीमित हो जाता है और संदर्भ (context) खो देता है, तो वह बड़े परिदृश्य को देखने के लिए ज़ूम आउट करता है।
    • उपमा: पेंटिंग के बहुत करीब होने के कारण पूरी कैनवास को देखने के लिए पेंटिंग से पीछे हटना।

3. "एक्शन प्लानर" (शतरंज का माहिर/Chess Master)

AI को कैसे पता चलता है कि अगली चाल क्या चलनी है? यह मोंटे कार्लो ट्री सर्च (MCTS) नामक रणनीति का उपयोग करता है।

  • उपमा: इसे शतरंज के खिलाड़ी के रूप में सोचें। केवल एक चाल चलने के बजाय, AI अपने दिमाग में कई संभावित भविष्य का अनुकरण (simulate) करता है। यह पूछता है: "यदि मैं अब ज़ूम इन करता हूँ, तो क्या मुझे लक्ष्य मिलेगा? यदि मैं बाईं ओर शिफ्ट होता हूँ, तो क्या मुझे वह मिलेगा?"
  • यह प्रत्येक संभावना को स्कोर करने के लिए एक "क्वालिटी रिवॉर्ड" प्रणाली का उपयोग करता है। यह पूछता है: "क्या इस ज़ूम-इन दृश्य में सही प्रकार के बटन हैं? क्या यह बहुत खाली है? क्या टेक्स्ट स्पष्ट है?"
  • यदि कोई रास्ता बुरा दिखता है (जैसे, यह एक खाली स्थान पर ज़ूम इन करता है), तो AI "बैकट्रैक" करता है और एक अलग चाल आज़माता है। यह उसे डेड एंड (बंद रास्ते) में फंसने से रोकता है।

परिणाम: एक स्वच्छ खोज

क्योंकि DRS-GUI मुख्य AI द्वारा भविष्यवाणी करने से पहले "विजुअल जंक" (दृश्य कचरे) को फ़िल्टर कर देता है, इसलिए AI को केवल स्क्रीन के एक छोटे, साफ और प्रासंगिक हिस्से को देखना होता है।

  • शोध पत्र का दावा: कठिन, उच्च-रिज़ॉल्यूशन वाली स्क्रीन (जैसे सैकड़ों बटनों वाले पेशेवर सॉफ़्टवेयर) पर परीक्षण के दौरान, इस पद्धति ने AI की सटीकता में 14% का सुधार किया।
  • मुख्य निष्कर्ष: यह मौजूदा AI मॉडल को बिना पुन: प्रशिक्षित किए उनके साथ काम करता है। यह एक "प्लग-एंड-प्ले" अपग्रेड है जो AI को कार्य करने से पहले देखने में स्मार्ट बनाता है।

संक्षेप में, DRS-GUI AI को एक बिखरी हुई स्क्रीन पर अंधे होकर अनुमान लगाने के बजाय, अपने परिवेश को स्कैन करने, शिफ्ट करने, ज़ूम करने और मूल्यांकन करने के लिए सिखाता है, जिससे यह सुनिश्चित होता है कि वह हर बार सही बटन ढूंढ ले।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →