← नवीनतम पेपर
🤖 AI

AQuaUI: Visual Token Reduction for GUI Agents with Adaptive Quadtrees

AquaUI एक ट्रेनिंग-मुक्त, इन्फरेंस-टाइम टोकन रिडक्शन विधि है जो GUI एजेंटों के लिए एडेप्टिव क्वाडट्रीज़ (adaptive quadtrees) का उपयोग करती है ताकि स्क्रीनशॉट के गैर-समान स्थानिक सूचना घनत्व (non-uniform spatial information density) का लाभ उठाया जा सके, जिससे मल्टी-स्टेप इंटरैक्शन में लगभग पूर्ण प्रदर्शन और टेम्पोरल कंसिस्टेंसी बनाए रखते हुए महत्वपूर्ण गति और टोकन में कमी प्राप्त होती है।

मूल लेखक: Yuankai Li, Tinghui Zhu, Ha Min Son, Zhe Zhao, Xin Liu, Muhao Chen

प्रकाशित 2026-05-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuankai Li, Tinghui Zhu, Ha Min Son, Zhe Zhao, Xin Liu, Muhao Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े धीमे रोबोट को कंप्यूटर या फोन का उपयोग करना सिखाने की कोशिश कर रहे हैं। आप रोबोट को स्क्रीन की एक तस्वीर दिखाते हैं और कहते हैं, "'Save' बटन पर क्लिक करें।"

समस्या यह है कि कंप्यूटर की स्क्रीन बहुत बड़ी होती है और इसमें बहुत सारे विवरण होते हैं। रोबोट के लिए, एक सिंगल स्क्रीनशॉट केवल एक छवि नहीं है; यह हजारों छोटे-छोटे टुकड़ों में विभाजित है जिन्हें "टोकन" कहा जाता है। यदि स्क्रीन हाई-रिज़ॉल्यूशन वाली है, तो रोबट को एक साधारण स्क्रीन को समझने के लिए इन 3,000 टुकड़ों को देखना होगा। यह एक लाइब्रेरियन से एक 1,000 पन्नों के विश्वकोश का हर एक पन्ना पढ़ने के लिए कहने जैसा है ताकि वह केवल "apple" शब्द को ढूंढ सके। इसमें बहुत समय लगता है, बहुत अधिक ऊर्जा खर्च होती है, और रोबोट थक जाता है (उसकी मेमोरी खत्म हो जाती है) इससे पहले कि वह पूरी बातचीत को याद रख सके।

पेपर का समाधान: AQuaUI

यह पेपर एक नया टूल पेश करता है जिसे AQuaUI (जो AQuaUI - Adaptive Quadtrees for UI का संक्षिप्त रूप है) कहा जाता है। AQuaUI को एक बहुत ही स्मार्ट स्काउट (scout) के रूप में सोचें जो रोबोट के देखने से पहले ही तस्वीर को साफ करने के लिए आगे जाता है।

यह इस प्रकार काम करता है, कुछ रोजमर्रा के उदाहरणों का उपयोग करते हुए:

1. "खाली कमरा" बनाम "व्यस्त डेस्क"

अधिकांश कंप्यूटर स्क्रीन वास्तव में बड़े हिस्सों में काफी उबाऊ होती हैं। कल्पना कीजिए कि एक स्क्रीन है जिसमें एक विशाल सफेद बैकग्राउंड है (एक खाली कमरा) और कोने में एक छोटा सा, जटिल आइकन है (एक व्यस्त डेस्क)।

  • पुराना तरीका: रोबोट सफेद दीवार के हर एक इंच और व्यस्त डेस्क को समान तीव्रता के साथ देखता है। वह खाली दीवार को घूरने में अपना समय बर्बाद करता है।
  • AQuaUI का तरीका: AQuaUI स्क्रीन को देखता है और कहता है, "हे, यह बड़ा सफेद क्षेत्र खाली है। मुझे रोबोट को इस खाली दीवार का हर एक पिक्सेल दिखाने की जरूरत नहीं है। मैं बस यह बताने के लिए एक 'प्रतिनिधि' (representative) पिक्सेल भेज दूंगा कि, 'यह एक सफेद दीवार है।' लेकिन उस व्यस्त डेस्क के लिए जिसमें आइकन है, वह कहता है, "यह महत्वपूर्ण है! मैं रोबोट को केवल इस छोटे से क्षेत्र का एक विस्तृत मानचित्र भेजूँगा।"

2. "पेड़" का उदाहरण (क्वाडट्री - Quadtree)

ऐसा करने के लिए, AQuaUI एक क्वाडट्री (Quadtree) विधि का उपयोग करता है। कल्पना कीजिए कि आपके पास एक शहर का बड़ा नक्शा है।

  • आप पूरे शहर के चारों ओर एक बड़ा वर्ग (square) खींचते हैं।
  • यदि उस क्षेत्र के अंदर केवल एक बड़ा पार्क है (खाली), तो आप वहीं रुक जाते हैं। आपको और करीब देखने की आवश्यकता नहीं है।
  • यदि उस क्षेत्र के अंदर गगनचुंबी इमारतों वाला एक भीड़भाड़ वाला डाउनटाउन है (जटिल), तो आप उस वर्ग को चार छोटे वर्गों में विभाजित करते हैं।
  • आप भीड़भाड़ वाले क्षेत्रों को तब तक विभाजित करते रहते हैं जब तक कि आपके पास विवरण दिखाने वाले छोटे वर्ग न हों, लेकिन आप खाली पार्कों को एक बड़े वर्ग के रूप में छोड़ देते हैं।

AQuaUI स्क्रीन के साथ यही करता है। यह वर्गों का एक "पेड़" बनाता है। खाली हिस्सों के लिए, यह एक ही टोकन रखता है। व्यस्त हिस्सों के लिए, यह अधिक टोकन रखता है। यह महत्वपूर्ण जानकारी खोए बिना, रोबोट को देखने के लिए दिए जाने वाले टुकड़ों की संख्या को लगभग 30% कम कर देता है।

3. "चलती हुई तस्वीर" का तरीका (कंडीशनल क्वाडट्री)

कंप्यूटर स्क्रीन स्थिर नहीं होतीं; वे बदलती रहती हैं। यदि आप एक वेबपेज को नीचे स्क्रॉल करते हैं, तो ऊपर का हिस्सा ऊपर चला जाता है, और नीचे कुछ नया दिखाई देने लगता है।

  • समस्या: यदि रोबोट नई स्क्रीन को शुरुआत से देखता है, तो वह गलती से ऊपर के हिस्से के विवरण को फेंक सकता है क्योंकि वह अब "अलग" दिखता है, भले ही वह वही कंटेंट हो जो थोड़ा हिल गया है।
  • AQuaUI का समाधान: AQuaUI पिछली स्क्रीन को याद रखता है। यह एक सुरक्षा गार्ड की तरह है जो जानता है, "मैंने पिछले सेकंड में ऊपर दाईं ओर वह 'Save' बटन देखा था। भले ही स्क्रीन हिल गई हो, मुझे पता है कि अब वह बटन कहाँ है।" यह स्क्रीन के इतिहास का उपयोग यह सुनिश्चित करने के लिए करता है कि महत्वपूर्ण विवरण सुसंगत रहें, ताकि जब स्क्रीन थोड़ी सी भी हिले तो रोबोट भ्रमित न हो।

यह क्यों मायने रखता है (पेपर के अनुसार)
शोधकर्ताओं ने नवीनतम, सबसे उन्नत AI मॉडल्स (जैसे Qwen और GUI-Owl) पर इसका परीक्षण किया। उन्होंने पाया कि:

  • गति: रोबोट तेजी से काम करता है। सबसे बड़े मॉडल्स पर, यह 13% तक तेज़ था।
  • स्मार्टनेस: भले ही रोबोट ने तस्वीर के कम टुकड़े देखे, फिर भी वह कम बुद्धिमान नहीं हुआ। पूरी तस्वीर देखने की तुलना में उसे लगभग 99% बार सही उत्तर मिले।
  • कोई ट्रेनिंग की आवश्यकता नहीं: सबसे अच्छी बात यह है कि आपको रोबोट को यह करने के लिए फिर से सिखाने की आवश्यकता नहीं है। आप बस AQuaUI को प्लग इन करते हैं, और यह तुरंत काम करता है।

संक्षेप में:
AQuaUI कंप्यूटर स्क्रीन के लिए एक स्मार्ट एडिटर की तरह है। यह AI को बताता है, "खाली सफेद स्थान को अनदेखा करें, बटनों और टेक्स्ट पर ध्यान दें, और जो आपने एक सेकंड पहले देखा था उसे याद रखें।" यह AI एजेंट्स को तेज़ और सस्ता बनाता है, जिससे वे बहुत अधिक विजुअल डेटा से अभिभूत हुए बिना लंबी बातचीत और जटिल कार्यों को संभाल सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →