← नवीनतम पेपर
💻 computer science

HATS: Hardness-Aware Trajectory Synthesis for GUI Agents

यह शोध पत्र HATS पेश करता है, जो एक हार्डनेस-अवेयर ट्रेजेक्टरी सिंथेसिस फ्रेमवर्क है जो हार्डनेस-संचालित अन्वेषण और एलाइनमेंट-गाइडेड रिफाइनमेंट की एक क्लोज्ड-लूप प्रक्रिया के माध्यम से अर्थपूर्ण रूप से अस्पष्ट कार्यों की पहचान करके और उन्हें प्राथमिकता देकर GUI एजेंट सामान्यीकरण (generalization) में सुधार करता है।

मूल लेखक: Rui Shao, Ruize Gao, Bin Xie, Yixing Li, Kaiwen Zhou, Shuai Wang, Weili Guan, Gongwei Chen

प्रकाशित 2026-03-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rui Shao, Ruize Gao, Bin Xie, Yixing Li, Kaiwen Zhou, Shuai Wang, Weili Guan, Gongwei Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को अपना स्मार्टफोन या कोई वेबसाइट चलाना सिखाने की कोशिश कर रहे हैं। आप चाहते हैं कि रोबोट केवल आपकी आवाज़ के निर्देशों को सुनकर फ्लाइट बुक कर सके, टेक्स्ट भेज सके या किराने का सामान खरीद सके।

इस रोबोट को सिखाने के लिए, आपको उसे "चीजें करने" के हजारों उदाहरण दिखाने होंगे। इसे ट्रेनिंग डेटा (training data) कहा जाता है। अतीत में, शोधकर्ताओं ने इन उदाहरणों को स्वचालित रूप से उत्पन्न करने की कोशिश की, लेकिन वे एक बड़ी बाधा से टकरा गए: रोबोट सरल कार्यों (जैसे मेनू खोलना) में तो बहुत अच्छा हो गया, लेकिन जटिल चीजों में बहुत खराब साबित हुआ।

"HATS" (Hardness-Aware Trajectory Synthesis) नामक शोध पत्र इस रोबोट को सिखाने का एक नया तरीका पेश करता है। यहाँ कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग करके इसका सरल विवरण दिया गया है।

समस्या: "ईज़ी मोड" (Easy Mode) का जाल

कल्पना कीजिए कि आप एक बच्चे को खाना बनाना सिखा रहे हैं।

  • पुराना तरीका: आप बच्चे को कहते हैं "खाना बनाओ।" वह सबसे आसान चीजें करना शुरू करता है: फ्रिज खोलना, चूल्हा जलाना और खाली बर्तन को चलाना। वह ऐसा 1,000 बार करता है।
  • परिणाम: बच्चे को लगता है कि वह एक मास्टर शेफ है क्योंकि उसे फ्रिज खोलना आता है। लेकिन यदि आप उससे प्याज काटने या स्टेक को मसाले लगाने (कठिन हिस्सों) के लिए कहते हैं, तो वह विफल हो जाता है क्योंकि उसने कभी उन कठिन चरणों का अभ्यास ही नहीं किया।

AI की दुनिया में, मौजूदा तरीके इसी तरह के थे। उन्होंने लाखों "आसान" निर्देश (जैसे, "बैक बटन दबाएं") उत्पन्न किए, लेकिन ऐप्स का उपयोग करने के कठिन, भ्रमित करने वाले हिस्सों को नजरअंदाज कर दिया। ये कठिन हिस्से ऐसी चीजें हैं जैसे:

  • दो बटन जो बिल्कुल एक जैसे दिखते हैं लेकिन अलग-अलग पेज पर होने के कारण अलग-अलग काम करते हैं।
  • एक कार्य जो तभी सफल होता है जब आप स्टेप A, फिर स्टेप B, फिर स्टेप C बिल्कुल सही क्रम में करते हैं।

समाधान: HATS (एक "स्मार्ट कोच")

लेखकों ने HATS बनाया है, जिसका अर्थ है Hardness-Aware Trajectory Synthesis। HATS को एक स्मार्ट कोच के रूप में सोचें जो केवल छात्र को अपनी मर्जी से अभ्यास करने की अनुमति नहीं देता। इसके बजाय, कोच सक्रिय रूप से उन चीजों को ढूंढता है जिनमें छात्र कमजोर है और उसे विशेष रूप से उन कौशलों का अभ्यास करने के लिए मजबूर करता है।

HATS दो मुख्य भागों के साथ एक लूप में काम करता है:

1. "हार्डनेस डिटेक्टर" (एक्सप्लोरेशन/खोज)

बेतरतीब ढंग से भटकने के बजाय, HATS पूछता है: "रोबोट कहाँ भ्रमित हो रहा है?"

  • उपमा: एक वीडियो गेम खिलाड़ी की कल्पना करें जो एक ही बॉस लेवल पर बार-बार हार जाता है। एक सामान्य खिलाड़ी केवल हाई स्कोर पाने के लिए आसान स्तरों को खेलना जारी रख सकता है। HATS एक कोच की तरह है जो कहता है, "रुको! तुम इसी विशिष्ट बॉस से बार-बार हार रहे हो। चलो वापस चलते हैं और उस विशिष्ट लड़ाई का अभ्यास करते हैं जब तक कि तुम इसे सही से न जीत लो।"
  • यह कैसे काम करता है: सिस्टम "सेमेंटिक एम्बिग्युटी" (Semantic Ambiguity) को देखता है। यह एक तकनीकी शब्द है जिसका अर्थ है "भ्रमित करने वाली स्थितियाँ"। यदि रोबोट एक बटन देखता है और उसे नहीं पता कि वह क्या करता है, तो HATS उस स्थान को "कठिन" (Hard) के रूप में चिह्नित करता है और सुनिश्चित करता है कि रोबोट बारीकियों को सीखने के लिए वहां बार-बार जाए।

2. "रियलिटी चेक" (रिफाइनमेंट/सुधार)

एक बार जब रोबोट एक कठिन कार्य करने की कोशिश करता है, तो HATS केवल उसके प्रयास को स्वीकार नहीं करता। यह "अंतर पहचानो" का खेल खेलता है।

  • उपमा: कल्पना कीजिए कि आप एक शेफ को रेसिपी देते हैं। शेफ खाना बनाने की कोशिश करता है, लेकिन टोस्ट जल जाता है क्योंकि आपने यह नहीं कहा था कि "आंच पर ध्यान दें।"
    • पुराना तरीका: सिस्टम बस लिख देता, "शेफ ने टोस्ट बनाया," और आगे बढ़ जाता।
    • HATS तरीका: सिस्टम शेफ को देखता है। वह देखता है कि टोस्ट जल गया है। वह कहता है, "रुको, रेसिपी अस्पष्ट थी। चलिए रेसिपी को फिर से लिखते हैं कि 'आंच पर सावधानी से ध्यान दें।' अब, फिर से प्रयास करें।"
  • यह कैसे काम करता है: HATS एक निर्देश उत्पन्न करता है, रोबोट को इसे आज़माने देता है, और फिर जाँच करता है: "क्या रोबोट ने वास्तव में वही किया जो निर्देश में कहा गया था?" यदि रोबोट इसलिए विफल हुआ क्योंकि निर्देश अस्पष्ट था, तो HATS निर्देश को ठीक करता है और फिर से प्रयास करता है। यह तब तक लूप में चलता रहता है जब तक कि निर्देश एकदम सही न हो जाए और रोबोट सफल न हो जाए।

जादुई लूप (The Magic Loop)

HATS की खासियत यह है कि ये दोनों भाग एक घेरे में एक-दूसरे से बात करते हैं:

  1. कोच एक कठिन स्थान ढूंढता है (Exploration)।
  2. रियलिटी चेक उसे हल करने की कोशिश करता है और निर्देशों को ठीक करता है (Refinement)।
  3. यदि रियलिटी चेक विफल होता है, तो वह कोच को बताता है: "यह बहुत कठिन था! इसे अगली बार के लिए उच्च-प्राथमिकता वाले प्रशिक्षण स्थल के रूप में चिह्नित करें।"
  4. कोच फिर उस फीडबैक के आधार पर और भी अधिक पेचीदा स्थानों को खोजने के लिए वापस जाता है।

यह क्यों मायने रखता है?

इसके परिणाम प्रभावशाली हैं। जब उन्होंने इस नई पद्धति का परीक्षण किया:

  • Android ऐप्स पर, नया AI पिछले सर्वश्रेष्ठ तरीके की तुलना में कार्यों को हल करने में 100% बेहतर था।
  • वेबसाइटों पर, यह 215% बेहतर था।

सारांश

HATS को एक ऐसे शिक्षक के रूप में सोचें जो छात्र को कठिन गणित के सवालों को छोड़ने देने से इनकार कर देता है। छात्र को स्मार्ट महसूस कराने के लिए उसे 1,000 बार आसान जोड़ (addition) के सवाल हल करने देने के बजाय, शिक्षक भ्रमित करने वाले बीजगणित (algebra) के सवालों की पहचान करता है, स्पष्टीकरण को तब तक फिर से लिखता है जब तक कि वे समझ में न आ जाएं, और छात्र को उन पर महारत हासिल करने के लिए मजबूर करता है।

तकनीक का उपयोग करने के कठिन, भ्रमित करने वाले और अस्पष्ट हिस्सों पर ध्यान केंद्रित करके, HATS एक ऐसा रोबोट बनाता है जो न केवल स्क्रीन टैप करना जानता है—बल्कि वह वास्तव में वास्तविक दुनिया में काम पूरा करना भी समझता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →