← नवीनतम पेपर
🤖 machine learning

ClawGUI: A Unified Framework for Training, Evaluating, and Deploying GUI Agents

यह शोध पत्र ClawGUI को प्रस्तुत करता है, जो वर्चुअल और फिजिकल डिवाइसेस के लिए एक स्थिर RL इंफ्रास्ट्रक्चर, एक मानकीकृत बेंचमार्किंग पाइपलाइन और क्रॉस-प्लेटफॉर्म एजेंट डिप्लॉयमेंट प्रदान करके GUI एजेंट्स के प्रशिक्षण, मूल्यांकन और परिनियोजन (डिप्लॉयमेंट) को एकीकृत करने वाला एक ओपन-सोर्स फ्रेमवर्क है, जो अंततः ClawGUI-2B मॉडल को मोबाइल GUI कार्यों में मौजूदा बेसलाइन्स से बेहतर प्रदर्शन करने में सक्षम बनाता है।

मूल लेखक: Fei Tang, Zhiqiong Lu, Boxuan Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

प्रकाशित 2026-04-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fei Tang, Zhiqiong Lu, Boxuan Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को अपना स्मार्टफोन चलाना सिखाना चाहते हैं। आप उसे कोई गुप्त "चीट कोड" (API) नहीं देना चाहते जो केवल ऐप डेवलपर्स को पता होता है। इसके बजाय, आप चाहते हैं कि रोबोट स्क्रीन को देखे, बटनों को पहचाने, और ठीक वैसे ही टैप या स्वाइप करे जैसे एक इंसान करता है। एक "GUI एजेंट" यही करता है।

हालाँकि, एक ऐसा रोबोट बनाना जो वास्तव में यह सीख सके, जिसे निष्पक्ष रूप से परखा जा सके, और फिर आपकी मदद के लिए आपके फोन पर रह सके, यह अविश्वसनीय रूप से कठिन है। रिसर्च कम्युनिटी तीन अलग-अलग साइलो (silos) में फंसी हुई है: एक समूह ट्रेनिंग जिम बनाता है, दूसरा टेस्ट ट्रैक बनाता है, और तीसरा कार चलाने की कोशिश करता है, लेकिन वे कभी एक-दूसरे से बात नहीं करते।

ClawGUI वह पेपर है जो अंततः इन तीनों को जोड़ने वाला पूरा हाईवे सिस्टम बनाता है। यह एक सिंगल, ओपन-सोर्स टूलकिट है जो सिखाने से लेकर वास्तविक दुनिया में चलाने तक सब कुछ संभालता है।

यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:

1. समस्या: "टूटी हुई असेंबली लाइन"

ClawGUI से पहले, यह प्रक्रिया तीन अलग-अलग देशों में कार बनाने की तरह थी:

  • ट्रेनिंग: शोधकर्ता रोबोट को एक वीडियो गेम (सिमुलेटर) में सिखाने की कोशिश करते थे, लेकिन गेम बग से भरा था, और कोई भी गेम इंजन साझा नहीं करता था।
  • टेस्टिंग: हर कोई गति मापने के लिए अलग-अलग पैमाने (रूलर) का उपयोग करता था। एक व्यक्ति मील में मापता था, दूसरा किलोमीटर में, और कुछ तो यह भी नहीं लिखते थे कि उन्होंने कौन सा पैमाना इस्तेमाल किया। आप यह नहीं बता सकते थे कि नया रोबोट वास्तव में तेज़ था या उसे अलग तरीके से मापा गया था।
  • डिप्लॉयमेंट (तैनाती): भले ही एक रोबोट ने गाड़ी चलाना सीख लिया हो, वह लैब में ही रह जाता था। वह आपकी असली कार (आपके फोन) में नहीं आ सकता था या उस तरह से आपसे बात नहीं कर सकता था जैसा आप आदी हैं (जैसे कि एक चैट ऐप)।

2. समाधान: "ClawGUI" फैक्ट्री

लेखकों ने एक एकीकृत फैक्ट्री बनाई है जिसमें तीन मुख्य विभाग हैं जो सहजता से एक साथ काम करते हैं।

🏭 विभाग A: द ट्रेनिंग जिम (ClawGUI-RL)

  • पुराना तरीका: एक रोबोट को बटन दबाना सिखाना अंधेरे में तीर चलाने जैसा था। आपको केवल तभी पता चलता था जब आप गेम के बिल्कुल अंत में लक्ष्य (bullseye) को हिट कर देते थे। यदि रोबोट वहां पहुँचने के लिए 50 कदम उठाता था, तो उसे यह नहीं पता होता था कि उन 50 कदमों में से कौन से कदम सही थे।
  • ClawGUI का तरीका: उन्होंने एक "प्रोसेस रिवॉर्ड मॉडल" (PRM) पेश किया। कल्पना कीजिए कि एक कोच रोबोट के बगल में खड़ा है, और हर एक टैप के बाद फुसफुसा रहा है: "अच्छा काम! वह सही बटन था," या "ओह, तुम गलत दिशा में चले गए।"
  • हार्डवेयर: उन्होंने एक ऐसा सिस्टम बनाया है जो एक साथ सैकड़ों वर्चुअल फोन चला सकता है (एम्युलेटर्स के एक विशाल सर्वर फार्म की तरह) और सीधे वास्तविक भौतिक फोन पर भी ट्रेनिंग कर सकता है। यह एक ऐसे जिम की तरह है जहाँ आप ट्रेडमिल पर या वास्तविक सड़क पर अभ्यास कर सकते हैं, और सिस्टम स्वचालित रूप से टूटे हुए ट्रेडमिल को बदल देता है ताकि ट्रेनिंग कभी न रुके।

📏 विभाग B: मानकीकृत टेस्ट ट्रैक (ClawGUI-Eval)

  • समस्या: अतीत में, यदि पेपर A ने कहा कि उनका रोबोट 90% सटीक है और पेपर B ने कहा कि 88%, तो आप उनकी तुलना नहीं कर सकते थे। शायद पेपर A ने हाई-रिज़ॉल्यूशन फोटो का उपयोग किया और पेपर B ने धुंधली फोटो का।
  • ClawGUI का तरीका: उन्होंने एक सार्वभौमिक रेफरी बनाया। उन्होंने 6 प्रसिद्ध टेस्ट ट्रैक (benchmarks) और 11 अलग-अलग रोबोट मॉडल लिए। उन्होंने सभी को बिल्कुल समान कैमरा सेटिंग्स, बिल्कुल समान लाइटिंग और बिल्कुल समान स्कोरिंग नियमों का उपयोग करने के लिए मजबूर किया।
  • परिणाम: उन्होंने साबित किया कि जब आप समान नियमों का उपयोग करते हैं, तो आप पिछले परिणामों का 95.8% पुनरुत्पादन (reproduce) कर सकते हैं। यह अंततः इस बात पर सहमत होने जैसा है कि दुनिया के हर धावक के लिए "100 मीटर" का मतलब एक ही है।

🚗 विभाग C: वास्तविक दुनिया का ड्राइवर (ClawGUI-Agent)

  • समस्या: अधिकांश रिसर्च रोबोट लैब में फंसे रहते हैं। वे WhatsApp या WeChat पर आपसे बात नहीं कर सकते, और वे हर कार्य के बाद आपकी पसंद को भूल जाते हैं।
  • ClawGUI का तरीका: उन्होंने एक पुल बनाया है जो रोबोट को आपके चैट ऐप्स (जैसे Telegram, Slack, या DingTalk) में रहने की अनुमति देता है।
    • हाइब्रिड ड्राइविंग: यदि किसी ऐप में "गुप्त कमांड" (CLI) है, तो रोबमा की गति के लिए उसका उपयोग करता है। यदि नहीं, तो यह "विजुअल ड्राइविंग" (GUI) पर स्विच करता है और स्क्रीन को टैप करता है। यह एक ऐसे ड्राइवर की तरह है जो जानता है कि कार के ऑटोपायलट का उपयोग कैसे करना है लेकिन अगर रास्ता अजीब हो जाए तो वह मैन्युअल रूप से स्टीयरिंग भी संभाल सकता है।
    • मेमोरी: रोबोट आपको याद रखता है। यदि आप हमेशा सुबह 8 बजे कॉफी ऑर्डर करते हैं, तो वह इसे सीख लेता है। यह आपकी आदतों को एक "पर्सनल मेमोरी बैंक" में संग्रहीत करता है ताकि वह समय के साथ आपके बारे में और स्मार्ट हो सके।

3. प्रमाण: "ClawGUI-2B" रोबोट

यह साबित करने के लिए कि उनका सिस्टम काम करता है, उन्होंने ClawGUI-2B नामक एक रोबोट बनाया।

  • यह एक अपेक्षाकृत छोटा रोबोट है (2 बिलियन "ब्रेन सेल्स")।
  • उन्होंने इसे पूरी तरह से अपने नए सिस्टम के भीतर प्रशिक्षित किया।
  • परिणाम: इसने एक कठिन मोबाइल फोन टेस्ट पर बहुत बड़े, अधिक महंगे रोबोट्स (कुछ के पास 72 बिलियन ब्रेन सेल्स हैं) को हरा दिया।
  • सबक: एक बेहतरीन सिस्टम (अच्छा कोच, निष्पक्ष टेस्ट, वास्तविक दुनिया का अभ्यास) के साथ प्रशिक्षित एक छोटा रोबोट, एक टूटे हुए सिस्टम के साथ प्रशिक्षित एक विशाल रोबोट को हरा देता है।

बड़ी तस्वीर

ClawGUI अगली पीढ़ी के AI सहायकों के लिए "ऑपरेटिंग सिस्टम" है।

  • यह शोधकर्ताओं को पहिए का पुन: आविष्कार करने से रोकता है।
  • यह उन्हें आंकड़ों में हेरफेर करने से रोकता है।
  • यह अंततः इन AI सहायकों को लैब से बाहर निकलकर वास्तव में आपके फोन पर आपकी मदद करने, आपकी आदतों को याद रखने और किसी भी ऐप को चलाने में सक्षम बनाता है जिसे आप उनके सामने लाते हैं।

यह एक रोबोट को सिम्युलेटर में वीडियो गेम खेलना सिखाने और उसे वास्तव में आपकी कार चलाकर किराने की दुकान तक पहुँचाने के बीच का अंतर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →