← नवीनतम पेपर
🤖 AI

ToolTok: Tool Tokenization for Efficient and Generalizable GUI Agents

ToolTok GUI एजेंटों के लिए एक नवीन मल्टी-स्टेप पाथफाइंडिंग प्रतिमान पेश करता है जो सिमेंटिक अवधारणाओं द्वारा एंकर किए गए लर्नबल टूल टोकन एम्बेडिंग्स का उपयोग करता है और इसे ईज़ी-टू-हार्ड करिकुलम के माध्यम से प्रशिक्षित किया गया है, जिससे मौजूदा तरीकों की तुलना में काफी कम डेटा के साथ बेहतर सामान्यीकरण और प्रदर्शन प्राप्त होता है।

मूल लेखक: Xiaoce Wang, Guibin Zhang, Junzhe Li, Jinzhe Tu, Chun Li, Ming Li

प्रकाशित 2026-02-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiaoce Wang, Guibin Zhang, Junzhe Li, Jinzhe Tu, Chun Li, Ming Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कंप्यूटर चलाना सिखा रहे हैं। लंबे समय तक, हम रोबोट को बटन क्लिक करना जिस तरह से सिखाते थे, वह एक सटीक GPS निर्देशांक (coordinates) वाला नक्शा देने जैसा था। हम कहते, "अपनी उंगली को ठीक 500 पिक्सेल दाईं ओर और 300 पिक्सेल नीचे ले जाओ।"

पुराने तरीके के साथ समस्या
इस "GPS निर्देशांक" पद्धति में एक बड़ी खामी है: यह अविश्वसनीय रूप से कठोर है। यदि आप रोबोट को एक ऐसा स्क्रीन दिखाते हैं जो उनके अभ्यास वाले स्क्रीन से थोड़ी चौड़ी, लंबी या बस अलग आकार की है, तो वह पूरी तरह से भटक जाता है। यह वैसा ही है जैसे किसी को केवल एक विशिष्ट 10-फुट चौड़ी सड़क पर गाड़ी चलाना सिखाना; जैसे ही वे 12-फुट की सड़क पर पहुँचते हैं, वे दुर्घटनाग्रस्त हो जाते हैं। रोबोट को कठिनाई भी होती है क्योंकि उसे लाखों विशिष्ट निर्देशांक नंबरों को याद करना पड़ता है, जिसके लिए बहुत अधिक प्रशिक्षण डेटा की आवश्यकता होती है।

नया समाधान: ToolTok
इस शोध पत्र के लेखक, ToolTok, एक स्मार्ट तरीका प्रस्तावित करते हैं। रोबोट को GPS निर्देशांक देने के बजाय, वे इसे डिस्क्रीट "टूल टोकन्स" (discrete tool tokens) का उपयोग करना सिखाते हैं।

इसे एक बच्चे को कमरे में नेविगेट करना सिखाने जैसा समझें, जिसमें उसे इंच और फीट बताने के बजाय, सरल और समझने योग्य कमांड दिए जाते हैं:

  • "एक बड़ा कदम आगे बढ़ाओ।"
  • "बाईं ओर एक छोटा सा धक्का दो।"
  • "एक त्वरित टैप करो।"
  • "शुरुआत पर वापस जाओ।"

शोध की भाषा में, ये टोकन <MOVE UP FAR>, <CLICK SHORT>, या <GO HOME> जैसे हैं। रोबोट निर्देशांकों की गणना नहीं करता; वह अपने वोकैबुलरी (शब्दकोश) से सही "शब्द" चुनता है ताकि वह चरण-दर-चरण लक्ष्य के करीब पहुँच सके।

उन्होंने रोबोट को कैसे सिखाया (तीन-चरणीय पाठ योजना)
चूंकि रोबोट इन "टूल शब्दों" के लिए नया है, इसलिए लेखक उसे तुरंत वास्तविक कंप्यूटर इंटरफेस में नहीं डाल सकते थे। उन्होंने इसे कुशलतापूर्वक सीखने में मदद करने के लिए एक चतुर, तीन-चरणीय प्रशिक्षण पाठ्यक्रम (जैसे एक स्कूल सिलेबस) तैयार किया:

  1. चरण 1: शब्दकोश का पाठ (सिंथेटिक डेटा)
    रोबोट को वास्तविक स्क्रीन दिखाने से पहले, उन्होंने नकली, सरल चित्रों का उपयोग करके उसे सिखाया कि इन शब्दों का क्या अर्थ है। उन्होंने पूछा, " <MOVE UP FAR> का क्या अर्थ है?" और रोबोट को एक खाली कैनवास पर एक बिंदु को हिलाने का अभ्यास कराया। इसने रोबोट को हजारों वास्तविक स्क्रीनशॉट की आवश्यकता के बिना शब्दावली की बुनियादी समझ दी।
  • उपमा: यह वास्तविक खेल खेलने से पहले खाली बोर्ड पर शतरंज के नियम सीखने जैसा है।
  1. चरण 2: "ईजी मोड" अभ्यास (वास्तविक स्क्रीन)
    एक बार जब रोबोट शब्दों को जान गया, तो उन्हें सरल, वास्तविक कंप्यूटर स्क्रीन दिखाई गईं। उन्होंने एक "परफेक्ट पाथ" बनाया जिसका रोबोट को पालन करना था, जो उसे दिखा रहा था कि बिंदु A से बिंदु B तक पहुँचने के लिए कौन सा टूल चुनना है।
  • उपमा: यह एक ड्राइविंग इंस्ट्रक्टर द्वारा आपको ऐसी कार देने जैसा है जिसमें डैशबोर्ड पर एक आदर्श मार्ग अंकित है, ताकि आपको बस संकेतों का पालन करना हो।
  1. चरण 3: "हार्ड मोड" चुनौती (जटिल स्क्रीन)
    अंत में, उन्होंने छोटे बटनों और जटिल लेआउट वाली कठिन, पेशेवर स्तर की स्क्रीन पेश कीं। चूंकि रोबोट पहले दो चरणों में गति की "भाषा" सीख चुका था, इसलिए वह बिना अभिभूत हुए इन कठिन कार्यों को संभाल सकता था।

गुप्त नुस्खा: "सिमेंटिक एंकरिंग" (Semantic Anchoring)
एक बड़ी चुनौती यह थी कि ये नए "टूल शब्द" रोबोट के दिमाग के लिए बिल्कुल नए थे। यदि आप किसी शब्दकोश में यादृच्छिक रूप से एक नया शब्द जोड़ देते हैं, तो रोबोट को उसका अर्थ पता नहीं चलेगा।

लेखकों ने सिमेंटिक एंकरिंग नामक एक ट्रिक का उपयोग किया। उन्होंने प्रत्येक नए टूल शब्द को उन शब्दों से जोड़ा जिन्हें रोबोट पहले से जानता था।

  • उदाहरण: उनके नए टूल <MOVE UP FAR> के लिए, उन्होंने इसे मौजूदा शब्दों से जोड़ा जिन्हें रोबोट पहले से समझता था, जैसे "move," "up," "jump," और "far।"
  • उपमा: कल्पना कीजिए कि आप एक नई भाषा सीख रहे हैं। एक यादृच्छिक ध्वनि को याद करने के बजाय, आप सीखते हैं कि नया शब्द "Gato" का अर्थ "Cat" है क्योंकि आप पहले से जानते हैं कि बिल्ली क्या है। रोबोट अपने मौजूदा ज्ञान ("up" और "far") का उपयोग करके तुरंत इस नए टूल टोकन को समझ लेता है।

परिणाम
यह शोध पत्र दावा करता है कि यह विधि एक बड़ी सफलता है:

  • डेटा दक्षता: रोबोट ने अन्य तरीकों की तुलना में 1% से भी कम डेटा का उपयोग करके विशेषज्ञ बनना सीख लिया। जहां अन्य रोबोटों को लाखों उदाहरणों की आवश्यकता थी, वहीं ToolTok ने केवल लगभग 5,000 नमूनों के साथ सीखा।
  • मजबूती (Robustness): क्योंकि रोबोट "कदमों" (बड़े, मध्यम, छोटे) का उपयोग करता है (न कि सटीक निर्देशांकों का), यह पूरी तरह से काम करता है भले ही स्क्रीन का आकार बदल जाए। आस्पेक्ट रेशियो बदलने पर भी यह क्रैश नहीं होता है।
  • प्रदर्शन: इस पद्धति के साथ प्रशिक्षित एक अपेक्षाकृत छोटा मॉडल (4 बिलियन पैरामीटर्स) बहुत बड़े मॉडलों (235 बिलियन पैरामीटर्स) से बेहतर प्रदर्शन करता है और अन्य विशेष रोबोट एजेंटों को भी पीछे छोड़ देता है।

सारांश में
ToolTok यह बदल देता है कि हम रोबोट को कंप्यूटर का उपयोग करना कैसे सिखाते हैं। उन्हें सटीक निर्देशांकों को याद करने के लिए मजबूर करने के बजाय (जो आसानी से टूट जाता है), यह उन्हें "कदमों" और "कार्यों" की एक लचीली भाषा सिखाता है। एक स्मार्ट पाठ्यक्रम का उपयोग करके और नए टूल को उन शब्दों से जोड़कर जिन्हें रोबोट पहले से जानता है, उन्होंने एक ऐसा सिस्टम बनाया जो तेजी से सीखता है, कम डेटा का उपयोग करता है, और विभिन्न स्क्रीन आकारों में विश्वसनीय रूप से काम करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →