← नवीनतम पेपर
💻 computer science

CAPTCHA Solving for Native GUI Agents: Automated Reasoning-Action Data Generation and Self-Corrective Training

यह शोध पत्र ReCAP को प्रस्तुत करता है, जो एक नेटिव GUI एजेंट है जो एक गतिशील मूल्यांकन प्रणाली, स्वचालित तर्क-क्रिया डेटा जनरेशन और विफलता प्रक्षेपवक्रों (failure trajectories) पर स्व-सुधारात्मक प्रशिक्षण का उपयोग करके मजबूत CAPTCHA समाधान प्राप्त करता है और सामान्य GUI प्रदर्शन बनाए रखता है।

मूल लेखक: Yuxi Chen, Haoyu Zhai, Chenkai Wang, Rui Yang, Lingming Zhang, Gang Wang, Huan Zhang

प्रकाशित 2026-03-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuxi Chen, Haoyu Zhai, Chenkai Wang, Rui Yang, Lingming Zhang, Gang Wang, Huan Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट को कंप्यूटर का उपयोग करना सिखा रहे हैं। यह रोबोट, जिसे GUI एजेंट कहा जाता है, एक डिजिटल इंटर्न की तरह है। यह स्क्रीन देख सकता है, समझ सकता है कि बटनों पर क्या लिखा है, और काम करने के लिए उन पर क्लिक कर सकता है, जैसे कि फ्लाइट बुक करना या ईमेल भेजना।

हालाँकि, एक चीज़ है जिसमें यह रोबोट बहुत बुरा है: CAPTCHAs

आप जानते हैं वे परेशान करने वाले टेस्ट जो वेबसाइटों द्वारा यह साबित करने के लिए उपयोग किए जाते हैं कि आप रोबोट नहीं हैं? "ट्रैफिक लाइट वाली सभी तस्वीरों पर क्लिक करें" या "जो टेढ़े-मेढ़े अक्षर आप देखते हैं उन्हें टाइप करें।" एक इंसान के लिए, यह एक त्वरित, उबाऊ झुंझलाहट है। एक रोबोट के लिए, यह एक दुःस्वप्न है। अधिकांश रोबोट इसमें फंस जाते हैं, घबरा जाते हैं, या बस हार मान लेते हैं क्योंकि वे इन पेचीदा, जटिल और बदलते स्वरूपों को नहीं संभाल पाते।

यह पेपर एक नए रोबोट ReCAP (जिसका अर्थ है Reasoning CAPTCHA एजेंट) को पेश करता है, जिसने इन टेस्ट्स को एक प्रो की तरह क्रश करना सीख लिया है। उन्होंने इसे कैसे किया, यहाँ सरल भाषा में समझाया गया है:

1. समस्या: "रोबोट-प्रूफ" दीवार

वर्तमान रोबोट सामान्य कार्यों (जैसे "ब्राउज़र खोलें") में बहुत अच्छे हैं, लेकिन जब वे CAPTCHA की दीवार से टकराते हैं, तो वे टूट जाते हैं।

  • पुराने रोबोट अनुमान लगाने या कठोर नियमों का उपयोग करने की कोशिश करते हैं। यदि टेक्स्ट धुंधला है या पहेली थोड़ी बदल जाती है, तो वे विफल हो जाते हैं।
  • विशेषज्ञ रोबोट मौजूद हैं जो केवल CAPTCHAs के लिए अच्छे हैं, लेकिन वे बाकी सब चीजों में बहुत खराब हैं। यदि आप उनसे "टिकट खरीदने" के लिए कहते हैं, तो वे नहीं कर सकते।

लक्ष्य एक यूनिवर्सल रोबोट बनाना था जो सब कुछ करने में अच्छा हो, जिसमें ये पेचीदा सुरक्षा परीक्षण भी शामिल हों।

2. समाधान: एक "रोबोट जिम" बनाना

ReCAP को प्रशिक्षित करने के लिए, शोधकर्ताओं ने केवल उसे वास्तविक वेबसाइटें नहीं दिखाईं। उन्होंने एक डायनामिक CAPTCHA जिम बनाया।

  • उपमा: कल्पना कीजिए कि आप एक जिम्नास्ट को बैकफ्लिप करना सिखाने की कोशिश कर रहे हैं। आप उसे केवल असमान घास वाले किसी रैंडम पार्क में नहीं फेंकेंगे। आप एक जिम बनाएंगे जिसमें मैट, बार और स्प्रिंग्स होंगे जिन्हें आप एडजस्ट कर सकते हैं।
  • जिम: शोधकर्ताओं ने एक ऐसा सिस्टम बनाया जो चलते-फिरते लाखों अद्वितीय CAPTCHA पहेलियाँ उत्पन्न करता है। वे तुरंत फ़ॉन्ट, रंग, बैकग्राउंड नॉइज़ और लेआउट बदल सकते हैं।
  • प्रशिक्षण: यह जिम रोबोट को किसी भी पहेली के लिए आवश्यक मुख्य कौशल सीखने के लिए मजबूर करता है: बिखरे हुए टेक्स्ट को पढ़ना, स्लाइडर को सटीक रूप से खींचना, और भीड़ में विशिष्ट वस्तुओं को पहचानना। क्योंकि पहेलियाँ हमेशा बदलती रहती हैं, रोबोट केवल "उत्तर याद" नहीं कर सकता; उसे वास्तव में यह समझना होगा कि वह क्या देख रहा है।

3. सीक्रेट सॉस: "सोचकर बोलना" और "गलतियों से सीखना"

शोधकर्ताओं ने केवल रोबोट को बटन क्लिक करने के लिए नहीं छोड़ा। उन्होंने उसे दो सुपरपावर दीं:

A. "सोचकर बोलने" की रणनीति (चेन-ऑफ-थॉट)

केवल क्लिक करने के बजाय, रोबोट को कार्य करने से पहले खुद से बात करने के लिए प्रशिक्षित किया गया है।

  • सामान्य रोबोट: एक बस की तस्वीर देखता है। क्लिक करता है। (शायद यह बस है, शायद ट्रक। किसे पता?)
  • ReCAP: एक तस्वीर देखता है। सोचता है: "ठीक है, मैं पहियों वाला एक लाल वाहन देख रहा हूँ। यह एक बस जैसा दिखता है। निर्देश कहते हैं 'बसें खोजें'। यह मेल खाता है। मैं इस पर क्लिक करूँगा।"
  • यह क्यों काम करता है: रोबोट को अपने तर्क को समझाने के लिए मजबूर करने से, यह मूर्खतापूर्ण गलतियाँ कम करता है। यह गणित के उत्तर का अनुमान लगाने और अपना काम दिखाने के बीच के अंतर जैसा है।

B. "सेल्फ-करेक्शन" लूप

यह सबसे रचनात्मक हिस्सा है। शोधकर्ताओं ने रोबोट को जानबूझकर विफल होने दिया।

  • प्रक्रिया:
    1. रोबोट एक पहेली को हल करने की कोशिश करता है और विफल हो जाता है (जैसे, वह गलत आइकन पर क्लिक करता है)।
    2. सिस्टम उसे रोकता है और कहता है, "हे, तुमने गलती की। देखो तुमने क्या किया। यह गलत क्यों था? अब, इसे ठीक करो।"
    3. रोबोट अपनी गलती का विश्लेषण करता है, महसूस करता है, "ओह, मुझे लगा कि यह कार है, लेकिन यह वास्तव में एक ट्रक था," और फिर अपने रास्ते को सुधारता है।
  • उपमा: साइकिल चलाना सीखने के बारे में सोचें। यदि आप गिरते हैं, तो एक अच्छा शिक्षक केवल यह नहीं कहता कि "फिर से कोशिश करो।" वे कहते हैं, "तुम बहुत अधिक बाईं ओर झुक गए थे। अगली बार, अपना संतुलन बनाए रखें।" ReCAP अपने स्वयं के "क्रैश" की समीक्षा करके और तुरंत उन्हें ठीक करके सीखता है।

4. परिणाम: द अल्टीमेट इंटर्न

लाखों पहेलियों और सेल्फ-करेक्शन सत्रों के साथ इस जिम में प्रशिक्षण के बाद, ReCAP का परीक्षण किया गया।

  • पहले: मानक रोबोट लगभग 30% CAPTCHAs को हल करते थे।
  • बाद में: ReCAP ने लगभग 80% को हल किया।
  • सबसे अच्छी बात: भले ही इसने CAPTCHA मास्टर बनने के लिए सीखा, लेकिन यह एक सामान्य रोबोट बनना नहीं भूला। यह अभी भी उतना ही अच्छा है जितना कि पहले था, फ्लाइट बुक करने और वेब ब्राउज़ करने में।

सारांश

यह पेपर एक डिजिटल रोबोट को सुरक्षा परीक्षण देखते समय घबराना बंद करने के बारे में है। उन्होंने इसे निम्न प्रकार से किया:

  1. अनंत, बदलते पहेलियों वाला एक जिम बनाकर।
  2. रोबोट को कार्य करने से पहले सोचने के लिए सिखाकर।
  3. रोबोट को विफल होने, सीखने और वास्तविक समय में खुद को ठीक करने की अनुमति देकर।

परिणामस्वरूप एक ऐसा रोबोट मिला जो मजबूत, स्मार्ट और इंटरनेट की अनिश्चित दुनिया को संभालने के लिए तैयार है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →