← नवीनतम पेपर
💬 NLP

Building Autonomous GUI Navigation via Agentic-Q Estimation and Step-Wise Policy Optimization

यह शोध पत्र स्वायत्त GUI एजेंटों के लिए एक नवीन MLLM-केंद्रित ढांचे को प्रस्तुत करता है जो कुशल, स्व-जनित डेटा संग्रह और स्थिर सुदृढीकरण शिक्षण (reinforcement learning) को सक्षम करने के लिए एजेंटिक-Q अनुमान (agentic-Q estimation) और चरण-वार नीति अनुकूलन (step-wise policy optimization) को संयोजित करता है, जिससे Ovis2.5-9B मॉडल ने नेविगेशन और ग्राउंडिंग बेंचमार्क पर बड़े पैमाने के प्रतिस्पर्धियों को पछाड़ दिया है।

मूल लेखक: Yibo Wang, Guangda Huzhang, Yuwei Hu, Yu Xia, Shiyin Lu, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Lijun Zhang

प्रकाशित 2026-02-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yibo Wang, Guangda Huzhang, Yuwei Hu, Yu Xia, Shiyin Lu, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Lijun Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन अनुभवहीन रोबोट को इंटरनेट चलाना सिखा रहे हैं। आपका लक्ष्य इस रोबोट को बटन क्लिक करना, टेक्स्ट टाइप करना और वेबसाइटों को स्क्रॉल करना सिखाना है ताकि वह "iPhone 14 की कीमत पता करें" या "पेरिस के लिए फ्लाइट बुक करें" जैसे कार्य पूरे कर सके।

यह शोध पत्र इस रोबोट को प्रशिक्षित करने का एक नया, अत्यधिक कुशल तरीका पेश करता है, जो तीन बड़ी समस्याओं को हल करता है जिनसे आमतौर पर AI डेवलपर्स जूझते हैं: महंगा डेटा, अस्पष्ट फीडबैक, और अस्थिर प्रशिक्षण

यहाँ उनके समाधान का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. समस्या: फीडबैक का "ब्लैक बॉक्स" (Black Box)

आमतौर पर, एक AI को वेबसाइट नेविगेट करना सिखाना एक वीडियो गेम खेलने जैसा है जहाँ आपको 50 स्तरों के मैराथन के अंत में केवल "गेम ओवर" या "आप जीत गए" का संदेश मिलता है।

  • समस्या: यदि रोबोट तीसरे चरण में विफल हो जाता है, तो आपको यह नहीं पता चलता कि यह तीसरे चरण के कारण हुआ था, या इसलिए कि उसने 45वें चरण में कोई गलत निर्णय लिया था।
  • लागत: इसे ठीक करने के लिए, इंसानों को आमतौर पर घंटों के वीडियो देखने होते हैं और हर एक क्लिक को मैन्युअल रूप से "अच्छा" या "बुरा" लेबल करना होता है। यह अविश्वसनीय रूप से महंगा और धीमा है।
  • अस्थिरता: क्योंकि इंटरनेट लगातार बदलता रहता है (वेबसाइटें अपडेट होती हैं, पॉप-अप आते हैं), रोबोट जो "खेल" रहा है वह कभी भी दो बार एक जैसा नहीं होता, जिससे सीखना कठिन हो जाता है।

2. समाधान: "एजेंटिक-क्यू" (Agentic-Q) कोच

लेखक एक दो-चरणीय प्रशिक्षण विधि प्रस्तावित करते हैं जो एक स्मार्ट कोच की तरह काम करती है जो रोबोट को खेलते हुए देखता है और तुरंत फीडबैक देता है।

चरण A: "एजेंटिक-क्यू" एस्टिमेटर (तत्काल कोच)

कार्य के अंत में "अच्छा काम किया" या "बुरा काम किया" कहने के बजाय, वे एक विशेष AI मॉडल (एजेंटिक-क्यू) को एक कोच के रूप में प्रशिक्षित करते हैं।

  • यह कैसे काम करता है: हर बार जब रोबोट कोई चाल चलता है (जैसे बटन क्लिक करना), तो कोच तुरंत मूल्यांकन करता है: "यदि रोबोट यह करता है, तो अंततः सफल होने की कितनी संभावना है?"
  • जादुई ट्रिक: कोच यह सीखने के लिए रोबोट के अपने पिछले प्रयासों को देखता है। यदि रोबोट अंततः सफल रहा, तो कोच सीखता है कि उन चरणों में जो उसे सफलता की ओर ले गए वे "अच्छे" थे। यदि वह विफल रहा, तो वे चरण "बुरे" थे।
  • यह क्यों शानदार है: कोच को देखने के लिए किसी इंसान की ज़रूरत नहीं है। यह रोबोट को खेलते हुए देखकर अपना स्वयं का प्रशिक्षण डेटा तैयार करता है, और फिर उस डेटा का उपयोग भविष्य की चालों को तुरंत ग्रेड करने के लिए करता है।

चरण B: स्टेप-वाइज पॉलिसी ऑप्टिमाइज़ेशन (ड्रिल सार्जेंट)

एक बार जब कोच तैयार हो जाता है, तो रोबोट फिर से प्रशिक्षण शुरू करता है।

  • पुराना तरीका: रोबोट पूरा खेल खेलता है, अंत में एक स्कोर प्राप्त करता है, और अनुमान लगाने की कोशिश करता है कि उसने क्या गलत किया।
  • नया तरीका: रोबोट एक कदम चलता है। कोच तुरंत कहता है, "इसकी सफलता की संभावना 90% थी!" या "इसकी संभावना 10% थी!" रोबोट इस तत्काल फीडबैक का उपयोग करके तुरंत अपने मस्तिष्क को समायोजित करता है।
  • लाभ: यह एक ऐसे वीडियो गेम की तरह है जहाँ आपको लेवल के अंत तक प्रतीक्षा करने के बजाय हर एक जंप के बाद स्कोर मिलता है। यह सीखने की प्रक्रिया को बहुत तेज़ और अधिक स्थिर बनाता है।

3. गुप्त नुस्खा: "स्लाइडिंग विंडो" और "फोकस"

लेखकों ने देखा कि यदि रोबोट वह सब कुछ याद रखने की कोशिश करता है जो उसने दिन की शुरुआत से किया है, तो वह भ्रमित हो जाता है (जैसे 10 घंटे की बातचीत का हर शब्द याद रखने की कोशिश करना)।

  • समाधान: वे एक स्लाइडिंग विंडो (Sliding Window) का उपयोग करते हैं। कोच केवल रोबोट द्वारा उठाए गए पिछले कुछ कदमों को देखता है। यह एक कोच की तरह है जो कहता है, "भूल जाओ कि तुमने 20 मिनट पहले क्या किया था; ध्यान केंद्रित करो कि तुमने अभी क्या किया।" यह रोबोट के दिमाग को स्पष्ट रखता है और उसे बुरी आदतों में फंसने से रोकता है।

4. परिणाम: दिग्गजों को पछाड़ना

उन्होंने वास्तविक वेबसाइटों जैसे Amazon, Google Maps और Apple पर इस नई पद्धति (Ovis2.5) का परीक्षण किया।

  • आश्चर्य: उनका मॉडल, जो अपेक्षाकृत छोटा (9 बिलियन पैरामीटर्स) है, बड़ी टेक कंपनियों (जैसे GPT-4o और Claude 3.7/4) के विशाल और महंगे मॉडलों से बेहतर प्रदर्शन करता है।
  • "बाउंड्री ट्रैवर्सल" की सुपरपावर: एक दिलचस्प उदाहरण में, रोबोट को Apple की वेबसाइट पर iPhone 14 खोजने के लिए कहा गया था। रोबोट ने महसूस किया कि उत्पाद अब वहां नहीं है। रुकने या हार मानने के बजाय, उसने रणनीति बदलने का निर्णय लिया। उसने एक नया टैब खोला, Google पर गया, वहां खोज की और कीमत ढूंढ ली। इससे पता चला कि वह सोच सकता है, "यह रास्ता बंद है, चलो दूसरा रास्ता आजमाते हैं।"

सारांश उपमा (Summary Analogy)

कल्पना कीजिए कि आप एक बच्चे को साइकिल चलाना सिखा रहे हैं।

  • पुराना तरीका: आप उन्हें 10 मील तक चलाने देते हैं। अंत में, आप कहते हैं, "तुम तीन बार गिरे हो।" बच्चे को पता ही नहीं चलता कि किस पेडल मारने की वजह से वह गिरा।
  • इस शोध पत्र का तरीका: आप एक विशेष सेंसर (एजेंटिक-क्यू) के साथ उनके साथ चलते हैं। जैसे ही वे डगमगाते हैं, सेंसर कहता है, "बाईं ओर झुकें!" बच्चा तुरंत सुधार करता है। आपको हर सेकंड देखने के लिए किसी इंसान की ज़रूरत नहीं है; सेंसर बच्चे के अपने राइडिंग इतिहास से सीखकर सटीक और तत्काल सलाह देता है।

मुख्य बात: यह शोध पत्र दिखाता है कि AI को एक ऐसा "तत्काल फीडबैक लूप" देकर जिसे वह स्वयं उत्पन्न कर सके, हम मानव शिक्षकों की सेनाओं की आवश्यकता के बिना स्मार्ट, तेज़ और अधिक अनुकूलन योग्य इंटरनेट नेविगेटर बना सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →