← नवीनतम पेपर
💻 computer science

Agentic Reward Modeling: Verifying GUI Agent via Progressive Trajectory-Grounded Interaction

यह शोधपत्र VAGEN को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो मौजूदा निष्क्रिय और अत्यधिक-प्रोबिंग (over-probing) रिवॉर्ड मॉडलिंग विधियों की सीमाओं को दूर करने के लिए एक प्रोग्रेसिव, सरफेस-टू-लेटेंट (surface-to-latent) सत्यापन तंत्र के साथ टूल-ऑगमेंटेड वेरिफायर एजेंट का उपयोग करता है, जिससे OSWorld-Verified और AndroidWorld जैसे बेंचमार्क पर GUI एजेंट मूल्यांकन की सटीकता और दक्षता में महत्वपूर्ण सुधार होता है।

मूल लेखक: Chaoqun Cui, Jing Huang, Shijing Wang, Liming Zheng, Qingchao Kong, Zhixiong Zeng

प्रकाशित 2026-07-28
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chaoqun Cui, Jing Huang, Shijing Wang, Liming Zheng, Qingchao Kong, Zhixiong Zeng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कंप्यूटर चलाना सिखा रहे हैं। आप चाहते हैं कि वह ऐप्स खोले, बटन क्लिक करे और किताब खरीदने या फ़ाइलें व्यवस्थित करने जैसे कार्य पूरे करे। रोबोट को सिखाने के लिए, आपको उसे यह बताने का एक तरीका चाहिए कि उसने अच्छा काम किया या उसने गलती की। यह रिनफोर्समेंट लर्निंग (Reinforcement Learning) की दुनिया है, जहाँ एक AI प्रयास करने और सफलता मिलने पर "इनाम" (rewards) प्राप्त करके सीखता है। लेकिन यहाँ पेच यह है: आप कैसे जानेंगे कि रोबोट ने वास्तव में काम पूरा कर लिया है? क्या उसने वास्तव में किताब खरीदी, या उसने केवल एक ऐसे बटन पर क्लिक किया जो खरीदने वाले बटन जैसा दिखता था? यह रिवॉर्ड मॉडलिंग (Reward Modeling) की समस्या है। यदि रोबोट सोचता है कि वह सफल हो गया जबकि वह नहीं हुआ, तो वह बार-बार वही गलती करता रहेगा। यदि वह सोचता है कि वह विफल हो गया जबकि वह वास्तव में सफल रहा, तो वह भ्रमित हो जाएगा और कोशिश करना छोड़ देगा। इस "स्कोर" को सही पाना ही एक अनाड़ी रोबोट और एक सहायक असिस्टेंट के बीच का अंतर है।

लंबे समय तक, वैज्ञानिकों ने रोबोट को ग्रेड देने के दो मुख्य तरीके आजमाए। पहला एक सख्त शिक्षक की तरह था जिसके पास एक चेकलिस्ट थी: "क्या फ़ाइल दिखाई दी? हाँ। क्या विंडो बंद हुई? हाँ।" यह सरल कार्यों के लिए काम करता है लेकिन जब काम रचनात्मक या खुले अंत वाला हो, तो यह विफल हो जाता है। दूसरा तरीका यह था कि एक सुपर-स्मार्ट AI (एक लार्ज लैंग्वेज मॉडल) से रोबोट के काम का वीडियो देखने और यह अनुमान लगाने के लिए कहना कि क्या वह सफल रहा। यह स्केलेबल है, लेकिन AI निष्क्रिय है; वह केवल वही देख सकता है जो वह स्क्रीन पर देखता है। वह कंप्यूटर के "दिमाग" के अंदर झाँककर यह नहीं देख सकता कि बैकग्राउंड में वास्तव में कोई फ़ाइल सेव की गई है या नहीं। यह एक शिक्षक की तरह है जो छात्र के गणित के टेस्ट को केवल उसके अंतिम उत्तर पत्र को देखकर ग्रेड देता है, बिना यह जांचे कि छात्र ने वास्तवв में काम किया था या वह केवल एक तुक्का था।

यह पेपर इन कंप्यूटर चलाने वाले रोबोटों को ग्रेड देने का एक नया, स्मार्ट तरीका पेश करता है। लेखक, चाओक्वुन कुई (Chaoqun Cui) और उनके सहयोगियों ने VAGEN नामक एक सिस्टम प्रस्तावित किया है। केवल एक वीडियो देखने या चेकलिस्ट की जाँच करने के बजाय, VAGEN एक "वेरिफायर एजेंट" (Verifier Agent) का उपयोग करता है—एक दूसरा AI जासूस जो सक्रिय रूप से जांच कर सकता है। इसे एक ऐसे जासूस की तरह समझें जो न केवल संदिग्ध का बहाना (रोबोट का वीडियो) पढ़ता है, बल्कि उसके पास अपराध स्थल में जाने, छिपी हुई फ़ाइलों की जाँच करने और परीक्षण करने की शक्ति भी है ताकि यह देखा जा सके कि कहानी सच है या नहीं। लेखकों ने पाया कि यह सक्रिय, खोजी दृष्टिकोण सच्चाई का पता लगाने में बहुत बेहतर है, खासकर जब रोबोट के कार्यों से ऐसे सुराग मिलते हैं जो स्क्रीन पर दिखाई नहीं देते। उन्होंने दिखाया कि यह तरीका न केवल अधिक सटीक है, बल्कि कुशल भी है, जो यह साबित करता है कि कभी-कभी यह जानने के लिए कि काम वास्तव में पूरा हुआ है या नहीं, आपको अपने हाथ गंदे करने पड़ते हैं।

डिजिटल दुनिया में जासूस

तो, यह नया जासूस, VAGEN, वास्तव में कैसे काम करता है? लेखकों ने महसूस किया कि यह जांचना कि क्या एक रोबोट ने कार्य पूरा किया है, अक्सर कार्य को करने से आसान होता है। यह केक बनाने और यह जांचने के बीच के अंतर जैसा है कि केक तैयार है या नहीं। बेकर ( "एक्टर" रोबोट) को सामग्री मिलानी पड़ती है, ओवन पर नज़र रखनी पड़ती है और केक को सजाना पड़ता है। जज ("वेरिफायर") को बस टूथपिक से केक को छूना या रसोई को सूंघना होगा यह जानने के लिए कि क्या यह तैयार है। लेखक इसे "आसान सत्यापन, कठिन समाधान" (easy to verify, hard to solve) का गुण कहते हैं।

इसे साकार करने के लिए, VAGEN एक प्रोग्रेसिव वेरिफिकेशन मैकेनिज्म (Progressive Verification Mechanism) का उपयोग करता है। कल्पना कीजिए कि वेरिफायर एक रहस्य सुलझाने वाला जासूस है, और उनके पास एक विशिष्ट रणनीति है ताकि समय बर्बाद न हो। वे सीधे दरवाजे तोड़ने में नहीं कूदते; वे सबसे आसान सुरागों से शुरू करते हैं और केवल आवश्यकता पड़ने पर ही अधिक आक्रामक होते हैं।

चरण 1: एक त्वरित नज़र (स्टैटिक असेसमेंट)
सबसे पहले, वेरिफायर कंप्यूटर स्क्रीन की अंतिम तस्वीर और रोबोट ने क्या किया उसका सारांश देखता है। वह पूछता है, "क्या यह जीत जैसा लग रहा है?" यदि स्क्रीन स्पष्ट रूप से "ऑर्डर कन्फर्म" का संदेश दिखाती है, तो जासूस कहता है, "मामला सुलझ गया!" और आगे बढ़ जाता है। यह तेज़ और सस्ता है।

चरण 2: टेप को रिवाइंड करना (विजुअल रिट्रोस्पेक्शन)
यदि अंतिम तस्वीर भ्रमित करने वाली है—शायद स्क्रीन खाली है, या संदेश छिपा हुआ है—तो जासूस हार नहीं मानता। इसके बजाय, वह वीडियो को रिवाइंड करता है। वह सुराग खोजने के लिए पिछले चरणों के स्क्रीनशॉट देखता है। शायद रोबोट ने पाँच मिनट पहले सही बटन क्लिक किया था, भले ही अंतिम स्क्रीन अव्यवस्थित हो। यह सुरक्षा कैमरे के फुटेज की जांच करने जैसा है कि क्या संदिग्ध वास्तव में इमारत में दाखिल हुआ था।

चरण 3: घुसपैठ करना (प्रोएक्टिव प्रोबिंग)
कभी-कभी, सुराग स्क्रीन पर नहीं होते। शायद रोबोट को हार्ड ड्राइव में एक फ़ाइल सेव करनी थी, लेकिन स्क्रीन केवल एक सामान्य "डन" (Done) संदेश दिखाती है। स्क्रीन झूठ बोल रही है, या कम से कम, वह सच को छिपा रही है। यहीं पर VAGEN वास्तव में शानदार है। वेरिफायर एजेंट के पास कंप्यूटर के साथ सक्रिय रूप से बातचीत (actively interact) करने के लिए विशेष उपकरण हैं। वह कोड चला सकता है, फ़ाइल सिस्टम की जाँच कर सकता है, या यह परीक्षण करने के लिए खुद बटन भी क्लिक कर सकता है कि क्या फ़ाइल वास्तव में वहां है। यह ऐसा है जैसे जासूस को आखिरकार संदिग्ध के घर की तलाशी लेने का वारंट मिल गया हो। वे केवल कहानी पर भरोसा नहीं करते; वे बेसमेंट में जाकर जाँच करते हैं।

पेपर दिखाता है कि यह "सरफेस-टू-लेटेंट" (सतह से गुप्त अवस्था तक) दृष्टिकोण एक गेम-चेंजर है (जो स्क्रीन की सतह से सिस्टम की गहराई तक जाता है)। लेखकों ने VAGEN का परीक्षण दो बड़े कार्यों पर किया: OSWorld-Verified (डेस्कटॉप कंप्यूटर) और AndroidWorld (मोबाइल फोन)।

परिणाम: स्मार्ट और तेज़

जब लेखकों ने आंकड़े चलाए, तो VAGEN ने केवल ठीक प्रदर्शन ही नहीं किया; उसने प्रतिस्पर्धा को पछाड़ दिया। डेस्कटॉप बेंचमार्क पर, जबकि अन्य तरीके 80% सटीकता से ऊपर जाने के लिए संघर्ष कर रहे थे, VAGEN ने मानव विशेषज्ञों द्वारा जाँचे जाने पर 92.9% सटीकता हासिल की। इससे भी अधिक प्रभावशाली बात यह है कि इसने यह सब बिना हर एक स्क्रीनशॉट की जाँच किए या अंतहीन परीक्षण चलाए किया। यह उत्तर मिलने पर जल्दी रुकने के लिए पर्याप्त स्मार्ट था।

पेपर यह महत्वपूर्ण निष्कर्ष भी उजागर करता है: सक्रिय बातचीत आवश्यक है, लेकिन हमेशा पहला कदम नहीं होती। पिछले तरीके जो "प्रोबिंग" (सिस्टम की जाँच) पर बहुत अधिक निर्भर थे, अक्सर धीमे और अक्षम थे क्योंकि उन्होंने पहले वीडियो साक्ष्य नहीं देखे थे। वे उन जासूसों की तरह थे जो पहले सामने का दरवाजा देखे बिना ही तुरंत दरवाजा तोड़ देते हैं। हालाँकि, VAGEN वीडियो साक्ष्य का उपयोग अपने अन्वेषण को निर्देशित करने के लिए करता है। वह सिस्टम में तभी घुसता है जब वीडियो पर्याप्त नहीं होता। इस संतुलन ने इसे बहुत कुशल बनाया, जिससे बेहतर उत्तर पाने के लिए कम कंप्यूटर संसाधनों (जैसे "स्टेप्स" या "टोकन") का उपयोग हुआ।

लेखकों ने यह भी परीक्षण किया कि क्या वे वेरिफायर को एक ही कार्य को कई बार जाँचने के लिए कहकर (एक रणनीति जिसे "स्केलिंग" कहा जाता है) और भी बेहतर बना सकते हैं। उन्होंने पाया कि भले ही उन्होंने वेरिफायर को केवल डेटा को "पढ़ने" तक सीमित रखा और कुछ भी बदलने की अनुमति नहीं दी, फिर भी यह और भी स्मार्ट हो गया। यह सुझाव देता है कि वेरिफायर का मुख्य काम जांच करना है, कंप्यूटर के साथ छेड़छाड़ करना नहीं।

यह क्यों मायने रखता है

बड़ा निष्कर्ष यह है कि हमें एक निष्क्रिय पर्यवेक्षक और एक दखल देने वाले जासूस के बीच चयन करने की आवश्यकता नहीं है। हमारे पास दोनों हो सकते हैं। रोबोट के वीडियो के निष्क्रिय अवलोकन को कंप्यूटर की छिपी हुई अवस्थाओं की जाँच करने की सक्रिय शक्ति के साथ जोड़कर, VAGEN एक ऐसा रिवॉर्ड सिस्टम बनाता है जो विश्वसनीय और कुशल दोनों है।

लेखक तर्क देते हैं कि यह AI एजेंटों को प्रशिक्षित करने का भविष्य है। यदि हम ऐसे रोबोट चाहते हैं जो वास्तव में हमारे कंप्यूटर और फोन में हमारी मदद कर सकें, तो हमें उन्हें ग्रेड देने के एक ऐसे तरीके की आवश्यकता है जो सुंदर दिखने वाली तस्वीर से धोखा न खाए। VAGEN सुझाव देता है कि अपने AI ग्रेडर्स को गहराई तक जाने के उपकरण देकर, हम अपने रोबोट को बहुत अधिक सक्षम बनाने के लिए प्रशिक्षित कर सकते हैं। पेपर यह दावा नहीं करता है कि उसने दुनिया की हर समस्या को हल कर दिया है, लेकिन यह एक स्पष्ट रास्ता दिखाता है: केवल शो देखना बंद करें, और बैकस्टेज की जाँच करना शुरू करें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →