← नवीनतम पेपर
🤖 AI

ENVS: Environment-Native Verified Search for Long-Horizon GUI Agents

यह शोध पत्र ENVS को प्रस्तुत करता है, जो एक प्रशिक्षण-समय खोज-और-फ़िल्टर पाइपलाइन है जो GUI एजेंटों के लिए सत्यापित, वैश्विक रूप से संतुलित पर्यवेक्षण उत्पन्न करने के लिए लाइव OSWorld वातावरण का लाभ उठाता है, जो लंबी अवधि के कार्यों पर उत्कृष्ट प्रदर्शन और कंप्यूट दक्षता प्राप्त करता है और साथ ही वास्तविक डेस्कटॉप बाधाओं के विरुद्ध बेहतर मजबूती और दृश्य तर्क क्षमताओं के बेहतर संरक्षण का प्रदर्शन करता है।

मूल लेखक: Yincheng Zhou, Athena Zhuoming Zhong, Shijie Zhang, Kevin Zhang, Teresa Xiaotao Shang, Shanghang Zhang

प्रकाशित 2026-06-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yincheng Zhou, Athena Zhuoming Zhong, Shijie Zhang, Kevin Zhang, Teresa Xiaotao Shang, Shanghang Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कंप्यूटर चलाना सिखाने की कोशिश कर रहे हैं। रोबोट को क्लिक करना, टाइप करना और विंडोज़ को नेविगेट करना सीखना होगा ताकि वह "फ्लाइट बुक करने" या "डॉक्यूमेंट एडिट करने" जैसे कार्य पूरे कर सके।

समस्या यह है कि कंप्यूटर का वातावरण बहुत अव्यवस्थित है। यदि रोबोट कोई गलती करता है, तो उसे अक्सर अंत तक यह पता नहीं चलता कि किस कदम के कारण विफलता हुई, और तब तक बहुत देर हो चुकी होती है सुधार करने के लिए। साथ ही, रोबोट को एक वास्तविक कंप्यूटर पर हजारों परिदृश्यों (scenarios) के माध्यम से टेस्ट करना बेहद धीमा और महंगा है (जैसे किसी रोबोट को असफल होते देखने के लिए सुपरकंप्यूटर किराए पर लेना)।

यह पेपर एक नई विधि पेश करता है जिसे ENVS (Environment-Native Verified Search) कहा जाता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं (analogies) का उपयोग किया गया है:

1. पुराना तरीका: "अंधेरे में प्रयास और त्रुटि" (Online RL)

पुराने तरीके (जिसे Online RL कहा जाता है) को ऐसे समझें जैसे एक छात्र कार चलाने की कोशिश कर रहा है और वह गाड़ी में बैठकर इधर-उधर घूमता है जब तक कि वह दुर्घटनाग्रस्त न हो जाए।

  • वह गाड़ी चलाता है, दुर्घटनाग्रस्त होता है, फिर से शुरू करता है, और फिर से प्रयास करता है।
  • उसे यात्रा के बिल्कुल अंत में ही "पास" या "फेल" का पता चलता है।
  • यदि वह दुर्घटनाग्रस्त होता है, तो उसे यह नहीं पता होता कि क्या उसने बहुत जल्दी मोड़ लिया था, ब्रेक बहुत जोर से लगाया था, या गलत साइन बोर्ड देख लिया था।
  • इसमें बहुत अधिक समय (कंप्यूट) और ईंधन (पैसा) खर्च होता है।

2. नया तरीका: "सिमुलेशन लैब" (ENVS)

लेखक एक अलग दृष्टिकोण प्रस्तावित करते हैं। रोबोट को वास्तविक जीवन में गाड़ी चलाने देने के बजाय, वे एक सिमुलेशन लैब बनाते हैं जहाँ वे रोबोट के असली पहिए के पीछे बैठने से पहले ही हर संभावित मोड़ का परीक्षण कर सकते हैं।

  • शाखाओं में निकलना (Branching Out): कल्पना करें कि रोबोट एक चौराहे पर है। केवल एक रास्ता चुनने के बजाय, सिस्टम एक साथ अलग-अलग रास्तों पर 32 "स्काउट्स" (आभासी रोबोट) भेजता है।
  • समान चालों को समूह में रखना: यदि 20 स्काउट्स बाईं ओर मुड़ते हैं और 10 दाईं ओर, तो सिस्टम महसूस करता है कि "बाएं" मुड़ना एक लोकप्रिय और संभवतः सही चाल है। यह अपनी ऊर्जा वहीं केंद्रित करता है।
  • "वेरिफाइड" फिल्टर: सिस्टम हर रास्ते के अंत की जांच करता है। क्या स्काउट ने सफलतापूर्वक फ्लाइट बुक की?
    • हाँ: बहुत बढ़िया! हम उस रास्ते को एक "गोल्ड स्टैंडर्ड" सबक के रूप में सहेज लेते हैं।
    • नहीं: हम उस रास्ते को हटा देते हैं। हम रोबोट को असफल होने का तरीका सिखाने में समय बर्बाद नहीं करते।
  • परिणाम: इसके बाद रोबोट को केवल "गोल्ड स्टैंडर्ड" रास्तों पर प्रशिक्षित किया जाता है। वह विफलताओं के ढेर के बजाय सफलता की कहानियों के एक क्यूरेटेड पुस्तकालय से सीखता है।

3. "नॉइज़" बेंचमार्क: "विचलित करने वाला ऑफिस"

यह पेपर एक नया टेस्ट भी पेश करता है जिसे OSWORLD-NOISY कहा जाता है।

  • परिदृश्य: कल्पना करें कि आप एक डॉक्यूमेंट पर काम करने की कोशिश कर रहे हैं, लेकिन हर कुछ मिनटों में एक सहकर्मी पास से गुजरता है और चिल्लाता है, एक पॉप-अप विज्ञापन आपकी स्क्रीन को ढक देता है, या फोन बजने लगता है।
  • टेस्ट: क्या रोबोट इस शोर को अनदेखा कर सकता है, पॉप-अप को बंद कर सकता है और वापस अपने काम पर लौट सकता है?
  • निष्कर्ष: नए "सिमुलेशन लैब" (ENVS) तरीके से प्रशिक्षित रोबोट, पुराने "प्रयास और त्रुटि" (Trial and Error) वाले तरीके से प्रशिक्षित रोबोट की तुलना में इन विकर्षणों (distractions) को संभालने में बहुत बेहतर था। इसने इन बाधाओं के दौरान ध्यान केंद्रित करना और "इंतजार करना" सीख लिया क्योंकि इसने अपने ट्रेनिंग डेटा संग्रह के दौरान इन व्यवधानों को देखा था।

4. यह क्यों महत्वपूर्ण है (परिणाम)

पेपर का दावा है कि ENVS के तीन मुख्य लाभ हैं:

  • स्मार्ट: इसने पुराने तरीकों (26.7%) की तुलना में अधिक कार्यों को सफलतापूर्वक हल किया (30.3% सफलता दर)।
  • सस्ता: इसने काफी कम कंप्यूटर पावर (लगभग 25% कम) का उपयोग किया क्योंकि इसे असफल प्रयोगों को बार-बार चलाने की आवश्यकता नहीं पड़ी।
  • अधिक मजबूत (Robust): यह केवल मुख्य कार्य में ही बेहतर नहीं हुआ; यह वास्तव में अन्य कौशलों में भी बेहतर हुआ, जैसे कि दृश्य पहेलियों (visual puzzles) को समझना, क्योंकि इसका प्रशिक्षण डेटा उच्च गुणवत्ता वाला था और इसमें "शोर" वाले परिदृश्य भी शामिल थे।

सारांश

ENVS को एक ऐसे शिक्षक के रूप में समझें जो केवल छात्र को परीक्षा देने और यह देखने के लिए नहीं छोड़ देता कि वह पास हुआ या फेल। इसके बजाय, शिक्षक पहले हजारों अभ्यास परीक्षाएँ चलाता है, उन परीक्षाओं को फ़िल्टर कर देता है जहाँ छात्र भ्रमित हो गया था, और फिर सफल प्रयासों से एक आदर्श अध्ययन मार्गदर्शिका (study guide) बनाता है। छात्र फिर केवल उसी आदर्श मार्गदर्शिका का अध्ययन करता है, जिससे वह तेजी से सीखता है, कम समय खर्च करता है, और एक शोर-शराबे वाले, विचलित करने वाले क्लासरूम के लिए बेहतर ढंग से तैयार होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →