Safe and Scalable Web Agent Learning via Recreated Websites
यह शोध पत्र VeriEnv को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो वास्तविक दुनिया की वेबसाइटों को सुरक्षित, सत्यापन योग्य सिंथेटिक वातावरण में स्वचालित रूप से क्लोन करने के लिए लैंग्वेज मॉडल्स का लाभ उठाता है, जिससे स्वायत्त वेब एजेंटों को असुरक्षित वास्तविक दुनिया की अंतःक्रियाओं या ह्यूरिस्टिक रिवॉर्ड सिग्नल्स पर निर्भर रहे बिना, स्केलेबल सेल्फ-इवोल्यूशन करने और मजबूत सामान्यीकरण प्राप्त करने में सक्षम बनाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को इंटरनेट पर नेविगेट करना सिखाना चाहते है, जैसे कि फ्लाइट बुक करना, किराने का सामान खरीदना, या मौसम की जानकारी देखना। समस्या यह है कि असली इंटरनेट, सीखने वाले रोबोट के लिए एक खतरनाक और अराजक जगह है। यदि रोबोट कोई गलती करता है, तो वह गलती से आपका डेटा डिलीट कर सकता है, किसी वेबसाइट को स्पैम कर सकता है, या सुरक्षा प्रणालियों द्वारा ब्लॉक किया जा सकता है। इसके अलावा, आपको कैसे पता चलेगा कि रोबोट वास्तव में सफल हुआ या नहीं? क्या उसने वास्तव में सही फ्लाइट ढूंढी, या उसने सिर्फ अनुमान लगाया?
यह पेपर VERIENV पेश करता है, जो एक चतुर फ्रेमवर्क है जो रोबोटों के अभ्यास करने के लिए वास्तविक इंटरनेट का एक परफेक्ट, सुरक्षित "वीडियो गेम" संस्करण बनाकर इन समस्याओं को हल करता है।
यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:
1. समस्या: "लाइव" इंटरनेट पर सीखना खतरनाक है
असली इंटरनेट को एक व्यस्त, वास्तविक दुनिया के शहर की तरह समझें।
- जोखिम: यदि आप एक छात्र ड्राइवर (AI एजेंट) को इस शहर में सीखने के लिए भेजते हैं, तो वह कार से टकरा सकता है, रेड लाइट पार कर सकता है, या रास्ता भटक सकता है। यदि वे गड़बड़ी करते हैं, तो आप शहर को बस "रीसेट" नहीं कर सकते।
- जज (निर्णायक) की समस्या: अतीत में, शोधकर्ताओं ने एक स्मार्ट AI (जैसे एक शिक्षक) से छात्र के काम को देखने और यह कहने की कोशिश की कि "अच्छा काम किया!" या "फिर से प्रयास करें।" लेकिन यह शिक्षक अक्सर गलत होता है, पक्षपाती होता है, या आसानी से धोखा खा जाता है। यह एक इंसान से बिना उत्तर कुंजी (answer key) के गणित के टेस्ट को ग्रेड करने के लिए कहने जैसा है—वे केवल अनुमान लगा सकते हैं।
2. समाधान: "डिजिटल ट्विन" शहर
लेखकों ने VERIENV बनाया है, जो इंटरनेट के लिए एक हाई-टेक फ्लाइट सिम्युलेटर की तरह काम करता है।
- क्लोन: रोबोट को असली हाईवे पर चलाने के बजाय, एक विशेष "कोडिंग एजेंट" (एक सुपर-प्रोग्रामर AI) एक वास्तविक वेबसाइट (जैसे Amazon या कोई न्यूज़ साइट) को देखता है और तुरंत उसका एक परफेक्ट डिजिटल कॉपी बनाता है।
- गुप्त पहुंच: यह केवल वेबसाइट की तस्वीर नहीं है; यह अपने स्वयं के डेटाबेस और कोड के साथ एक पूरी तरह से कार्यात्मक, जीवित प्रति है। महत्वपूर्ण रूप से, शोधकर्ता रोबोट को एक "बैकडोर की" (एक Python SDK) देते हैं। यह चाबी रोबोट को इंजन रूम के अंदर झांकने देती है ताकि वह देख सके कि वास्तव में क्या हो रहा है, जो वास्तविक दुनिया में असंभव है।
3. "स्वयं-ग्रेडिंग" होमवर्क
यह सबसे जादुई हिस्सा है। वास्तविक दुनिया में, आपको अपना होमवर्क चेक करने के लिए एक इंसान का इंतज़ार करना पड़ता है। VERIENV में, सिस्टम अपनी उत्तर कुंजी (answer key) खुद लिखता है।
- कार्य (Task): सिस्टम एक कार्य उत्पन्न करता है, जैसे "सबसे सस्ती लाल शर्ट ढूंढें।"
- वैलिडेटर (Validator): क्योंकि शोधकर्ताओं के पास "बैकडोर की" है, वे एक छोटा सा प्रोग्राम लिख सकते हैं जो तुरंत डेटाबेस की जांच करता है: "क्या रोबोट ने वास्तव में लाल शर्ट ढूंढी? हाँ/नहीं।"
- इनाम (Reward): यदि रोबोट सफल होता है, तो उसे एक परफेक्ट स्कोर मिलता है। यदि वह विफल होता है, तो उसे शून्य मिलता है। इसमें कोई अनुमान नहीं है, कोई मानवीय पक्षपात नहीं है, और कोई "शायद" नहीं है। यह 100% वस्तुनिष्ठ (objective) है।
4. यह क्यों मायने रखता है: "अनंत डोजो" (Infinite Dojo)
क्योंकि यह सिस्टम सुरक्षित और स्वचालित है, रोबोट हमेशा के लिए अभ्यास कर सकता है।
- स्व-विकास (Self-Evolution): रोबोट किसी कार्य को हल करने की कोशिश कर सकता है, असफल हो सकता है, सीख सकता है, फिर से प्रयास कर सकता है, और बेहतर बन सकता है। वह बिना किसी इंसान द्वारा नए चैलेंज लिखे, अपने लिए हजारों नए चैलेंज खुद उत्पन्न कर सकता है।
- स्केलिंग (Scaling): ठीक वैसे ही जैसे एक वीडियो गेम बेहतर होता जाता है जैसे-जैसे आप उसमें लेवल जोड़ते हैं, शोधकर्ताओं ने पाया कि रोबोट ने जितने अधिक "डिजिटल शहरों" (वेबसाइटों) को क्लोन किया, वह उतना ही स्मार्ट होता गया।
परिणाम
जब उन्होंने इन रोबोटों का वास्तविक वेबसाइटों (जैसे WebArena और Mind2Web) पर परीक्षण किया, तो इस "सुरक्षित सिम्युलेटर" में प्रशिक्षित रोबोट पुराने तरीके से प्रशिक्षित रोबोटों की तुलना में वास्तविक इंटरनेट को नेविगेट करने में काफी बेहतर थे।
संक्षेप में:
VERIENV एक सुरक्षित, अनंत, स्वयं-ग्रेडिंग वाले वीडियो गेम की तरह है जो बिल्कुल असली इंटरनेट जैसा दिखता है। यह AI एजेंटों को कुछ भी तोड़े बिना अपने कौशल का अभ्यास करने देता है, और चूंकि गेम को सटीक उत्तर कुंजी का पता होता है, इसलिए एजेंट पहले की तुलना में बहुत अधिक तेज़ी से और अधिक विश्वसनीय रूप से सीखते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।