Go-Browse: Training Web Agents with Structured Exploration
यह शोध पत्र Go-Browse को प्रस्तुत करता है, जो एक ऐसी विधि है जो वेब एजेंट प्रक्षेपवक्र (trajectories) का एक बड़े पैमाने पर डेटासेट स्वचालित रूप से एकत्र करने के लिए संरचित ग्राफ-आधारित अन्वेषण का उपयोग करती है, जिसे जब एक 7B भाषा मॉडल को फाइन-ट्यून करने के लिए उपयोग किया जाता है, तो यह WebArena बेंचमार्क पर अत्याधुनिक (state-of-the-art) प्रदर्शन प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को इंटरनेट का उपयोग करना सिखाने की कोशिश कर रहे हैं। आप चाहते हैं कि वह केवल स्क्रीन को देखकर और बटन पर क्लिक करके उड़ान (flights) बुक कर सके, किराने का सामान खरीद सके, या अपना बैंक खाता चेक कर सके।
समस्या यह है कि अधिकांश रोबोट (AI एजेंट) इसमें बहुत खराब हैं। वे आसानी से रास्ता भटक जाते हैं। यदि आप एक रोबोट को "एक वेबसाइट पर एक विशिष्ट शर्ट खरीदने" के लिए कहते हैं, तो वह गलत सेक्शन में जा सकता है, गलत बटन दबा सकता है, या ऐसे पेज पर फंस सकता है जिसे वह समझ नहीं पाता। यह वैसा ही है जैसे किसी पर्यटक को एक शहर का नक्शा देना जिसे उसने पहले कभी नहीं देखा, लेकिन उस नक्शे में सड़कों के नाम गायब हैं, और पर्यटक को यह भी नहीं पता कि रास्ता कैसे पूछना है।
यह पेपर इस समस्या को ठीक करने के लिए Go-Browse नामक एक नई विधि पेश करता है। यह कैसे काम करता है, यहाँ सरल भाषा में समझाया गया है:
समस्या: "भटका हुआ पर्यटक" (The "Lost Tourist")
वर्तमान AI एजेंट उन पर्यटकों की तरह हैं जो बिना किसी दिशा के शहर में घूमकर सीखने की कोशिश करते हैं। वे गलती से किसी शानदार दुकान तक पहुँच सकते हैं, लेकिन वे वहां पहुँचने का सबसे अच्छा तरीका शायद ही कभी सीख पाते हैं। यदि वे खो जाते हैं, तो वे बस शुरुआत से फिर से शुरू कर देते हैं, जिससे समय और ऊर्जा बर्बाद होती है।
समाधान: "स्मार्ट टूर गाइड" (Go-Browse)
रोबोट को अंधाधुंध घूमने देने के बजाय, लेखकों ने एक ऐसा सिस्टम बनाया है जो एक सुव्यवस्थित टूर गाइड की तरह काम करता है। यह गाइड केवल घूमता नहीं है; यह चलते-चलते शहर का एक मानसिक मानचित्र (mental map) बनाता है।
यहाँ प्रक्रिया के चरण दिए गए, जिन्हें एक लाइब्रेरी (पुस्तकालय) के उदाहरण से समझाया गया है:
1. बाहरी लूप (Outer Loop): अलमारियों का मानचित्र बनाना
कल्पना कीजिए कि हजारों किताबों वाली एक लाइब्रेरी है। एक सामान्य रोबोट अंदर जा सकता है, एक रैंडम किताब उठा सकता है, उसे पढ़ सकता है, और फिर बाहर निकल सकता है। अगली बार, वह दूसरी रैंडम किताब उठाता है। वह कभी नहीं सीख पाता कि "कुकिंग" सेक्शन "हिस्ट्री" सेक्शन के सापेक्ष कहाँ है।
Go-Brose अलग है। यह फ्रंट डेस्क (होमपेज) से शुरू करता है। यह कहता है, "ठीक है, मैं यहाँ हूँ। यहाँ से मैं और कौन से सेक्शन तक पहुँच सकता हूँ?" यह "कुकिंग" की एली (aisle) ढूंढता है, फिर "हिस्ट्री" की एली ढूंढता है, और इसी तरह। यह लाइब्रेरी का एक मानचित्र बनाता है, हर उस शेल्फ का रिकॉर्ड रखता है जिसे उसने खोजा है लेकिन अभी तक पूरी तरह से एक्सप्लोर नहीं किया है।
2. आंतरिक लूप (Inner Loop): "रीसेट और एक्सप्लोर" का तरीका
यही असली सफलता का मंत्र है। अतीत में, यदि कोई रोबोट लाइब्रेरी के बहुत अंदर किसी विशिष्ट पुस्तक को खोजने में खो जाता था, तो उसे एक अलग रास्ते को आज़माने के लिए मुख्य दरवाजे से वापस पैदल चलकर आना पड़ता था। यह थकाऊ और अक्षम था।
Go-Browse एक "टाइम ट्रैवल" ट्रिक का उपयोग करता है।
- एक बार जब रोबोट एक नया सेक्शन (जैसे "कुकिंग" एली) खोज लेता है, तो वह उस स्थान को सुरक्षित (save) कर लेता है।
- यदि उसे उस एली के अंदर एक विशिष्ट रेसिपी खोजने के लिए सीखना है, तो वह मुख्य दरवाजे से शुरू नहीं करता। वह सीधे "कुकिंग" एली में टेलीपोर्ट (रीसेट) हो जाता है।
- अब, उसे पूरी इमारत में नेविगेट करने के कठिन कार्य के बजाय, केवल उस एली के अंदर विशिष्ट कार्य (जैसे "रेसिपी खोजना") पर ध्यान केंद्रित करना होता है।
यह रोबोट को विशिष्ट कौशल (जैसे "'Buy' बटन पर क्लिक करना") का अभ्यास करने की अनुमति देता है, बिना लंबी पैदल यात्रा से थके।
3. "व्यवहार्यता जांच" (Feasibility Check): सुरक्षा जाल
इससे पहले कि रोबोट कोई नया कार्य सीखना शुरू करे, एक "सेफ्टी ऑफिसर" (एक बहुत बुद्धिमान AI) यह जाँचता है: "क्या यह वास्तव में संभव है?"
- यदि रोबोट "एक यूनिकॉर्न खरीदने" के बारे में सीखने की कोशिश करता है, तो सेफ्टी ऑफिसर कहता है: "नहीं, यहाँ यूनिकॉर्न असली नहीं हैं। समय बर्बाद मत करो।"
- यदि कार्य वास्तविक है (जैसे "एक टोस्टर खरीदना"), तो सेफ्टी ऑफिसर रोबोट को कोशिश करने देता है। यदि वह सफल होता है, तो उस सफलता को एक सबक के रूप में सहेजा जाता है। यदि वह विफल होता है, तो उस सबक को हटा दिया जाता है।
परिणाम: एक सुपर-लर्नर
लेखकों ने इस पद्धति का उपयोग करके रोबोट द्वारा वेब कार्यों को करने के 10,000 सफल उदाहरण एकत्र किए। फिर उन्होंने इन उदाहरणों का उपयोग करके एक मानक AI मॉडल (एक 7-बिलियन पैरामीटर वाला मॉडल) को प्रशिक्षित किया।
परिणाम प्रभावशाली था:
- प्रशिक्षित रोबोट पहले की तुलना में वेबसाइटों को नेविगेट करने में काफी बेहतर हो गया।
- इसने वास्तव में इन विशिष्ट कार्यों पर GPT-4o Mini (OpenAI का एक बहुत शक्तिशाली और महंगा AI) को भी पीछे छोड़ दिया।
- यह उन अन्य रोबोटों से बहुत बेहतर था जो बिना किसी मानचित्र के केवल घूम-घूम कर सीखने की कोशिश करते थे।
यह क्यों महत्वपूर्ण है
इसे गाड़ी चलाना सीखने जैसा समझें।
- पुराना तरीका: आप एक कार में बैठते हैं और शहर में बेतरतीब ढंग से घूमते हैं, इस उम्मीद में कि शायद आप पार्किंग करना सीख जाएँ। आप बहुत बार टकराते हैं, और आप पार्किंग लॉट के विशिष्ट नियमों को कभी नहीं सीख पाते।
- Go-Browse तरीका: आप पहले शहर के लेआउट को सीखते हैं (नक्शा)। फिर, आप सीधे उस जगह के सामने से शुरू करके बार-बार अभ्यास करते हैं जहाँ आपको पार्क करना है, जब तक कि आप उसमें महारत हासिल न कर लें। एक बार जब आप उस जगह में माहिर हो जाते हैं, तो आप अगले स्थान पर बढ़ जाते हैं।
"इंटरनेट सर्फिंग" की बड़ी और डरावनी समस्या को छोटे, प्रबंधनीय हिस्सों में तोड़कर और यह याद रखकर कि वे कहाँ रहे हैं, Go-Go-Browse AI एजेंटों को बहुत अधिक आत्मविश्वासी, कुशल और सफल डिजिटल सहायक बनने की शिक्षा देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।