Weblica: Scalable and Reproducible Training Environments for Visual Web Agents
यह शोध पत्र 'वेब्लिका' (Weblica) का परिचय देता है, जो एक ऐसा फ्रेमवर्क है जो स्केलेबल और पुनरुत्पादक (reproducible) वेब वातावरण बनाने के लिए HTTP-स्तरीय कैशिंग और LLM-आधारित संश्लेषण (synthesis) का लाभ उठाता है, जिससे वेब्लिका-8B मॉडल को प्रशिक्षित करना सक्षम होता है जो विजुअल वेब नेविगेशन कार्यों में मौजूदा ओपन-वेट बेसलाइनों से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को इंटरनेट पर नेविगेट करना सिखाना चाहते हैं, जैसे कि फ्लाइट बुक करना, जूते खरीदना या कोई फॉर्म भरना। इंटरनेट एक अराजक और निरंतर बदलने वाली जगह है। यह किसी को तूफान के दौरान समुद्र में फेंककर तैरना सिखाने जैसा है, जहाँ लहरें हर सेकंड बदल रही हैं और नई लहरें टकरा रही हैं।
यही वह समस्या है जिसे WEBLICA पेपर हल करने की कोशिश करता है। Apple के लेखकों ने महसूस किया कि AI एजेंटों को "लाइव" वेब पर प्रशिक्षित करना बहुत अव्यवस्थित, धीमा और अप्रत्याशित है। इसके बजाय, उन्होंने एक विशाल, पूर्ण, ऑफलाइन सिम्युलेटर बनाया जिसे WEBLICA कहा जाता है।
उन्होंने इसे कैसे किया, यहाँ दो सरल भागों में दिया गया है:
1. "टाइम-ट्रैवल कैमरा" (HTTP-लेवल कैशिंग)
कल्पना कीजिए कि आप एक वेबपेज की फोटो लेते हैं, लेकिन केवल एक तस्वीर के रूप में नहीं, बल्कि आप अपने कंप्यूटर और वेबसाइट के बीच होने वाली पूरी बातचीत को कैद कर लेते हैं।
- समस्या: यदि आप बाद में उस बातचीत को फिर से चलाने (replay) की कोशिश करते हैं, तो वेबसाइट कह सकती है, "रुको, आपका सेशन टोकन अलग है!" या "टाइमस्टैम्प गलत है!" और आपको ब्लॉक कर सकती है। यह एक पुराने ताले पर पुराने चाबी से खोलने की कोशिश करने जैसा है जो दोबारा लॉक हो चुका है।
- समाधान: टीम ने एक स्मार्ट सिस्टम बनाया जो एक "टाइम-ट्रैवल कैमरे" की तरह काम करता है। यह प्रत्येक अनुरोध (request) और प्रतिक्रिया (response) को रिकॉर्ड करता है। फिर, यह एक नियम पुस्तिका का उपयोग करता है ताकि उन हिस्सों को अनदेखा किया जा सके जो हर बार बदलते रहते हैं (जैसे टाइमस्टैम्प या रैंडम सेशन नंबर) और केवल स्थिर हिस्सों को ही रखा जाए।
- परिणाम: वे इन रिकॉर्ड किए गए वेबसाइटों को पूरी तरह से, बार-बार, बिना वास्तविक इंटरनेट से जुड़े फिर से चला सकते हैं। यह एक वेबसाइट के पूर्ण, जमे हुए स्नैपशॉट जैसा है जो अभी भी आपको बटन क्लिक करने और बॉक्स में टाइप करने की अनुमति देता है, बिल्कुल असली चीज़ की तरह।
2. "अनंत LEGO फैक्ट्री" (LLM-आधारित सिंथेसिस)
कभी-कभी, आप केवल एक वेबसाइट को रिकॉर्ड नहीं कर सकते क्योंकि वह बहुत जटिल होती है या अभी मौजूद ही नहीं होती।
- समस्या: वास्तविक वेबसाइटें सीमित होती हैं। आप अभ्यास करने के लिए "शॉपिंग कार्ट" या "फ्लाइट बुकिंग" पेज के 10,000 अलग-अलग संस्करण आसानी से नहीं ढूंढ सकते।
- समाधान: उन्होंने एक सुपर-स्मार्ट AI कोडर (एक LLM) का उपयोग एक फैक्ट्री के रूप में किया। उन्होंने फैक्ट्री को निर्देश दिया: "मेरे लिए एक योग स्टूडियो की वेबसाइट बनाओ जो क्लास बुक करने की सुविधा देती हो," या "एक कार डीलरशिप साइट बनाओ जहाँ आप मॉडल की तुलना कर सकें।"
- जादू: AI कोडर इन वेबसाइटों को कोड के माध्यम से शून्य से बनाता है, नकली चित्र बनाता है, और यहाँ तक कि उन कार्यों का भी आविष्कार करता है जिन्हें आपको उन पर करना है। यह एक LEGO फैक्ट्री की तरह है जो तुरंत एक महल, एक अंतरिक्ष यान या एक घर के लाखों अलग-अलग संस्करण बना सकती है, जिनमें काम करने वाले दरवाजे और खिड़कियां भी शामिल हैं, ताकि रोबोट उनके खोलने का अभ्यास कर सके।
यह क्यों मायने रखता है: "ट्रेनिंग जिम"
इन दोनों विधियों को मिलाकर, लेखकों ने अपने AI के लिए एक विशाल, सुरक्षित प्रशिक्षण जिम बनाया।
- अब कोई तूफान नहीं: उन्हें वास्तविक इंटरनेट के टूटने, बदलने या अपने बॉट को ब्लॉक करने की चिंता करने की आवश्यकता नहीं है।
- गति: क्योंकि सब कुछ ऑफलाइन और स्थानीय (local) है, इसलिए AI वास्तविक वेबसाइटों के लोड होने का इंतज़ार करने के बजाय हजारों गुना तेज़ी से अभ्यास कर सकता है।
- पैमाना (Scale): उन्होंने अपने AI को इन हजारों विविध, नकली-लेकिन-वास्तविक वातावरणों पर प्रशिक्षित किया।
परिणाम: "Weblica-8B" चैंपियन
उन्होंने Weblica-8B नामक एक मॉडल को इस जिम में प्रशिक्षित किया। यहाँ क्या हुआ:
- यह तेज़ और स्मार्ट है: वास्तविक वेबसाइटों पर परीक्षण के दौरान, इस मॉडल ने अपने आकार के अन्य ओपन-सोर्स मॉडलों की तुलना में कार्यों को बेहतर ढंग से हल किया।
- यह कम चरणों का उपयोग करता है: यह अपने प्रतिस्पर्धियों की तुलना में कम क्लिक और प्रयासों में समस्याओं को हल कर सका।
- यह स्केल करता है: यदि आप इसे सोचने के लिए अधिक समय देते हैं (अधिक "टेस्ट-टाइम कंप्यूट"), तो यह और भी बेहतर हो जाता है, और उन महंगे, प्रोप्रायटरी AI मॉडलों (जैसे OpenAI या Google के मॉडल) के प्रदर्शन के लगभग बराबर पहुँच जाता है जिनके उपयोग के लिए पैसे देने पड़ते हैं।
संक्षेप में: पेपर कहता है, "अपने रोबोट को वास्तविक वेब के अराजक समुद्र में तैरना सीखने के लिए मत फेंको। इसके बजाय, एक पूर्ण, अनंत, ऑफलाइन सिम्युलेटर बनाओ जहाँ वह गीला हुए बिना लाखों बार अभ्यास कर सके।" और यह काम कर गया: रोबोट ने अविश्वसनीय रूप से अच्छा तैरना सीख लिया।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।