AutoWebWorld: Synthesizing Infinite Verifiable Web Environments via Finite State Machines
AutoWebWorld स्वायत्त वेब GUI एजेंटों के लिए सत्यापन योग्य प्रशिक्षण डेटा की कमी को फाईनाइट स्टेट मशीन-मॉडल किए गए वातावरण से 11,000 से अधिक लागत प्रभावी, प्रोग्रामेटिक रूप से सत्यापित इंटरैक्शन प्रक्षेपवक्र (ट्रैजेक्टरीज) को संश्लेषित करके संबोधित करता है, जो एजेंट के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है और वास्तविक दुनिया के बेंचमार्क पर स्पष्ट स्केलिंग लॉ को प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को इंटरनेट पर नेविगेट करना सिखाने की कोशिश कर रहे हैं। आप चाहते हैं कि वह इंसानों की तरह उड़ान बुक कर सके, किराने का सामान खरीद सके या ईमेल मैनेज कर सके। एक रोबोट को सिखाने के लिए, आपको आमतौर पर इंसानों द्वारा इन कार्यों को करने के हजारों उदाहरणों की आवश्यकता होती है।
समस्या: "ब्लैक बॉक्स" इंटरनेट
अभी, रोबोट को सिखाना कार चलाने सीखने जैसा है, जहाँ आप उन्हें केवल विंडशील्ड से बाहर का दृश्य दिखाते हैं, लेकिन उन्हें इंजन, गियर या सड़क के संकेतों को देखने नहीं देते।
- छिपी हुई स्थिति (The Hidden State): जब कोई इंसान किसी वेबसाइट पर "Add to Cart" पर क्लिक करता है, तो स्क्रीन पर एक छोटा सा कार्ट आइकन अपडेट हो सकता है। लेकिन रोबोट को यह नहीं पता होता कि वास्तव में कार्ट के अंदर क्या है, क्या कीमत बदल गई है, या क्या वह आइटम वास्तव में स्टॉक में है। वह केवल तस्वीर देखता है।
- महंगा शिक्षक: क्योंकि रोबोट यह नहीं देख पाता कि वास्तव में क्या हुआ (सच्चाई क्या है), हमें महंगे मानव शिक्षकों को काम पर रखना पड़ता है या शक्तिशाली (और महंगी) AI जजों का उपयोग करना पड़ता है जो स्क्रीनशॉट को देखते हैं और अनुमान लगाते हैं, "क्या रोबोट ने सही काम किया?" यह धीमा, महंगा और अक्सर असंगत होता है। एक शिक्षक कह सकता है "अच्छा काम किया," जबकि दूसरा कह सकता है "गलत।"
समाधान: AutoWebWorld (द "वीडियो गेम" अप्रोच)
इस पेपर के लेखकों ने, AutoWebmentWorld, असली, अव्यवस्थित और अप्रत्याशित इंटरनेट पर रोबोट को सिखाने की कोशिश करना बंद करने का निर्णय लिया। इसके बजाय, उन्होंने कंप्यूटर के भीतर अपना खुद का एक परफेक्ट, सिम्युलेटेड इंटरनेट बनाया।
इसे इस तरह सोचें:
- असली इंटरनेट: एक अराजक शहर जहाँ ट्रैफिक लाइट कभी-कभी खराब हो जाती है, सड़कें रातों-रात बदल जाती हैं, और आपको यह जानने के लिए कि क्या आप सही रास्ते पर हैं, किसी अजनबी से रास्ता पूछना पड़ता है।
- AutoWebWorld: एक पूरी तरह से डिज़ाइन किया गया वीडियो गेम लेवल (जैसे सुपर मारियो या द सिम्स)। एक वीडियो गेम में, नियम कोड में लिखे होते हैं। यदि आप एक मशरूम पर कूदते हैं, तो आप जानते हैं कि आगे क्या होगा। गेम इंजन स्थिति (state) को पूरी तरह से जानता है।
उन्होंने इसे कैसे बनाया: "फाइनाइट स्टेट मशीन" (FSM)
इसका गुप्त मंत्र एक चीज़ है जिसे फाइनाइट स्टेट मशीन (FSM) कहा जाता है। एक बोर्ड गेम के फ्लोचार्ट की कल्पना करें।
- स्टेट्स (States): वेबसाइट की हर संभव स्थिति जिसमें वह हो सकती है (जैसे, "होम पेज," "सर्च रिजल्ट्स," "आइटम सिलेक्टेड," "कार्ट फुल")।
- एक्शन (Actions): वे चालें जो आप ले सकते हैं (जैसे, "सर्च पर क्लिक करें," "साइज चुनें," "कार्ट में जोड़ें")।
- नियम (Rules): इस खेल के सख्त भौतिक नियम। "आप 'Add to Cart' पर तभी क्लिक कर सकते हैं जब आपने पहले ही साइज चुन लिया हो।"
शोधकर्ताओं ने 29 अलग-अलग प्रकार की वेबसाइटों (जैसे एक नकली फेसबुक, एक नकली अमेज़न, एक नकली गिटहब) के लिए ये फ्लोचार्ट लिखने के लिए AI एजेंटों का उपयोग किया। फिर, उन्होंने कोडिंग रोबोटों का उपयोग करके वास्तविक, काम करने वाली वेबसाइटें बनाईं जो सख्ती से इन फ्लोचार्ट का पालन करती हैं।
जादू: ऑटोमैटिक वेरिफिकेशन
चूंकि उन्होंने फ्लोचार्ट से वेबसाइट बनाई है, इसलिए उन्हें यह जांचने के लिए मानव की आवश्यकता नहीं है कि रोबोट ने अच्छा किया या नहीं।
- चेक: यदि रोबकट सही बटन पर क्लिक करता है और वेबसाइट ठीक वैसे ही "स्टेट A" से "स्टेट B" में चली जाती है जैसा कि फ्लोचार्ट में दिया गया है, तो सिस्टम स्वचालित रूप से जान जाता है कि कार्य सफल रहा।
- परिणाम: वे बिना किसी मानव के स्क्रीनशॉट देखे, मिनटों में और चंद पैसों में हजारों परफेक्ट ट्रेनिंग उदाहरण तैयार कर सकते हैं।
उपमा: "परफेक्ट चेस कोच"
कल्पना कीजिए कि आप एक चेस AI को सिखाना चाहते हैं।
- पुराना तरीका: आप एक इंसान के खिलाफ खेलते हैं, चालों को रिकॉर्ड करते हैं, और फिर यह देखने के लिए कि क्या AI ने अच्छी चाल चली, एक ग्रैंडमास्टर से रिकॉर्डिंग की समीक्षा करने के लिए कहते हैं। इसमें बहुत समय लगता है और बहुत खर्च आता है।
- AutoWebWorld तरीका: आप एक डिजिटल चेस बोर्ड बनाते हैं जहाँ नियम हार्ड-कोडेड होते हैं। कंप्यूटर तुरंत जानता है कि कोई चाल कानूनी है या नहीं और क्या वह जीत की ओर ले जाती है। यह एक सेकंड में लाखों गेम सिम्युलेट कर सकता है, जिससे एक विशाल लाइब्रेरी तैयार होती है।
परिणाम
- सस्ता और तेज़: उन्होंने केवल **0.15 से $1.00 प्रति पाथ थी।)
- बेहतर प्रदर्शन: उन्होंने इस डेटा का उपयोग करके एक रोबोट को प्रशिक्षित किया, और वह असली इंटरनेट पर नेविगेट करने में उन रोबोटों की तुलना में बहुत बेहतर हो गया जो भारी मात्रा में बिखरे हुए, मानव-संग्रहित डेटा पर प्रशिक्षित थे।
- स्केलिंग लॉ (Scaling Law): उन्होंने जितना अधिक "परफेक्ट गेम" डेटा जेनरेट किया, रोबोट उतना ही स्मार्ट होता गया। इसने साबित किया कि उच्च-गुणवत्ता वाला, सत्यापित डेटा, केवल "अधिक" डेटा होने से कहीं अधिक महत्वपूर्ण है।
संक्षेप में
AutoWebWorld ने रोबोट को अव्यवस्थित, अप्रत्याशित वास्तविक वेब पर सिखाने की कोशिश करना बंद कर दिया। इसके बजाय, उन्होंने वेब का एक परफेक्ट, नियम-आधारित वीडियो गेम संस्करण बनाया। चूंकि नियम ज्ञात हैं, इसलिए कंप्यूटर स्वचालित रूप से रोबोट द्वारा उठाए गए हर कदम को सत्यापित कर सकता है, जिससे एक विशाल, सस्ता और परफेक्ट ट्रेनिंग लाइब्रेरी बनती है जो रोबोट को वास्तविक इंटरनेट पर नेविगेट करने में काफी स्मार्ट बनाती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।