GTA: Generating Long-Horizon Tasks for Web Agents at Scale
यह शोध पत्र GTA को प्रस्तुत करता है, जो एक स्केलेबल फ्रेमवर्क है जो मौजूदा बेंचमार्क की सीमाओं को दूर करने और मजबूत प्रशिक्षण एवं मूल्यांकन को सक्षम करने के लिए क्रॉलिंग, रिट्रीवल-आधारित सीडिंग और स्वचालित सत्यापन को एकीकृत करके वास्तविक, मल्टी-हॉप वेब एजेंट कार्यों को निष्पादन योग्य प्रक्षेपवक्रों (ट्रैजेक्टरीज) के साथ स्वचालित रूप से उत्पन्न करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को इंटरनेट का उपयोग करना सिखाने की कोशिश कर रहे हैं। उस रोबोट के पास एक दिमाग (एक लैंग्वेज मॉडल) है, और हाथ (क्लिक करने और टाइप करने के टूल्स) हैं, लेकिन वह अभी बहुत अनाड़ी है। वह सरल उत्तर ढूंढ सकता है, जैसे "फ्रांस की राजधानी क्या है?" लेकिन वह जटिल मिशनों में संघर्ष करता है, जैसे "टोक्यो के लिए सबसे सस्ती उड़ान खोजें, यह जांचें कि क्या होटल में पूल है, और देखें कि क्या उड़ान का समय मेरे डॉक्टर के अपॉइंटमेंट के साथ मेल खाता है।"
समस्या यह है कि हम रोबोट को पर्याप्त अच्छी प्रैक्टिस नहीं दे पा रहे हैं।
समस्या: एक टूटे हुए मानचित्र के साथ प्रशिक्षण
वर्तमान में, वेब रोबोट्स के लिए अधिकांश परीक्षण ऐसे हैं जैसे उन्हें एक नक्शा देना जिसमें केवल एक "शुरुआत" और एक "समाप्ति" बिंदु हो, लेकिन वहां तक पहुँचने के निर्देश न हों।
- पुराने बेंचमार्क (Old Benchmarks): ये इंसानों द्वारा बनाए गए हाथ से लिखे गए पहेलियों की तरह हैं। ये बहुत कम संख्या में हैं, और अक्सर केवल सरल, एक-चरणीय कार्यों का परीक्षण करते हैं।
- स्वचालित प्रयास (Automatic Attempts): कुछ शोधकर्ताओं ने रोबोट्स को खुद वेबसाइटों पर घूमने और नए पहेलियाँ बनाने के लिए छोड़ा। लेकिन यह एक बच्चे को खिलौने खोजने के लिए मॉल में घूमने देने जैसा था: उन्होंने केवल चमकदार, स्पष्ट चीजों (जैसे खिलौने की दुकान) को पाया और बाकी चीजों (जैसे फार्मेसी या फूड कोर्ट) को अनदेखा कर दिया। यह अविश्वसनीय रूप से महंगा और धीमा भी था।
इस कारण से, रोबोट "ओवरफिटिंग" कर रहे हैं। उन्होंने दिए गए विशिष्ट पहेलियों को रट लिया लेकिन वे वास्तविक दुनिया की उन उलझी हुई स्थितियों को नहीं संभाल सकते जहाँ उन्हें एक समस्या को हल करने के लिए विभिन्न पेजों और वेबसाइटों के बीच कूदना पड़ता है।
समाधान: GTA (द "आर्किटेक्ट" अप्रोच)
लेखक GTA (Generating Long-Horizon Tasks for Web Agents at Scale) पेश करते हैं। इसे ऐसे सोचें कि GTA एक शिक्षक नहीं है जो वर्कशीट बांट रहा है, बल्कि एक मास्टर आर्किटेक्ट है जो एक ट्रेनिंग जिम बना रहा है।
उन्होंने इसे कैसे बनाया, इसके सरल चरण यहाँ दिए गए हैं:
- द क्रॉल (शहर का मानचित्रण - The Crawl): रोबोट को अंधेरे में भटकने देने के बजाय, GTA पहले पूरी वेबसाइटों (जैसे ई-कॉमर्स स्टोर, सरकारी साइटें और समाचार पोर्टल) का मानचित्रण करने के लिए डिजिटल "स्काउट्स" का एक बेड़ा भेजता है। वे हर पेज और उनके बीच के कनेक्शन का एक पूर्ण "सिटी मैप" बनाते हैं।
- द सीड (चुनौती चुनना - The Seed): यह अनुमान लगाने के बजाय कि एक कठिन कार्य कैसा दिखता है, GTA मानचित्र पर दो यादृच्छिक (रैंडम) स्थान चुनता है (उदाहरण के लिए, एक विशिष्ट जूते के बारे में एक पेज और एक विशिष्ट डिस्काउंट के बारे में एक पेज)।
- द जनरेशन (मिशन लिखना - The Generation): एक AI को एक ऐसा मिशन लिखने के लिए कहा जाता है जिसके लिए दोनों स्थानों पर जाना अनिवार्य हो। उदाहरण के लिए: "पेज A पर जूते की कीमत देखें, फिर देखें कि क्या पेज B पर कोई कूपन है जो इसे और सस्ता बना देता है।"
- द क्वालिटी कंट्रोल (रेफरी - The Quality Control): मिशन जारी करने से पहले, एक सख्त रेफरी इसकी जांच करता है।
- क्या यह हल करने योग्य है? (क्या आप वास्तव में उत्तर प्राप्त कर सकते हैं?)
- क्या यह स्पष्ट है? (क्या केवल एक ही सही उत्तर है?)
- क्या यह मल्टी-हॉप है? (क्या यह रोबोट को एक से अधिक पेज देखने के लिए मजबूर करता है?)
- द गोल्ड पाथ (उत्तर कुंजी - The Gold Path): महत्वपूर्ण रूप से, GTA उस सटीक मार्ग को रिकॉर्ड करता है जिसे रोबोट को लेना चाहिए। यह शोधकर्ताओं को मिशन को पूरी तरह से फिर से चलाने और यह देखने की अनुमति देता है कि रोबोट कहाँ गलत हुआ।
यह क्यों मायने रखता है: "इंसान बनाम रोबोट" का अंतर
लेखकों ने इस नए जिम का वर्तमान रोबोट्स के साथ परीक्षण किया और पाया कि एक बड़ा अंतर है:
- रोबोट्स: जब इन नए, बहु-चरणीय कार्यों का सामना करने की बात आई, तो रोबोट ज्यादातर समय विफल रहे (अक्सर 20% से नीचे स्कोर करते हैं)। वे रास्ता भटक गए, जल्दी हार मान ली, या साइट को ठीक से नेविगेट करने के बजाय सर्च बार का उपयोग करने की कोशिश करने लगे।
- इंसान: जब इंसानों ने उन्हीं कार्यों को आजमाया, तो उन्होंने उन्हें आसानी से हल कर लिया (85% सफलता दर)।
- सर्च इंजन: यहाँ तक कि एक साधारण गूगल सर्च भी इन कार्यों को हल नहीं कर सका क्योंकि उत्तर एक ही जगह पर नहीं था; यह अलग-अलग पेजों में छिपा हुआ था।
GTA की मुख्य विशेषताएं
- यह एक "जीवित" जिम है: पुराने परीक्षणों के विपरीत जो स्थिर (समय में जमे हुए) होते हैं, GTA लाइव वेबसाइटों से नए कार्य उत्पन्न करना जारी रख सकता है। यह रोबोट्स को उत्तर रटने से रोकता है।
- यह वैश्विक है: यह केवल अंग्रेजी नहीं, बल्कि कई भाषाओं (अंग्रेजी, इतालवी, जापानी, जर्मन, चीनी) में काम करता है। रोबोट्स गैर-अंग्रेजी साइटों के साथ और भी अधिक संघर्ष करते हैं।
- यह क्रॉस-वेबसाइट है: कुछ कार्यों के लिए समस्या को हल करने हेतु स्वास्थ्य साइट से वित्त साइट पर कूदने की आवश्यकता होती है, जो यह दर्शाता है कि वास्तविक लोग वेब का उपयोग कैसे करते हैं।
निचोड़ (The Bottom Line)
GTA वेब रोबोट्स के लिए यथार्थवादी, कठिन प्रशिक्षण मिशन बनाने की एक नई, विशाल और स्वचालित प्रणाली है। यह साबित करता है कि वर्तमान रोबोट वास्तविक इंटरनेट की जटिल, बहु-चरणीय प्रकृति को नेविगेट करने में अभी भी काफी कमजोर हैं। उन्हें निरंतर, उच्च-गुणवत्ता वाले और सत्यापन योग्य चुनौतियां प्रदान करके, GTA शोधकर्ताओं को यह समझने में मदद करता है कि रोबोट कहाँ विफल हो रहे हैं ताकि वे बेहतर रोबोट बना सकें।
यह क्या नहीं है:
- यह अभी डॉक्टरों या व्यवसायों के उपयोग के लिए कोई टूल नहीं है।
- यह दावा नहीं करता है कि इसने वेब एजेंट की समस्या को हल कर दिया है; इसने केवल उन्हें टेस्ट करने का एक बेहतर तरीका प्रदान किया है और दिखाया है कि अभी कितना काम बाकी है।
- इसमें निजी खातों में लॉग इन करने या वास्तविक खरीदारी करने वाले कार्यों को कवर नहीं किया गया है (सुरक्षा नियमों के कारण)।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।