← नवीनतम पेपर
🤖 AI

Online Skill Learning for Web Agents via State-Grounded Dynamic Retrieval

यह शोध पत्र स्टेट-ग्राउंडेड डायनेमिक रिट्रीवल (SGDR) का प्रस्ताव करता है, जो एक ऑनलाइन स्किल लर्निंग विधि है जो वेब एजेंटों को एक ऐसे तंत्र के माध्यम से स्टेपवाइज स्किल पुन: उपयोग करने में सक्षम बनाकर बेहतर बनाती है जो कार्यों के लक्ष्यों और वर्तमान वेबपेज अवस्थाओं दोनों के साथ कौशल को गतिशील रूप से मेल खाता है, जिससे यह WebArena बेंचमार्क पर स्टैटिक रिट्रीवल बेसलाइन्स से बेहतर प्रदर्शन करता है।

मूल लेखक: Jiaxi Li, Ke Deng, Yun Wang, Jingyuan Huang, Yucheng Shi, Qiaoyu Tan, Jin Lu, Ninghao Liu

प्रकाशित 2026-06-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiaxi Li, Ke Deng, Yun Wang, Jingyuan Huang, Yucheng Shi, Qiaoyu Tan, Jin Lu, Ninghao Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को इंटरनेट पर नेविगेट करना सिखा रहे हैं ताकि वह फ्लाइट बुक करने, कोई फॉर्म भरने या किसी फोरम पर कोई विशिष्ट पोस्ट खोजने जैसे काम कर सके। यह रोबोट एक "वेब एजेंट" है।

समस्या यह है कि इंटरनेट अव्यवस्थित है और लगातार बदलता रहता है। एक रोबोट को कोई कार्य शुरू करना तो पता हो सकता है, लेकिन एक बार जब वह किसी बटन पर क्लिक करता है और एक नए पेज पर पहुँच जाता है, तो पुराने निर्देश अब समझ में नहीं आते।

यह पेपर इन रोबोट्स को सिखाने का एक नया तरीका पेश करता है, जिसे SGDR (स्टेट-ग्राउंडेड डायनेमिक रिट्रीवल) कहा जाता है। यह कैसे काम करता है, यहाँ सरल रूप में समझाया गया है:

समस्या: "वन-एंड-डन" (एक बार में ही सब कुछ) निर्देश

पारंपरिक तरीकों के बारे में सोचें जैसे कि यात्रा की शुरुआत में ही रोबोट को एक एकल, स्थिर मानचित्र (static map) देना।

  • पुराना तरीका: आप रोबोट को बताते हैं, "दुकान जाओ और दूध खरीदो।" रोबोट अपनी मेमोरी से उस वाक्य के आधार पर एक "शॉपिंग स्किल" चुनता है और अंत तक उसी पर टिका रहता है।
  • दोष: यदि रोबोट दुकान में प्रवेश करता है और लेआउट बदल गया है, या यदि वह डेयरी आइल (डेयरी विभाग) में फंस जाता है, तो वह मूल मानचित्र काम नहीं आता। रोबोट फंस जाता है क्योंकि वह अपनी वर्तमान स्थिति के आधार पर अपनी रणनीति को अपडेट नहीं कर पाता। यह एक ऐसे शहर में नेविगेट करने जैसा है जहाँ आप 10 साल पुराने नक्शे का उपयोग कर रहे हैं जबकि आप एक बिल्कुल नई इमारत के अंदर खड़े हैं।

समाधान: "स्मार्ट जीपीएस" दृष्टिकोण

लेखक SGDR का प्रस्ताव करते हैं, जो एक स्मार्ट जीपीएस की तरह काम करता है जो आपके वर्तमान स्थान और ट्रैफिक के आधार पर हर कुछ सेकंड में आपका मार्ग अपडेट करता है।

यहाँ तीन मुख्य तरीके दिए गए हैं जिनका उपयोग SGDR करता है:

1. कार्यों को "अध्यायों" में तोड़ना (स्लाइडिंग-विंडो एक्सट्रैक्शन)

एक पूरी यात्रा को एक विशाल, कठोर कहानी के रूप में सहेजने के बजाय, SGDR सफल यात्राओं को छोटे, पुन: प्रयोज्य अध्यायों में तोड़ देता है।

  • उपमा: कल्पना कीजिए कि आप केक बनाना सीख रहे हैं। पूरी रेसिपी को एक बड़े ब्लॉक के रूप में याद करने के बजाय, आप विशिष्ट "मूव्स" (चालें) सीखते हैं: "अंडा कैसे फोड़ें," "मैदा कैसे मिलाएं," और "कैसे जांचें कि यह बन गया है।"
  • यह कैसे काम करता है: जब रोबट सफलतापूर्वक कोई कार्य पूरा करता है, तो वह पीछे मुड़कर देखता है कि उसने क्या किया और उसे इन छोटे, पुन: प्रयोज्य "मूव्स" (सब-प्रोसीजर) में विभाजित कर देता है। यह इसे बाद में किसी अन्य बेकिंग कार्य के बीच में भी केवल "अंडा फोड़ने" वाला मूव निकालने की अनुमति देता है।

2. "द्विभाषी" स्किल कार्ड (टेक्स्ट-कोड रिप्रेजेंटेशन)

रोबोट द्वारा सीखा गया प्रत्येक "मूव" एक दो-भाग वाले कार्ड के रूप में संग्रहीत किया जाता है:

  • भाग A (विवरण): साधारण अंग्रेजी में एक सरल वाक्य (जैसे, "लॉगिन बटन पर क्लिक करें")। यह रोबोट को सही कार्ड ढूंढने में मदद करता है।
  • भाग B (कोड): क्रिया करने के लिए वास्तविक कंप्यूटर निर्देश।
  • महत्व: यह सुनिश्चित करता है कि रोबोट केवल यह न पढ़े कि क्या करना है; उसके पास तुरंत करने के लिए वास्तविक टूल भी हो।

3. "कॉन्टेक्स्ट-अवेयर" खोज (स्टेट-ग्राउंडेड डायनेमिक रिट्रीवल)

हर बार जब रोबोट एक कदम उठाता है, तो वह केवल यह नहीं पूछता कि "मेरा लक्ष्य क्या है?" बल्कि वह यह भी पूछता है कि "मैं अभी कहाँ हूँ?"

  • पुराना तरीका: "मुझे दूध खरीदना है।" -> "दुकान जाओ" स्किल प्राप्त करता है। (यहीं रुक जाता है)।
  • SGDR का तरीका:
    • चरण 1: "मुझे दूध खरीदना है।" -> "दुकान जाओ" प्राप्त करता है।
    • चरण 2: (रोबोट दुकान के प्रवेश द्वार पर पहुँचता है)। "मैं अब प्रवेश द्वार पर हूँ, और दरवाजा बंद है।" -> "दरवाजा अनलॉक करें" स्किल प्राप्त करता है।
    • चरण 3: (रोबोट अंदर है)। "मैं डेयरी आइल में हूँ।" -> "दूध उठाएं" स्किल प्राप्त करता है।

रोबोट न केवल अपने मूल लक्ष्य के आधार पर, बल्कि उस वर्तमान वेबपेज के आधार पर भी अपने "स्किल लाइब्रेरी" का निरंतर पुनर्मूल्यांकन करता है जिसे वह देख रहा है।

परिणाम: क्या यह काम करता है?

शोधकर्ताओं ने WebArena (जिसमें शॉपिंग साइट्स, एडमिन पैनल, फोरम आदि शामिल हैं) नामक एक यथार्थवादी वेब सिमुलेशन पर इसका परीक्षण किया।

  • बेहतर सफलता दर: SGDR का उपयोग करने वाले रोबोटों ने पुराने "स्टैटिक मैप" तरीकों वाले रोबोटों की तुलना में काफी अधिक कार्य हल किए।
    • एक शक्तिशाली AI मॉडल (GPT-4.1) के साथ, सफलता दर पिछले सबसे अच्छे तरीके की तुलना में लगभग 10% बढ़ गई।
    • एक छोटे, अधिक कुशल मॉडल के साथ भी, इसमें 10% का सुधार देखा गया।
  • तेज़ निष्पादन: रोबोट ने केवल अधिक बार सफलता ही नहीं प्राप्त की; उसने वहां पहुँचने के लिए कम कदम भी लिए। क्योंकि वह तुरंत सही "मूव" को पकड़ सकता था, इसलिए उसे अनुमान लगाने या गलत क्रियाएं करने में समय बर्बाद करने की आवश्यकता नहीं थी।

संक्षेप में

यह पेपर तर्क देता है कि वेब में महारत हासिल करने के लिए, रोबोट केवल शुरुआत में बनाई गई योजना पर निर्भर नहीं रह सकते। उन्हें अपनी वर्तमान स्थिति को देखने, उस सटीक क्षण के लिए उपयुक्त विशिष्ट "मूव" को खोजने और उसे निष्पादित करने में सक्षम होना चाहिए। SGDR वह सिस्टम है जो उन्हें बिल्कुल यही करने में सक्षम बनाता है, जिससे एक कठोर, एक-बार की योजना एक लचीले, चरण-दर-चरण मार्गदर्शक में बदल जाती है जो यात्रा के दौरान अनुकूलित होती रहती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →