← नवीनतम पेपर
💬 NLP

DynaWeb: Model-Based Reinforcement Learning of Web Agents

यह शोध पत्र DynaWeb को प्रस्तुत करता है, जो एक मॉडल-आधारित सुदृढीकरण लर्निंग (reinforcement learning) ढांचा है जो इंटरैक्शन को सिम्युलेट करने और सिंथेटिक प्रक्षेप पथ (trajectories) उत्पन्न करने के लिए एक सीखे हुए वर्ल्ड मॉडल का लाभ उठाकर स्वायत्त वेब एजेंटों को प्रशिक्षित करता है, जिससे लाइव इंटरनेट प्रशिक्षण की अक्षमताओं और जोखिमों को दूर किया जाता है और चुनौतीपूर्ण बेंचमार्क पर प्रदर्शन में महत्वपूर्ण सुधार किया जाता है।

मूल लेखक: Hang Ding, Peidong Liu, Junqiao Wang, Ziwei Ji, Meng Cao, Rongzhao Zhang, Lynn Ai, Eric Yang, Tianyu Shi, Lei Yu

प्रकाशित 2026-04-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hang Ding, Peidong Liu, Junqiao Wang, Ziwei Ji, Meng Cao, Rongzhao Zhang, Lynn Ai, Eric Yang, Tianyu Shi, Lei Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ DynaWeb पेपर का सरल, रोज़मर्रा की भाषा और उपमाओं (analogies) का उपयोग करके किया गया अनुवाद है।

🌐 समस्या: व्यस्त हाईवे पर गाड़ी चलाना सीखना

कल्प Imagine कीजिए कि आप एक रोबोट को किसी खास मंजिल (जैसे किराने की दुकान) तक पहुँचने के लिए एक व्यस्त शहर के बीचों-बीच कार चलाना सिखाना चाहते हैं।

अतीत में, इन "वेब एजेंट्स" (वे रोबट जो इंटरनेट ब्राउज़ करते हैं) को प्रशिक्षित करने के लिए, शोधकर्ता उन्हें असली इंटरनेट पर गाड़ी चलाने के लिए भेज देते थे।

  • समस्या: यह खतरनाक और महंगा है। यदि रोबोट कोई गलती करता है, तो वह गलती से ऐसी चीज़ खरीद सकता है जिसकी उसे ज़रूरत नहीं है, कोई फ़ाइल डिलीट कर सकता है, या एक ही लूप में फंस सकता है। यह एक छात्र को बिना किसी इंस्ट्रक्टर के, बिना किसी घड़ी के, सीधे ट्रैफिक वाले हाईवे पर गाड़ी चलाना सिखाने जैसा है। यह धीमा है, जोखिम भरा है, और आप इसे बार-बार नहीं कर सकते।

💡 समाधान: इंटरनेट के लिए एक "फ्लाइट सिम्युलेटर"

DynaWeb पेपर इन एजेंट्स को प्रशिक्षित करने का एक शानदार नया तरीका पेश करता है। असली हाईवे पर गाड़ी चलाने के बजाय, वे एक परफेक्ट फ्लाइट सिम्युलेटर बनाते हैं।

वे एक "वर्ल्ड मॉडल" (World Model) बनाते हैं—एक सुपर-स्मार्ट AI जो जानता है कि इंटरनेट कैसे काम करता है। यह एक वीडियो गेम इंजन की तरह है जो अनुमान लगा सकता है: "यदि मैं इस बटन पर क्लिक करता हूँ, तो यह मेनू खुलेगा। यदि मैं यह शब्द टाइप करता हूँ, तो यह सर्च रिजल्ट दिखाई देगा।"

अब, एजेंट इस सिम्युलेटर में लाखों बार अभ्यास कर सकता है बिना कभी असली कार को छुए या किसी वास्तविक दुर्घटना का जोखिम उठाए।

🧠 DynaWeb कैसे काम करता है: "सपनों" की प्रक्रिया (The "Dreaming" Process)

पेपर इसे "मॉडल-बेस्ड रीइन्फोर्समेंट लर्निंग" (Model-Based Reinforcement Learning) कहता है। आइए इसे एक रूपक (metaphor) के साथ समझते हैं:

  1. सपना देखने वाला (द वर्ल्ड मॉडल):
    कल्पना कीजिए कि एजेंट एक छात्र है। लाइब्रेरी (असली वेब) जाने के बजाय, छात्र अपनी आँखें बंद करता है और लाइब्रेरी के बारे में सपना देखता है।
  • "वर्ल्ड मॉडल" वह शिक्षक है जो छात्र को सपने को विज़ुअलाइज़ करने में मदद करता है। छात्र सोचता है, "मैं 'सर्च' बटन पर क्लिक करने जा रहा हूँ।" वर्ल्ड मॉडल कहता है, "ठीक है, तुम्हारे सपने में, सर्च रिजल्ट दिखाई दे रहे हैं। अब, तुम आगे क्या करोगे?"
  • छात्र अपने दिमाग में पूरी यात्रा का अभ्यास (एक "रोलआउट") सेकंडों में कर लेता है।
  1. सुरक्षा जाल (रियल एक्सपर्ट डेटा):
    शुद्ध सपना देखना जोखिम भरा हो सकता है। कभी-कभी, जब हम सपने देखते हैं, तो हम ऐसी चीज़ों की कल्पना कर लेते हैं जो असली नहीं होतीं (जैसे, सपने में देखना कि आप उड़ सकते हैं, लेकिन असल में आप नहीं उड़ सकते)।
  • इसे ठीक करने के लिए, DynaWeb असली एक्सपर्ट वीडियो को इसमें मिला देता है। कल्पना कीजिए कि छात्र एक मास्टर लाइब्रेरियन का वीडियो देख रहा है जो बिल्कुल सही तरीके से किताब ढूँढ रहा है।
  • प्रशिक्षण प्रक्रिया एक मिश्रण है: 50% सपना देखना (सिम्युलेटर में अभ्यास करना) और 50% मास्टर को देखना (असली, सफल मानवीय उदाहरणों से सीखना)। यह एजेंट को वास्तविकता से जोड़े रखता है जबकि उसे खुलकर अभ्यास करने की अनुमति भी देता है।
  1. सीखने का लूप (Learning Loop):
    एजेंट सपने में एक कार्य को हल करने की कोशिश करता है।
  • सफलता? उसे एक "गोल्ड स्टार" (रिवॉर्ड) मिलता है।
  • विफलता? वह सीखता है कि क्या नहीं करना है।
  • क्योंकि एजेंट एक वास्तविक सर्च करने के समय में हजारों बार सपने देख सकता है, इसलिए वह अविश्वसनीय रूप से तेज़ी से सीखता है।

🏆 परिणाम: यह क्यों मायने रखता है

शोधकर्ताओं ने इसका परीक्षण इंटरनेट के दो प्रमुख "ड्राइविंग टेस्ट" पर किया: WebArena (एक सिम्युलेटेड शहर) और WebVoyager (असली लाइव वेबसाइट्स)।

  • पुराना तरीका: असली वेब पर प्रशिक्षित एजेंट ठीक-ठाक थे, लेकिन धीमे और जोखिम भरे थे।
  • DynaWay: "ड्रीम सिम्युलेटर" (थोड़ी सी असली एक्सपर्ट मदद के साथ) में प्रशिक्षित एजेंट सबसे बेहतरीन ड्राइवर बन गया। इसने कई कार्यों में सबसे महंगे, क्लोज्ड-सोर्स मॉडल्स (जैसे GPT-4o) को भी पीछे छोड़ दिया।

🚀 मुख्य निष्कर्ष

DynaWeb यह साबित करता है कि आपको दुनिया में नेविगेट करना सीखने के लिए असली दुनिया को छूने की ज़रूरत नहीं है।

ठीक वैसे ही जैसे एक पायलट असली विमान उड़ाने से पहले सिम्युलेटर में प्रशिक्षण लेता है, वेब एजेंट्स अब सफलता के लिए "कल्पना" (imagine) कर सकते हैं। यह AI ट्रेनिंग को बनाता है:

  • सुरक्षित: कोई अनचाही खरीदारी या डेटा का नुकसान नहीं।
  • सस्ता: हर एक गलती के लिए महंगे सर्वर टाइम का भुगतान करने की आवश्यकता नहीं।
  • तेज़: एजेंट एक वास्तविक कार्य करने के समय में हजारों "क्या-होता-अगर" (what-if) परिदृश्यों से सीख सकते हैं।

संक्षेप में: DynaWeb AI एजेंट्स को सपने देखकर सीखने की अनुमति देता है, ताकि वे जागने पर पूरी तरह से परफॉर्म कर सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →