← नवीनतम पेपर
🤖 AI

Speculative Rollback Correction for Quality-Diverse Web Agent Imitation

यह शोध पत्र स्पेकुलेटिव रोलबैक करेक्शन (SRC) का प्रस्ताव करता है, जो एक ब्रांच-लेवल इमिटेशन लर्निंग फ्रेमवर्क है जो फिक्स्ड-होरिज़ोन स्पेकुलेटिव सेगमेंट्स को निष्पादित करके, केवल पहले हानिकारक विचलन का पता चलने पर रोलबैक करके, और मजबूत वेब एजेंटों को प्रशिक्षित करने के लिए सत्यापित ट्राजेक्टरीज के क्वालिटी-डाइवर्सिटी आर्काइव को क्यूरेट करके विशेषज्ञ हस्तक्षेप और एजेंट स्वायत्तता के बीच के संतुलन को अनुकूलित करता है।

मूल लेखक: Longkun Hao, Hongyu Lin, Hao Li, Zhichao Yang, Haojie Hao, Dongshuo Huang, Haitao Yang, Hongyu Ge, Ming jie Xie, Yanjun Wu, Zi Hao Yin, Yan Bai, Yihang Lou

प्रकाशित 2026-06-12
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Longkun Hao, Hongyu Lin, Hao Li, Zhichao Yang, Haojie Hao, Dongshuo Huang, Haitao Yang, Hongyu Ge, Ming jie Xie, Yanjun Wu, Zi Hao Yin, Yan Bai, Yihang Lou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल भूलभुलैया (जैसे कि कोई वेबसाइट या कंप्यूटर डेस्कटॉप) में नेविगेट करना सिखा रहे हैं ताकि वह एक विशिष्ट खजाना खोज सके। इस रोबोट के पास एक मानव शिक्षक है जो रास्ता पूरी तरह से जानता है।

यह शोध पत्र इस रोबोट को सिखाने का एक नया तरीका पेश करता है जिसे स्पेक्युलेटिव रोलबैक करेक्शन (Speculative Rollback Correction - SRC) कहा जाता है। यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ समझाया गया है:

समस्या: "एक गलती" का जाल

पुराने तरीके (जिसे "इमिटेशन लर्निंग" कहा जाता है) में, रोबोट शिक्षक के हर कदम की नकल करने की कोशिश करता है।

  • समस्या: यदि रोबोट शुरुआत में ही कोई छोटी सी गलती कर देता है (जैसे गलत बटन पर क्लिक करना), तो वह भटक जाता है। उस बिंदु के बाद, रोबोट उस "परफेक्ट पाथ" को नहीं देख रहा होता है जिसे शिक्षक ने चाहा था; बल्कि वह उस गड़बड़ी को देख रहा होता है जो उसने खुद बनाई है।
  • दुविधा:
    • यदि शिक्षक रोबोट को हर एक सेकंड सुधारता है, तो रोबोट एक ऐसा रोबोट बन जाएगा जो खुद कभी नहीं सोच सकता। वह बस निर्देशों का इंतजार करता रहेगा और यदि शिक्षक वहां नहीं है, तो वह फंस जाएगा।
    • यदि शिक्षक रोबोट को बिल्कुल अंत तक सुधारने के लिए इंतजार करता है, तो रोबोट रास्ते से इतना दूर भटक सकता है कि मूल रास्ता बेकार हो जाए। रोबोट को फिर से शून्य से शुरुआत करनी होगी, जिससे समय बर्बाद होगा।

समाधान: "स्पेक्युलेटिव ब्रांच" रणनीति

यह एक हाइकिंग गाइड और एक स्काउट की तरह है:

  1. स्पेक्युलेटिव रन (Speculative Run): गाइड से हर कदम पर निर्देश मांगने के बजाय, रोबोट (स्काउट) को कुछ दूरी तक (मान लीजिए 3 कदम) अपने आप आगे बढ़ने की अनुमति दी जाती है। यह "स्पेक्युलेटिव ब्रांच" है।
  2. चेकपॉइंट रिव्यू (Checkpoint Review): उन 3 कदमों के बाद, गाइड स्काउट के रास्ते की जांच करता है।
    • स्थिति अ (अच्छा रास्ता): स्काउट ने एक वैध शॉर्टकट या खजाने तक पहुँचने का कोई दूसरा सही रास्ता खोज लिया। गाइड कहता है, "बहुत बढ़िया, चलते रहो!" रोबंतु सीखता है कि यह नया रास्ता भी वैध है।
    • स्थिति ब (बुरा रास्ता): स्काउट किसी डेड एंड (बंद रास्ते) या लूप में फंस गया। गाइड कहता है, "यहीं रुक जाओ।"
  3. रोलबैक (Rollback): यही असली जादू है। गाइड रोबोट को पूरी हाइकिंग फिर से शुरू करने के लिए मजबूर नहीं करता है। इसके बजाय, गाइड समय को ठीक उसी क्षण पर पीछे ले जाता है (रोल बैक करता है) जब गलती हुई थी।
  4. करेक्शन (Correction): गाइड रोबोट को उस एक विशिष्ट गलती को सुधारने के लिए एक निर्देश देता है। फिर, रोबोट उस सुधारे हुए स्थान से आगे बढ़ता है और फिर से प्रयास करता है।

यह बेहतर क्यों है?

यह तरीका तीन बड़ी समस्याओं को हल करता है:

  • यह समय बचाता है: केवल खराब हिस्से को पीछे ले जाकर, रोबोट उन अच्छे हिस्सों को दोबारा करने में समय बर्बाद नहीं करता जो उसने पहले ही सही ढंग से किए थे।
  • यह रचनात्मकता को बढ़ावा देता है: रोबोट को केवल शिक्षक के सटीक पथ का पालन करने के लिए मजबूर नहीं किया जाता है। यदि रोबोट समस्या को हल करने का कोई अन्य वैध तरीका ढूंढ लेता है (जैसे माउस क्लिक के बजाय कीबोर्ड शॉर्टकट का उपयोग करना), तो गाइड उसे स्वीकार कर लेता है। यह एक ही समस्या को हल करने के कई अलग-अलग सफल तरीकों का एक "लाइब्रेरी" बनाता है, न कि केवल एक कठोर तरीका।
  • यह गुणवत्ता को फ़िल्टर करता है: अंत में, एक सख्त "वेरिफायर" (जैसे कि अंतिम परीक्षा का निरीक्षक) यह जांचता है कि क्या रोबोट ने वास्तव में खजाना खोजा है। यदि रोबोट ने खजाना खोज लिया है लेकिन बहुत लंबा, घुमावदार और अक्षम रास्ता अपनाया है, तो उस डेटा को हटा दिया जाता है। केवल कुशल और सफल रास्तों को ही रखा जाता है ताकि अगले दौर में रोबोट को सिखाया जा सके।

परिणाम

इस शोध पत्र का परीक्षण जटिल वेब और डेस्कटॉप कार्यों (जैसे फॉर्म भरना या मेनू नेविगेट करना) पर किया गया।

  • रोबोट पुराने तरीकों की तुलना में अपनी गलतियों से उबरने में बहुत बेहतर तरीके से सीख गया।
  • इसने एक ही समस्या को हल करने के कई अलग-अलग समाधान खोजने की क्षमता विकसित की, जिससे यह अधिक लचीला और मजबूत बना।
  • प्रभावी ढंग से सीखने के लिए इसे पुराने तरीकों की तुलना में कम "शिक्षक हस्तक्षेप" (कम मानवीय सहायता) की आवश्यकता पड़ी।

संक्षेप में: SRC रोबोट को अपने आप कुछ कदम चलने, गलती होने पर समय को पीछे ले जाकर केवल उस विशिष्ट कदम को सुधारने, और पहेली को हल करने के लिए खोजे गए सभी अलग-अलग सफल तरीकों का एक संग्रह रखने के लिए सिखाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →