← नवीनतम पेपर
🤖 machine learning

WARC-Bench: Web Archive Based Benchmark for GUI Subtask Executions

यह शोध पत्र WARC-Bench प्रस्तुत करता है, जो जटिल GUI उप-कार्यों (subtasks) पर मल्टीमॉडल AI एजेंटों का मूल्यांकन करने के लिए वेब आर्काइव (Web ARChive) फाइलों का उपयोग करने वाला एक नया बेंचमार्क है, जो यह दर्शाता है कि जहाँ वर्तमान फ्रंटियर मॉडल संघर्ष करते हैं, वहीं ओपन-सोर्स मॉडल प्रतिस्पर्धी प्रदर्शन प्राप्त करने के लिए सुपरवाइज्ड फाइन-ट्यूनिंग और सत्यापन योग्य पुरस्कारों (verifiable rewards) के साथ सुदृढीकरण शिक्षण (reinforcement learning) के माध्यम से महत्वपूर्ण सुधार करते हैं।

मूल लेखक: Sanjari Srivastava, Gang Li, Cheng Chang, Rishu Garg, Manpreet Kaur, Charlene Y. Lee, Yuezhang Li, Yining Mao, Ignacio Cases, Yanan Xie, Peng Qi

प्रकाशित 2026-05-20✓ Author reviewed
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sanjari Srivastava, Gang Li, Cheng Chang, Rishu Garg, Manpreet Kaur, Charlene Y. Lee, Yuezhang Li, Yining Mao, Ignacio Cases, Yanan Xie, Peng Qi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कंप्यूटर का उपयोग करना सिखा रहे हैं। अधिकांश पिछले परीक्षणों में रोबोट से दो में से एक काम करने के लिए कहा जाता था: या तो स्क्रीन पर एक अकेले बटन की ओर इशारा करना ("लाल बटन पर क्लिक करें") या एक बहुत ही विशाल, जटिल यात्रा की योजना बनाना ("चार लोगों के परिवार के लिए उड़ानें, होटल और कार किराए पर लेना सहित, $2,000 से कम में एक छुट्टी बुक करें")।

इस शोध पत्र के लेखकों ने इनके बीच के एक बड़े अंतर को पहचाना। उन्होंने देखा कि एक रोबोट को वह छुट्टी बुक करने से पहले, उसे बीच के छोटे, पेचीदा चरणों में महारत हासिल करनी होगी: जैसे किसी विशिष्ट तिथि को खोजने के लिए सूची को स्क्रॉल करना, बजट को समायोजित करने के लिए स्लाइडर को खींचना, या पहले से लिखे गए टेक्स्ट को गलती से हटाए बिना एक फॉर्म भरना। वे इन्हें "GUI सबटास्क" (GUI subtasks) कहते हैं।

यहाँ उनके कार्य, WARC-Bench का एक सरल विवरण दिया गया है:

1. समस्या: "लुप्त मध्य" (The Missing Middle)

एक जटिल वेब कार्य को केक बनाने के उदाहरण से समझें।

  • विजुअल ग्राउंडिंग (Visual Grounding): "अंडा उठाओ।" (बहुत सरल)।
  • लॉन्ग-होरिज़न नेविगेशन (Long-Horizon Navigation): "केक बनाओ, उस पर फ्रॉस्टिंग लगाओ और पार्टी में पहुँचा दो।" (बहुत जटिल, बहुत अधिक चर/variables)।
  • लुप्त मध्य (The Missing Middle): "अंडे को बिना छिलका गिराए कटोरे में तोड़ो," या "बैटर को तब तक फेंटो जब तक वह चिकना न हो जाए।"

लेखकों का तर्क है कि वर्तमान AI रोबोट इन "मध्यवर्ती चरणों" में विफल हो रहे हैं। वे शायद जानते हैं कि केक क्या है, लेकिन उन्हें रसोई के उपकरणों की विशिष्ट, बारीक क्रियाओं (mechanics) के साथ संघर्ष करना पड़ता है।

2. समाधान: एक "टाइम-ट्रैवलिंग" टेस्ट किचन

इन रोबोटों का परीक्षण करने के लिए, टीम ने WARC-Bench बनाया।

आमतौर पर, वास्तविक इंटरनेट पर रोबोटों का परीक्षण करना अराजक होता है। वेबसाइटें बदल जाती हैं, पॉप-अप आते हैं, और सर्वर क्रैश हो जाते हैं। इसे ठीक करने के लिए, टीम ने WARC फाइलों (वेब आर्काइव्स) का उपयोग किया।

  • उपमा: कल्पना कीजिए कि आप एक वेबसाइट का एक सटीक, जमा हुआ स्नैपशॉट ले रहे हैं, जिसमें उसके सभी बटन, स्क्रिप्ट और चित्र शामिल हैं। आप इस स्नैपशॉट को एक "टाइम कैप्सूल" में रख देते हैं।
  • यह कैसे काम करता है: जब वे एक रोबोट का परीक्षण करते हैं, तो वे उसे लाइव इंटरनेट पर नहीं भेजते। वे उसे इस "टाइम कैप्सूल" में भेजते हैं। रोबोट इस जमी हुई, आदर्श प्रतिलिपि के साथ इंटरैक्ट करता है। यह वेब ब्राउज़रों के लिए एक फ्लाइट सिम्युलेटर की तरह है: सुरक्षित, दोहराने योग्य और हर बार बिल्कुल एक जैसा।

उन्होंने इस सिम्युलेटर में 438 अलग-अलग "मिनी-चैलेंज" बनाए, जैसे "कैलेंडर पर मार्च 21 चुनना" या "कीमत खोजने के लिए नीचे स्क्रॉल करना।"

3. परिणाम: यहाँ तक कि "सबसे स्मार्ट" रोबोट भी संघर्ष करते हैं

उन्होंने इन मिनी-चैलेंजों पर दुनिया के सबसे उन्नत AI मॉडल्स (जैसे Claude 4.0 और GPT-5) का परीक्षण किया।

  • वास्तविकता की जाँच: यहाँ तक कि सबसे स्मार्ट रोबोट भी इन सरल कार्यों को केवल 65% सही कर पाते हैं।
  • उपमा: यह एक बुद्धिमान इंसान को एक विशिष्ट गांठ बांधने या टैक्स फॉर्म भरने के लिए टेस्ट देने जैसा है। यदि निर्देश पेचीदा हैं या इंटरफ़ेस भ्रमित करने वाला है, तो बुद्धिमान लोग भी गलतियाँ करते हैं। रोबोट वेबसाइट के "माहौल को पढ़ने" (read the room) में विफल हो रहे हैं।

4. समाधान: "वीडियो गेम्स" के साथ प्रशिक्षण

लेखक यह देखना चाहते थे कि क्या वे ओपन-सोर्स रोबोट्स (जो आमतौर पर कमजोर होते हैं) को बेहतर बनाने के लिए सिखा सकते हैं। उन्होंने दो प्रशिक्षण विधियों का उपयोग किया:

  1. सुपरवाइज्ड फाइन-ट्यूनिंग (SFT): रोबोट को हजारों उदाहरण दिखाना कि इंसानों ने सफलतापूर्वक ये कार्य कैसे किए, जैसे किसी छात्र को हल किया हुआ गणित का सवाल दिखाना।
  2. वेरिफिएबल रिवॉर्ड्स के साथ रीइन्फोर्समेंट लर्निंग (RLVR): यह एक वीडियो गेम की तरह है। वे रोबोट को कार्य करने देते हैं। यदि वह सफल होता है, तो उसे एक "पॉइंट" (पुरस्कार) मिलता है। यदि वह विफल होता है, तो उसे शून्य अंक मिलते हैं। रोबलेट हजारों गेम खेलकर सीखता है, यह समझते हुए, "ओह, पिछली बार मैंने गलत बटन दबाया था, मुझे ऐसा नहीं करना चाहिए।"

परिणाम:
इन सिंथेटिक (नकली लेकिन यथार्थवादी) वेबसाइटों पर इस "वीडियो गेम" प्रशिक्षण पद्धति का उपयोग करके, उनका ओपन-सोर्स मॉडल एक कम स्कोर से उछलकर 52.3% पर पहुँच गया। यह प्रभावशाली है क्योंकि इसने इन विशिष्ट कार्यों पर कई महंगे, क्लोज्ड-सोर्स "सुपर-ब्रेन" को भी पीछे छोड़ दिया।

5. यह क्यों मायने रखता है

यह शोध पत्र निष्कर्ष निकालता है कि यदि आप चाहते हैं कि एक रोबोट बड़े, जटिल कार्यों (जैसे आपकी छुट्टी बुक करना) में अच्छा हो, तो आपको पहले यह सुनिश्चित करना होगा कि वह छोटे, उबाऊ कार्यों (जैसे सही तारीख पर क्लिक करना) में अच्छा हो।

उन्होंने पाया कि इन छोटे, विशिष्ट उप-कार्यों (subtasks) को संभालने की एक रोबोट की क्षमता यह बताने के लिए एक बहुत मजबूत भविष्यवक्ता है कि वह बड़े, जटिल कार्यों को कितनी अच्छी तरह संभालेगा। यदि एक रोबोट ड्रॉपडाउन मेनू को नेविगेट नहीं कर सकता, तो वह शायद यात्रा की योजना नहीं बना पाएगा।

संक्षेप में: लेखकों ने एक सुरक्षित, समय-जमा हुआ प्लेग्राउंड बनाया ताकि यह परीक्षण किया जा सके कि रोबोट वेबसाइट का उपयोग करने के छोटे, पेचीदा विवरणों को कितनी अच्छी तरह संभाल सकते हैं। उन्होंने पाया कि सर्वश्रेष्ठ रोबोट भी इन विवरणों में खराब हैं, लेकिन उन्हें "वीडियो गेम" खेलकर बहुत बेहतर बनाया जा सकता है जहाँ उन्हें सही करने के लिए अंक मिलते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →