WebForge: Breaking the Realism-Reproducibility-Scalability Trilemma in Browser Agent Benchmark
वेबफोर्ज (WebForge) एक पूर्णतः स्वचालित, चार-एजेंट फ्रेमवर्क पेश करता है जो ब्राउज़र एजेंट मूल्यांकन में यथार्थवाद-पुनरुत्पादकता-स्केलेबिलिटी (realism-reproducibility-scalability) त्रिशंकु (trilemma) को हल करता है, जो समग्र स्कोर से परे सूक्ष्म मॉडल क्षमताओं को प्रकट करने के लिए बहु-आयामी कठिनाई नियंत्रणों के साथ एक स्केलेबल, पुनरुत्पादक बेंचमार्क तैयार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ WebForge पेपर का स्पष्टीकरण दिया गया है, जिसे सरल, रोज़मर्रा की भाषा और कुछ रचनात्मक उपमाओं (analogies) के साथ अनुवादित किया गया है।
बड़ी समस्या: AI ब्राउज़र्स के परीक्षण का "त्रिशंकु" (Trilemma)
कल्पना कीजिए कि आप एक नई सेल्फ-ड्राइविंग कार का परीक्षण करना चाहते हैं। आपके पास इसे टेस्ट करने के लिए तीन विकल्प हैं, लेकिन प्रत्येक में एक घातक दोष है:
- असली हाईवे: आप कार को वास्तविक शहर की सड़कों पर चलाने देते हैं।
- फायदे: यह बिल्कुल असली अनुभव है।
- नुकसान: सड़क हर दिन बदलती है (निर्माण कार्य, नए संकेत), इसलिए आप परीक्षण को ठीक से दोहरा नहीं सकते। साथ ही, यदि कार दुर्घटनाग्रस्त हो जाती है, तो यह महंगा और खतरनाक है।
- खाली पार्किंग लॉट: आप लैब में एक आदर्श, स्थिर कोर्स बनाते हैं।
- फायदे: आप एक ही परीक्षण को हज़ार बार बिल्कुल समान तरीके से चला सकते हैं।
- नुकसान: यह बहुत आसान है। यहाँ न तो गड्ढे हैं, न ही अचानक राहगीर आते हैं, और न ही अचानक बारिश होती है। कार यहाँ जीनियस लग सकती है, लेकिन असली दुनिया में बुरी तरह विफल हो सकती है।
- मैनुअल कोर्स: आप हर टेस्ट के लिए एक कस्टम बाधा दौड़ (obstacle course) बनाने के लिए लोगों की एक टीम को काम पर रखते हैं।
- फायदे: आप इसे बिल्कुल वैसा बना सकते हैं जैसा आप चाहते हैं।
- नुकसान: इसमें बहुत समय लगता है और बहुत पैसा खर्च होता है। आप यह देखने के लिए पर्याप्त कारें टेस्ट नहीं कर सकते कि वास्तव में कौन सबसे अच्छा है।
"त्रिशंकु" (The Trilemma): AI वेब ब्राउज़र्स (ऐसे एजेंट जो आपके लिए इंटरनेट सर्फ करते हैं) के मौजूदा परीक्षण इसी जाल में फंसे हुए हैं। वे या तो अवास्तविक (बहुत साफ-सुथरे) हैं, या अपुनरावृत्ति योग्य (वेबसाइटें बहुत तेज़ी से बदल जाती हैं), या अपरिवर्धनीय (बनाने में बहुत महंगे हैं)।
समाधान: WebForge (एक "वीडियो गेम फैक्ट्री")
लेखकों ने WebForge बनाया है, जो एक पूरी तरह से स्वचालित फैक्ट्री है जो इस समस्या को हल करती है। AI को बदलते हुए असली इंटरनेट पर टेस्ट करने के बजाय, WebForge हर एक टेस्ट के लिए इंटरनेट का एक पूर्ण, आत्मनिर्भर वीडियो गेम संस्करण बनाता है।
WebForge को एक 4-सदस्यीय निर्माण दल (construction crew) के रूप में समझें जो एक रोबोट द्वारा पहेली सुलझाने के लिए एक छोटा, इंटरैक्टिव वेबसाइट बनाता है। यहाँ यह दल कैसे काम करता है:
1. आर्किटेक्ट (प्लान एजेंट - Plan Agent)
यह एजेंट बॉस है। यह कठिनाई सेटिंग (आसान, मध्यम, कठिन) और एक विषय (जैसे "शादी का वेन्यू बुक करना" या "लैपटॉप खरीदना") को देखता है। यह एक ब्लूप्रिंट तैयार करता है: "ठीक है, रोबोट को 5 बार क्लिक करना होगा, एक चार्ट देखना होगा और कुल कीमत की गणना करनी होगी। सुनिश्चित करें कि यह चुनौतीपूर्ण हो लेकिन हल करने योग्य हो।"
2. बिल्डर (जेनरेशन एजेंट - Generation Agent)
यह एजेंट ब्लूप्रिंट लेता है और वास्तव में वेबसाइट बनाता है।
- जादू: यह केवल नकली टेक्स्ट नहीं बनाता। यह असली दिखने के लिए वास्तविक इंटरनेट से असली तस्वीरें, असली उत्पाद की कीमतें और असली डिज़ाइन शैलियाँ लेता है।
- जाल: यह उत्तर को एक लॉक किए गए बॉक्स (एन्क्रिप्शन) में छिपा देता है ताकि रोबोट कोड देखकर नकल न कर सके।
3. रियलिस्ट (रिफाइनमेंट एजेंट - Refinement Agent)
यह सबसे महत्वपूर्ण चरण है। बिल्डर ने एक "साफ" वेबसाइट बनाई थी। रियलिस्ट आता है और इसे वास्तविक बनाने के लिए इसमें गड़बड़ कर देता है।
- यह एक पॉप-अप विज्ञापन जोड़ता है जिसमें लिखा होता है "रुको, क्या आप कुकीज़ चाहते हैं?"
- यह धीमे इंटरनेट कनेक्शन का सिमुलेशन जोड़ता है।
- यह एक "शेड्यूल अ टूर" पॉप-अप जोड़ता है जो स्क्रीन को ब्लॉक कर देता है।
- क्यों? असली वेबसाइटें परेशान करने वाली होती हैं। यदि एक AI पॉप-अप को नहीं संभाल सकता, तो वह असली दुनिया के लिए तैयार नहीं है।
4. इंस्पेक्टर (वैलिडेशन एजेंट - Validation Agent)
टेस्ट जारी करने से पहले, यह एजेंट एक "बीटा टेस्टर" के रूप में कार्य करता है। यह खुद एक वास्तविक वेब ब्राउज़र का उपयोग करके पहेली को हल करने की कोशिश करता है।
- यदि वेबसाइट खराब है, तो इंस्पेक्टर फेल हो जाता है।
- यदि उत्तर ढूँढना असंभव है, तो इंस्पेक्टर फेल हो जाता है।
- केवल तभी जब इंस्पेक्टर सफलतापूर्वक इसे हल कर लेता है, इस कार्य को अंतिम परीक्षा में जोड़ा जाता है।
परिणाम: WebForge-Bench
इस फैक्ट्री का उपयोग करके, उन्होंने 934 अलग-अलग कार्यों के साथ एक विशाल परीक्षा बनाई है: WebForge-Bench।
- 7 डोमेन: जैसे "शॉपिंग," "ट्रैवल," "ऑफिस वर्क," आदि।
- 3 कठिनाई स्तर: "एक बटन क्लिक करने" से लेकर "पॉप-अप्स को अनदेखा करते हुए एक जटिल गणितीय समस्या को हल करने" तक।
उन्होंने क्या सीखा?
उन्होंने इस नई परीक्षा पर 14 अलग-अलग AI मॉडल (जैसे GPT-5, Gemini, Claude) का परीक्षण किया और कुछ आश्चर्यजनक बातें पाईं:
- "एक-आकार-सभी-के-लिए" (One-Size-Fits-All) स्कोर एक झूठ है:
यदि आप केवल औसत स्कोर देखते हैं, तो आपको लग सकता है कि दो AI बराबर हैं। लेकिन जब आप विवरण देखते हैं, तो एक "शॉपिंग" में बहुत अच्छा हो सकता है लेकिन "ऑफिस वर्क" में बहुत बुरा। यह कहने जैसा है कि कोई व्यक्ति "खेलों में अच्छा है" बिना यह जाने कि वह एक चैंपियन तैराक है लेकिन एक मील दौड़ नहीं सकता। - विजुअल्स (दृश्य) आपकी सोच से कहीं अधिक महत्वपूर्ण हैं:
जब उन्होंने तस्वीरें (स्क्रीनशॉट) हटा दीं और केवल AI को टेक्स्ट कोड दिया, तो AI का प्रदर्शन 15-16% खराब हो गया। यह साबित करता है कि वेब कार्यों के लिए, पेज को पढ़ने के साथ-साथ उसे देखना भी उतना ही महत्वपूर्ण है। - "कठिन" चीजें वाकई कठिन हैं:
सबसे आसान कार्य (कीमत ढूँढना) सभी के लिए आसान थे। लेकिन सबसे कठिन कार्य (जटिल नियमों और पॉप-अप्स के साथ फ्लाइट बुक करना) ने जीनियस और साधारण AI के बीच का अंतर स्पष्ट कर दिया। सबसे अच्छे AI ने कठिन कार्यों में 58% स्कोर किया; सबसे खराब ने 2%।
यह क्यों मायने रखता है
WebForge एक गेम-चेंजर है क्योंकि यह शोधकर्ताओं को अनुमति देता है:
- निष्पक्ष परीक्षण: सभी को बिल्कुल एक ही "गेम" लेवल मिलता है।
- वास्तविक परीक्षण: "गेम्स" में पॉप-अप्स और शोर है, ठीक वैसे ही जैसे असली वेब पर होता है।
- अनंत परीक्षण: वे इंसानों को काम पर रखे बिना स्वचालित रूप से हजारों नए टेस्ट जेनरेट कर सकते हैं।
संक्षेप में: WebForge ने AI ड्राइवरों को बदलते हाईवे या एकदम खाली पार्किंग लॉट पर टेस्ट करने की कोशिश छोड़ दी। इसके बजाय, इसने एक ऐसा सिम्युलेटर बनाया है जो इतना वास्तविक, इतना दोहराने योग्य और इतना स्केलेबल है कि हम अंततः यह बता सकते हैं कि कौन सा AI वास्तव में असली दुनिया में गाड़ी चलाने के लिए तैयार है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।