🤖 AI
When Web Agents Finish but Still Fail: Reproducible Triggers and Trace Diagnostics for Parallel Web Exploration
यह शोध पत्र 'पैरेलल वेबबेंच' (Parallel WebBench) का परिचय देता है, जो 1,679 सत्यापित रिकॉर्डों वाला एक बेंचमार्क है, ताकि लॉन्ग-होराइजन वेब एजेंटों में छिपी हुई विफलताओं का विश्लेषण और निदान किया जा सके, जो यह दर्शाता है कि हालांकि GRPO प्रशिक्षण कार्य पूरा करने की दरों में महत्वपूर्ण सुधार करता है, लेकिन यह संदर्भ-बद्ध लूप (context-bound loops), समयपूर्व समाप्ति (premature termination) और संश्लेषण पतन (synthesis collapse) जैसी निरंतर समस्याओं के कारण अंतिम शुद्धता में एक महत्वपूर्ण अंतर छोड़ देता है।
Aagam Sogani, Botao Rui, Swetha Vaidyanathan, Rishi Agarwal, Minghao Yan, Shivaram Venkataraman2026-06-23