WARC-Bench: Web Archive Based Benchmark for GUI Subtask Executions
यह शोध पत्र WARC-Bench प्रस्तुत करता है, जो जटिल GUI उप-कार्यों (subtasks) पर मल्टीमॉडल AI एजेंटों का मूल्यांकन करने के लिए वेब आर्काइव (Web ARChive) फाइलों का उपयोग करने वाला एक नया बेंचमार्क है, जो यह दर्शाता है कि जहाँ वर्तमान फ्रंटियर मॉडल संघर्ष करते हैं, वहीं ओपन-सोर्स मॉडल प्रतिस्पर्धी प्रदर्शन प्राप्त करने के लिए सुपरवाइज्ड फाइन-ट्यूनिंग और सत्यापन योग्य पुरस्कारों (verifiable rewards) के साथ सुदृढीकरण शिक्षण (reinforcement learning) के माध्यम से महत्वपूर्ण सुधार करते हैं।