WARC-Bench: Web Archive Based Benchmark for GUI Subtask Executions
본 논문은 복잡한 GUI 서브태스크에 대한 멀티모달 AI 에이전트를 평가하기 위해 웹 아카이브 파일을 활용한 새로운 벤치마크인 WARC-Bench 를 소개하며, 최첨단 모델들은 어려움을 겪는 반면 오픈소스 모델들은 검증 가능한 보상을 활용한 감독 미세조정과 강화학습을 통해 경쟁력 있는 성능을 달성함으로써 크게 개선됨을 보여줍니다.