← 최신 논문
💻 computer science

WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation

이 논문은 기존 벤치마크의 한계를 해결하기 위해 실제 시나리오에서 웹 에이전트 성능에 대한 더욱 포괄적이고 세밀한 평가를 제공하고자, 800개의 다양한 웹사이트에 걸친 1,550개의 태스크로 구성된 대규모 벤치마크인 WebRetriever와 새로운 NavEval 프레임워크 및 세 가지 상호 보완적인 평가 프로토콜을 소개한다.

원저자: Wei Dong, Tianyu Fu, Zhe Yu, Hanning Wang, Anyang Su, Zhizhou Fang, Yuyang Chen, Shuo Wang, Minghui Wu, Ping Jiang, Zhen Lei, Chenxu Zhao

게시일 2026-07-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Wei Dong, Tianyu Fu, Zhe Yu, Hanning Wang, Anyang Su, Zhizhou Fang, Yuyang Chen, Shuo Wang, Minghui Wu, Ping Jiang, Zhen Lei, Chenxu Zhao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

개요: "운전면허" 문제

당신이 로봇에게 자동차 운전을 가르치고 있다고 상상해 보세요. 과거의 연구자들은 교통량도, 보행자도, 날씨 변화도 없는 아주 작고 텅 빈 주차장에서 이 로봇들을 테스트했습니다. 로봇들은 그 테스트를 아주 훌륭하게 통과했습니다. 하지만 건설 구역, 헷갈리는 표지판, 난폭한 운전자들이 가득한 실제 고속도로에 그들을 내보내자마자 로봇들은 즉시 사고를 냈습니다.

이 논문은 "웹 에이전트"(당신을 대신해 인터넷을 탐색하는 AI)를 위한 현재의 테스트들이 바로 그 텅 빈 주차장과 같다고 주장합니다. 너무 작고, 너무 단순하며, 실제 웹의 복잡한 현실을 반영하지 못한다는 것입니다. 저자들은 이 AI 운전자들이 실제로 실제 도로의 교통량을 감당할 수 있는지 확인하기 위해 WebRetriever라는 거대하고 새로운 테스트를 구축했습니다.


1. 새로운 테스트 트랙: WebRetriever

저자들은 AI 에이전트를 위한 거대한 장애물 코스를 만들었습니다.

  • 과거의 방식: 이전의 테스트들은 아마 4개에서 100개의 웹사이트 정도를 포함했을 것입니다. 그것은 마치 단 하나의 거리에서 운전 테스트를 하는 것과 같았습니다.
  • 새로운 방식 (WebRetriever): 그들은 800개의 서로 다른 웹사이트1,550개의 구체적인 작업이 있는 트랙을 구축했습니다.
    • 다양성: 단순히 쇼핑만 하는 것이 아닙니다. 주식 시장 확인, 법률 문서 읽기, 정부 포털 탐색과 같은 전문적인 작업들이 포함되어 있습니다.
    • 비유: 만약 과거의 테스트가 조용한 막다른 골목에서의 운전 테스트였다면, WebRetriever는 복잡한 교차로, 일방통행 도로, 공사 우회로가 있는 출퇴근 시간대의 번잡한 도시를 통과하는 시승 테스트입니다.

2. 새로운 심판: NavEval

로봇 운전사를 어떻게 채점할까요? 인간이 모든 테스트 과정을 일일이 지켜보는 것은 너무 비용이 많이 들고 느립니다.

  • 과거의 방식: 이전의 자동화된 심판들은 자동차의 최종 사진만을 보는 심판과 같았습니다. "차가 결승선에 도착했는가?" 만약 그렇다면 합격입니다. 하지만 이는 운전자가 결승선에 도착하기 위해 신호 세 개를 무시하거나 길을 잘못 들었을 가능성을 놓치게 됩니다.
  • 새로운 방식 (NavEval): 저자들은 NavEval이라는 더 똑똑한 심판을 만들었습니다. NavEval은 단순히 최종 사진을 보는 대신, 비행기의 블랙박스 기록 장치처럼 작동합니다.
    • 엔진 소리(네트워크 요청)를 듣습니다.
    • 스티어링 휠의 움직임(클릭 및 동작)을 관찰합니다.
    • GPS 기록(방문한 URL)을 확인합니다.
    • 결과: 이 심판은 매우 정확하여 인간 전문가와 90%의 일치율을 보입니다. 이 심판은 로봇이 "부정행위"를 했는지, 아니면 실제로 문제를 스스로 해결했는지를 구별해 낼 수 있습니다.

3. 세 가지 난이도 단계

이 논문은 난이도가 높아지는 비디오 게임처럼 에이전트를 테스트하는 세 가지 다른 방법을 소개합니다.

  • 레벨 1: "문 찾기" 테스트 (Protocol I)

    • 작업: "'Informed Consent(고지된 동의)'에 관한 페이지로 가시오."
    • 목표: 에이전트가 도움 없이 웹사이트를 탐색하여 올바른 페이지를 찾을 수 있는가?
    • 현실: 이 간단한 목표에도 불구하고, 대부분의 AI 에이전트는 실패했습니다. 그들은 링크의 미로 속에서 길을 잃었습니다.
  • 레벨 2: "지도와 함께" 테스트 (Protocol II)

    • 작업: "'Informed Consent'에 관한 페이지로 가시오."
    • 반전: 이번에는 에이전트에게 단계별 지침서(음성 안내가 있는 GPS와 같은)를 제공합니다.
    • 결과: 에이전트들의 성적이 좋아졌지만, 완벽하지는 않았습니다. 그들은 여전히 복잡한 지시사항을 완벽하게 따르는 데 어려움을 겪었으며, 이는 그들이 복잡한 방향을 이해하기 위해 더 많은 훈련이 필요함을 보여줍니다.
  • 레벨 3: "풀 미션" 테스트 (Protocol III)

    • 작업: "해당 페이지로 가서, 문서를 읽고, 세 번째 단락이 정확히 무엇이라고 말하는지 알려주시오."
    • 반전: 단순히 페이지에 도착하는 것만으로는 부족합니다. 에이전트는 특정 정보를 읽고, 이해하고, 추출해야 합니다.
    • 현실: 여기서 에이전트들은 정말 큰 어려움을 겪었습니다. 많은 에이전트가 페이지는 찾을 수 있었지만, 세부 내용을 읽지는 못했습니다. 이는 차를 주차할 수는 있지만 주차 위반 딱지를 읽지는 못하는 운전자와 같습니다.

4. 충격적인 결과

저자들이 테스트를 실행했을 때, 그 결과는 AI 업계에 겸허함을 안겨주었습니다.

  • 주차장 vs 고속도로: 기존의 쉬운 테스트에서 90%의 점수를 받았던 에이전트들이 이 새로운 현실적인 테스트에서는 20% 미만의 점수를 기록했습니다.
  • "도착"의 함정: 에이전트가 올바른 웹페이지에 도달했다고 해서 반드시 업무를 마친 것은 아닙니다. 가장 어려운 테스트에서, 에이전트가 전체 작업(페이지 찾기 + 정답 추출)을 완료하는 데 성공한 비율은 약 **12%**에 불과했습니다.

요약

이 논문은 우리가 AI 웹 에이전트들을 "멸균된" 환경에서 테스트했기 때문에 그들의 능력을 과대평가해 왔다고 주장합니다. WebRetriever는 이러한 에이전트들이 실제 세상에서는 여전히 꽤 서투르다는 것을 보여주는 새롭고 거대하며 현실적인 테스트 장입니다. 그들은 때때로 올바른 문을 찾을 수는 있지만, 자주 길을 잃으며, 일단 도착한 후의 세부 사항을 읽는 데는 형편없습니다.

저자들은 또한 새로운, 매우 정확한 "심판"(NavEval)을 제공하여, 앞으로 인간이 모든 움직임을 지켜볼 필요 없이 이 에이전트들을 자동으로 테스트하고 그들이 얼마나 잘 수행하고 있는지 정확히 알 수 있도록 했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →