← 최신 논문
🤖 AI

When Web Agents Finish but Still Fail: Reproducible Triggers and Trace Diagnostics for Parallel Web Exploration

이 논문은 장기적 웹 에이전트(long-horizon web agents)의 숨겨진 실패를 분석하고 진단하기 위해 1,679개의 검증된 레코드로 구성된 벤치마크인 Parallel WebBench를 소개하며, GRPO 학습이 작업 완료율을 크게 향상시키지만 컨텍스트 제한 루프, 조기 종료, 합성 붕괴와 같은 지속적인 문제들로 인해 최종 정확도 측면에서 결정적인 격차를 남긴다는 점을 입증한다.

원저자: Aagam Sogani, Botao Rui, Swetha Vaidyanathan, Rishi Agarwal, Minghao Yan, Shivaram Venkataraman

게시일 2026-06-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Aagam Sogani, Botao Rui, Swetha Vaidyanathan, Rishi Agarwal, Minghao Yan, Shivaram Venkataraman

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매우 똑똑하고 의욕 넘치는 연구 보조원을 고용하여 정보를 수집하도록 시켰다고 상상해 보십시오. 당신은 그에게 컨퍼런스에 대한 구체적인 세부 사항(날짜, 발표자, 장소, 등록비)을 찾아달라고 요청했습니다. 그는 여러 웹 페이지를 열고 뛰어다닌 뒤, 깔끔하고 완벽하게 형식이 갖춰진 보고서를 들고 돌아옵니다. 그는 자신만만해 보이고, 보고서도 완성되었습니다.

하지만 당신이 보고서를 자세히 읽어보니, 그는 날짜의 절반을 놓쳤거나, 존재하지 않는 발표자를 지어냈거나, 올해의 장소를 작년의 장소와 혼동했다는 사실을 깨닫게 됩니다. 그는 과업을 "완수"했지만, 실제로 문제를 "해결"한 것은 아니었습니다.

이 논문, **"웹 에이전트가 끝냈지만 여전히 실패하는 이유(When Web Agents Finish but Still Fail)"**는 바로 이 문제에 대해 다룹니다. 이 연구는 질문에 답하기 위해 인터넷을 탐색하는 AI 에이전트를 연구합니다. 연구진은 에이전트들이 보고서를 '완성'하는 능력은 향상되고 있지만, 그 안에 담긴 정보가 실제로 정확하고 완전한지 확인하는 데는 여전히 서투르다는 것을 발견했습니다.

다음은 이들의 연구 결과를 쉬운 비유를 사용하여 정리한 내용입니다.

1. 새로운 테스트: "Parallel WebBench"

기존의 대부분의 AI 에이전트 테스트는 학생에게 특정 사실 하나를 찾는 법을 묻는 것과 같았습니다 (예: "프랑스의 수도는 어디인가?"). 그것을 찾으면 승리하는 방식입니다.

연구진은 Parallel WebBench라는 새로운 테스트를 구축했습니다. 이것은 학생에게 컨퍼런스에 대한 **복잡한 서류 뭉치(dossier)**를 작성하라고 요구하는 것과 더 비슷합니다. 학생은 다음을 찾아야 합니다:

  • 5개의 서로 다른 페이지에서 5명의 서로 다른 발표자 찾기.
  • 3개의 서로 다른 하위 페이지에서 3개의 서로 다른 날짜 찾기.
  • PDF 파일에서 규칙 목록 추출하기.

에이전트는 많은 곳을 방문해야 하고, 이 분리된 사실들을 모두 올바르게 유지하며, 이를 하나의 완벽한 답변으로 결합해야 합니다. 연구진은 모든 링크와 답변을 일일이 확인하여 "골드 스탠다드(정답)"가 정확한지 검증하며 1,679개의 이러한 복잡한 과업을 만들었습니다.

2. 훈련: "의욕 넘치는 인턴"

연구진은 GRPO(보상을 통한 시행착오라는 뜻의 복잡한 방식)라는 방법으로 AI 에이전트를 훈련시켰습니다. 그들은 세 가지 다른 "튜터"를 시도했습니다:

  • 인간 전용: AI가 인간이 정성껏 확인한 과업으로부터만 학습합니다.
  • 균형 잡힌 모델: 인간이 확인한 과업과 컴퓨터가 생성한 과업을 혼합합니다.
  • 합성 데이터 중심: AI가 주로 컴퓨터가 생성한 과업으로부터 학습합니다.

결과: "합성 데이터 중심" 에이전트는 완성하기의 챔피언이 되었습니다. 기존 모델들은 종종 포기하거나 시간 초과가 발생했던 반면(완성율 50%), 이 모델은 거의 항상 보고서를 제출했습니다(96%).

함정: 에이전트가 보고서를 제출했다고 해서 그 보고서가 좋다는 뜻은 아니었습니다.

  • 완성율(Completion Rate): 50%에서 96%로 상승 (훌륭함!).
  • 실제 정확도(Actual Accuracy): 22%에서 33%로 상승 (여전히 나쁨).

에이전트는 답변이 대부분 틀렸음에도 불구하고, 매우 자신 있게 "여기 제 답이 있습니다!"라고 말하는 법을 배웠습니다.

3. 에이전트가 "가짜로 해내는" 세 가지 방식

연구진은 에이전트의 "트레이스(trace, 단계별 로그)"를 조사하여, 에이전트가 작업을 마쳤음에도 실패하는 세 가지 구체적인 방식을 찾아냈습니다.

A. "회전하는 바퀴" 루프 (문맥에 갇힌 검색 루프)

  • 비유: 당신이 에이전트에게 특정 인물의 직함을 찾으라고 요청했다고 가정해 봅시다. 에이전트는 "편집자(Editor)"를 검색하여 페이지를 찾았지만, 정확한 직함을 발견하지 못합니다. 그래서 에이전트는 다시 "편집자", 그다음엔 "편집 위원회", 그다음엔 "편집장" 등을 검색하며 같은 과정을 반복합니다. 에이전트는 정답이 이미 찾은 텍스트 안에 숨겨져 있음에도 불구하고, 단어가 조금씩 바뀌기를 기대하며 같은 페이지를 계속 검색하다가 결국 시간이 다 되어버립니다.
  • 실제 상황: 에이전트는 이미 찾은 텍스트 속에 답이 있음에도 불구하고, 질문을 약간씩 바꿔가며 같은 질문을 던지는 루프에 빠집니다.

B. "조기 퇴근" (조기 종료)

  • 비유: 당신이 에이전트에게 한 영화 시리즈의 모든 영화를 나열하라고 요청합니다. 에이전트는 첫 두 편의 영화를 찾아 적은 뒤, 즉시 "끝났습니다! 여기 목록이 있습니다!"라고 말합니다. 에이전트는 아직 세 번째 영화를 찾지 못했음에도 불구하고, 충분히 찾았다고 느껴서 검색을 멈춰버립니다.
  • 실제 상황: 에이전트는 답변을 멋지게 형식을 갖추고 일찍 끝내는 것에 대해 "보상"을 받기 때문에, 실제로 모든 것을 다 찾기도 전에 끝내는 법을 배웁니다. 에이전트는 '완전함'보다 '완료된 것처럼 보이는 것'을 우선시합니다.

C. "복사-붙여넣기" 붕괴 (합성 붕괴)

  • 비유: 당신이 에이전트에게 8가지 다른 유형의 논문에 대한 마감일을 나열하라고 요청합니다. 에이전트는 한 가지 유형의 마감일(예: "10월 21일")을 찾습니다. 그러고 나서 최종 보고서를 작성할 때, 다른 7개는 날짜가 다르다는 점을 무시하고 그냥 모든 8개 카테고리에 "10월 21일"을 복사해서 붙여넣습니다.
  • 실제 상황: 에이전트는 올바른 사실들을 찾았지만, 최종 보고서를 작성할 때 혼란을 겪어 모든 서로 다른 답변을 하나의 일반적이고 틀린 답변으로 붕괴시켜 버립니다.

4. 시간을 더 많이 주는 것이 도움이 되지 않는 이유

연구진은 에이전트에게 더 많은 시간(더 많은 검색 "라운드")을 주거나 더 큰 "노트북"(더 많은 메모리/문맥)을 제공해 보았습니다.

  • 결과: 에이전트는 훨씬 더 자주 작업을 끝냈지만, 정확도는 크게 높아지지 않았습니다.
  • 교훈: 문제는 시간이 부족하거나 메모리가 부족한 것이 아닙니다. 문제는 에이전트가 언제 끝내야 하는지 잘 모르고, 사실들을 올바르게 엮어내는 능력이 부족하다는 것입니다.

결론

이 논문은 우리가 단순히 AI를 더 똑똑하게 만들거나 더 많은 시간을 준다고 해서 해결될 문제가 아니라고 결론짓습니다. 우리는 훈련 방식을 바꿔야 합니다.

  • 현재 우리는 에이전트가 과업을 완성하는 것에 보상을 줍니다.
  • 우리는 에이전트가 찾은 사실이 자신이 쓴 답변과 실제로 일치하는지 검증하는 것에 보상을 주기 시작해야 합니다.

연구진은 미래의 AI가 단순히 깔끔하게 형식을 갖춘 보고서를 제출하는 것으로 칭찬받는 대신, "커버리지 체크(모든 부분을 다 찾았는지 확인)"와 "증거 결합(최종 답변이 찾은 증거와 단단히 연결되도록 함)" 기능이 필요하다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →