← 최신 논문
🤖 AI

GTA: Generating Long-Horizon Tasks for Web Agents at Scale

본 논문은 기존 벤치마크의 한계를 극복하고 견고한 훈련 및 평가를 가능하게 하기 위해 크롤링, 검색 기반 시드 생성, 자동 검증을 통합하여 실행 가능한 궤적을 가진 현실적인 멀티홉 웹 에이전트 작업을 자동으로 생성하는 확장 가능한 프레임워크인 GTA 를 소개합니다.

원저자: Tenghao Huang, Kung-Hsiang Huang, Prafulla Kumar Choubey, Yilun Zhou, Muhao Chen, Jonathan May, Chien-Sheng Wu

게시일 2026-05-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tenghao Huang, Kung-Hsiang Huang, Prafulla Kumar Choubey, Yilun Zhou, Muhao Chen, Jonathan May, Chien-Sheng Wu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 인터넷 사용법을 가르치려 한다고 상상해 보세요. 이 로봇은 뇌(언어 모델) 와 손(클릭 및 타이핑 도구) 을 가지고 있지만, 현재는 매우 서툴러요. "프랑스의 수도는 무엇인가요?"와 같은 간단한 답변은 찾을 수 있지만, "도쿄로 가는 가장 저렴한 항공권 찾아보기, 호텔에 수영장이 있는지 확인하기, 그리고 비행 시간이 내 병원 예약과 맞는지 확인하기"와 같은 복잡한 미션에는 어려움을 겪습니다.

문제는 우리가 로봇에게 충분한 양질의 연습을 시켜주지 않았다는 점입니다.

문제: 망가진 지도로 훈련하기

현재 이 웹 로봇들을 위한 대부분의 테스트는 출발점과 도착점만 표시된 지도를 주고, 어떻게 그곳에 도달할지에 대한 지침은 주지 않는 것과 같습니다.

  • 기존 벤치마크: 이는 인간이 손으로 만든 퍼즐과 같습니다. 수가 적을 뿐만 아니라, 종종 단순한 한 단계 작업만 테스트합니다.
  • 자동 시도: 일부 연구자들은 로봇이 스스로 웹사이트를 탐색하게 하여 새로운 퍼즐을 만들려고 시도했습니다. 하지만 이는 장난감을 찾기 위해 쇼핑몰을 배회하는 유아를 방치하는 것과 같았습니다. 그들은 반짝이는 눈에 띄는 것들 (예: 장난감 가게) 만 찾고 나머지는 (예: 약국이나 푸드코트) 무시했습니다. 또한 이는 엄청나게 비싸고 느렸습니다.

이로 인해 로봇들은 "과적합 (overfitting)"됩니다. 그들은 주어진 특정 퍼즐을 외웠을 뿐, 서로 다른 페이지와 웹사이트를 오가며 문제를 해결해야 하는 현실 세계의 복잡한 상황에는 대처하지 못합니다.

해결책: GTA("건축가" 접근법)

저자들은 GTA(대규모 웹 에이전트를 위한 장기 미션 생성) 를 소개합니다. GTA 를 워크시트를 나눠주는 교사로 생각하지 말고, 훈련용 체육관을 짓는 마스터 건축가로 생각하세요.

다음은 그들이 간단한 단계를 통해 이를 구축한 방법입니다:

  1. 크롤링 (도시 매핑): 로봇이 맹목적으로 배회하게 두는 대신, GTA 는 먼저 디지털 "정찰대"를 보내 전자상거래 매장, 정부 사이트, 뉴스 포털 등 전체 웹사이트를 매핑합니다. 그들은 모든 페이지와 그 연결 방식을 보여주는 완전한 "도시 지도"를 구축합니다.
  2. 시드 (도전 과제 선정): 어려운 작업이 무엇인지 추측하는 대신, GTA 는 지도 위의 두 무작위 위치 (예: 특정 신발에 대한 페이지와 특정 할인에 대한 페이지) 를 선택합니다.
  3. 생성 (미션 작성): AI 에게 두 장소를 모두 방문해야만 해결할 수 있는 미션을 작성하도록 요청합니다. 예를 들어: "A 페이지의 신발 가격을 찾은 후, B 페이지에 더 저렴하게 만들어주는 쿠폰이 있는지 확인하세요."
  4. 품질 관리 (심판): 미션이 출시되기 전에 엄격한 심판이 이를 점검합니다.
    • 해결 가능한가? (실제로 답을 얻을 수 있는가?)
    • 명확한가? (오직 하나의 정답만 있는가?)
    • 멀티홉인가? (로봇이 한 페이지 이상 방문하도록 강제하는가?)
  5. 골드 패스 (정답 키): 중요하게도, GTA 는 로봇이 해야 할 정확한 경로를 기록합니다. 이를 통해 연구자들은 미션을 완벽하게 재현하고 로봇이 어디서 잘못되었는지 정확히 확인할 수 있습니다.

이것이 중요한 이유: "인간 vs 로봇" 격차

저자들은 이 새로운 체육관에서 현재 로봇들을 테스트했고, 엄청난 격차를 발견했습니다:

  • 로봇들: 이러한 새로운 다단계 작업에 직면했을 때, 로봇들은 대부분 실패했습니다 (종종 20% 미만 점수). 길을 잃거나, 너무 일찍 포기하거나, 사이트를 제대로 탐색하는 대신 검색창을 사용하려 했습니다.
  • 인간들: 인간들이 동일한 작업을 시도했을 때, 그들은 쉽게 해결했습니다 (85% 성공률).
  • 검색 엔진: 심지어 간단한 구글 검색도 이러한 작업을 해결하지 못했습니다. 답이 한 곳에 있는 것이 아니라 서로 다른 페이지에 숨겨져 있었기 때문입니다.

GTA 의 주요 특징

  • "살아있는" 체육관: 시간 속에 고정된 정적인 기존 테스트와 달리, GTA 는 라이브 웹사이트에서 지속적으로 새로운 작업을 생성할 수 있습니다. 이는 로봇들이 단순히 답을 외우는 것을 방지합니다.
  • 글로벌: 영어뿐만 아니라 이탈리아어, 일본어, 독일어, 중국어 등 여러 언어로 작동합니다. 로봇들은 비영어권 사이트에서 더욱 어려움을 겪었습니다.
  • 크로스-웹사이트: 일부 작업은 로봇이 문제를 해결하기 위해 건강 사이트에서 금융 사이트로 이동해야 하도록 요구하며, 이는 실제 사람들이 웹을 사용하는 방식을 모방합니다.

결론

GTA 는 웹 로봇을 위한 현실적이고 어려운 훈련 미션을 생성하는 새롭고 방대하며 자동화된 시스템입니다. 이는 현재 로봇들이 실제 인터넷의 복잡하고 다단계적인 특성을 탐색하는 데 여전히 매우 약하다는 것을 증명합니다. 끝없는 고품질 검증 가능한 도전을 생성할 수 있는 방법을 제공함으로써, GTA 는 로봇들이 어디서 실패하는지 정확히 파악하여 더 나은 로봇을 만들 수 있도록 연구자들을 돕습니다.

그것이 아닌 것:

  • 이는 현재 의사나 기업이 사용할 도구가 아닙니다.
  • 이는 웹 에이전트 문제를 해결했다고 주장하지 않습니다. 단지 그들을 테스트하는 더 나은 방법을 제공하고 아직 할 일이 얼마나 많은지 보여주었을 뿐입니다.
  • 이는 개인 계정 로그인이나 실제 구매가 필요한 작업을 다루지 않습니다 (안전 규정 때문).

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →