AutoSurfer -- Teaching Web Agents through Comprehensive Surfing, Learning, and Modeling
AutoSurfer 는 데이터 부족과 환각 문제를 극복하기 위해 체계적인 너비 우선 탐색, 탐색 유도 작업 합성, 그리고 궤적 기반 정제를 활용하는 새로운 웹 궤적 생성기로서, WebArena 벤치마크에서 웹 에이전트의 성능과 작업 다양성을 크게 향상시킵니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대한 복잡하고 방대한 도서관 (웹사이트) 을 탐색하여 특정 책을 찾거나 대출하거나 리뷰를 작성하는 방법을 로봇에게 가르치고 싶다고 상상해 보세요. 문제는 로봇이 도서관의 구조를 알지 못하며, 이를 위한 매뉴얼도 아무도 작성하지 않았다는 점입니다.
AutoSurfer는 이러한 "웹 로봇" (웹 에이전트) 을 가르치기 위해 고안된 새로운 시스템으로, 도서관을 먼저 탐험한 다음 완벽한 가이드를 작성하고 그 가이드를 이용해 로봇을 가르치는 매우 꼼꼼하고 체계적인 인간 사서처럼 작동합니다.
다음은 AutoSurfer 가 작동하는 방식을 간단한 단계로 나눈 것입니다:
1. 문제: 로봇이 길을 잃는 경우
현재 웹사이트를 탐색하려는 로봇들은 종종 충분한 양의 좋은 예시로 훈련받지 못해 실패합니다.
- 기존 방식: 이전 방법들은 로봇을 가르치기 위해 다음 두 가지 중 하나를 시도했습니다:
- 정문에서 추측하기: 홈페이지를 보고 가능한 작업들을 추측했는데, 도서관 깊숙한 곳에 숨겨진 방들을 놓쳤습니다.
- 방향 없이 방황하기: 관광객이 벽에 부딪히듯 무작위로 돌아다녔습니다. 이로 인해 로봇은 실제로 존재하지 않는 작업을 만들어내거나 (환각), 클릭해야만 나타나는 드롭다운 메뉴와 같은 중요한 기능을 놓치는 경우가 많았습니다.
2. 해결책: AutoSurfer 의 3 단계 전략
AutoSurfer 는 인간이 새로운 웹사이트를 배우는 방식을 모방한 "진행하며 학습 (Learn as You Go)" 접근법을 사용하여 이를 해결합니다.
단계 A: 체계적인 탐험가 (너비 우선 탐색)
무작위로 방황하는 대신, AutoSurfer 는 체크리스트를 든 탐정처럼 행동합니다.
- 대기열: 아직 완전히 탐색하지 않은 모든 페이지의 목록을 유지합니다. 홈페이지에서 시작해 해당 페이지의 모든 링크를 확인한 다음, 그 페이지들의 모든 링크를 확인하는 식으로 진행합니다.
- "펼치기" 트릭: "더 보기"를 클릭할 때까지 옵션이 숨겨져 있는 메뉴를 상상해 보세요. 기존 방법들은 이를 종종 놓쳤습니다. AutoSurfer 는 "더 보기" 버튼을 클릭하고 새로운 옵션을 확인한 뒤, 즉시 그 새로운 옵션들을 체크리스트에 추가할 만큼 똑똑합니다. 이는 인간이 하듯이 메뉴의 층을 벗겨내듯 재귀적으로 수행됩니다.
- 중복 제거: 홈페이지에서 "검색" 상자를 발견했다면, 다른 모든 페이지에서 "검색" 상자를 찾으려 시간을 낭비하지 않습니다. 이미 알고 있는 것을 기억하고 중복된 항목은 건너뜁니다.
단계 B: 이야기 쓰기 (작업 합성)
AutoSurfer 가 웹사이트를 탐험한 후, 단순히 "여기를 클릭했습니다"라고 말하지 않습니다. 대신 이야기를 씁니다.
- 점 연결하기: 취한 경로 (탐험 궤적) 를 살펴보고 그 실제 경로에 기반한 작업을 생성합니다.
- 비유: 누군가에게 케이크를 굽는 방법을 가르친다고 상상해 보세요.
- 기존 방법은 "밀가루를 산 다음, 계란을 산 다음, 굽는다"고 말할 수 있습니다. (고립된 단계).
- AutoSurfer는 "먼저 통로로 걸어 밀가루를 집어 들고, 계산대로 걸어 결제한 다음, 오븐으로 걸어..."라고 말합니다. 실제 여정에 작업을 기반함으로써 지시를 오해하기 훨씬 어렵게 만듭니다.
단계 C: 다듬기 (정제)
지침의 초안은 혼란스러울 수 있습니다. 로봇이 우회로를 돌거나 실수로 버튼을 두 번 클릭했을 수도 있습니다.
- 편집자: AutoSurfer 는 자신의 여정에 대한 "초안"을 가져와 웹 에이전트 (똑똑한 로봇) 에게 힌트와 함께 제시합니다: "우리가 취한 경로가 여기 있습니다. 이제 이 작업을 완벽하게 수행해 주세요."
- 결과: 에이전트가 경로를 정리하고 불필요한 단계를 제거하며 지침이 100% 정확하도록 보장합니다. 이는 훈련을 위한 고품질의 "교과서"를 만들어냅니다.
3. 결과: 수퍼 학생
AutoSurfer 는 이러한 정제되고 검증된 경로들을 특정 "웹사이트 전용 LLM"(하나의 웹사이트에 전념하는 로봇 두뇌) 을 훈련시키기 위한 데이터셋으로 변환합니다.
- 테스트: 연구원들은 WebArena(Reddit, 쇼핑몰, 코드 저장소 등의 사이트가 포함된 시뮬레이션 인터넷) 라는 벤치마크에서 이를 테스트했습니다.
- 점수: AutoSurfer 로 훈련된 로봇은 작업의 **24.23%**를 정확히 수행했습니다. 기존 최고 방법의 정확도는 **19.59%**에 불과했습니다.
- 다양성: 정확도가 높을 뿐만 아니라 더 다양한 작업을 학습했습니다. 쉬운 것뿐만 아니라 다른 방법들이 놓친 웹사이트의 깊고 복잡한 기능까지 찾아냈습니다.
요약 비유
웹 에이전트를 훈련시키는 것은 거대하고 혼란스러운 사무실 건물의 새로운 직원을 교육하는 것과 같습니다.
- 기존 방법은 직원에게 로비만 표시된 지도를 주고 "휴게실을 찾아라"고 말했습니다. 그들은 길을 잃었습니다.
- AutoSurfer는 선임 직원을 보내 모든 복도를 걷고, 모든 문을 열고, 모든 옷장을 확인한 후 실제 도보에 기반한 단계별 가이드를 작성하게 합니다. 그런 다음 그 가이드를 신입 직원에게 전달합니다. 신입 직원은 휴게실이 어디에 있는지, 어떻게 가는 방법, 그리고 도착했을 때 무엇을 해야 하는지 정확히 알고 도착합니다.
이 논문은 이러한 철저하고 체계적인 접근을 통해 AutoSurfer 가 더 나은 훈련 데이터를 생성하여, 더 정확하고, 사실을 만들어낼 가능성이 적으며, 웹상의 복잡하고 다단계 작업을 처리할 수 있는 웹 에이전트를 만들어낸다고 주장합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.