BrowserForge: Scaling Web Episode via Parallel Browser Sandboxes
BrowserForge는 오픈 웹 전반에 걸쳐 병렬 브라우저 샌드박스를 실행함으로써 고품질 웹 상호작용 데이터를 생성하는 규모를 확장하여 203,238개의 궤적을 담은 다양한 코퍼스를 생성하며, 이는 라이브 및 정적 벤치마크에서 픽셀 기반 웹 에이전트의 성능을 크게 향상시킵니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인터넷을 탐색하는 데 도움을 주는, 마치 사용자를 대신해 버튼을 클릭하고 텍스트를 입력하며 페이지를 스크롤하여 작업을 완료하는 디지털 비서와 같은 컴퓨터 프로그램을 상상해 보십시오. 이러한 프로그램이 이를 수행하는 법을 배우기 위해서는, 인간이 시작점에서 목표 지점까지 어떻게 이동하는지를 관찰하며 실제 웹사이트에서 연습해야 합니다. 지금까지 이 프로그램들을 가르치는 데 사용된 데이터는 제한적이었습니다. 대부분의 훈련 세트는 인기 있는 소수의 고정된 웹사이트 목록에서 인간의 행동을 기록하거나, 좁은 범위의 튜토리얼을 기반으로 가상의 시나리오를 생성하는 방식으로 구축되었습니다. 이는 프로그램들이 인터넷의 아주 작은 부분만을 탐색하도록 학습하게 만들었으며, 새로운 사이트나 생소한 사이트를 마주했을 때 어려움을 겪게 했습니다. 그들은 마치 단 한 권의 교과서만 공부한 학생들과 같아서, 다른 책을 손에 쥐었을 때 그것을 읽는 법을 알지 못했습니다.
한 연구팀은 이 문제를 해결하기 위해 브라우저포지(BrowserForge)라고 불리는 시스템을 구축했습니다. 이들은 미리 선정된 적은 수의 웹사이트 목록에 의존하는 대신, 개방된 인터넷 전체를 훈련장으로 탈바가했습니다. 그들은 각각 별도의 웹 브라우저를 실행하는 수백 대의 가상 컴퓨터로 구성된 거대한 네트워크를 만들었습니다. 이 브라우저들은 공개된 웹에서 발견되는 수십만 개의 서로 다른 실제 웹사이트를 방문하도록 파견되었습니다. 시스템은 단순히 페이지를 방문하는 데 그치지 않고, 그 페이지들에서 작업을 수행하려고 능동적으로 시도했습니다. 첫 번째 인공지능 에이전트는 페이지를 살펴보고 특정 기사를 찾거나 가격을 확인하는 것과 같이 그럴듯한 과업을 만들어냈습니다. 그다음 두 번째 에이전트는 클릭과 타이핑을 통해 그 과업을 완수하려고 시도하며 자신이 수행한 모든 움직임을 기록했습니다. 만약 과업이 성공적으로 완료되었다면, 그 움직임의 기록은 하나의 레슨(lesson)으로 저장되었습니다. 만약 에이전트가 막히거나 실패했다면, 그 시도는 폐기되었습니다. 이 과정은 반복해서 수행되었으며, 완전히 다른 웹사이트에서 추출된 20만 개 이상의 고유한 학습 사례를 생성해 냈습니다.
연구진은 이 접근 방식이 기존의 그 어떤 것보다 훨씬 크고 다양한 데이터셋을 만들어냈다는 것을 발견했습니다. 기존의 데이터셋에는 수백 개의 사이트에서 추출한 수천 개의 사례만이 포함되어 있었던 반면, 이 새로운 컬렉션은 거의 20만 개의 독특한 웹사이트를 다루었습니다. 연구진이 이 새로운 데이터를 사용하여 작고 효율적인 컴퓨터 모델을 훈련시켰을 때, 결과는 즉각적이고 유의미했습니다. 라이브 웹사이트에서 작업을 성공적으로 완료하는 모델의 능력은 약 25%에서 33% 이상으로 급증했습니다. 이 향상은 단순한 미미한 상승이 아니었습니다. 이는 비교적 작은 규모의 모델이 기존의 더 좁은 데이터로 훈련된 훨씬 더 크고 복잡한 시스템들을 능가할 수 있게 해주었습니다. 이 연구는 개선의 핵심이 모델을 가르치는 새로운 기술이 아니라, 단순히 모델이 접한 웹사이트의 엄청난 다양성에 있다는 것을 보여주었습니다. 시스템을 혼란스럽고 예측 불가능한 실제 웹의 현실에 노출시킴으로써, 연구진은 그것이 훨씬 더 잘 적응할 수 있도록 가르친 것입니다.
이 방법의 성공은 세심한 정제 과정에 달려 있었습니다. 시스템이 인간의 감독 없이 과업을 생성하고 시도했기 때문에, 많은 시도가 실패하거나 지저한 기록을 만들어냈습니다. 연구진은 이러한 나쁜 사례들을 제거하기 위한 필터를 구축했습니다. 먼저, 결코 끝나지 않는 등 명백히 잘못된 시도들을 버리기 위해 단순한 규칙을 사용했습니다. 그런 다음, 남은 시도들을 검토하고 과업이 실제로 완료되었는지 확인하기 위해 또 다른 지능형 시스템을 사용했습니다. 마지막으로, 학습 모델이 행동의 논리를 이해할 수 있도록 성공적인 시도들을 명확하고 일관된 형식으로 다시 작성했습니다. 이는 모델이 노이즈가 아닌 고품질의 사례로부터 학습하도록 보장했습니다. 연구는 웹사이트의 다양성이 성공의 주요 동력이었음을 확인해 주었습니다. 연구진이 다양한 유형의 웹사이트와 과업에 대해 모델을 테스트했을 때, 개선 효과는 일정하게 유지되었으며, 이는 모델이 특정 페이지를 단순히 암기한 것이 아니라 일반적인 기술을 진정으로 학습했음을 시사합니다.
이 작업은 컴퓨터에게 웹을 탐색하는 법을 가르치는 가장 좋은 방법은 컴퓨터가 웹 자체를 탐험하게 하는 것임을 입증합니다. 실제 사이트를 방문하고 실제 과업을 시도하는 과정을 자동화함으로써, 연구진은 인터넷의 진정한 복잡성을 반영하는 훈련 세트를 만들어냈습니다. 그 결과, 더 유능하고 신뢰할 수 있는 디지털 비서, 즉 오늘날 존재하는 수백만 개의 웹사이트가 가진 예상치 못한 레이아웃과 고유한 특징들을 처리할 수 있는 비서를 탄생시켰습니다. 이 연구 결과는 이러한 오픈 웹 데이터의 양이 늘어남에 따라, 이 에이전트들의 성능이 계속해서 향상되어 진정한 범용 웹 비서라는 목표에 더 가까워질 것임을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.