← 최신 논문
🤖 AI

Weblica: Scalable and Reproducible Training Environments for Visual Web Agents

이 논문은 HTTP 레벨 캐싱과 LLM 기반 합성을 활용하여 확장 가능하고 재현 가능한 웹 환경을 구축하는 프레임워크인 Weblica를 소개하며, 이를 통해 시각적 웹 탐색 작업에서 기존 오픈 가중치 베이스라인을 능가하는 Weblica-8B 모델의 훈련을 가능하게 합니다.

원저자: Oğuzhan Fatih Kar, Roman Bachmann, Yuanzheng Gong, Anders Boesen Lindbo Larsen, Afshin Dehghan

게시일 2026-05-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Oğuzhan Fatih Kar, Roman Bachmann, Yuanzheng Gong, Anders Boesen Lindbo Larsen, Afshin Dehghan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 항공권 예약, 신발 구매, 양식 작성과 같은 작업을 수행하기 위해 인터넷을 탐색하는 방법을 가르치고 싶다고 상상해 보세요. 인터넷은 혼란스럽고 끊임없이 변하는 곳입니다. 이는 조수가 끊임없이 변하고 매초 새로운 파도가 치는 폭풍우 속에서 바다에 사람을 던져 수영을 가르치려는 것과 같습니다.

이것이 WEBLICA 논문이 해결하려는 문제입니다. 애플의 저자들은 '실시간' 웹에서 AI 에이전트를 훈련시키는 것은 너무 지저분하고, 느리며, 예측 불가능하다는 점을 깨달았습니다. 대신 그들은 거대하고 완벽한 오프라인 시뮬레이터인 WEBLICA를 구축했습니다.

그들이 어떻게 했는지 두 가지 간단한 부분으로 나누어 설명해 드리겠습니다:

1. "시간 여행 카메라" (HTTP 레벨 캐싱)

웹페이지의 사진을 찍는다고 상상해 보세요. 하지만 단순한 사진이 아니라, 컴퓨터와 웹사이트 간의 전체 대화를 포착하는 것입니다.

  • 문제: 나중에 그 대화를 재생하려 하면 웹사이트는 "잠깐, 세션 토큰이 다르다!" 또는 "타임스탬프가 잘못됐다!"라고 말하며 차단할 수 있습니다. 이는 재잠금된 문에 낡은 열쇠를 사용하려는 것과 같습니다.
  • 해결책: 팀은 '시간 여행 카메라'처럼 작동하는 지능형 시스템을 구축했습니다. 이 시스템은 모든 요청과 응답을 기록한 후, 규칙서를 사용하여 매번 변하는 부분 (타임스탬프나 무작위 세션 번호 등) 을 무시하고 안정적인 부분만 유지합니다.
  • 결과: 그들은 기록된 웹사이트를 실제 인터넷에 연결할 필요 없이 완벽하게, 반복적으로 재생할 수 있습니다. 이는 마치 버튼을 클릭하고 상자에 입력할 수 있는 완벽한 웹사이트 스냅샷을 가지고 있는 것과 같습니다.

2. "무한한 레고 공장" (LLM 기반 합성)

때로는 웹사이트가 너무 복잡하거나 아직 존재하지 않기 때문에 단순히 기록할 수 없습니다.

  • 문제: 실제 웹사이트는 제한적입니다. 연습할 '장바구니'나 '항공권 예약' 페이지의 10,000 가지 다른 버전을 쉽게 찾을 수 없습니다.
  • 해결책: 그들은 슈퍼 스마트한 AI 코더 (LLM) 를 공장처럼 활용했습니다. 그들은 공장에게 "요가 스튜디오를 위한 웹사이트를 만들어 줘. 여기서 수업을 예약할 수 있게 해줘" 또는 "모델을 비교할 수 있는 자동차 딜러십 사이트를 만들어 줘"라고 지시했습니다.
  • 마법: AI 코더는 코드를 사용하여 이러한 웹사이트를 처음부터 구축하고, 가짜 이미지를 생성하며, 심지어 그 사이트에서 수행해야 할 작업까지 발명합니다. 이는 작동하는 문과 창문이 있는 성, 우주선, 또는 집의 백만 가지 다른 버전을 즉시 구축할 수 있는 레고 공장처럼, 로봇이 문을 여는 연습을 할 수 있게 해줍니다.

이것이 중요한 이유: "훈련 체육관"

이 두 가지 방법을 결합하여 저자들은 AI 를 위한 거대하고 안전한 훈련 체육관을 만들었습니다.

  • 폭풍우 더 이상 없음: 그들은 실제 인터넷이 고장 나거나, 변하거나, 봇을 차단하는 것을 걱정할 필요가 없습니다.
  • 속도: 모든 것이 오프라인이고 로컬이기 때문에, AI 는 실제 웹사이트가 로드되기를 기다리는 것보다 수천 배 더 빠르게 연습할 수 있습니다.
  • 규모: 그들은 이 다양하고 가짜이지만 현실적인 환경 수천 개에서 AI 를 훈련시켰습니다.

결과: "Weblica-8B" 챔피언

그들은 이 체육관에서 Weblica-8B라는 모델을 훈련시켰습니다. 다음과 같은 일이 발생했습니다:

  • 더 빠르고 똑똑함: 이 모델은 실제 웹사이트에서 테스트되었을 때, 동일한 크기의 다른 오픈소스 모델보다 작업을 더 잘 해결했습니다.
  • 더 적은 단계 사용: 이 모델은 경쟁자들보다 더 적은 클릭과 시도로 문제를 해결할 수 있었습니다.
  • 확장성: 더 많은 생각할 시간 (더 많은 '테스트 시간 컴퓨팅') 을 주면 성능이 더욱 향상되어, 사용 비용이 드는 비싼 독점 AI 모델 (OpenAI 나 Google 의 모델 등) 의 성능에 거의 근접합니다.

요약하자면: 논문은 "로봇을 배우게 하기 위해 혼란스러운 실제 웹의 바다에 던지지 마라. 대신, 로봇이 젖지 않고 수백만 번 연습할 수 있는 완벽하고 무한한 오프라인 시뮬레이터를 구축하라"고 말합니다. 그리고 그것은 성공했습니다: 로봇은 놀라울 정도로 수영을 잘 배우게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →