← 최신 논문
🤖 AI

Web Agents Should Use Typed Actions Instead of Click-Based Browsing

이 입장 논문은 더 신뢰할 수 있고, 감사 가능하며, 재현 가능한 에이전트 기반 웹 시스템을 구축하기 위해, 취약하고 낮은 수준의 클릭 기반 웹 상호작용을 타입이 지정된 "웹 동사(web verbs)"라는 시맨틱 계층으로 대체할 것을 옹호한다.

원저자: Linxi Jiang, Rui Xi, Zhijie Liu, Shuo Chen, Zhiqiang Lin, Suman Nath

게시일 2026-06-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Linxi Jiang, Rui Xi, Zhijie Liu, Shuo Chen, Zhiqiang Lin, Suman Nath

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: 클릭을 멈추고, "동사"를 말하기 시작하라

로봇에게 피자를 주문하는 법을 가르치고 있다고 상상해 보세요.

기존 방식 (클릭 기반 브라우징):
현재 대부분의 웹 에이전트(AI 로봇)는 인간이 버튼을 클릭하는 모습을 관찰하며 피자 주문법을 배웁니다. 로봇은 다음과 같은 과정을 파악해야 합니다: "좋아, 마우스를 오른쪽으로 400픽셀 이동하고, 빨간색 버튼을 클릭한 뒤, 화면이 로드될 때까지 기다렸다가, 세 인치 정도 스크롤을 내리고, '페퍼로니'라고 타이핑해야지."

이는 마치 누군가에게 운전을 가르칠 때 모든 근육의 움직임을 하나하나 지시하는 것과 같습니다: "고개를 왼쪽으로 돌려, 발을 2인치 움직여, 페달을 밟아." 작동은 하겠지만, 매우 취약합니다. 만약 피자 가게가 "주문" 버튼을 왼쪽으로 두 인치 옮기거나 메뉴 색상을 바꾸면, 로봇은 혼란에 빠지고 멈춰버립니다. 그때마다 새로운 춤 동작을 다시 배워야 하기 때문입니다.

새로운 방식 (타이핑된 액션 / 웹 동사):
이 논문의 저자들은 로봇에게 클릭하는 법을 가르치는 것을 멈춰야 한다고 주장합니다. 대신, 로봇에게 **"웹 동사(Web Verbs)"**라는 메뉴를 주어야 합니다.

웹 동사는 마법의 버튼이나 명령 카드와 같습니다. 로봇에게 어떻게 클릭할지를 알려주는 대신, 명확하고 구조화된 명령을 사용하여 무엇을 할지를 알려주는 것입니다.

  • 기존 명령: "마우스를 X, Y 좌표로 이동하여 클릭하라."
  • 새로운 동사: hotel_search(destination="Anchorage", check_in="2026-06-01")

이 명령은 마치 미리 준비된 밀키트와 같습니다. 로봇은 양파를 어떻게 다지거나 스테이크를 어떻게 굽는지(복잡한 클릭과 스크롤 과정) 알 필요가 없습니다. 그저 "호텔 검색" 밀키트를 요청하기만 하면, 시스템이 백그라운드에서 모든 번거로운 세부 사항을 처리합니다.

왜 이것이 필요한가요?

논문은 "클릭" 방식의 세 가지 주요 문제점과 "동사"가 이를 어떻게 해결하는지 지적합니다.

1. 신뢰성 ("취약한 집" 문제)

  • 문제점: 로봇이 버튼을 클릭할 때, 그것은 마치 카드로 집을 짓는 것과 같습니다. 웹사이트의 레이아웃이 조금만 바뀌어도(예: 버튼 위치 변경), 집 전체가 무너집니다. 로봇은 길을 잃습니다.
  • 동사 솔루션: 동사는 튼튼한 벽돌과 같습니다. 웹사이트가 페인트칠을 새로 하거나 가구 배치를 바꾸더라도, "호텔 검색"이라는 벽돌은 내부적으로 이러한 변화를 처리하도록 설계되었기에 여전히 작동합니다. 로봇은 그 벽돌이 어떻게 만들어졌는지 알 필요 없이, 그저 벽돌을 요청하기만 하면 됩니다.

2. 효율성 ("멈춤과 시작" 문제)

  • 문제점: 여행 예약과 같은 간단한 작업을 수행하기 위해, 클릭 방식의 로봇은 50번의 작은 단계(여기 클릭, 대기, 스크롤, 타이핑, 저기 클릭 등)를 거쳐야 할 수도 있습니다. 매 단계마다 화면을 "보고" "생각"해야 합니다. 이는 느리고 비용이 많이 듭니다.
  • 동사 솔루션: 동사를 사용하면 로봇은 "호텔 찾아줘", "항공편 찾아줘", "예약해줘"라고 말할 수 있습니다. 50번의 작은 단계 대신 세 번의 큰 단계로 전체 작업을 끝낼 수 있습니다. 이는 식재료를 하나하나 직접 요리하는 대신 레스토랑에서 코스 요리를 주문하는 것과 같습니다.

3. 검증 가능성 ("블랙박스" 문제)

  • 문제점: 클릭 방식의 로봇이 실수를 하면, 왜 그런 일이 발생했는지 알기 어렵습니다. 잘못된 버튼을 클릭한 걸까요? 텍스트를 잘못 읽은 걸까요? 추적이 어려운 복잡한 행동의 흔적들이 남습니다.
  • 동사 솔루션: 동사는 영수증과 같습니다. 로봇이 동사를 사용하면, 명확하고 구조화된 답변(예: "가격 정보가 포함된 호텔 목록입니다")을 얻습니다. 우리는 입력값(무엇을 요청했는지)과 출력값(무엇을 얻었는지)을 쉽게 확인할 수 있습니다. 문제가 발생하면, 로봇이 어떤 특정 픽셀을 클릭했는지가 아니라, 어떤 "벽돌"이 실패했는지 정확히 알 수 있습니다.

실제 사례 (예시)

논문은 두 가지 예시로 이를 테스트합니다:

  • 여행 계획: 사용자가 박물관 근처의 호텔을 찾고 거리순으로 정렬하고 싶어 합니다.

    • 클릭 방식 로봇: 혼란에 빠집니다. 모든 박물관과 호텔을 잇는 단일 선을 그리려 시도하지만, 이는 실제로 거리를 정확하게 계산하지 못합니다. 클릭하는 과정 중에 수학적 계산을 놓쳐버립니다.
    • 동사 방식 로봇: get_directions 동사를 사용합니다. 리스트를 순회하며 각 호텔과 박물관 사이의 거리를 동사에게 묻고, 그 값을 더한 뒤 정렬합니다. "거리"가 시각적인 추측이 아닌 명확한 숫자이기 때문에 수학적으로 완벽하게 수행합니다.
  • 가구 쇼나핑: 사용자가 1,000달러 예산 내에서 평점이 가장 높은 침대, 책상, 스탠드를 사고 싶어 합니다.

    • 클릭 방식 로봇: 아이템을 하나씩 탐욕적으로 선택합니다. 아주 좋은 침대를 골랐다가, 그다음 좋은 책상을 고르고 나니 갑자기 스탠드를 살 돈이 없다는 사실을 깨닫게 될 수 있습니다. 전체 목표 달성에 실패합니다.
    • 동사 방식 로봇: 동사를 사용하여 가격과 평점이 포함된 모든 아이템 리스트를 가져옵니다. 그 후 간단한 컴퓨터 프로그램을 실행하여 예산에 맞는 최적의 조합을 찾아냅니다. 논리적으로 퍼즐을 해결하는 것입니다.

행동 촉구 (Call to Action)

저자들은 AI 모델이 더 "똑똑해져야" 한다고 말하는 것이 아닙니다. 인터페이스가 바뀌어야 한다고 말하는 것입니다.

그들은 웹사이트가 이러한 "동사"를 세상에 공개해야 한다고 제안합니다.

  • 개발자를 향하여: 단순히 인간을 위한 웹사이트를 만드는 것을 넘어, 로봇을 위한 "동사 계층(Verb Layer)"을 구축하십시오. 이는 간단한 API(서버로 가는 직통 라인)가 될 수도 있고, 브라우저 클릭을 대신 자동화해 주는 스크립트가 될 수도 있습니다.
  • 커뮤니티를 향하여: 웹사이트가 어떻게 보이는지에 대한 표준(HTML)이 있는 것처럼, 로봇이 웹사이트와 대화하는 방식에 대한 표준이 필요합니다. 로봇이 어떤 명령을 사용할 수 있는지 알 수 있도록 보편적인 "웹 동사" 사전이 필요합니다.

요약 비유

  • 현재의 웹 에이전트: 지도를 보면서 수동으로 핸들을 돌리고, 가속 페달을 밟고, 브레이크를 밟으며 자동차를 운전하려는 사람과 같습니다. 만약 길이 바뀌면 사고가 납니다.
  • 제안된 웹 에이전트: 자율주행차의 승객과 같습니다. 그저 차에게 "공항으로 데려다줘"라고 말하기만 하면 됩니다. 차(동사)가 조향, 제동, 내비게이션을 처리합니다. 이것이 더 안전하고 빠르며, 목적지까지 정확히 가고 있다는 것을 알 수 있습니다.

이 논문은 "에이전트형 웹(로봇이 우리를 위해 일을 하는 웹)"을 신뢰할 수 있게 만들려면, 로봇에게 핸들을 쥐여주는 것을 멈추고 목적지를 알려주어야 한다고 주장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →