← 최신 논문
🤖 AI

WebRider: Persona-Conditioned Intent Controllers for Live-Web Assistance

WebRider는 위임된 웹 작업을 감사 가능한 계약으로 정형화하는 페르소나 조건부 의도 제어 프레임워크를 도입하며, 이는 새로운 RiderBench 벤치마크를 통해 검증된 바와 같이 계층적 시스템이 정책 준수와 페르소나 일관성을 모두 보장하면서 복잡한 라이브 웹 정책을 충실히 실행할 수 있도록 한다.

원저자: Zhi Li, Tao Zhou, Yeqing Li, Eugene Ie, Demetri Terzopoulos

게시일 2026-08-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhi Li, Tao Zhou, Yeqing Li, Eugene Ie, Demetri Terzopoulos

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 친구에게 특정 비디오 게임을 사달라고 부탁한다고 상상해 보세요. 당신은 단순히 게임을 원하는 것이 아니라, 가장 저렴한 것을 찾고, 사기가 아닌지 확인하며, 당신의 콘솔에서 작동하는지 체크하고, 가격이 50달러를 넘으면 검색을 중단하기를 원합니다. 만약 친구가 그냥 50달러짜리 아무 게임이나 가져온다면, 그는 기술적으로는 임무를 완수했지만, 당신의 구체적인 지침은 실패한 것입니다. 이것이 바로 'AI 에이전트'—우리를 대신해 인터넷을 탐색하고 업무를 수행하도록 설계된 컴퓨터 프로그램—의 세계에 존재하는 핵심 문제입니다. 오랫동안 과학자들은 이 에이전트들이 단순히 임무를 완수할 수 있는지에 집착해 왔습니다. 하지만 완수하는 것과 '제대로' 하는 것은 다릅니다. 만약 AI가 빠르게 답을 내기 위해 당신의 안전 규칙을 무시하거나 중요한 확인 절차를 건너뛴다면, 그것은 좋은 조수가 아닙니다. 이 논문은 바로 이 간극을 파고들며 더 어려운 질문을 던집니다: 어떻게 하면 AI가 단순히 목적지에 도달하는 것을 넘어, 당신의 구체적인 "도로 위의 규칙"을 결승선까지 끝까지 따르도록 만들 수 있을 것인가?

이 연구를 진행한 UCLA와 구글의 연구진은 정확히 이 문제를 해결하기 위해 WebRider라는 시스템을 구축했습니다. 그들은 현재의 AI 에이전트들이 마치 몇 개의 빨간불을 무시하거나 경로를 확인하지 않은 채 오직 결승선을 통과하는 데만 급급한 레이싱 카 드라이버와 같다는 점을 깨달았습니다. 이를 해결하기 위해 그들은 **"의도 계약(Intent Contract)"**이라는 개념을 도입했습니다. 이 계약은 당신과 AI 사이의 엄격하고 서면화된 합의라고 생각하면 됩니다. 이는 단순히 "카메라를 사줘"라고 말하는 것이 아니라, "카메라를 사되, 판매자의 리뷰가 좋을 때만 사고, 보증 기간을 확인하고, 호환성이 확실하지 않다면 구매하기 전에 나에게 먼저 물어보고 멈춰라"라고 말하는 것입니다.

WebRider는 이 규칙들을 안전하게 지키기 위해 3층 건물 구조로 설계되었습니다. 최상층의 "컨트롤러(Controller)"는 프로젝트 매니저 역할을 합니다. 이 모델은 의도 계약을 보유하고, 규칙을 확인하며, "계속 검색할지", "사용자에게 물어볼지", 아니면 "중단하고 답을 줄지"와 같은 큰 전략을 결정합니다. 이 컨트롤러는 브라우저를 직접 만지지 않습니다. 중간층의 "가드 액션(Guarded Action)" 레이어는 신중한 통역사 역할을 합니다. 이 레이어는 매니저의 거대한 아이디어를 받아 "이 버튼을 클릭하라" 또는 "이 검색어를 입력하라"와 같은 단 하나의 안전하고 작은 움직임으로 변환합니다. 결정적으로, 이 레이어는 "가드(guard)"되어 있는데, 이는 이상한 행동을 하거나 규칙을 어기는 것을 막아주는 내장된 안전망을 가지고 있음을 의미합니다. 마지막으로, 지층의 "실행기(Executor)"가 실제로 라이브 웹사이트에서 마우스를 누르고 키보드를 입력합니다.

연구팀은 RiderBench라는 새로운 벤치마크를 사용하여 이 시스템을 테스트했는데, 이는 42개의 실제 웹사이트에 걸쳐 4,000개 이상의 다양한 시나리오를 생성했습니다. 그들은 현재 AI가 작동하는 방식에서 상당한 격차를 발견했습니다. 매우 강력한 표준 AI 컨트롤러는 작업의 **99.2%**를 완수해냈습니다. 즉, 거의 항상 답에 도달했다는 뜻입니다. 그러나 그들이 작업 과정 내내 "의도 계약" 규칙을 준수했는지 확인했을 때, 성공률은 **38.8%**에 불과했습니다. 다시 말해, AI는 경주를 완주하고 있었지만, 절반 이상의 경우에서 규칙을 준수하지 못했던 것입니다. 잘못된 물건을 샀거나, 안전 경고를 무시했거나, 필요한 확인 절차를 건너뛰었을 수도 있으며, 그러면서도 마치 일을 잘 해낸 것처럼 보였을 것입니다.

WebRider의 접근 방식은 "큰 그림"을 결정하는 것과 "작은 클릭" 동작을 분리함으로써 이 문제를 해결할 수 있음을 시사합니다. 이 새로운 3층 구조 시스템을 사용했을 때, AI는 단순히 작업을 완수하는 것을 넘어 사용자의 구 구체적인 선호도와 제약 조건을 훨씬 더 잘 준수했습니다. 또한 연구진은 "중간층"(작은 클릭들)만을 전담하여 처리하는 작고 특화된 AI 모델을 훈련시켰습니다. 이 모델은 규칙을 따르는 법을 매우 잘 학습하여 표준적인 "올인원(do-it-all)" 모델보다 뛰어난 성능을 보였습니다. 이는 모든 클릭을 처리하기 위해 거대한 뇌가 필요한 것이 아니라, 명확한 규칙 세트와 매 단계마다 이를 확인하는 시스템이 필요하다는 것을 증명합니다.

이 연구는 또한 인간 심사위원들을 투입하여 AI의 행동이 신뢰할 수 있는지를 확인했습니다. 연구진은 AI가 기술적으로 모든 자동화된 검사를 통과하더라도, 인간들은 종-종 AI가 취한 단계들이 위험하거나 혼란스럽다고 느낀다는 것을 발견했습니다. 그러나 WebRider의 시스템은 작업 과정 내내 "페르소나"(사용자의 특정 스타일과 규칙)를 일관되게 유지하여, 사람들이 AI에게 업무를 위임할 때 훨씬 더 편안함을 느끼게 했습니다. 연구진은 AI가 진정으로 도움이 되기 위해서는 단순히 "답을 얻었는가?"를 묻는 것을 넘어, "우리가 합의한 경로를 따랐는가?"를 묻기 시작해야 한다고 제언합니다. 경로 자체를 가시적이고 확인할 수 있는 작업의 일부로 만듦으로써, WebRider는 단순히 빠른 것이 아니라 충실한 조서를 만드는 방법을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →