← 최신 논문
💬 NLP

Scaling Agents for Computer Use

이 논문은 행동 내러티브(behavior narratives)를 사용하여 여러 실행 롤아웃을 평가하고 선택함으로써 컴퓨터 사용 에이전트의 신뢰성을 향상시키고, 인간 수준의 능력을 뛰어넘는 OSWorld에서의 최첨단 성능을 달성하는 프레임워크인 BJudge를 소개한다.

원저자: Gonzalo Gonzalez-Pumariega, Vincent Tu, Chih-Lun Lee, Jiachen Yang, Ang Li, Xin Eric Wang

게시일 2026-02-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Gonzalo Gonzalez-Pumariega, Vincent Tu, Chih-Lun Lee, Jiachen Yang, Ang Li, Xin Eric Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 컴퓨터 화면을 보면서 로봇에게 빨래를 하고, 저녁 식사를 준비하고, 공과금을 납부하는 법을 가르치려 한다고 상상해 보세요. 이것이 바로 "컴퓨터 사용 에이전트(Computer-Use Agents, CUAs)"가 수행하도록 설계된 작업입니다. 이들은 인간처럼 버튼을 클릭하고, 텍스트를 입력하며, 소프트웨어를 탐색할 수 있는 AI 프로그램입니다.

하지만 큰 문제가 있습니다. 이 로봇들은 매우 취약합니다. 만약 초기에 아주 작은 실수라도 한다면—예를 들어 잘못된 창을 클릭하거나 팝업창을 놓친다면—그 오류는 눈덩이처럼 불어납니다. 50번째 단계에 도달할 때쯤이면, 그들은 완전히 길을 잃게 됩니다. 이는 마치 바람 부는 방 안에서 카드 집을 짓는 것과 같습니다. 작은 흔들림 하나가 전체를 무너뜨립니다.

과거의 방식: "한 번에 끝내기 (One and Done)"

이전에는 연구자들이 로봇에게 단 한 번의 움직임을 하기 전에 더 "깊이 생각하라"고 지시함으로써 이 문제를 해결하려 했습니다. 그들은 AI에게 다음 클릭을 위한 다섯 가지 서로 다른 아이디어를 생성하고 그중 가장 좋은 것을 고르라고 요청했습니다. 하지만 이것은 마치 한 사람에게 식료품점에 가는 다섯 가지 서로 다른 경로를 생각해보라고 한 뒤, 가장 좋은 것을 골라 직접 걸어가라고 하는 것과 같습니다. 만약 그 한 사람이 첫 번째 교차로에서 혼란에 빠진다면, 전체 여정은 실패하게 됩니다.

새로운 아이디어: "경주 (The Race)" (Wide Scaling)

이 논문의 저자들은 **와이드 스케일링(Wide Scaling)**이라는 다른 전략을 제안합니다. 하나의 로봇에게 제대로 해보라고 맡기는 대신, 동시에 열 대의 서로 다른 로봇을 보내 동일한 작업을 시도하게 합니다.

이것은 열 명의 주자가 달리는 경주와 같습니다. 주자 3번이 넘어지고 주자 7번이 길을 잃더라도, 아마 주자 5번은 지름길을 찾아 승리할 수 있을 것입니다. 목표는 열 번의 시도를 병렬로 실행한 다음 승자를 뽑는 것입니다.

병목 현상: 어떻게 승자를 뽑을 것인가?

여기 까다로운 문제가 있습니다. 열 대의 로봇 중 실제로 성공한 로봇이 누구인지 어떻게 알 수 있을까요?

  • 문제점: 로봇이 작업을 수행하는 열 시간 분량의 영상을 모두 지켜보는 것은 너무나 벅찬 일입니다. 영상의 대부분은 지루하거나 무관한 내용(예: 로봇이 빈 화면을 응시하는 모습 등)입니다. 게다가 많은 작업에는 완료하는 데 여러 가지 "정답" 경로가 존재할 수 있습니다. 단순한 스크립트는 원본 화면 녹화본만 보고는 로봇의 성공 여부를 쉽게 판단할 수 없습니다.
  • 비유: 요리 경연 대회를 심사하기 위해 셰프들이 요리하는 세 시간짜리 영화 열 편을 본다고 상상해 보세요. 당신은 지칠 것이고 중요한 순간을 놓칠 것입니다. 행동을 요약할 방법이 필요합니다.

해결책: "행동 판사 (Behavior Judge, BJudge)"

저자들은 **행동 판사(BJudge)**라는 새로운 시스템을 도입했습니다. 작동 단계는 다음과 같습니다.

  1. 경주: 서로 다른 AI 모델을 사용하여 작업을 열 번 동시에 실행합니다.
  2. 번역가 (행동 내러티브 생성기): 판사에게 화면의 원본 영상을 보여주는 대신, 이 시스템은 번역가 역할을 합니다. 이 시스템은 각 로봇의 시도를 관찰하고, 무슨 일이 일어났는지에 대한 짧고 명확한 이야기(내러티브)를 작성합니다.
    • 단순 기술: "로봇이 마우스를 좌표 400, 200으로 이동하여 클릭했고, 화면이 새로고침되었으며, 새 창이 열렸다..."
    • 내러티브: "로봇이 '저장'을 클릭했고, 문서가 폴더에 성공적으로 저장되었다."
    • 이 시스템은 노이즈를 걸러내고 오직 원인과 결과에 집중합니다: "나는 X를 했고, 그 결과 Y가 일어났다."
  3. 판사 (비교 평가자): 이제 판사는 열 시간의 영상을 보는 대신, 열 개의 짧은 이야기를 읽습니다. 판사는 이 이야기들을 나란히 놓고 비교합니다. "이야기 A는 파일이 저장되었다고 말한다. 이야기 B는 파일이 삭제되었다고 말한다. 이야기 A가 승리했다."

결과

그들이 OSWorld(실제 컴퓨터 작업 모음)라는 벤치마크에서 테스트했을 때의 결과는 다음과 같습니다.

  • 기존 최고 성능: 이전의 최고 방식은 작업의 약 **63.4%**를 성공했습니다.
  • 인간 수준: 인간은 약 **72.36%**를 성공합니다.
  • 새로운 방식 (BJudge): 이 시스템은 **72.6%**를 달성했습니다.

그들은 단순히 이전의 로봇들을 이긴 것이 아니라, 인간을 넘어섰습니다.

이것이 중요한 이유

이 논문은 AI 에이전트를 신뢰할 수 있게 만드는 핵심이 개별 에이전트를 더 똑똑하게 만드는 것뿐만 아니라, 여러 에이전트를 동시에 실행하고 최선의 결과를 선택하는 스마트한 시스템을 갖추는 데 있음을 보여줍니다.

그들은 또한 이 시스템을 다양한 운영 체제(Windows 및 Android)에서 테스트했으며, 이 "경주와 판사" 전략이 범용적으로 작동함을 입증하여 컴퓨터를 사용하는 AI를 더 견고하게 만드는 방법임을 증명했습니다.

요약하자면: AI 컴퓨터의 "취약함"을 해결하기 위해, 완벽한 로봇 하나를 만드는 데 집중하지 마세요. 열 대를 만들어 경주를 시키고, 그들의 복잡한 시도를 간단한 이야기로 번역한 뒤, 똑똑한 판사가 승자를 뽑게 하세요. 이 간단한 변화를 통해 그들은 복잡한 디지털 작업에서 인간의 성능을 뛰어넘을 수 있었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →