← 최신 논문
💻 computer science

Agentic Reward Modeling: Verifying GUI Agent via Progressive Trajectory-Grounded Interaction

이 논문은 기존의 수동적이고 과도한 탐색(over-probing)을 수행하는 보상 모델링 방식의 한계를 극복하기 위해 점진적인 표면-잠재 검증(surface-to-latent verification) 메커니즘을 갖춘 도구 증강 검증 에이전트를 활용하는 프레임워크인 VAGEN을 소개하며, 이를 통해 OSWorld-Verified 및 AndroidWorld와 같은 벤치마크에서 GUI 에이전트 평가의 정확도와 효율성을 크게 향상시킨다.

원저자: Chaoqun Cui, Jing Huang, Shijing Wang, Liming Zheng, Qingchao Kong, Zhixiong Zeng

게시일 2026-07-28
📖 5 분 읽기🧠 심층 분석

원저자: Chaoqun Cui, Jing Huang, Shijing Wang, Liming Zheng, Qingchao Kong, Zhixiong Zeng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 컴퓨터 사용법을 가르치고 있다고 상상해 보세요. 당신은 앱을 열고, 버튼을 클릭하고, 책을 사거나 파일을 정리하는 것과 같은 작업을 완수하도록 로봇을 가르치고 싶어 합니다. 로봇을 가르치기 위해서는 로봇이 잘 해냈을 때와 실수했을 때를 알려줄 방법이 필요합니다. 이것이 바로 **강화 학습(Reinforcement Learning)**의 세계로, AI가 무언가를 시도하고 성공했을 때 "보상"을 받으며 배우는 방식입니다. 하지만 여기서 까다로운 문제가 있습니다. 로봇이 정말로 일을 끝냈는지 어떻게 알 수 있을까요? 정말로 책을 산 것일까요, 아니면 그저 구매 버튼처럼 보이는 것을 클릭한 것뿐일까요? 이것이 바로 **보상 모델링(Reward Modeling)**의 문제입니다. 만약 로봇이 성공하지 못했는데도 성공했다고 생각한다면, 로봇은 똑같은 실수를 계속 반복할 것입니다. 반대로 성공했는데도 실패했다고 생각한다면, 로봇은 혼란에 빠져 시도를 멈추게 될 것입니다. 이 "점수"를 얼마나 정확하게 매기느냐가 서투른 로봇과 유능한 조수의 차이를 만듭니다.

오랫동안 과학자들은 로봇을 채점하기 위해 두 가지 주요 방법을 시도했습니다. 첫 번째는 체크리스트를 가진 엄격한 선생님과 같았습니다: "파일이 나타났는가? 예. 창이 닫혔는가? 예." 이 방식은 단순한 작업에는 효과적이지만, 창의적이거나 개방적인 작업에서는 한계가 있습니다. 두 번째 방법은 매우 똑똑한 AI(대규모 언어 모델)에게 로봇의 작업 영상을 보여주고 성공 여부를 추측하게 하는 것이었습니다. 이는 확장성이 좋지만, AI는 수동적입니다. AI는 화면에 보이는 것만 볼 수 있을 뿐입니다. 컴퓨터의 "두뇌" 내부를 들여다보고 파일이 실제로 백그라운드에서 저장되었는지 확인할 수는 없습니다. 이는 마치 학생이 실제로 공부를 했는지, 아니면 운 좋게 정답을 맞힌 것인지 확인하지 않고 오직 최종 답안지만 보고 수학 시험을 채점하는 선생님과 같습니다.

이 논문은 컴퓨터를 사용하는 로봇을 위한 더 똑똑한 채점 방식을 소개합니다. 저자 Chaoqun Cui와 동료들은 VAGEN이라 불리는 시스템을 제안합니다. 단순히 영상을 보거나 체크리스트를 확인하는 대신, VAGEN은 "조사관 에이전트(Verifier Agent)"라는 두 번째 AI 탐정을 사용합니다. 이 탐정은 능동적으로 조사할 수 있습니다. 마치 용의자의 알리바이(로봇의 영상)를 읽기만 하는 것이 아니라, 직접 범죄 현장에 들어가 숨겨진 파일을 확인하고 테스트를 실행하여 이야기가 사실인지 확인하는 데 권한을 가진 탐정과 같습니다. 저자들은 이러한 능동적이고 조사적인 접근 방식이, 특히 로봇의 행동이 화면에 보이지 않는 흔적을 남길 때 진실을 포착하는 데 훨씬 더 뛰어나다는 것을 발견했습니다. 그들은 이 방법이 더 정확할 뿐만 아니라 효율적이라는 것을 보여주었으며, 때로는 일이 정말로 완료되었는지 알기 위해 직접 손을 더럽혀야 한다는 것을 증명했습니다.

디지털 세계의 탐정

그렇다면 이 새로운 탐정인 VAGEN은 실제로 어떻게 작동할까요? 저자들은 로봇이 작업을 마쳤는지 확인하는 것이 작업을 수행하는 것 자체보다 훨씬 쉽다는 점을 깨달았습니다. 그것은 케이크를 굽는 것과 케이크가 다 구워졌는지 확인하는 것의 차이와 같습니다. 제빵사(이하 "액터(Actor)" 로봇)는 재료를 섞고, 오븐을 지켜보고, 케이크를 장식해야 합니다. 하지만 심판(이하 "베리파이어(Verifier)")은 케이크를 이쑤시개로 찔러보거나 주방 냄새를 맡는 것만으로도 준비가 되었는지 알 수 있습니다. 저자들은 이를 "해결하기는 어렵지만 검증하기는 쉬운(easy to verify, hard to solve)" 속성이라고 부릅니다.

이를 구현하기 위해 VAGEN은 **단계적 검증 메커니즘(Progressive Verification Mechanism)**을 사용합니다. 베리파이어가 미스터리를 해결하는 탐정이라고 상상해 보세요. 그들은 시간을 낭비하지 않기 위해 구체적인 전략을 가지고 있습니다. 그들은 바로 문을 부수고 들어가는 대신, 가장 쉬운 단서부터 시작하여 필요할 경우에만 더 공격적으로 접근합니다.

1단계: 빠른 훑어보기 (정적 평가 - Static Assessment)
먼저, 베리파이어는 컴퓨터 화면의 최종 모습과 로봇이 수행한 작업의 요약을 살펴봅니다. 그리고 묻습니다. "이것이 승리처럼 보이는가?" 만약 화면에 "주문 완료" 메시지가 명확히 표시되어 있다면, 탐정은 "사건 종료!"라고 말하며 넘어갑니다. 이 단계는 빠르고 비용이 적게 듭니다.

2단계: 테이프 되감기 (시각적 회상 - Visual Retrospection)
만약 최종 화면이 모호하다면—예를 들어 화면이 비어 있거나 메시지가 숨겨져 있다면—탐정은 포기하지 않습니다. 대신, 영상을 되감습니다. 그들은 이전 단계의 스크린샷들을 살펴보며 단서를 찾습니다. 설령 최종 화면이 엉망이더라도, 로봇이 5분 전에 올바른 버튼을 클릭했을 수도 있습니다. 이는 보안 카메라 영상을 확인하여 용의자가 실제로 건물에 들어갔는지 확인하는 것과 같습니다.

3단계: 침입 및 조사 (선제적 프로빙 - Proactive Probing)
때로는 단서가 화면에 전혀 없을 수도 있습니다. 로봇이 하드 드라이브에 파일을 저장하기로 되어 있었지만, 화면에는 그저 일반적인 "완료" 메시지만 떠 있을 수 있습니다. 화면이 거짓말을 하고 있거나, 최소한 진실을 숨기고 있는 것입니다. 여기서 VAGEN은 정말 멋지게 작동합니다. 베리파이어 에이전트는 컴퓨터와 능동적으로 상호작용할 수 있는 특별한 도구를 가지고 있습니다. 코드를 실행하거나, 파일 시스템을 확인하거나, 심지어 직접 버튼을 클릭하여 파일이 정말로 존재하는지 테스트할 수 있습니다. 이는 탐정이 마침내 용의자의 집을 수색할 영장을 받은 것과 같습니다. 그들은 이야기를 믿기만 하는 것이 아니라, 직접 지하실까지 내려가 확인합니다.

논문은 이 "표면에서 잠재 영역으로(surface-to-latent)" 이어지는 접근 방식이 게임 체인저임을 보여줍니다. 저자들은 두 가지 큰 작업 세트인 OSWorld-Verified(데스크톱 컴퓨터)와 AndroidWorld(모바일 폰)에서 VAGEN을 테스트했습니다.

결과: 더 똑똑하고 더 빠르게

저자들이 수치를 분석했을 때, VAGEN은 단순히 괜찮은 수준을 넘어 경쟁자들을 압도했습니다. 데스크톱 벤치마크에서 다른 방법들이 정확도 80%를 넘기 위해 고군분투하는 동안, VAGEN은 인간 전문가의 판단 기준으로 **92.9%**의 정확도를 달달성했습니다. 더욱 인상적인 것은, 모든 스크린샷을 확인하거나 끝없는 테스트를 실행하지 않고도 이 성과를 냈다는 점입니다. VAGEN은 답을 찾으면 즉시 멈출 정도로 영리했습니다.

또한 이 논문은 중요한 발견을 강조합니다: 능동적인 상호작용은 필요하지만, 항상 첫 번째 단계는 아니다. "프로빙(시스템 확인)"에 과도하게 의존했던 기존 방식들은 영상 증거를 먼저 확인하지 않았기 때문에 종종 느리고 비효율적이었습니다. 그들은 문 앞에 서서 확인도 하지 않고 바로 문을 부수고 들어가는 탐정과 같았습니다. 반면 VAGEN은 영상 증거를 사용하여 조사를 안내합니다. 영상만으로는 충분하지 않을 때만 시스템을 조사합니다. 이러한 균형 덕분에 VAGEN은 더 나은 답을 얻으면서도 더 적은 컴퓨터 자원(예: "단계" 또는 "토큰")을 사용하여 훨씬 더 효율적이었습니다.

저자들은 베리파이어에게 동일한 작업을 여러 번 확인하도록 요청함으로써(이 전략을 "스케일링"이라 함) 베리파이어를 더 발전시킬 수 있는지 테스트했습니다. 그들은 베리파이어가 데이터를 "읽기"만 하고 아무것도 변경하지 못하도록 제한했을 때도 훨씬 더 똑똑해진다는 것을 발견했습니다. 이는 베리파이어의 주된 임무가 컴퓨터를 건드리는 것이 아니라 조사하는 것임을 시사합니다.

이것이 왜 중요한가

여기서 핵심적인 교훈은, 우리가 게으른 관찰자와 참견하기 좋아하는 탐정 중 하나를 선택할 필요가 없다는 것입니다. 우리는 둘 다 가질 수 있습니다. 로봇의 영상에 대한 수동적인 관찰과 컴퓨터의 숨겨진 상태를 확인할 수 있는 능동적인 힘을 결합함으로써, VAGEN은 신뢰할 수 있고 효율적인 보상 시스템을 만듭니다.

저자들은 이것이 AI 에이전트를 훈련하는 미래라고 주장합니다. 우리가 진정으로 우리의 컴퓨터와 휴대폰을 도와줄 수 있는 로봇을 원한다면, 예쁜 그림에 속지 않는 방식으로 그들을 채점할 방법이 필요합니다. VAGEN은 AI 채점자에게 더 깊이 파고들 수 있는 도구를 제공함으로써, 우리가 로봇을 훨씬 더 유능하게 가르칠 수 있다는 것을 보여줍니다. 이 논문은 세상의 모든 문제를 해결했다고 주장하는 것이 아닙니다. 다만 명확한 길을 제시합니다: 단순히 쇼를 구경하는 것을 멈추고, 무대 뒤를 확인하기 시작하십시오.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →