← 최신 논문
💬 NLP

Video-Based Reward Modeling for Computer-Use Agents

이 논문은 컴퓨터 사용 에이전트의 작업 수행 성공 여부를 내부 논리 없이 실행 비디오만으로 평가할 수 있도록, 대규모 데이터셋과 시공간 토큰 가지치기 기술을 활용한 새로운 보상 모델 (ExeVRM) 을 제안하고 GPT-5.2 등 기존 최상위 모델보다 우수한 성능을 입증했습니다.

원저자: Linxin Song, Jieyu Zhang, Huanxin Sheng, Taiwei Shi, Gupta Rahul, Yang Liu, Ranjay Krishna, Jian Kang, Jieyu Zhao

게시일 2026-03-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Linxin Song, Jieyu Zhang, Huanxin Sheng, Taiwei Shi, Gupta Rahul, Yang Liu, Ranjay Krishna, Jian Kang, Jieyu Zhao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎬 1. 문제: "AI 비서가 일을 잘했는지 어떻게 알까?"

상상해 보세요. 당신이 AI 비서에게 **"내 이메일에서 '청구서'라는 제목의 파일을 찾아서 구글 드라이브에 저장해 줘"**라고 시켰습니다.

  • 기존의 방법: 우리는 AI 가 마지막에 저장된 파일만 보고 "완료!"라고 판단했습니다. 하지만 AI 가 중간에 실수를 하고 다시 고쳤는지, 아니면 엉뚱한 파일을 저장한 건지 알 수 없었습니다. 마치 시험지 정답만 보고 채점하는 것과 비슷하죠.
  • 새로운 문제: AI 가 컴퓨터 화면을 조작하는 과정 (클릭, 타이핑, 창 이동 등) 은 매우 길고 복잡합니다. 이 긴 과정을 AI 가 스스로 판단하려면 화면의 모든 부분을 다 봐야 하는데, 컴퓨터 메모리가 부족해지거나 너무 느려집니다.

🕵️‍♂️ 2. 해결책: "비디오 감시 카메라"를 켜다

이 연구팀은 **"AI 가 컴퓨터 화면을 조작하는 전 과정을 비디오로 녹화"**해서, 그 영상을 보고 "이 작업이 성공했나, 실패했나?"를 판단하는 새로운 시스템을 만들었습니다.

이를 **ExeVRM (실행 비디오 보상 모델)**이라고 부르는데, 쉽게 말해 **"AI 의 컴퓨터 사용 실력을 비디오로 평가하는 심판"**입니다.

핵심 아이디어 3 가지:

1. 📹 "5 만 3 천 개의 영화" (ExeVR-53k 데이터셋)

  • AI 가 성공한 경우와 실패한 경우의 컴퓨터 사용 영상 5 만 3 천 개를 모았습니다.
  • 비유: 마치 드라이빙 스쿨에서 5 만 3 천 개의 운전 영상을 모아, "어떤 운전이 안전하고 올바른지"를 가르치는 교재와 같습니다.
  • 특히, **"잘못된 명령"**을 만들어내는 기술 (적대적 지시 번역) 을 써서, AI 가 "아, 이 행동은 명령과 맞지 않구나!"라고 배우게 했습니다.

2. ✂️ "불필요한 장면 잘라내기" (시공간 토큰 가지치기)

  • 컴퓨터 화면을 녹화하면 배경 (바탕화면, 도구 모음 등) 이 계속 똑같이 나오기 때문에, AI 는 쓸데없는 정보에 에너지를 낭비합니다.
  • 이 연구팀은 **STP(공간 가지치기)**와 **TTP(시간 가지치기)**라는 기술을 썼습니다.
    • STP: 화면에서 변하지 않는 배경 (예: 고정된 메뉴바) 은 잘라냅니다.
    • TTP: 시간이 지나도 변하지 않는 장면 (예: 10 초 동안 아무 일도 안 일어난 화면) 은 건너뜁니다.
  • 비유: 긴 영화를 볼 때, 대사가 없는 배경 장면이나 중복된 장면을 스킵하고, 주인공이 중요한 결정을 내리는 순간만 모아서 빠르게 보는 것과 같습니다. 덕분에 고해상도 영상도 가볍게 처리할 수 있습니다.

3. 🏆 "심판의 눈" (보상 모델 학습)

  • 이렇게 정리된 영상을 보고 AI 는 "사용자의 명령을 잘 수행했는가?"를 판단합니다.
  • 단순히 "성공/실패"만 보는 게 아니라, **"어느 순간에 실수를 했는지"**도 정확히 찾아냅니다.
  • 비유: 축구 심판이 경기 전체를 보다가, "저 선수가 3 분 20 초에 핸드볼을 했어!"라고 정확히 지적하는 것과 같습니다.

🚀 3. 결과: "상위권 AI 를 능가하다"

이 새로운 시스템 (ExeVRM 8B) 을 테스트해 보니 놀라운 결과가 나왔습니다.

  • 성능: 기존에 유명한 상용 AI 모델들 (GPT-5.2, Gemini 3 Pro 등) 보다 더 정확하게 AI 의 실수를 찾아내고 성공 여부를 판단했습니다.
  • 이유: 다른 AI 들이 "마지막 결과물"만 본다면, 이 모델은 **"과정 전체의 비디오"**를 분석했기 때문입니다.
  • 효율성: "불필요한 장면 잘라내기" 기술을 써서 고화질 영상도 빠르게 처리할 수 있게 되었습니다.

💡 요약: 왜 이것이 중요한가요?

이 연구는 **"AI 가 컴퓨터를 다룰 때, 우리가 직접 하나하나 확인하지 않아도 AI 스스로가 '내가 잘했는지'를 비디오로 판단하고 학습할 수 있다"**는 것을 증명했습니다.

앞으로 AI 비서들이 더 복잡한 일을 시켜도, "실수한 부분을 정확히 찾아서 스스로 고치는" 똑똑한 비서들이 등장할 수 있는 토대가 된 것입니다. 마치 스스로 반성하고 성장하는 AI 학생을 만든 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →