← 최신 논문
💬 NLP

ReVision: Scaling Computer-Use Agents via Temporal Visual Redundancy Reduction

이 논문은 연속된 스크린샷 간의 중복 패치를 선택적으로 제거함으로써 컴퓨터 사용 에이전트 궤적에서 시각적 토큰 중복성을 줄이는 ReVision 방법을 소개하며, 이를 통해 토큰 비용을 크게 낮추고 성공률을 향상시키며 에이전트가 더 긴 역사적 맥락을 효과적으로 활용할 수 있도록 합니다.

원저자: Amirhossein Abaskohi, Yuhang He, Peter West, Giuseppe Carenini, Pranit Chawla, Vibhav Vineet

게시일 2026-05-13
📖 3 분 읽기☕ 가벼운 읽기

원저자: Amirhossein Abaskohi, Yuhang He, Peter West, Giuseppe Carenini, Pranit Chawla, Vibhav Vineet

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하지만 약간 건망증이 있는 로봇 비서를 컴퓨터 화면을 탐색하여 항공권 예약이나 브라우저 기록 정리와 같은 복잡한 작업을 수행하도록 가르치려 한다고 상상해 보세요.

로봇이 한 걸음 움직일 때마다 화면의 사진을 찍습니다. 이 사진을 이해하기 위해 로봇은 이를 '토큰'이라고 불리는 수천 개의 작은 퍼즐 조각으로 분해합니다. 더 많은 사진을 볼수록 로봇이 다루어야 할 퍼즐 조각도 더 많아집니다.

문제: '스티커 노트' 과부하
해당 논문은 큰 비효율성을 지적합니다. 마우스를 움직이거나 버튼을 클릭할 때, 화면의 90% 는 보통 그대로 유지됩니다. 오직 아주 작은 모서리 부분만 변합니다.

그러나 현재의 AI 비서는 매 단계마다 95% 가 방금 붙인 스티커 노트와 동일함에도 불구하고, 완전히 새롭고 전체 페이지 분량의 스티커 노트를 벽에 붙이는 사람과 같습니다.

  • 결과: 그들의 벽 (컴퓨터의 메모리) 은 매우 빠르게 스티커 노트로 덮여 버립니다. 새로운 중요한 정보를 기록할 공간이 부족해집니다.
  • 결과: 그들은 같은 낡은 배경을 반복해서 보는 데 너무 바빠서, 긴 작업을 수행할 때 좋은 결정을 내리기 위해 과거를 충분히 기억하지 못합니다. 그들은 더 많은 기록을 추가할수록 중복 데이터에 압도되어 오히려 성능이 떨어지는 '한계점'에 도달합니다.

해결책: ReVision(스마트 지우개)
저자들은 이러한 디지털 스티커 노트를 위한 '스마트 지우개' 역할을 하는 새로운 방법인 ReVision을 소개합니다.

매번 전체 새 페이지를 붙이는 대신, ReVision 은 새로운 사진을 보고 *"지난 사진 이후로 실제로 무엇이 변했는가?"*라고 묻습니다.

  • 배경, 메뉴 모음, 텍스트가 이동하지 않았다면, ReVision 은 새로운 사진의 해당 부분을 지웁니다.
  • 그것은 새로운 행동 (새 버튼이 나타나거나 텍스트가 변경되는 등) 을 나타내는 작은 퍼즐 조각들만 유지합니다.
  • 결정적으로, 로봇이 사물의 위치를 혼동하지 않도록 화면의 형태를 온전하게 유지합니다.

비유: 영화 대 슬라이드 쇼
일반적인 AI 비서가 영화를 볼 때 초당 60 장의 동일한 사진으로 구성된 슬라이드 쇼를 보는 것처럼 생각하면, 이는 지치고 낭비적인 일입니다.
ReVision 은 영화를 실시간으로 보는 것과 같습니다. 움직이는 배우와 변하는 배경에만 주의를 기울이고 정적인 배경은 무시합니다.

논문의 발견
연구진은 컴퓨터 에이전트 (OSWorld, WebTailBench, AgentNetBench) 를 위한 세 가지 다른 '장애물 코스'에서 이를 테스트했습니다. 결과는 다음과 같습니다.

  1. 대규모 절감: ReVision 을 사용하면 AI 가 동일한 작업을 수행하는 데 필요한 '토큰' (퍼즐 조각) 이 약 46% 적게 사용되었습니다. 여행용 가방을 싸다가 같은 셔츠만 다시 입는다는 사실을 깨닫고 옷의 절반을 버릴 수 있는 것과 같습니다.
  2. 성능 향상: 놀랍게도 AI 는 비용을 절감했을 뿐만 아니라 더 똑똑해졌습니다. 성공률은 약 3% 상승했습니다.
    • 왜? 정적인 배경에 뇌력을 낭비하지 않았기 때문에, 작업 초기에 취한 중요한 단계를 기억할 수 있는 더 많은 '정신적 공간'을 확보할 수 있었기 때문입니다.
  3. '포화' 지점 돌파: 일반적으로 AI 에게 너무 많은 과거 사진을 주면 혼란을 겪고 더 이상 개선되지 않습니다. 논문은 이것이 과거 사진이 쓸모없어서가 아니라, AI 가 중복 데이터에 압도되었기 때문임을 발견했습니다. ReVision 이 노이즈를 정리하자, AI 는 실제로 더 많은 기록을 활용하여 길고 복잡한 작업에서 더 나아질 수 있었습니다.

결론
ReVision 은 컴퓨터 에이전트가 효율적인 관찰자가 되도록 가르칩니다. 매초마다 전체 화면을 암기하는 대신, 새로운 것에만 집중하도록 학습시킵니다. 이를 통해 그들은 더 긴 이야기를 기억하고, 더 나은 결정을 내리며, 데이터 처리량을 처리하기 위한 슈퍼컴퓨터 없이도 더 어려운 문제를 해결할 수 있습니다.

참고: 해당 논문은 마우스와 키보드를 제어하는 소프트웨어인 컴퓨터 사용 에이전트의 개선에 엄격히 초점을 맞추고 있습니다. 의료 응용, 임상적 용도, 또는 이러한 특정 에이전트의 효율성을 높이는 것을 넘어선 미래적 함의에 대해서는 논의하지 않습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →