Covering Human Action Space for Computer Use: Data Synthesis and Benchmark
본 논문은 CUActSpot 벤치마크와 렌더러 기반 데이터 합성 파이프라인을 도입하여 복잡한 저빈도 상호작용에서 컴퓨터 사용 에이전트의 낮은 신뢰성 문제를 해결하며, 이를 통해 4B 파라미터 모델이 다양한 GUI 모달리티에 걸쳐 더 큰 오픈소스 모델들을 능가할 수 있도록 합니다.
원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇 집사가 컴퓨터를 사용하는 법을 가르친다고 상상해 보세요. 버튼 클릭, 이메일 작성, 파일 정리 등을 당신처럼 하길 원합니다. 오랫동안 연구자들은 이러한 로봇들을 주로 단순한 클릭 작업, 예를 들어 "제출" 버튼을 누르거나 링크를 클릭하는 것 위주로 훈련시켜 왔습니다. 이는 로봇에게 문종이를 누르는 법만 가르치는 것과 같습니다.
하지만 실제 컴퓨터 사용은 훨씬 더 복잡합니다. 때로는 한 폴더에서 다른 폴더로 파일을 드래그하거나, 사진을 잘라내기 위해 사진 주위에 동그라미를 그리거나, 삭제할 특정 문단을 선택해야 할 수도 있습니다. 이 논문은 현재의 로봇 집사들이 이러한 "롱테일" 작업에 실패하는 이유는 충분히 연습하지 못했기 때문이라고 주장합니다. 이는 객관식 시험만 공부한 학생이 갑자기 에세이를 쓰도록 요구받는 것과 같습니다.
다음은 저자들이 이를 해결하기 위해 수행한 작업을 간단한 비유로 정리한 것입니다:
1. 문제: "클릭만" 함정에 빠지다
저자들은 GPT-5.4 와 같은 고급 AI 모델이 컴퓨터를 사용하려 할 때 실패하는 이유를 분석했습니다. 그들은 로봇들이 단순한 클릭에는 익숙하지만 스프레드시트 셀을 드래그하거나 도형을 그리는 것과 같은 복잡한 작업을 요구받으면 혼란을 겪는다는 사실을 발견했습니다.
- 비유: 시동 키를 돌리는 것만 연습하는 운전 면허 시험을 상상해 보세요. 갑자기 병렬 주차나 고속도로 합류를 해야 한다면 사고가 날 것입니다. 현재의 AI 모델은 키를 돌리는 것 (클릭) 에는 뛰어나지만 주차 (드래그 및 그리기) 에는 매우 서툴습니다.
2. 해결책 1 부: 새로운 "운전 시험" (CUActSpot)
이를 해결하기 위해 팀은 CUActSpot이라는 새로운 벤치마크를 구축했습니다. 이는 로봇을 위한 더 어렵고 새로운 운전 시험이라고 생각하세요.
- 무엇이 다른가요? 로봇에게 단순히 "빨간 버튼을 클릭하라"고 요구하는 대신, 이 시험은 다음과 같은 작업을 요구합니다:
- 파일을 휴지통으로 드래그하기.
- 두 도형을 연결하는 선을 그리기.
- 문서에서 특정 단어를 선택하기.
- 사진에서 사람을 잘라내기.
- 다섯 가지 세계: 이 시험은 화면상의 다섯 가지 다른 "세계"를 다룹니다. 표준 앱 (GUI), 텍스트 문서, 스프레드시트 (테이블), 드로잉 캔버스, 그리고 자연 사진입니다.
- 규칙: 로봇을 평가하기 위해 엄격한 규칙을 만들었습니다. 로봇이 파일을 드래그하려다가 실수로 "금지" 영역 (예: 팝업 광고) 을 클릭하면 즉시 실패합니다. 이는 로봇이 운이 좋은 것이 아니라 정밀해야 함을 보장합니다.
3. 해결책 2 부: "마법 공장" (데이터 합성)
가장 큰 문제는 로봇을 가르칠 복잡한 행동의 예시가 부족했다는 것입니다. 인간이 드래그와 그리기 작업을 수백만 시간 동안 기록하기를 기다릴 수는 없습니다. 시간이 너무 오래 걸리기 때문입니다.
- 비유: 실제 운전사들이 연습하기를 기다리는 대신, 팀은 비디오 게임 시뮬레이터를 구축했습니다.
- 작동 원리: 그들은 수백만 개의 가짜 컴퓨터 화면을 자동으로 생성하는 코드를 작성했습니다.
- 무작위 숫자가 포함된 가짜 스프레드시트를 만들었습니다.
- 캔버스에 가짜 도형을 그렸습니다.
- 실제 사진을 가져와 특정 부분을 표시했습니다.
- "선생님" (LLM): 그들은 스마트한 AI(대규모 언어 모델, LLM) 를 사용하여 이러한 가짜 화면을 보고 "노란색 원의 꼭대기로 초록색 화살표를 드래그하라"는 지시를 작성하게 했습니다. AI 는 로봇이 이동해야 할 정확한 좌표도 계산했습니다.
- 결과: 그들은 5 천만 개의 연습 샘플을 생성했습니다. 이는 로봇이 실제 자동차를 만지기 전에 시뮬레이터에서 수백만 시간의 운전 연습을 하는 것과 같습니다.
4. 발견: 양보다 다양성이 더 중요하다
팀은 로봇을 더 똑똑하게 만드는 요인이 무엇인지 실험했습니다. 그들은 놀라운 사실을 발견했습니다:
- 옛날 방식: 로봇에게 같은 것을 더 많이 주는 것 (예: 버튼 클릭 1 천만 개) 은 큰 도움이 되지 않았습니다.
- **새로운 방식 (다양성 확장): 로봇에게 서로 다른 종류의 작업 (클릭, 드래그, 그리기, 테이블, 텍스트) 을 주는 것이 훨씬 더 똑똑하게 만들었습니다.
- 비유: 이는 요리사와 같습니다. 양파 다지기만 연습하면 양파 다지기는 잘하지만, 양파 다지기, 토마토 썰기, 스테이크 구이, 빵 굽기 등을 모두 연습하면 어떤 레시피든 다룰 수 있는 마스터 셰프가 됩니다. 로봇은 움직이는 물체의 종류보다 마우스를 움직이는 기술이 더 중요하다는 것을 배웠습니다.
5. 결과: 새로운 로봇 (Phi-Ground-Any-4B)
이 새로운 "운전 시험"과 데이터의 "마법 공장"을 사용하여 그들은 Phi-Ground-Any-4B라는 새로운 모델을 훈련시켰습니다.
- 성과: 이 모델은 상대적으로 작습니다 (파라미터 40 억 개). 그럼에도 불구하고 이 복잡한 작업에서 훨씬 더 큰 오픈소스 모델들 (일부는 320 억 개 이상의 파라미터) 보다 뛰어난 성능을 발휘했습니다.
- 단점: 이 모델은 여전히 옛날 스타일의 시험 (표준 버튼 클릭에만 초점을 맞춘) 에서는 다소 약하지만, 실제 컴퓨터 사용에 실제로 중요한 새로운 복잡한 작업에서는 챔피언입니다.
요약
이 논문은 다음과 같이 말합니다: "로봇에게 클릭하는 법만 가르치는 것을 멈추세요. 실제 컴퓨터 사용에는 드래그, 그리기, 편집이 포함됩니다. 우리는 이러한 기술을 측정하기 위한 새로운 시험을 구축하고, 수백만 개의 연습 예제를 생성하는 공장을 만들었으며, 로봇에게 다양한 행동을 가르치는 것이 단순히 클릭하는 법을 가르치는 것보다 컴퓨터 사용에 훨씬 더 효과적임을 증명했습니다."
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.