← 최신 논문
🤖 AI

UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations

이 논문은 확장 가능한 환경 기반 학습 스택과 인컨텍스트 시연 학습을 활용하여 장기적 컴퓨터 사용 작업에서 최첨단 성능을 달성하고 기본 모델 대비 신뢰성과 성공률을 크게 향상시킨 오픈 웨이트 파운데이션 GUI 에이전트인 UI-Mate를 소개한다.

원저자: Zihan Ding, Longxu Dou, Qi Gao, Xiangwu Guo, Shengchao Hu, Zilong Huang, Zihang Jiang, Lei Ke, Mengcheng Lan, Weixian Lei, Hanxuan Li, Honglin Li, Xiyun Li, Zaitang Li, Leowei Liang, Xin Luo, Haozhe M
게시일 2026-08-18
📖 6 분 읽기🧠 심층 분석

원저자: Zihan Ding, Longxu Dou, Qi Gao, Xiangwu Guo, Shengchao Hu, Zilong Huang, Zihang Jiang, Lei Ke, Mengcheng Lan, Weixian Lei, Hanxuan Li, Honglin Li, Xiyun Li, Zaitang Li, Leowei Liang, Xin Luo, Haozhe Ma, Jiayi Mao, Zhoujie Pan, Can Qin, Tianyuan Qu, Weiqi Wang, Wenkai Wang, Yonglin Wang, Yuxin Wang, Chenxu Wu, Yingchen Yu, Chenyu Zhang, Yuhao Zheng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터는 복잡한 정보를 처리하는 강력한 도구가 되었지만, 기계에게 다단계 사무 업무를 수행하도록 요청하는 것은 마치 목적지만 설명하며 아이에게 운전을 가르치는 것과 같은 느낌을 주곤 합니다. 수년 동안 연구자들은 화면을 보고, 무엇을 해야 하는지 이해하며, 목적지에 도달하기 위해 올바른 버튼을 클릭할 수 있는 인공지 intelligence 에이전트를 구축하려고 노력해 왔습니다. GUI 에이전트라고 불리는 이러한 시스템들은 진전을 이루었지만, 두 가지 지속적인 문제로 어려움을 겪고 있습니다. 첫째, 사람들이 실제로 소프트웨어를 사용하는 방식의 미묘하고 암묵적인 규칙을 학습하기 위한 고품질의 연습 데이터가 부족합니다. 둘째, 이들은 너무 경직되어 있습니다. 만약 인간이 모호한 지시를 내리면, 기계는 운 좋게 한 번은 성공할 수 있지만, 화면의 작은 변화나 사용자의 특정 습관에 적응하지 못해 다음번에는 실패하곤 합니다. 목표는 단순히 스크립트를 따를 정도로 똑똑한 것이 아니라, 실제 데스크톱의 무질서한 현실을 처리할 수 있을 정도로 신뢰할 수 있는 디지털 노동자를 만드는 것이었습니다.

텐센트(Tencent)의 한 팀은 에이전트가 학습하는 방식과 도움을 받는 방식을 바꿈으로써 이러한 문제를 해결하는 새로운 시스템인 UI-Mate를 선보였습니다. 단순히 클릭 목록을 암기하는 대신, 이 시스템은 스프레드시트 정리부터 이메일 관리까지 수천 가지의 작업을 연습할 수 있는 시뮬레이션 환경에서 훈련되며, 특화된 엔진이 실시간으로 작업 내용을 점검합니다. 이 과정은 시스템이 최종 결과가 어떤 모습이어야 하는지뿐만 아니라, 실수를 했을 때 어떻게 복구해야 하는지도 학습하게 해줍니다. 연구진은 이처럼 엄격한 폐쇄 루프(closed-loop) 방식으로 에이전트를 훈련함으로써, 이전의 오픈 소스 시스템보다 훨씬 더 뛰어난 성능을 구현하고 훨씬 더 큰 규모의 독점 모델들과도 대등한 능력을 갖출 수 있다는 것을 발견했습니다.

이러한 개선의 핵심은 연구진이 "환경 기반 훈련(environment-grounded training)"이라고 부르는 방법입니다. 이는 마치 학생이 단순히 레시피를 읽는 것이 아니라, 실제로 주방에 서서 채소를 썰면서 칼이 미끄러지거나 불이 너무 세면 즉시 지적받는 선생님과 함께 요리를 배우는 것과 같습니다. 마찬가지로, UI-Mate는 모든 동작이 실제 작동하는 컴퓨터 화면에 대해 테스트되는 디지털 환경에서 훈련됩니다. 만약 에이전트가 파일을 잘못된 위치에 저장하려고 하면, 시스템은 즉시 이를 인지하고 실패를 기록합니다. 이러한 시도, 실패, 그리고 수정의 순환은 다양한 애플리케이션에 걸쳐 수백만 번 반복되며, 이를 통해 에이전트는 소프트웨어가 어떻게 작동하는지에 대한 깊은 이해를 쌓을 수 있습니다. 연구진은 단순한 파일 관리부터 캘린더, 이메일 클라이언트, 프로젝트 관리 도구 사이에서 정보를 이동해야 하는 복잡한 워크플로우에 이르기까지 방대한 연습 작업 라이브러리를 구축했습니다. 에이전트가 접하는 작업의 유형을 세심하게 균형 있게 맞춤으로써, 짧고 단순한 작업과 길고 복잡한 시퀀스를 혼동 없이 모두 처리할 수 있도록 보장했습니다.

하지만 아무리 잘 훈련된 에이전트라도 "이 후보자의 제안을 처리해 줘"와 같이 인간이 모호한 지시를 내릴 때는 어려움을 겪을 수 있습니다. 에이전트는 어떤 특정 파일을 열어야 할지, 혹은 정확히 어떤 버튼을 클릭해야 할지 알 수 없는데, 이는 지시에 필요한 세부 사항이 부족하기 때문입니다. 이를 해결하기 위해 연구진은 에이전트가 시연으로부터 학습하는 새로운 방법을 개발했습니다. 에이ка가 녹화된 마우스 클릭 시퀀스를 맹목적으로 복사하도록 강요하는 대신, 시스템은 시연을 유연한 하위 작업(subtasks) 계획으로 분해합니다. 시스템은 인간이나 더 강력한 AI가 유사한 업무를 완료하는 영상을 보고 "제안서 찾기", "급여 확인하기", "이메일 보내기"와 같은 목표를 추출합니다. 실제 작업 중에 에이전트는 이 계획을 가이드로 사용하되, 여전히 라이브 화면을 보면서 마우스를 어떻게 움직이거나 텍스트를 입력할지 결정합니다. 이는 만약 화면이 영상과 약간 다르더라도, 에이전트가 멈춰 서는 대신 동작을 조정할 수 있음을 의미합니다.

이러한 접근 방식의 결과는 놀랍습니다. 표준적인 컴퓨터 사용 챌린지에서 테스트했을 때, 이 새로운 시스템, 특히 270억 개의 파라미터를 가진 버전은 77.0%의 성공률을 달 기록하며 다른 오픈 소스 모델들을 능가했고, 사용 가능한 최고의 폐쇄형 모델들에 매우 근접했습니다. 더 중요한 것은, 연구진이 수십 가지의 다양한 애플리케이션에 걸쳐 현실적인 사무 업무를 시뮬레이션하는 새로운 테스트인 OSWorkerBench를 만들었다는 점입니다. 이 테스트에서 시스템은 기본 모델에 비해 성능이 거의 18%포인트 향상되었습니다. 그러나 가장 주목할 만한 발견은 단 하나의 시연을 에이전트의 지침에 추가했을 때 나타났습니다. 33개의 길고 복잡한 작업 세트에 대해, 해당 업무를 수행하는 단 하나의 예시를 제공하는 것만으로도 에이전트의 성공률이 17.2%에서 35.4%로 높아졌습니다. 이는 시스템이 단순히 예시를 암기하는 것이 아니라, 근본적인 논리를 이해하고 이를 새로운 상황에 적용할 수 있음을 보여주며, 실생활 사용에서 훨씬 더 신뢰할 수 있게 만듭니다.

연구진은 또한 에이전트가 긴 작업을 처리하는 능력이 단순히 원시 컴퓨팅 파워에 의한 것이 아님을 발견했습니다. 그들은 다양한 크기의 모델을 테스트했으며, 더 큰 모델이 일반적으로 더 나은 성능을 보이지만, 구체적인 훈련 방법이 크기 자체보다 더 중요하다는 것을 발견했습니다. 엄격한 환경 기반 훈련을 받은 더 작은 모델이 동일한 훈련을 받지 못한 훨씬 더 큰 모델보다 더 뛰어난 성능을 보였습니다. 이는 에이전트의 '두뇌'를 단순히 키우는 것보다 훈련 데이터의 품질과 피드백 루프가 더 결정적이라는 것을 시사합니다. 또한 시스템은 워크플로우의 시작 부분에서 얻은 정보를 마지막 단계에서 사용하는 정보를 기억해야 하는 작업들을 처리할 수 있는 능력도 입증했습니다. 이는 기존 AI 에이전트들이 흔히 실패하던 지점이었습니다.

이러한 결과가 우연이 아님을 확인하기 위해, 팀은 인사, 영업, 엔지니어링 등 100가지의 뚜렷한 사무 업무를 포함하는 벤치마크를 구축했습니다. 그들은 도움 없이 작업을 완료하는 능력과 시연을 통한 능력을 평가했습니다. 데이터에 따르면 에이전트는 시각적 가이드가 주어졌을 때 일관되게 성능이 향다면, 가이드에 의존하지는 않았습니다. 에이전트는 지시만으로도 작업을 수행할 수 있는 능력을 유지했으며, 이는 시연이 경직된 규칙이 아니라 도움이 되는 지도 역할을 했음을 증명합니다. 이러한 균형은 실제 배포에 있어 매우 중요한데, 이는 사전 예시가 없는 상황에서도 시스템을 사용할 수 있으면서도, 사용자가 예시를 제공할 때 빠르게 학습할 수 있음을 의미하기 때문입니다.

이 연구의 함의는 단순히 더 높은 테스트 점수를 얻는 것에 그치지 않습니다. 연구진은 에이전트가 복잡하고 다중 애플리케이션을 사용하는 워크플로우를 높은 신뢰도로 탐색할 수 있음을 보여줌으로써, 디지털 자동화를 일상적인 사무 업무의 실질적인 현실로 만드는 데 중요한 발걸음을 내디뎠습니다. 이 시스템은 인간이 모든 클릭을 마이크로 매니징할 필요가 없습니다. 대신, 높은 수준의 목표를 받아들여 필요한 단계를 찾아내고, 예상치 못한 화면 레이아웃이나 누락된 정보를 만났을 때 스스로 경로를 수정할 수 있습니다. 단 하나의 시연으로부터 학습할 수 있는 능력은, 이러한 에이전트가 결국 몇 달이 아닌 몇 분 만에 특정 회사의 절차를 배울 수 있음을 시사합니다.

또한 이 연구는 이러한 시스템을 평가하는 방식의 중요성을 강조합니다. 연구진은 단순히 작업의 완료 여부만을 세는 것이, 에이전트가 마지막 단계 직전에 상당한 진전을 이루었음에도 불구하고 실패했다는 사실을 가릴 수 있다는 것을 발견했습니다. 부분적인 진행도를 측정함으로써, 그들은 에이전트가 복잡한 작업의 80%를 수행했음에도 불구하고 완료하지 못했을 때의 상황을 파악할 수 있었습니다. 이러한 미세한 차이는 현재 기술의 현주소와 개선이 필요한 부분을 이해하는 데 중요합니다. 팀은 가장 흔한 실패 사례가 작업의 초기 단계가 아니라, 확인 이메일을 보내는 것을 잊거나 양식의 특정 필드를 빠뜨리는 것과 같은 마지막 단계에서 발생한다는 것을 확인했습니다.

결국, 이 연구는 더 유능한 컴퓨터 에이전트를 구축하기 위한 명확한 경로를 제시합니다. 이는 엄격한 시뮬레이션 훈련과 시각적 예시로부터 학습하는 능력을 결합하면 강력하면서도 적응력이 뛰어난 시스템을 만들 수 있음을 보여줍니다. 연구진은 자신의 훈련 데이터와 벤치마크를 커뮤니티에 공개하여 다른 이들이 이 발견을 바탕으로 발전시킬 수 있도록 했습니다. 이러한 시스템이 계속 진화함에 따라, 인공지능이 현재 인간의 업무 시간을 많이 소비하는 일상적이고 반복적이며 복잡한 디지털 작업들을 처리하게 되어, 사람들이 진정으로 인간의 판단을 필요로 하는 결정에 집중할 수 있는 미래로 한 걸음 더 다가서고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →