Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents
Qwen-UI-Agent는 모바일, 컴퓨터, 웹, DeepSearch 환경을 하이브리드 액션 공간 및 AutoResearch 스타일의 데이터 플라이휠과 통합하여 모바일 벤치마크에서 최첨단 성능을 달hi는 동시에 더 넓은 디지털 작업 전반에 걸쳐 경쟁력 있는 결과를 제공하는 실세계 중심의 파운데이션 GUI 에이전트입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 당신의 디지털 맥락을 처리하고 당신이 요청하는 무엇이든 할 수 있는 아주 똑똑한 로봇 친구가 있다고 상상해 보세요. 하지만 지금 이 로봇은 오직 방해 요소가 없는 완벽하고 조용한 교실에서만 공부한 학생과 같습니다. 그 로봇은 종이 위에 수학 문제를 푸는 법은 알지만, 만약 당신이 그 로봇을 끈적한 가스레인지와 짖는 개, 그리고 문이 뻑뻑하게 끼는 실제의 어수선한 주방에 놓아둔다면, 당황해서 토스트를 떨어뜨릴지도 모릅니다. 이것이 현재 "GUI 에이전트(GUI agents)"의 상태입니다. GUI 에이전트는 화면을 보고 인간처럼 버튼을 클릭하도록 설계된 컴퓨터 프로그램입니다. 이들은 안전한 시뮬레이션 비디오 게임 속에서는 지시를 잘 따르지만, 실제 휴대폰이나 컴퓨터가 가진 혼란스럽고 예측 불가능한 현실 앞에서는 자주 비틀거립니다.
과학자들이 던지는 핵심적인 질문은 이것입니다: 어떻게 하면 이 디지털 조력자들이 '교실 속 학생'에서 벗어나 '실제 세상의 전문가'가 되도록 가르칠 것인가? 우리는 그들이 단순히 버튼을 클릭하는 것을 넘어, 팝업 광고가 자신의 시야를 가리고 있다는 것을 인지하고, 흐름을 놓치지 않으면서 휴대폰과 노트북 사이를 전환하며, 심지어 무언가 잘못되었을 때(예: 항공편 취소) 당신이 요청하기도 전에 이를 알아차리고 해결책을 제시할 수 있도록 만들어야 합니다. 만약 우리가 이 코드를 풀어낸다면, 이 에이전트들은 여행 예약부터 당신의 디지털 생활 정리까지 모든 것을 처리하며, 기술을 싸워 이겨야 할 도구가 아니라 마치 나를 잘 이해해 주는 파트너처럼 느끼게 만드는 궁극의 비서가 될 것입니다.
Qwen-UI-Agent를 만나보세요: 현실 세계에서 살아남는 법을 배운 로봇
Alibaba의 MAI-UI 팀이 개발한 새로운 종류의 디지털 조력자, Qwen-UI-Agent를 소개합니다. 이것은 훈련용 더미를 상대로 연습하는 로봇과 실제로 링 위에서 싸워본 로봇의 차이와 같습니다. 다른 에이전트들이 비디오 게임 시뮬레이션에서 완벽한 점수를 받는 데 몰두하는 동안, Qwen-UI-Agent는 실제 앱과 실제 인터넷 연결, 그리고 실제 삶의 방해 요소들이 존재하는 100대 이상의 물리적 휴대폰을 탐험하며 야생에서 학습했습니다.
팀은 진정으로 유용한 에이전트를 만들기 위해서는 단순히 뇌를 더 똑똑하게 만드는 것뿐만 아니라, 몸체와 그들이 살아가는 환경 전체를 바꿔야 한다는 것을 깨달았습니다. 이 마법 같은 과정을 재미있는 비유를 사용하여 설명해 보겠습니다.
1. "실제 세계의 체육관" vs "비디오 게임"
대부분의 AI 에이전트는 매 시도마다 모든 것이 완벽하게 초기화되는 "샌드박스(sandbox)"—디지털 방—에서 훈련합니다. 이는 농구 골대가 절대 움직이지 않고 공이 결코 잘못 튀지 않는 체육관에서 농구 연습을 하는 것과 같습니다. 하지만 실제 삶은 무질서합니다. 휴대폰에는 팝업 광고가 뜨고, 앱은 충돌하며, 예상치 못한 권한 요청을 받을 수도 있습니다.
Qwen-UI-Agent는 **실제 기기 모바일 런타임(Real-Device Mobile Runtime)**에서 훈련되었습니다. 이는 실제 앱이 실행되고 있는 100대 이상의 실제 물리적 휴대폰이 있는 거대한 창고를 상상하게 합니다. 이 시스템은 매우 똑똑해서 "아픈" 휴대폰(문제가 생긴 휴대폰)을 감지하고, 마치 코치가 경기 중에 선수를 교체하듯 즉시 작업을 건강한 휴대폰으로 전환할 수 있습니다. 이를 통해 에이전트는 비디오 게임 속의 완벽한 경로를 암기하는 대신, 이상한 팝업부터 네트워크 오류에 이르기까지 실제 세계의 혼란을 다루는 법을 배웠습니다.
2. "맥가이버 칼" 같은 액션 스페이스 (The "Swiss Army Knife" Action Space)
이전의 에이전트들은 오직 손(클릭과 탭)만 사용할 수 있는 사람들이었습니다. 만약 파일을 옮기거나 복잡한 계산을 수행해야 한다면, 그들은 몇 시간 동안 메뉴를 클릭해야 했습니다. Qwen-UI-Agent는 **맥가이버 칼(Swiss Army Knife)**을 얻었습니다.
이 모델은 GUI 액션(클릭, 타이핑, 스크롤)과 CLI 액션(컴퓨터 마법사처럼 터미널에 명령어를 입력하는 것)을 혼합하는 법을 배웠습니다.
- 비유: 사진 100장을 정리해야 한다고 가정해 봅시다. 일반적인 에이전트는 "열기", "선택", "이동"을 100번 반복하며 클릭할 것입니다. 하지만 Qwen-UI-Agent는 "이봐, 한 번에 이 파일들을 다 옮기도록 명령어를 입력할게!"라고 말할 수 있습니다. 또한 이 모델은 배치(batch) 액션을 수행할 수 있는데, 이는 한 번에 하나의 조각씩 움직이는 대신 체스 플레이어가 세 수 앞을 내다보는 것처럼 한 번에 일련의 움직임을 계획할 수 있음을 의미합니다. 덕분에 이 모델은 믿을 수 없을 정도로 빠르고 효율적이었습니다.
3. "자동 코치" 데이터 플라이휠 (The "Auto-Coach" Data Flywheel)
보통 로봇을 가르치는 데는 사람이 직접 문제를 만들고 답을 채점하는 많은 시간이 필요합니다. 이는 느리고 지루한 과정입니다. Qwen-UI-Agent는 **AutoResearch 스타일의 데이터 플라이휠(Data Flywheel)**을 사용합니다.
이것은 로봇이 플레이하는 것을 지켜보고, 로봇이 어디서 실수했는지 찾아내어, 그 실수를 바로 고칠 수 있는 더 어려운 연습 드릴을 즉시 만들어내는 로봇 코치와 같습니다. 에이전트 스스로가 과제를 설계하고, 자신의 오류를 찾아내며, 다음 훈련 단계를 계획합니다. 이는 로봇이 스스로를 가르치며 점점 더 나아지는 자기 개선 루프이며, 인간은 그저 높은 수준의 가이드라인을 제공하는 역할만 수행합니다.
4. "선제적인 집사" (The "Proactive Butler")
대부분의 로봇은 당신이 "이것 좀 해줘"라고 말할 때까지 기다립니다. 하지만 Qwen-UI-Agent는 선제적으로 행동할 수 있게 해주는 **하네스 레이어(Harness Layer)**를 가지고 있습니다.
- 비유: 당신이 항공편 취소 알림을 받았다고 상상해 보세요. 일반적인 로봇는 당신이 새 항공편을 찾아달라고 말할 때까지 기다립니다. 하지만 Qwen-UI-Agent는 알림을 감지하고, 실행 가능한 이벤트를 추론하며, 당신의 일정을 확인하고, 기차 시간표를 살펴보고, 가격을 비교한 뒤, 당신이 잠에서 깨기도 전에 완전한 복구 계획을 제시합니다. 이 모델은 단순히 명령을 기다리는 것이 아니라, 디지털 신호로부터 실행 가능한 순간을 포착하여 적절한 다음 단계를 제안합니다.
결과: 성공했는가?
팀은 Qwen-UI-Agent를 매우 까다로운 경기장에 투입했고, 결과는 인상적이었습니다.
- 실제 휴대폰에서: 실제 앱이 구동되는 실제 휴대폰을 사용하는 벤치마크인 MobileWorld-Real에서, Qwen-UI-Agent는 **92.2%**의 성공률을 기록했습니다. 이는 최고의 폐쇄형 모델들(Opus 4.8 및 GPT-5.6 Sol 등)을 상당한 차이로 앞선 결과입니다. 또 다른 테스트인 AndroidDaily에서는 **97.5%**라는 거의 완벽에 가까운 성적을 거두었습니다.
- 컴퓨터에서: 복잡한 컴퓨터 작업(OSWorld-Verified) 테스트에서 **79.5%**를 달성하며 전체 2위를 차지했고, 많은 다른 최상위 모델들을 제쳤습니다. 또한 어려운 OSWorld-v2 벤치마크에서 **40.0%**의 부분 진행 점수를 기록하며, 모든 단계를 완벽히 끝내지는 못하더라도 어려운 업무의 대부분을 수행할 수 있음을 증명했습니다.
- 웹에서: 복잡한 웹사이트를 탐색하는 테스트인 WebArena에서 **73.6%**를 기록했으며, ScreenSpot-Pro에서는 **81.5%**를 기록하여 화면상의 아주 작거나 보기 힘든 버튼도 정확히 찾아낼 수 있음을 입증했습니다.
이것이 의미하는 바
이 논문은 진정으로 유용한 AI 에이전트를 구축하기 위해서는 단순히 뇌를 키우는 것만이 아니라, 그들이 배우는 방식과 연습하는 장소를 바꿔야 한다고 제안합니다. 실제 기기에서 훈련하고, 다양한 방식의 액션(클릭과 코딩)을 혼합하며, 에이전트가 스스로의 훈련을 설계하도록 함으로써, Qwen-UI-Agent는 "비디오 게임 속 로봇"과 "실제 생활에서 도움을 줄 수 있는 로봇" 사이의 간극을 메우는 것이 가능하다는 것을 보여주었습니다.
아직 완벽한 해결책은 아닙니다. 저자들도 안전성과 전 과정의 완전 자동화에 대한 과제가 남아있음을 인정합니다. 하지만 이는 거대한 진전입니다. 적절한 실제 세계의 연습과 스마트한 훈련 루프가 결합된다면, 우리의 디지털 조력자들이 마침내 교실을 떠나 실제 세상으로 나올 준비가 되었음을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.