← 최신 논문
🤖 machine learning

Qwen-CUA: Native Computer Use for (almost) Everything

이 논문은 DOM 트리에 의존하지 않고 스크린샷과 입력 이벤트만을 통해 작동하며, 대규모 클라우드 롤아웃 훈련, 검증 가능한 보상 최적화 및 확장 가능한 아키텍처를 통해 컴퓨터 사용 벤치마크에서 최첨단 성능을 달전하는 397B Mixture-of-Experts 백본 기반의 네이티브 컴퓨터 사용 에이전트인 Qwen-CUA를 소개한다.

원저자: Dunjie Lu, Shuai Bai, Tianyi Bai, Sicheng Fan, Chang Gao, Jian Guan, Feng Hu, Mianqiu Huang, Xingyang Huang, Yizhen Jiang, Yuheng Jing, Dehui Kong, Ning Li, Dayiheng Liu, Shixuan Liu, Zheng Liu, Que S
게시일 2026-08-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Dunjie Lu, Shuai Bai, Tianyi Bai, Sicheng Fan, Chang Gao, Jian Guan, Feng Hu, Mianqiu Huang, Xingyang Huang, Yizhen Jiang, Yuheng Jing, Dehui Kong, Ning Li, Dayiheng Liu, Shixuan Liu, Zheng Liu, Que Shen, Bowen Wang, Junli Wang, Chencan Wu, Rui Xie, Tianbao Xie, Zhihui Xie, Haiyang Xu, An Yang, Tao Yu, Wenzhen Yuan, Xi Zhang, Zhenru Zhang, Mingkang Zhu, Zhaoqing Zhu, Yizhong Cao, Kai Dang, Binyuan Hui, Kaixin Li, Junyang Lin, Haiquan Wang, Zekun Wang, Yiheng Xu, Fan Yan, Mengqi Yuan, Danyang Zhang, Jiajun Zhang, Zhipeng Zhang, Fan Zhou, Fan Zhou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 단순히 당신의 클릭을 기다리는 것이 아니라, 실제로 당신이 무엇을 하는지 '지켜보고' 그것을 대신 수행하는 법을 배우는 세상을 상상해 보십시오. 이것은 컴퓨터에게 디지털 세계에서 인간처럼 행동하도록 가르치는 과학의 한 분야인 "AI 에이전트"의 흥미로운 최전선입니다. 오랫동안 이러한 에이전트들은 텍스트북(코드)을 읽거나 엄격한 설명서(API)를 따를 수 있는 똑똑한 학생과 같았습니다. 그들은 수학과 논리에는 뛰어났지만, 지저분하고 구식인 프로그램을 사용하거나 새로고침할 때마다 변하는 웹사이트를 사용하라고 하면 길을 잃곤 했습니다. 그들은 인간처럼 화면을 "볼" 수 없었습니다. 버튼이 어디에 있는지 알기 위해 웹사이트의 구조에 대한 특별한 설계도가 필요했습니다. 하지만 우리 디지털 삶의 대부분은 그러한 설계도가 없는 화면 위에서 이루어집니다. 이 논문은 AI에게 진정한 디지털 견습생을 가르치는 과제, 즉 특별한 지름길이나 숨겨진 지도 없이도 화면을 보고, 무엇을 할지 파악하며, 사람처럼 클릭하거나 타이핑하는 법을 가르치는 과제를 다룹니다.

이 연구의 팀은 "네이티브" 컴퓨터 사용자로서 설계된 새로운 종류의 AI 에이전트인 Qwen-CUA를 소개합니다. 이것은 로봇에게 자동차 운전법을 가르치는 것과 같습니다. 로봇에게 모든 도로와 신호등의 완벽한 디지털 지도를 주는 대신(많은 오래되거나 복잡한 소프트웨어 프로그램에는 존재하지 않는 지도입니다), 그들은 로봇에게 창밖을 내다보고, 도로를 보고, 보이는 것에 따라 스티어링 휠을 돌리는 법을 가르쳤습니다. Qwen-CUA는 컴퓨터 화면의 스크린샷만을 "보고", 키보드와 마우스 명령만을 보냄으로써 "행동"합니다. 코드 내부를 들여다보거나 소프트웨어에 도움을 요청하지 않고, 그저 관찰하고 배웁니다.

이 로봇이 실생활의 과업을 처리할 만큼 똑똑하게 만들기 위해, 연구진은 거대한 훈련 체육관을 구축해야 했습니다. 그들은 거의 100,000개의 가상 CPU(수천 대의 컴퓨터가 동시에 작동하는 도시를 상상해 보십시오)로 구성된 클라우드 기반 플릿을 구축하고, AI가 연습할 수 있도록 약 40,000개의 서로 다른 작업을 설정했습니다. 이 작업들은 파일 정리와 같은 간단한 것부터 전문적인 소프트웨어를 사용하는 복잡한 다단계 워크플로우까지 다양했습니다. AI는 단순히 마지막에 "잘했어" 또는 "다시 해봐"라는 피드백을 받는 것이 아니었습니다. 시스템은 작업이 실제로 올바르게 완료되었는지 검증하도록 설계되어, AI가 자신의 실수를 통해 반복해서 배울 수 있게 했습니다.

결과는 인상적입니다. 8개의 벤치마크 테스트에서 Qwen-CUA는 이전 버전인 Qwen3.7을 지속적으로 능가했으며, 오늘날 사용 가능한 가장 강력하고 비싼 AI 시스템들과도 대등하게 맞섰습니다. 예를 들어, AI가 일상적인 데스크톱 작업을 얼마나 잘 처리하는지 측정하는 OSWorld-Verified 테스트에서, Q-wen CUA는 86.2점을 기록한 반면 이전 모델은 73.3점을 기록했습니다. 이를 Qwen-CUA-Max(1조 개 이상의 파라미터를 가진 더 큰 모델)로 확장했을 때, 점수는 87.6까지 올라갔습니다.

이 논문에서 가장 멋진 점 중 하나는 긴 복잡한 작업을 처리하는 방식입니다. 새로운 장을 쓰는 동안 일주일 전에 읽은 이야기를 기억하려고 노력하는 상황을 상상해 보십시오. AI는 자신이 작업 중 어디에 있는지 알기 위해 몇 단계 전의 화면이 어떠했는지 기억해야 했습니다. 연구진은 AI에게 마지막 20개의 스크린샷을 보유하는 "시각적 메모리"를 부여하고, 오래된 스크린샷들을 요약본으로 영리하게 "접어서" 저장함으로써 AI가 압도되지 않도록 해결했습니다. 이를 통해 AI는 이야기의 시작 부분을 잊지 않고 긴 워크플로우 동안 평정심을 유지할 수 있었습니다.

논문은 안전성도 살펴보았습니다. 그들은 화면에 숨겨진 가짜 지시로 AI를 속이는 도전 과제인 "RedTeamCUA"를 통해 AI를 테스트했습니다. 새로운 모델은 이러한 속임수를 무시하는 데 훨씬 뛰어났으며, 공격 성공률을 **36.6%**에서 **16.4%**로 낮추면서도 자신의 작업은 완수해 냈습니다.

마지막으로, 연구진은 "하이브리드" 접근 방식을 탐구했습니다. 그들은 AI가 마우스와 키보드 기술과 함께 커맨드 라인 도구(파일 작업을 위한 텍스트 기반의 마법 지팡이 같은 것)를 사용할 수 있게 하면 작업을 더 빨리 끝낼 수 있다는 것을 발견했습니다. 그러나 AI가 때때-때로는 부적절한 시점에 도구를 전환하기도 했기에, 더 빠르기는 했지만 항상 완벽하지는 않았습니다. 저자들은 시각적 관찰과 텍스트 기반 명령의 이 조합이 AI 에이전트를 진정으로 효율적으로 만드는 열쇠가 될 수 있다고 제안합니다.

요컨대, 이 논문은 우리가 AI를 컴퓨터에 연결하기 위해 특별한 다리를 만들 필요가 없음을 보여줍니다. AI에게 단순히 화면을 보고 인간처럼 행동하도록 가르침으로써, 우리는 최신 앱부터 가장 오래된 프로그램까지 거의 모든 소프트웨어를 다룰 준비가 된 에이전트를 구축할 수 있습니다. 이는 방대한 양의 실제 세계 연습을 통해 학습됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →