이 논문은 인공지능 (AI) 이 스마트폰 화면을 보고 직접 터치하고, 스크롤하고, 앱을 실행할 수 있게 해주는 **'GUI 에이전트'**를 연구하고 실제 사용자에게 배포하는 방법을 소개합니다.
기존 연구들은 AI 모델 자체를 만드는 데만 집중했지만, 이 논문은 **"모델을 어떻게 훈련하고, 어떻게 시험하며, 어떻게 실제 사람의 손에 쥐어줄 것인가"**라는 **전체 과정 (Full-stack)**을 해결하는 통합 솔루션인 **'ClawGUI'**를 제안합니다.
🏗️ 1. 문제점: 왜 지금까지 AI 비서가 완벽하지 않았을까?
지금까지의 연구는 마치 레고 블록을 따로따로 만든 뒤, 어떻게 조립할지 고민도 없이 방치한 상태와 같았습니다.
훈련 (Training): AI 를 가르치는 환경이 너무 폐쇄적이었습니다. 연구실 안의 '가상 시뮬레이션'에서만 훈련이 가능했고, 실제 스마트폰에서 가르치는 방법은 열려 있지 않았습니다.
시험 (Evaluation): 각 연구팀마다 시험 문제의 난이도나 채점 기준이 달랐습니다. A 팀은 "정답률 90%"라고 했지만, B 팀은 다른 기준을 써서 "85%"라고 했을 때, 누가 진짜 더 잘하는지 알 수 없었습니다.
배포 (Deployment): 연구실의 AI 는 실제 사용자의 스마트폰에 들어가지 못했습니다. 마치 유명 요리사가 실험실에서만 요리를 하고, 일반인은 그 요리를 맛볼 수 없는 상황이었습니다.
🛠️ 2. 해결책: ClawGUI (클로 GUI) 의 3 대 기둥
이 논문은 이 세 가지 문제를 한 번에 해결하는 **하나의 통합 공장 (ClawGUI)**을 만들었습니다.
① ClawGUI-RL: "실전 훈련장" (훈련)
비유: AI 를 가르치는 거대한 운동장입니다.
특징:
가상과 현실의 결합: 컴퓨터 시뮬레이션 (가상) 과 실제 스마트폰 (현실) 을 동시에 연결해 AI 를 훈련시킵니다.
밀집 보상 (Dense Reward): AI 가 실수를 했을 때 "다시 해봐"라고만 하는 게 아니라, "어디서 잘못했는지, 어떤 단계가 좋았는지"를 매 순간 알려줍니다. (예: 길찾기 게임에서 "목표지점까지 100m 남음"이라고 알려주는 것)
결과: 이 방법으로 훈련된 작은 AI 모델 (ClawGUI-2B) 이 훨씬 큰 모델들보다 더 똑똑해졌습니다.
② ClawGUI-Eval: "공정한 심판실" (평가)
비유: 모든 AI 를 동일한 규칙으로 시험보는 표준화된 시험지입니다.
특징:
6 가지 주요 시험 문제 (벤치마크) 와 11 개 이상의 AI 모델을 한곳에 모아, 동일한 조건으로 시험을 봅니다.
기존 논문들의 결과를 95.8% 정확도로 재현해냈습니다. 즉, "이 AI 가 정말 잘하는지, 아니면 시험 조건을 조작한 건지"를 확실하게 가려냅니다.
③ ClawGUI-Agent: "실제 비서" (배포)
비유: 연구실 밖으로 나와 실제 사용자의 스마트폰을 조종하는 비서입니다.
특징:
혼합 제어 (Hybrid): 명령어 (CLI) 로 빠르게 할 수 있는 일은 명령어로, 화면을 봐야 하는 일은 화면을 터치 (GUI) 하여 처리합니다.
기억력 (Memory): 사용자의 습관, 좋아하는 앱, 연락처 등을 기억해서 시간이 갈수록 더 개인화된 비서가 됩니다.
다양한 플랫폼: 카카오톡, 디스코드, 텔레그램 등 12 개 이상의 채팅 앱에서 명령을 받으면, 실제 스마트폰을 조작해 줍니다.
🚀 3. 주요 성과: 작은 모델이 거인을 이기다
이 프레임워크로 훈련된 ClawGUI-2B라는 AI 모델은 놀라운 결과를 보여주었습니다.
작은 몸집, 큰 능력: 같은 크기의 다른 AI 모델보다 6% 더 높은 성공률을 기록했습니다.
거인 모델 제압: 훨씬 더 큰 (32 배, 72 배 큰) 최신 AI 모델들보다도 실제 스마트폰 작업 수행 능력이 뛰어났습니다.
핵심 교훈: 모델이 크다고 해서 무조건 좋은 게 아닙니다. **어떻게 훈련시키고, 어떻게 평가하는지 (인프라)**가 더 중요하다는 것을 증명했습니다.
💡 4. 한 줄 요약
"ClawGUI 는 AI 비서를 연구실의 실험실 밖으로 끌어내어, 실제 스마트폰에서 사용자의 생활을 돕는 '전능한 비서'로 만들어주는 통합 공장입니다."
이제 우리는 AI 가 단순히 화면을 보는 것을 넘어, 스마트폰을 직접 조작하며 우리의 삶을 자동화하는 시대를 향해 한 걸음 더 다가섰습니다.
ClawGUI: GUI 에이전트 훈련, 평가 및 배포를 위한 통합 프레임워크
1. 문제 정의 (Problem)
GUI 에이전트 (Graphical User Interface Agents) 는 프로그램matic API 가 아닌 시각적 인터페이스 (탭, 스와이프, 키보드 입력 등) 를 통해 소프트웨어를 조작하여 CLI 기반 에이전트가 접근할 수 없는 다양한 애플리케이션을 제어할 수 있습니다. 그러나 현재 이 분야의 발전은 모델링 능력의 한계보다는 일관된 풀스택 인프라 (full-stack infrastructure) 의 부재에 의해 병목 현상을 겪고 있습니다.
주요 세 가지 격차 (Gap) 는 다음과 같습니다:
훈련 생태계의 폐쇄성: 온라인 강화학습 (RL) 훈련이 가상 환경에서 이루어지고 있지만, 소스 코드가 공개되지 않아 재현이 어렵습니다. 또한, 실제 물리 디바이스 (Physical Devices) 에서의 훈련은 거의 연구되지 않았습니다.
평가 프로토콜의 불일치: 프롬프트 포맷팅, 좌표 정규화, 이미지 해상도 등 설정의 미세한 차이로 인해 논문 간 결과 비교가 불가능하며, 재현성이 낮습니다.
배포 루프의 단절: 연구용 에이전트가 실제 사용자의 일상 생활 (실제 디바이스) 에 도달하지 못합니다. CLI 기반은 정밀하지만 범위가 제한적이고, GUI 기반은 범용적이지만 배포 및 개인화가 어렵습니다.
2. 방법론 (Methodology)
저자들은 이러한 세 가지 격차를 해결하기 위해 ClawGUI라는 단일 오픈소스 프레임워크를 제안했습니다. 이는 세 가지 긴밀하게 통합된 모듈로 구성됩니다.
A. ClawGUI-RL (확장 가능한 온라인 RL 훈련)
환경 관리: Docker 기반의 병렬 안드로이드 에뮬레이터와 실제 물리 디바이스를 통합된 인터페이스로 지원합니다. 에뮬레이터의 상태 불안정성을 해결하기 위해 '스페어 서버 회전 (Spare Server Rotation)' 및 '헬스 체크' 메커니즘을 도입했습니다.
보상 설계 (Reward Design):
이진 결과 보상 (Binary Outcome Reward): 작업 성공/실패에 따른 희소 보상.
밀집 프로세스 보상 (Dense Process Reward): **Process Reward Model (PRM)**을 도입하여 각 단계 (step-level) 에서 작업 완수에 기여하는지 판단합니다. 이는 긴 시간의 GUI 작업에서 발생하는 보상 희소성 문제를 해결합니다.
RL 트레이너: Verl 기반을 사용하며, GiGPO (Grouped Advantage Estimation with Anchor-state grouping) 알고리즘을 통합했습니다. GiGPO 는 에피소드 전체에 균일한 보상을 주는 기존 GRPO 와 달리, 중간 상태 (anchor-state) 를 기준으로 그룹화하여 각 단계에 세밀한 크레딧 어시그먼트 (credit assignment) 를 제공합니다.
B. ClawGUI-Eval (재현 가능한 GUI 평가)
표준화 파이프라인: 6 개의 벤치마크 (ScreenSpot-Pro, UI-Vision 등) 와 11 개 이상의 모델을 대상으로 **Infer (추론) → Judge (판단) → Metric (지표 계산)**의 3 단계 파이프라인을 강제합니다.
설정 고정 (Pinning): 모델별 평가 설정 (프롬프트, 해상도, 온도 등) 을 고정하여 재현성을 보장합니다.
오픈 데이터: 모든 추론 결과와 평가 코드를 공개하여 커뮤니티가 결과를 재검증하고 확장할 수 있도록 합니다.
C. ClawGUI-Agent (실제 디바이스 배포)
하이브리드 제어: CLI 의 정밀함과 효율성을 활용하되, API 가 없는 경우 GUI 제어로 자동 전환하는 하이브리드 전략을 사용합니다.
개인화 메모리: 사용자의 습관, 연락처, 선호도 등을 벡터 임베딩으로 저장하여 지속적이고 개인화된 컨텍스트를 제공합니다.
다중 플랫폼 지원: Android, HarmonyOS, iOS 를 지원하며, Feishu, DingTalk, Telegram 등 12 개 이상의 채팅 플랫폼을 통해 원격 및 로컬 제어가 가능합니다.
3. 주요 기여 (Key Contributions)
ClawGUI 프레임워크 공개: 온라인 RL 훈련, 표준화된 평가, 실제 디바이스 배포를 통합한 최초의 오픈소스 프레임워크입니다.
ClawGUI-RL: 가상 환경과 실제 물리 디바이스 모두에서 검증된 RL 인프라를 제공하며, GiGPO 와 PRM 을 결합한 밀집 보상 시스템을 구현했습니다.
ClawGUI-Eval: 6 개 벤치마크와 11 개 모델에 대한 재현 가능한 평가 파이프라인과 예측 데이터를 공개하여, 공식 베이스라인 대비 95.8% 의 재현률을 달성했습니다.
ClawGUI-Agent: 실제 사용자에게 배포 가능한 생산 준비 시스템으로, 하이브리드 제어와 지속적 개인화 메모리를 구현했습니다.
성능 향상 (MobileWorld GUI-Only): ClawGUI-2B 는 **17.1% 의 성공률 (Success Rate)**을 기록했습니다. 이는 동일한 규모의 MAI-UI-2B 베이스라인 (11.1%) 보다 6.0%p(상대적으로 54% 향상) 높은 성능이며, 훨씬 큰 규모의 미훈련 모델 (Qwen3-VL-32B: 11.9%, UI-Venus-72B: 16.4%) 을 능가했습니다.
밀집 보상의 효과: 에피소드 수준의 GRPO 를 단계 수준의 GiGPO 로 변경했을 때 성공률이 14.5% 에서 17.1% 로 2.6%p(상대적 17.9% 향상) 증가하여, 세밀한 크레딧 어시그먼트의 중요성을 입증했습니다.
평가 재현성: ClawGUI-Eval 은 6 개 벤치마크와 11 개 모델에 걸쳐 공식 베이스라인 대비 **95.8% (46/48)**의 재현률을 달성했습니다. 재현이 실패한 2 건은 공식 평가 설정이 공개되지 않은 경우로, 인프라 문제임을 시사합니다.
5. 의의 및 결론 (Significance)
ClawGUI 는 GUI 에이전트 연구의 패러다임을 '모델 중심'에서 '풀스택 인프라 중심'으로 전환시켰습니다.
시스템적 접근: 알고리즘 자체의 개선뿐만 아니라 환경 관리, 보상 설계, 평가 표준화, 실제 배포까지 아우르는 통합 솔루션을 제공함으로써, 연구의 재현성과 실용성을 크게 높였습니다.
실제 적용 가능성: 실제 물리 디바이스에서의 훈련과 배포를 가능하게 하여, 연구실의 이론이 실제 사용자의 일상 생활에 적용되는 길을 열었습니다.
미래 방향: CLI 와 GUI 의 통합, 온디바이스 RL, 그리고 세계 모델 (World Models) 을 통한 예측적 계획 등 차세대 GUI 에이전트 개발을 위한 기초 인프라 역할을 할 것으로 기대됩니다.
이 프레임워크는 오픈소스 커뮤니티가 차세대 GUI 에이전트를 구축, 평가, 배포할 수 있는 강력한 기반을 마련했다는 점에서 중요한 의의를 가집니다.