← 최신 논문
🤖 AI

OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis

이 논문은 모바일 에이전트의 학습 데이터를 공개하고, 확장 가능한 태스크 생성 파이프라인과 정책 전환 전략을 통해 고품질 작업 지시 및 궤적을 합성하는 오픈소스 프레임워크 'OpenMobile'을 제안하며, 이를 통해 기존 오픈 데이터 기반 방법론을 크게 능가하는 성능을 달성함을 보여줍니다.

원저자: Kanzhi Cheng, Zehao Li, Zheng Ma, Nuo Chen, Jialin Cao, Qiushi Sun, Zichen Ding, Fangzhi Xu, Hang Yan, Jiajun Chen, Anh Tuan Luu, Jianbing Zhang, Lewei Lu, Dahua Lin

게시일 2026-04-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kanzhi Cheng, Zehao Li, Zheng Ma, Nuo Chen, Jialin Cao, Qiushi Sun, Zichen Ding, Fangzhi Xu, Hang Yan, Jiajun Chen, Anh Tuan Luu, Jianbing Zhang, Lewei Lu, Dahua Lin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **'OpenMobile(오픈모바일)'**이라는 새로운 프로젝트를 소개합니다. 쉽게 말해, 스마트폰을 스스로 조작하는 'AI 비서'를 더 똑똑하게 만드는 방법과 데이터를 공개한 연구입니다.

기존의 유명한 AI 비서들은 비싼 비용과 비밀스러운 데이터로만 훈련되어 일반인이 따라 하기 어렵습니다. 이 논문은 "우리가 어떻게 하면 열린 데이터로 그들만큼이나 똑똑한 AI 비서를 만들 수 있을까?"라는 질문에 답합니다.

이 내용을 일상적인 비유로 설명해 드릴게요.


1. 문제 상황: "비밀 레시피"와 "가난한 학생"

지금까지 스마트폰을 잘 다루는 AI(예: 구글, 애플의 비서)들은 **비밀스러운 '고급 레시피'와 '수천 권의 비공개 교재'**로 훈련되었습니다. 그래서 그들만 70% 이상의 성공률을 보입니다.

반면, 오픈소스(일반인) 커뮤니티는 공짜로 구할 수 있는 낡은 교재만 가지고 훈련해서 30% 정도밖에 성공하지 못했습니다. 게다가 그들 (비밀 레시피) 은 "어떻게 훈련했는지" 알려주지 않아서, 우리는 왜 그들이 더 잘하는지, 어떻게 따라 할지 몰라 답답했습니다.

2. 해결책: OpenMobile(오픈모바일)

연구팀은 이 격차를 메우기 위해 두 가지 혁신적인 방법을 고안했습니다.

① "전체 지도"를 먼저 그려라 (작업 생성)

  • 기존 방식: AI 가 스마트폰 화면을 한 번씩 클릭하며 지나가는 길 (경로) 만 보고 "이건 뭐하는 거지?"라고 추측하게 했습니다. 마치 어두운 방에서 손만 더듬어 가며 물건 위치를 찾는 것과 비슷합니다.
  • OpenMobile 방식: 먼저 AI 가 스마트폰의 모든 앱과 기능을 **미리 훑어보며 '전체 지도 (글로벌 메모리)'**를 만듭니다. 그다음, 이 지도를 바탕으로 "아, 이 기능과 저 기능을 합치면 이런 복잡한 일을 시킬 수 있겠구나!"라고 다양하고 현실적인 미션을 만들어냅니다.
    • 비유: 요리사 (AI) 가 냉장고 (스마트폰) 를 한 번 훑어보고 재료를 다 파악한 뒤, "오늘 저녁에 이 재료들로 스테이크와 파스타를 만들어줘"라고 주문하는 것과 같습니다.

② "실수하고 고치는" 훈련 (궤적 생성)

  • 기존 방식: 아주 똑똑한 전문가 (Expert) 가 완벽하게 일을 해내는 모습만 보여주고, 학생 (Learner) 이 그걸 따라 하게 했습니다. 문제는 학생이 실수했을 때 어떻게 고쳐야 하는지 배우지 못했다는 점입니다. 시험장에서 작은 실수가 나면 바로 패닉에 빠지는 셈이죠.
  • OpenMobile 방식: 학생이 일을 하다가 **실수를 하면, 바로 옆에 있던 전문가가 "잠깐! 여기서 실수했어. 이렇게 고쳐보자"**라고 개입합니다.
    • 비유: 운전 면허 시험을 볼 때, 교습사가 "지금 핸들을 너무 많이 꺾었어! 바로잡아!"라고 말해주며 실수를 바로잡는 과정을 함께 훈련하는 것과 같습니다. 이 과정을 통해 AI 는 실수를 인지하고 복구하는 능력을 키웁니다.

3. 결과: "열린 데이터"도 "비밀 데이터"를 이긴다

연구팀은 이 방법으로 20 개의 안드로이드 앱에서 2,800 개의 미션과 34,000 개의 행동 데이터를 만들었습니다.

  • 성과: 이 데이터로 훈련된 AI 는 **AndroidWorld(스마트폰 조작 시험)**에서 **64.7%**의 성공률을 기록했습니다. 이는 기존에 공개된 데이터로 훈련된 AI 들 (약 30%) 보다 훨씬 높고, 심지어 비밀 데이터를 가진 최고의 상용 AI 들과도 경쟁할 수 있는 수준입니다.
  • 중요한 점: 이 AI 가 시험 문제를 미리 외워서 점수를 받은 게 아닙니다. 오히려 스마트폰의 다양한 기능을 폭넓게 이해하고, 실수를 고치는 능력이 뛰어나서 좋은 점수를 받은 것입니다.

4. 결론

이 논문은 **"비밀스러운 데이터 없이도, 올바른 방법 (지도 그리기 + 실수 교정 훈련) 으로 똑똑한 AI 비서를 만들 수 있다"**는 것을 증명했습니다.

이제 누구나 이 **OpenMobile(오픈모바일)**이라는 도구와 데이터를 무료로 사용할 수 있게 되어, 앞으로 더 똑똑하고 실수에도 강한 스마트폰 AI 비서들이 우리 곁에 올 수 있을 것입니다. 마치 비밀 레시피를 공유해 모든 사람이 명장이 될 수 있게 된 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →