← 최신 논문
🤖 AI

CoAdapt-GUI: Joint Workflow Context and Policy Adaptation for Unseen GUI Applications

CoAdapt-GUI는 LoRA를 통해 작업별 정책을 공동으로 적응시키고 에이전트 자신의 상호작용으로부터 전이 가능한 워크플로 컨텍스트를 정제함으로써, 미학습 애플리케이션에 대한 모바일 GUI 에이전트의 일반화 성능을 향상시켜 베이스라인 방법들보다 상당한 성능 이득을 달성하는 테스트 타임 적응 프레임워크이다.

원저자: Linqiang Guo (Peter), Li Gu (Peter), Zihuan Jiang (Peter), Zhixiang Chi (Peter), Siobhan Reid (Peter), Ziqiang Wang (Peter), Yuanhao Yu (Peter), Wei Liu (Peter), Yang Wang (Peter), Tse-Hsun (Peter)
게시일 2026-08-13
📖 2 분 읽기☕ 가벼운 읽기

원저자: Linqiang Guo (Peter), Li Gu (Peter), Zihuan Jiang (Peter), Zhixiang Chi (Peter), Siobhan Reid (Peter), Ziqiang Wang (Peter), Yuanhao Yu (Peter), Wei Liu (Peter), Yang Wang (Peter), Tse-Hsun (Peter), Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 디지털 세상을 항해하는 법을 가르치고 있다고 상상해 보세요. 이 로봇은 "GUI 에이전트"로, 스마트한 비서와 같습니다. 휴대폰 화면을 보고, 보이는 것을 읽고, "항공권을 예약해 줘"나 "문자를 보내 줘"와 같은 당신의 지시를 따르기 위해 버튼을 누를 수 있습니다. 한동안 이 로봇들은 나중에 사용할 앱과 정확히 일치하는 앱으로 연습할 때만 꽤 잘 수행하는 모습을 보여왔습니다. 이는 마치 특정 수학 시험의 답을 암기했지만, 새로운 교과서를 보면 얼어붙어 버리는 학생과 같습니다. 진짜 과제는 로봇이 한 번도 본 적 없는 앱, 즉 자신이 인식하지 못하는 버튼과 메뉴가 있는 앱을 만났을 때 발생합니다. 이것이 바로 "보지 못한 애플리케이션(unseen application)" 문제입니다. 과학자들은 매번 인간이 요령을 알려주지 않아도, 단 몇 번의 시도만으로 새로운 앱이 어떻게 작동하는지 파악하여 로봇이 즉석에서 학습하도록 가르치는 방법을 찾아내려 노력하고 있습니다.

이 논문은 로봇 에이전트가 이전보다 훨씬 더 잘 새로운 앱에 적응할 수 있도록 돕는 CoAdapt-GUI라는 영리한 새로운 시스템을 소개합니다. 로봇의 두뇌를 두 부분으로 생각해 보세요. 하나는 어떻게 탭하고 스와이프할지에 대한 본능인 "정책(policy)"이고, 다른 하나는 업무를 완수하기 위한 단계와 규칙의 정신적 체크리스트인 "워크플로우(workflow)"입니다. 로봇이 새로운 앱을 배우도록 돕기 위한 기존의 시도들은 주로 체크리스트를 무시한 채 그들의 본능(정책)만을 미세하게 조정하려고 했습니다. 저자들은 이것만으로는 충분하지 않다는 것을 발견했습니다. 만약 로봇의 체크리스트가 자신이 알고 있는 이전 앱들에 특화된 세부 사항(예: "홈 화면에서 파란색 버튼을 찾으시오")으로 가득 차 있다면, 새로운 앱에 빨간 버튼이 다른 위치에 있을 때 로봇은 혼란에 빠지게 됩니다.

CoAdapt-GUI는 이 문제를 해결하기 위해 두 가지 일을 동시에 수행합니다. 첫째, 이 시스템은 로봇의 체크리스트를 엄격한 편집자처럼 다룹니다. 로봇이 알고 있는 일반적인 규칙(예: "막히면 뒤로 가기를 시도하라")은 유지하되, 이전 앱에 특화된 세부 사항(예: "뒤로 가기 버튼은 왼쪽 상단에 있다")은 삭제합니다. 이를 통해 어디서나 작동할 수 있는 "깨끗한" 가이드를 만듭 수 있습니다. 둘째, 로봇이 새로운 앱에서 연습하며 무엇이 성공하고 무엇이 실패하는지에 따라 자신의 본능(정책)을 업데이트할 수 있게 합니다. 마법은 이 두 부분이 서로를 돕는 과정에서 일어납니다. 깨끗한 체크리스트는 로봇이 더 잘 연습할 수 있도록 돕고, 연습 결과는 로봇이 체크리스트를 정교하게 다듬는 데 도움을 줍니다.

연구진은 AndroidWorld라는 디지털 놀이터에서 이 시스템을 테스트했습니다. 익숙한 작업의 새로운 버전을 처리해야 했던 한 테스트에서, CoAdapt-GUI는 **45.0%**의 성공률을 기록했습니다. 이는 기존의 가장 뛰어난 방법이 겨우 **37.5%**를 기록했던 것과 비교하면 상당한 도약입니다. 로봇이 한 번도 본 적 없는 완전히 새로운 유형의 작업을 배워야 했던 더 어려운 테스트에서는, 성공률을 **38.6%**에서 **52.9%**로 끌어올렸습니다. 이 논문은 "무엇을 할 것인가"(워크플로우)와 "어떻게 할 것인가"(정책)를 분리하고, 사용하기 전에 지침을 정제함으로써, 로봇이 훨씬 더 유연해지고 앱이 끊임없이 변하는 실제 세상에 대비할 수 있게 된다는 점을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →