← 최신 논문
💻 computer science

SwipeGen: Bridging the Execution Gap in GUI Agents via Human-like Swipe Synthesis

이 논문은 현재 GUI 에이전트의 성능을 실제 시나리오에서 제한하는 경직된 스와이프 실행 문제를 해결하기 위해, 다양한 인간 유사 스와이프 상호작용을 합성하는 도구인 SwipeGen과 이를 평가하기 위한 벤치마크인 SwipeBench를 소개한다.

원저자: Xuan Wang, Siyuan Su, Quantong Fu, Yongxiang Hu, Yangfan Zhou

게시일 2026-08-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xuan Wang, Siyuan Su, Quantong Fu, Yongxiang Hu, Yangfan Zhou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 전화기가 당신의 음성 명령을 이해하고, 당신이 하는 것처럼 앱을 탐색하며 버튼을 누르고 텍스트를 입력할 수 있는 세상을 상상해 보십시오. 이것이 바로 그래픽 사용자 인터페이스(GUI) 에이전트가 약속하는 미래입니다. 이 에이전트는 인간처럼 화면과 상호작용하도록 설계된 인공지능의 한 종류입니다. 수년 동안 연구자들은 이러한 시스템이 아이콘을 인식하고, 텍ей트를 읽고, 특정 대상을 클릭하도록 가르쳐 왔습니다. 그러나 결정적인 격차가 남아 있었습니다. 이 에이전트들이 점점 더 정확하게 가리키고 클릭할 수는 있었지만, 가장 흔한 제스처인 '스와이프(swipe)'에는 매우 크게 어려움을 겪었다는 점입니다. 뉴스 피드를 스크롤하거나, 볼륨 슬라이더를 조절하거나, 숨겨진 메뉴 옵션을 드러내는 등의 동작에서, 기계의 디지털 손은 종종 경직되고 기계적인 정밀함으로 움직여 화면의 반응을 끌어내는 데 실패하곤 했습니다. 이러한 한계는 아무리 똑똑한 에이전트라 할지라도 인간 손가락의 유동적인 움직임을 필요로 하는 단순한 작업을 완료하지 못하고 멈춰 서게 만들었습니다.

푸단 대학교의 연구팀은 "왜 기계는 스와이프를 할 때 어려움을 겪는 반면 인간에게는 그것이 매우 자연스러운가?"라는 근본적인 질문을 던짐으로써 이 구체적인 문제를 해결하고자 했습니다. 그들은 문제가 지능의 부족이 아니라, 데이터의 부족과 스와이프가 작동하는 방식에 대한 오해에서 비롯되었다는 것을 발견했습니다. 기존 시스템은 단순한 클릭 위주의 데이터셋으로 학습되었으며, 모든 상호작용을 화면 위의 단일 지점으로 취급했습니다. 하지만 스와이프는 하나의 점이 아니라 하나의 '여정'입니다. 그것은 시작점, 방향, 거리, 그리고 속도를 포함합니다. 연구진은 현재의 에이전트들이 단일 좌표를 추측하려고 시도하다가 완전히 빗나가는 경우가 많은데, 이는 스와이프의 속도나 정확한 시작점이 결과에 영향을 미칠 수 있다는 점을 이해하지 못했기 때문이라는 것을 발견했습니다. 이를 해결하기 위해 그들은 인간과 유사한 제스처의 예를 수천 개 생성하여 기계가 스와이프하는 법을 가르치도록 설계된 자동화 시스템인 'SwipeGen'이라는 새로운 도구를 구축했습니다.

그 과정은 시스템이 실제 사용자처럼 스스로 모바일 앱을 탐색하게 하는 것으로 시작되었습니다. 시스템은 사진 목록이나 아이콘 행과 같이 스크롤할 수 있는 영역을 식별하며 화면을 탐색했습니다. 일단 스크롤 가능한 영역을 찾으면, 시스템은 단순히 추측하는 대신 다양한 방식으로 스와이프를 체계적으로 시도했습니다. 화면 중앙에서 시작하는 스와이프, 가장자리에서 시작하는 스와이프, 위, 아래, 왼쪽, 오른쪽으로 움직이는 스와이프, 그리고 다양한 속도를 테스트했습니다. 결정적으로, 시스템은 각 시도 전후의 화면을 관찰했습니다. 만약 스와이프가 콘텐츠를 움직이거나 변화시켰다면, 시스템은 이를 성공으로 기록하고 정확한 좌표, 방향, 그리고 작동에 필요한 지속 시간을 포착했습니다. 만약 화면이 반응하지 않는다면, 그 시도는 폐기되었습니다. 이러한 시도, 관찰, 기록의 순환을 통해 연구팀은 각 제스처가 무엇을 달성했는지 설명하는 자연어 묘사와 함께 성공적인 스와이프 상호작용의 방대한 라이브러리를 구축할 수 있었습니다.

이 새로운 데이터 라이브러리를 확보한 후, 연구진은 'GUISwiper'라고 명명한 새로운 버전의 인공지능 모델을 훈련시켰습니다. 그들은 모델에게 단순히 버튼을 찾는 법이 아니라, 스와이프의 물리 법칙을 이해하도록 가르쳤습니다. 결과는 놀라웠습니다. 모델이 한 번도 본 적 없는 새로운 앱 세트에서 테스트했을 때, GUISwiper는 이전의 최첨단 모델들보다 2.5배 이상 더 잘 스와이프 동작을 수행했습니다. 기존 모델들이 스와이프 작업의 약 4분의 1만을 올바르게 수행했던 반면, 새 모델은 60% 이상의 작업에서 성공했습니다. 더 중요한 것은, 기계에게 스와이프를 가르치는 것이 다른 작업의 능력을 저하시키지 않는다는 것을 연구진이 증명했다는 점입니다. 이 모델은 버튼을 식별하고 텍스트를 읽는 능력도 여전히 유지하고 있었으며, 이는 복잡한 제스처를 배우면서도 화면의 레이아웃을 이해하는 능력을 잃지 않았음을 보여줍니다.

또한 이 연구는 이러한 에이전트들에게 가장 큰 장애물은 무엇을 할지 아는 것이 아니라, '어떻게' 하는지를 아는 것이라는 점을 강조했습니다. 연구진은 모델이 실패했을 때, 그것이 잘못된 방향을 선택했기 때문이 아니라 스와이프를 엉뚱한 곳에서 시작했거나 화면의 반응을 유도하기에 너무 느리게 움직였기 때문이라는 것을 발견했습니다. 실행의 세부 사항, 즉 동작의 정확한 시작, 끝, 그리고 속도에 집중함으로써, 그들은 기계의 경직된 논리와 인간 사용자의 유동적인 직관 사이의 간극을 메웠습니다. 이 작업은 인공지능이 진정으로 디지털 세계를 마스터하기 위해서는 단순히 보는 법뿐만 아니라, 자신이 봉사하기 위해 설계된 사람들과 같은 미묘함과 타이밍을 가지고 움직이는 법을 배워야 한다는 것을 시사합니다. 효과적으로 스와이프하는 능력은 더 이상 사소한 기능이 아닙니다. 그것은 인간의 손처럼 쉽게 우리의 화면을 탐색하기를 희망하는 모든 에이전트에게 필수적인 요구 사항입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →