MobileExplorer: Accelerating On-Device Inference for Mobile GUI Agents via Online Exploration
MobileExplorer 는 모델의 추론 시간을 활용하여 UI 요소에 대한 병렬 온라인 탐색을 수행함으로써 모바일 GUI 에이전트의 온디바이스 추론을 가속화하는 새로운 프레임워크로, 이는 높은 작업 성공률을 유지하면서 추론 단계와 지연 시간을 줄이는 컨텍스트 힌트를 생성합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신은 스마트폰 안에 거주하는 매우 똑똑하지만 약간은 느린 개인 비서를 상상해 보세요. 이 비서의 임무는 화면을 보고 사용자가 무엇을 하려는지 (예: "문자 보내기" 또는 "레시피 찾기") 파악한 후, 이를 실현하기 위해 올바른 버튼을 터치하는 것입니다.
문제는 이 비서가 "시각 - 언어 모델"이라는 점입니다. 이미지와 텍스트를 이해하는 데는 놀라울 정도로 뛰어나지만, 생각하는 데는 시간이 매우 오래 걸립니다. 마치 한 개의 수학 문제를 풀기 위해 30 초가 필요한 천재 교수를 생각해 보세요. 반면, 스마트폰에서 버튼을 실제로 터치하는 행위는 찰나의 순간에 끝납니다.
예전 방식에서는 비서가 화면을 응시하다가 30 초 동안 생각한 후, 드디어 버튼을 터치했습니다. 그 30 초 동안 스마트폰은 아무것도 하지 않고 그냥 가만히 있었습니다. 만약 한 작업이 20 번의 터치로 이루어진다면, 기다리는 시간은 매우 길어집니다.
"MobileExplorer"의 등장입니다.
MobileExplorer 를 개발한 연구자들은 그 "생각하는 시간"을 다른 무언가에 활용할 수 있음을 깨달았습니다. 몇 가지 간단한 비유를 들어 작동 방식을 설명해 보겠습니다.
1. "기다리는 동안" 전략
오븐에서 피자가 구워지는 동안 (30 초의 생각 시간) 기다리고 있다고 상상해 보세요. 오븐을 멍하니 바라보며 서 있는 대신, 그 시간을 이용해 냉장고 상태를 빠르게 확인하고 음료를 꺼내며 식탁을 차리는 것입니다. 피자가 늦어지는 것이 아니라, 오븐이 작업을 하는 동안 다음 단계에 대비하는 것입니다.
MobileExplorer 는 정확히 이렇게 작동합니다. AI 가 다음에 무엇을 할지 "생각"하는 동안, 시스템은 화면의 몇몇 다른 버튼을 조용하고 빠르게 터치하여 어떤 일이 일어나는지 확인합니다. 마치 복도에서 어떤 문이 열리는지 확인하기 위해 몇 개의 문을 살짝 두드려보는 것과 같습니다. 정보를 수집하기 위한 행위입니다.
2. "똑똑한 탐정" (작업 관련성)
시스템은 무작위로 버튼을 두드리지 않습니다. 그렇게 하면 혼란스러워질 것입니다. 대신 목표를 아는 탐정처럼 행동합니다.
- 목표: "영화를 찾아야 해."
- 행동: 시스템은 화면을 보고 "어떤 버튼이 영화로 이어질 것 같은가?"라고 묻습니다. "계산기"나 "날씨" 버튼은 무시하고 "Netflix"나 "검색" 버튼에 집중합니다.
- 결과: 시스템은 해당 특정 영역을 빠르게 확인하고 나타나는 새로운 화면을 살펴본 뒤, 작은 메모를 작성합니다. "아, '영화' 버튼은 장르 목록으로 이어지네."
3. "마법의 되돌리기" 버튼 (이중 단계 롤백)
여기가 까다로운 부분입니다. 너무 많이 두드리면 길을 잃을 수 있습니다. 실수로 의도하지 않은 메뉴를 열게 되어 원래 화면으로 돌아갈 수 없게 될 수도 있습니다.
MobileExplorer 는 두 단계로 구성된 초강력 "되돌리기" 시스템을 갖추고 있습니다.
- 1 단계 (빠른 되돌리기): 몇 번의 "뒤로" 버튼 누르기를 시도하여 시작했던 곳으로 돌아갑니다. 화면이 이전과 같은지 확인합니다 (지각 해시라는 디지털 지문을 사용하여).
- 2 단계 (초기화 버튼): "뒤로" 버튼이 실패하면 (예: 팝업이 길을 막은 경우) 당황하지 않습니다. 즉시 스마트폰의 "홈" 화면으로 완전히 돌아가서 원래 위치로 이동하기 위해 취했던 정확한 단계를 다시 재생합니다. 마치 "좋아, 홈에서 다시 시작해서 그 경로를 다시 걸어보자. 다만 이번엔 더 빠르게 하겠지"라고 말하는 것과 같습니다.
이를 통해 "두드려보기"가 주요 작업을 방해하지 않도록 보장합니다. 스마트폰은 탐색이 시작되기 전의 정확한 상태로 항상 돌아갑니다.
4. "요약 노트" (맥락적 힌트)
시스템이 "영화 목록은 '엔터테인먼트' 탭 아래에 있다"와 같은 추가 정보를 모두 수집하면, 이를 작고 읽기 쉬운 메모로 요약합니다. 그리고 AI 가 최종 결정을 내리기 전에 이 메모를 AI 에게 전달합니다.
따라서 AI 가 추측하는 대신, 이제 요약 노트를 갖게 됩니다. "이봐, 내가 앞서 확인했어. 영화 목록이 바로 여기 있어." 이는 AI 가 올바른 선택을 더 빠르게 내릴 수 있게 도와주므로, 작업을 완료하는 데 필요한 전체 단계 수가 줄어듭니다.
결과
연구자들은 실제 스마트폰과 실제 앱으로 이를 테스트했습니다. 그 결과 다음과 같은 사실을 발견했습니다.
- 더 빠릅니다: AI 가 덜 추측해야 했기 때문에 전체 과정이 약 23% 더 단축되었습니다.
- 더 똑똑합니다: 더 많은 정보를 갖게 되었기 때문에 AI 가 작업을 올바르게 수행하는 비율이 약간 더 높아졌습니다 (최대 5% 향상).
- 개인정보 보호: 모든 일이 스마트폰 내부에서 발생합니다. 데이터가 클라우드로 전송되지 않으므로 화면 활동은 비공개로 유지됩니다.
요약하자면, MobileExplorer 는 느리지만 똑똑한 AI 의 "기다리는 시간"을 "생산적인 시간"으로 전환하여, 스마트폰이 인터페이스를 안전하고 효율적으로 탐색하게 함으로써 AI 가 사용자의 작업을 더 빠르게 완료할 수 있도록 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.