Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining
본 논문은 데이터 부족 문제를 해결하고 멀티모달 GUI 에이전트의 일반화 성능을 크게 향상시키기 위해 레이블이 지정되지 않은 인터넷 비디오로부터 1,200 만 개의 GUI 상호작용 궤적로 구성된 대규모 데이터셋을 생성하는 자동화된 프레임워크인 Video2GUI를 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇에게 컴퓨터, 전화기, 웹사이트 사용법을 가르치고 싶다고 상상해 보세요. 이를 위해 사람들은 버튼을 누르고, 텍스트를 입력하고, 페이지를 스크롤하는 수백만 개의 예시를 로봇에게 보여줘야 합니다.
문제는 이러한 예시를 찾는 것이 매우 어렵다는 점입니다. 일반적으로 연구자들은 모든 클릭을 수동으로 기록하고 레이블을 지정할 사람을 고용해야 하는데, 이는 느리고 비용이 많이 들며 몇 가지 유형의 앱에만 국한되게 만듭니다. 이는 사전의 몇 페이지만 읽어서 언어를 배우려는 것과 같습니다.
Video2GUI는 인터넷 전체를 거대하고 무료인 교실로 변환함으로써 이 문제를 해결하는 새로운 시스템입니다. 간단한 비유를 들어 작동 방식을 설명해 보겠습니다:
1. 거대한 필터 (올바른 동영상 찾기)
인터넷에는 동영상이 가득하지만, 대부분 로봇 교육에는 쓸모가 없습니다 (요리 쇼나 고양이 동영상 등). 연구자들은 5 억 개의 YouTube 동영상을 시작점으로 삼았습니다.
- 대략적인 선별: 먼저 스마트 AI 를 사용해 제목과 설명을 스캔했습니다. 이는 책의 표지를 열어보기 전에 책등만 빠르게 훑어보며 "컴퓨터" 관련 책인지 확인하는 사서와 같은 작업입니다. 이를 통해 동영상을 2 천만 개로 줄였습니다.
- 정밀한 선별: 다음으로 더 고급스러운 AI 를 사용해 해당 동영상의 첫 1 분을 실제로 "관찰"했습니다. 화면이 선명한지, 목소리가 단계를 잘 설명하는지, 실제로 소프트웨어 사용법을 보여주는지 확인했습니다. 이는 고품질 튜토리얼인지 보장하기 위해 엄격한 교사가 동영상을 채점하는 것과 같습니다.
- 결과: 최종적으로 420 만 개의 고품질 튜토리얼 동영상을 확보했습니다.
2. 번역기 (동영상을 지시사항으로 변환)
이제 동영상이 있지만, 로봇은 인간처럼 동영상을 단순히 "보고" 이해할 수 없습니다. 동영상은 구조화된 지시사항 목록으로 번역되어야 합니다.
- 과정: 강력한 AI(초지능 번역기와 같은) 를 사용해 동영상을 관찰하고 분해했습니다. 목표 (예: "신발 구매"), 수행된 단계, 각 클릭이 발생한 정확한 시점을 식별했습니다.
- 마법: AI 는 단순히 추측한 것이 아니라, 클릭된 버튼의 정확한 좌표를 찾기 위해 동영상 프레임을 분석했습니다. 온라인 쇼핑을 하는 사람의 10 분 동영상을 *"0:05 에 검색창 클릭, 0:10 에 '운동화' 입력"*과 같은 정확한 단계별 지도로 변환했습니다.
3. 도서관 (WildGUI)
이렇게 번역된 모든 지시사항은 WildGUI라는 거대한 새로운 도서관에 수집되었습니다.
- 규모: 이 도서관에는 1,500 개 이상의 다양한 앱과 웹사이트를 아우르는 1,200 만 개의 상호작용 경로 (궤적) 가 포함되어 있습니다.
- 다양성: Windows 데스크톱부터 Android 폰, Mac 컴퓨터까지 모든 것을 포함합니다. 이는 인간이 컴퓨터를 사용해 온 모든 가능한 방법이 정리되어 로봇이 학습할 준비가 된 도서관을 가진 것과 같습니다.
4. 훈련 (로봇 교육)
연구자들은 두 가지 기존 AI 모델 (Qwen2.5-VL 및 Mimo-VL) 을 가져와 이 새로운 도서관을 "공급"했습니다.
- 결과: 이 거대한 데이터셋을 학습한 후 로봇들의 성능이 크게 향상되었습니다. 다양한 테스트에서 **5% 에서 20%**까지 개선되었습니다.
- 증거: 이제 그들은 이전보다 훨씬 더 잘 버튼을 찾고, 올바른 항목을 클릭하며, 복잡한 웹사이트를 탐색할 수 있게 되어 현재 존재하는 최고의 로봇들과 맞먹거나 능가하는 성과를 냈습니다.
결론
이 논문은 인터넷 동영상을 학습 데이터로 변환하는 과정을 자동화함으로써, AI 에이전트가 컴퓨터 사용에 훨씬 더 똑똑해지게 만드는 방대하고 다양한 데이터셋을 창출했다고 주장합니다. 그들은 새로운 유형의 로봇을 발명한 것이 아니라, 기존 로봇들에게 훨씬 더 좋고, 크며, 다양한 교과서를 제공한 것입니다.
그들은 이 데이터셋과 이를 구축하는 데 사용된 도구를 공개하여 다른 연구자들이 향후 더 나은 AI 에이전트를 구축할 수 있도록 했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.