← 최신 논문
🤖 machine learning

Generative Visual Code Mobile World Models

이 논문은 실행 가능한 웹 코드로서 다음 인터페이스 상태를 예측하기 위해 단일 비전 - 언어 모델을 활용하는 모바일 GUI 세계 모델의 새로운 패러다임인 gWorld 를 소개하며, 이를 통해 고충실도 시각적 렌더링과 정밀한 텍스트 생성을 달성하면서도 정확도 측면에서 훨씬 더 큰 기존 모델들을 크게 능가합니다.

원저자: Woosung Koh, Sungjun Han, Segyu Lee, Se-Young Yun, Jamin Shin

게시일 2026-05-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Woosung Koh, Sungjun Han, Segyu Lee, Se-Young Yun, Jamin Shin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"Generative Visual Code Mobile World Models" 논문 (gWorld 소개) 에 대한 설명을 쉬운 언어와 창의적인 비유로 풀어냅니다.

큰 문제: "흐릿한 수정구"

로봇에게 스마트폰 사용법을 가르치려 한다고 상상해 보세요. 이를 위해 로봇은 "이 버튼을 누르면 다음 화면은 어떻게 보일까?"를 예측할 수 있는 수정구 (World Model) 가 필요합니다.

이 수정구를 만드는 현재의 시도에는 치명적인 결함이 있습니다:

  1. "텍스트 전용" 모델: 일부 모델은 다음 화면을 단어 (예: "버튼이 파란색으로 바뀐다") 로 설명하려 합니다. 이는 빠르지만, 영화 대본을 읽으며 영화를 묘사하는 것과 같습니다. 정확한 폰트, 색조, 레이아웃 같은 모든 시각적 세부 사항을 잃게 됩니다.
  2. "픽셀 생성기" 모델: 다른 모델들은 화가가 그림을 그리듯 픽셀 단위로 다음 화면을 그리려 합니다. 이는 보기에는 예쁠지 몰라도, 텍스트를 그리는 데는 형편없습니다. 종종 의미 없는 글자, 왜곡된 버튼, 기이한 레이아웃을 만들어냅니다. 이를 고치기 위해 텍스트를 확인하고 오류를 수정하는 다른 AI 도구들을 포함하는 거대하고 느린 다단계 공장이 필요합니다. 마치 단일 버튼을 그리기 위해 화가를 고용한 뒤, 맞춤법 검사기, 건축가, 편집자를 차례로 고용하는 것과 같습니다.

해결책: "건축가의 설계도"

저자들은 수정구를 만드는 새로운 방식을 제안합니다. AI 에게 그림 (픽셀) 을 그리거나 (텍스트) 설명하라고 요청하는 대신, 그림을 만드는 코드를 쓰게 합니다.

이렇게 생각해보세요:

  • 구식 방식 (픽셀 생성기): 웹사이트를 완벽하게 복제하라고 화가에게 요청하는 것입니다. 색상은 맞출 수 있겠지만, 글자는 낙서처럼 보일 수 있습니다.
  • 신식 방식 (gWorld): 마스터 건축가에게 웹사이트의 설계도 (HTML/CSS 코드) 를 쓰게 하는 것입니다.

AI 가 구조화되고 논리적인 코드를 작성하기 때문에, 버튼을 어디에 배치할지, 단어를 어떻게 철자할지, 레이아웃을 어떻게 배열할지 정확히 알고 있습니다. 이 코드가 "렌더링" (브라우저에서 실행) 되면 다음 화면의 완벽하고 선명한 이미지가 즉시 나타납니다.

gWorld 란 무엇인가?

gWorld는 저자들이 개발한 새로운 AI 시스템의 이름입니다.

  • World Model 입니다: 현재 화면과 행동 (예: "여기 탭하기") 을 입력받아 다음 화면을 예측합니다.
  • "코드"로 말합니다: 이미지 파일을 출력하는 대신 웹 코드 (HTML/CSS) 를 출력합니다.
  • 열려 있고 빠릅니다: 저자들은 모델의 "가중치 (뇌)"를 무료로 공개했습니다. 다른 방법들의 느리고 복잡한 공정을 건너뛰기 때문에 매우 빠릅니다. 1 초 미만에 다음 화면을 예측합니다.

어떻게 가르쳤을까요?

AI 에게 아직 본 적 없는 화면의 코드를 쓰라고 할 수는 없습니다. 저자들은 특별한 훈련 공장을 구축해야 했습니다:

  1. 오래된 데이터 재활용: 사람들이 스마트폰을 사용한 기존 기록 (탭과 스와이프 궤적) 을 가져왔습니다.
  2. 번역기: 인간 행동의 "이후" 이미지를 보고 이를 깨끗하고 작동하는 코드로 번역하는 초지능 AI 를 사용했습니다.
  3. 추론 단계: 또한 AI 가 코드를 작성하기 전에 먼저 "스스로 생각하며 말하기"를 가르쳤습니다. 코드를 작성하기 전에 화면이 왜 변하는지 설명합니다 (예: "사용자가 '전송'을 클릭했으므로 이메일은 사라지고 '전송됨' 메시지가 나타나야 합니다").

결과: 왜 중요한가

저자들은 gWorld 를 8 개의 최상위 AI 모델 (일부는 50 배 더 크고 비쌈) 과 비교 테스트했습니다.

  • 정확도: gWorld 는 다음 화면을 예측하는 데 가장 정확했습니다. 텍스트도 정확하고 레이아웃도 완벽했습니다.
  • 효율성: 훨씬 작은 모델 크기로 이러한 결과를 달성했습니다. 거대한 트럭보다 소형 스포츠카가 경주에서 이기는 것과 같습니다.
  • "파레토 프런티어": 차트에서 gWorld 는 새로운 "최고 가능" 선을 만들었습니다. 모델을 훨씬 더 크게 만들지 않고서는 더 나은 정확도를 얻을 수 없으며, gWorld 는 이미 그 크기에서 가장 뛰어납니다.
  • 실제 환경 테스트: 심지어 AI 가 본 적 없는 앱과 언어 (예: 한국어) 로도 테스트했는데, 여전히 매우 잘 수행했습니다.

설계도의 "마법"

이 논문은 핵심 통찰을 강조합니다: 모바일 화면은 복잡한 사진이 아니라 대부분 구조와 텍스트입니다.
일부 화면에는 사진이 있지만 (예: 카메라 뷰), 대부분은 목록, 버튼, 텍스트입니다. gWorld 는 코드를 작성하기 때문에 화면을 구조화된 문서처럼 다룹니다. 이는 "픽셀 그림" 모델의 가장 큰 약점인 철자 실수나 레이아웃 오류를 결코 저지르지 않음을 의미합니다.

요약

이 논문은 사용자가 상호작용한 후 스마트폰 화면이 어떻게 변할지 예측하는 새로운 유형의 AI 인 gWorld를 소개합니다. 다음 화면을 "그리는" 시도 (흐릿한 텍스트와 오류로 이어짐) 대신, gWorld 는 화면을 구축할 코드를 작성합니다. 이 접근 방식은 더 빠르고, 정확하며, 더 적은 컴퓨팅 전력을 필요로 하며, 완벽한 텍스트와 레이아웃을 생성하여 AI 에이전트가 우리 스마트폰을 사용하는 법을 학습하는 방식에 새로운 기준을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →