← 최신 논문
🤖 AI

Video2Code: Generating Interactive Webpages from UI Videos via Action-Aware Revisit

Video2Code는 복잡한 대화형 웹페이지에서 기능적 정확성을 크게 향상시키기 위해, 실행 가능한 상태 전이를 정확하게 복구하도록 더 높은 시간 해상도로 중요한 액션 영역을 식별하고 재방문함으로써 UI 비디오-투-코드 생성을 강화하는 액션 인지 프레임워크입니다.

원저자: Mingde Xu, Zhen Yang, Yan Wang, Yu Wang, Xijun Liu, Zijun Dou, Wenyi Hong, Xiaotao Gu, Bin Xu, Jie Tang

게시일 2026-06-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mingde Xu, Zhen Yang, Yan Wang, Yu Wang, Xijun Liu, Zijun Dou, Wenyi Hong, Xiaotao Gu, Bin Xu, Jie Tang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 특정하고 상호작용이 가능한 웹사이트를 만드는 법을 가르치고 싶다고 상상해 보세요. 당신은 로봇에게 그 사이트의 정적인 사진 한 장을 보여줄 수 있습니다. 로봇은 색상, 레이아웃, 버튼 등을 아주 잘 복제할 것입니다. 하지만 여기에 문제가 있습니다. 사진은 사용자가 버튼을 클릭하거나, 상자에 글자를 입력하거나, 페이지를 스크롤할 때 어떤 일이 일어나는지 로봇에게 알려줄 수 없습니다. 사진은 시간에 박제되어 있으며, 사이트가 실제로 어떻게 작동하는지에 대한 "마법"을 놓치고 있습니다.

대안으로, 당신은 누군가가 사이트를 사용하는 영상을 로봇에게 보여줄 수 있습니다. 이것은 훨씬 더 나은 방법입니다. 움직임을 포착할 수 있기 때문입니다. 하지만 현재 이 영상을 보는 AI 모델들은 주의 집중 시간이 매우 짧은 사람들과 같습니다. 그들은 영상을 힐끗 보고 몇 개의 프레임만 확인한 채, 사용자가 버튼을 클릭하여 메뉴가 튀어나오는 그 아주 짧은 찰나의 순간을 놓칠 수 있습니다. 만약 AI가 그 찰나의 전환 과정을 놓친다면, AI는 그 메뉴가 튀어나오게 만드는 코드를 작성할 수 없습니다. 겉모습은 아름다운 껍데기를 만들겠지만, 내부는 고장 난 상태가 될 것입니다.

"Video2Code"의 등장.

이 논문의 연구진은 AI에게 영상을 통해 웹사이트를 구축하는 법을 가르치는 새로운 방법인 Video2Code를 개발했습니다. Video2Code를 AI에게 웹사이트 제작을 가르치기 위한 똑똑한 2단계 탐정 과정이라고 생각해보세요.

문제점: "흐릿한 스냅샷"

대부분의 AI 모델은 영상 전체를 이해하기 위해 시간 간격을 두고 몇 개의 "스냅샷"(프레임)을 추출합니다.

  • 비유: 마술사가 모자에서 토끼를 꺼내기 전의 사진 한 장과, 토끼가 사라진 후의 사진 한 장을 보고 마술을 이해하려고 노력하는 것과 같습니다. 당신은 모자와 토끼는 보이지만, 토끼가 어떻게 그곳에 나타났는지는 알 수 없습니다. 당신은 토끼가 처음부터 그곳에 있었다고 추측하거나, 혹은 모자가 그냥 토끼 그림이라고 생각할 수도 있습니다.
  • 결과: AI는 "액션 경계(action boundaries)", 즉 사용자가 화면과 상호작용하는 정확한 순간을 놓칩니다. 그 순간을 명확하게 보지 못하면, AI는 그 상호작용이 일어나도록 만드는 코드를 작성할 수 없습니다.

해결책: "액션 인지 재방문 (Action-Aware Revisit)"

Video2Code는 정확히 어디를 자세히 봐야 할지 아는 탐정처럼 행동함으로써 판도를 바꿉니다. 이 모델은 영상의 지루한 부분에 시간을 낭비하지 않고, 흥미로운 부분으로 줌인합니다.

1단계: 거친 스캔 (광각 렌즈)
먼저, AI는 책의 흥미로운 장을 찾기 위해 책장을 빠르게 넘기는 것처럼 전체 영상을 빠르게 훑어봅니다. 아직 모든 세부 사항을 이해하려고 시도하지 않습니다. 대신 다음과 같이 질문합니다: "사용자가 어디를 클릭했는가? 어디에 타이핑을 했는가? 어디에서 무언가 변했는가?" 그리고 이 지점들을 "액션 크리티컬 영역(Action-Critical Regions)"으로 표시합니다.

2단계: 재방문 (돋보기)
중요한 일이 일어난 곳을 파악하고 나면, AI는 특수한 도구를 사용하여 그 특정 순간들을 "재방문"합니다. AI는 영상을 일시 정지하고 그 몇 초간의 순간을 고화질 슬로 모션으로 관찰합니다.

  • 비유: 영화 편집자가 캐릭터가 문을 여는 장면을 보는 것과 같습니다. 영화 전체를 한 번만 보는 대신, 편집자는 문이 열리는 단 3초의 구간을 잘라내어 속도를 늦추고, 손잡이가 돌아가고, 걸쇠가 딸깍거리고, 문이 흔들리며 열리는 과정을 면밀히 연구합니다.
  • 결과: 이제 AI는 전체 시퀀스를 봅니다: 클릭 전의 상태, 클릭 자체, 그리고 클릭 후의 상태를 말이죠.

학습: 타임라인으로부터 배우기

AI가 이 작업을 수행하도록 가르치기 위해, 연구진은 단순히 무작위 영상을 보여준 것이 아닙니다. 그들은 WebVidCoding이라는 특별한 데이터셋을 만들었습니다.

  • 그들은 사람들이 실제 웹사이트를 사용하는 영상을 녹화했습니다.
  • 사용자가 클릭하거나 타이핑할 때 정확히 일치하도록, 화면 하단에 아주 작고 보이지 않는 "마커"(색이 변하는 바 형태)를 추가했습니다.
  • 이를 통해 AI는 완벽한 "타임라인"을 학습할 수 있었습니다: "바의 색이 변할 때가 바로 클릭이다. 클릭 직전과 직후에 어떤 일이 일어나는지 관찰하라."

결과: 효과가 있는가?

연구진은 Video2Code를 다른 최상위 AI 모델들과 비교 테스트했습니다.

  • 시각적 요소: 모든 모델이 웹사이트를 제대로 보이게 만드는 데는 능숙했습니다.
  • 기능성: 바로 이 지점에서 Video2Code가 빛을 발했습니다. 다른 모델들이 겉보기에는 좋지만 작동하지 않는(버튼을 눌러도 아무 일도 일어나지 않는) 웹사이트를 만든 반면, Video2Code는 실제로 영상처럼 동작하는 웹사이트를 구축했습니다.
  • "밀집(Dense)" 테스트: 개선 효과는 단계가 많은 영상(클릭, 스크롤, 타이핑이 연달아 일어나는 경우)에서 가장 두드러졌습니다. 다른 모델들은 복잡함 때문에 혼란을 겪었지만, 결정적인 순간을 재방문한 Video2Code는 그 논리를 파악해냈습니다.

요약하자면

Video2Code는 AI가 영상을 그저 "힐끗 보는" 것에 그치지 않도록 만드는 시스템입니다. 대신, AI에게 중요한 순간을 포착하고, 줌인하여, 코드를 작성하기 전에 이를 면밀히 연구하도록 가르칩니다. 이를 통해 최종 웹사이트는 단순히 영상처럼 보이는 것을 넘어, 실제 사용자 상호작용의 "상태-액션-상태(state-action-state)" 댄스를 완벽하게 구현하게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →