← 최신 논문
🤖 machine learning

Wan-Streamer v0.2: Higher Resolution, Same Latency

Wan-Streamer v0.2는 단일 GPU 기반의 'thinker'가 인지 및 언어 상태를 처리하고 멀티 GPU 기반의 'performer' 그룹이 고해상도 비디오 생성을 병렬로 처리하는 분할 아키텍처를 채택하여, 출력 해상도를 192x336에서 640x368로 두 배 높이면서도 약 550ms의 엔드 투 엔드 지연 시간을 유지하는 엔드 투 엔드 오디오-비주얼 상호작용 모델의 지연 시간 보존 업그레이드입니다.

원저자: Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chen Liang, Cheng Yu, Chongyang Zhong, Jinwei Qi, Kai Zh
게시일 2026-07-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chen Liang, Cheng Yu, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zoubin Bi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매우 똑똑하고 실시간으로 소통하는 디지털 친구와 화상 통화를 하고 있다고 상상해 보세요. 이 기술의 이전 버전(v0.1)에서 당신의 친구는 말을 하고 움직일 수는 있었지만, 화면 속의 아주 작고 흐릿한 썸네일처럼 보였습니다. 얼굴은 볼 수 있었지만, 친구가 손을 움직이거나 테이블 옆에 커피 한 잔이 놓여 있는 모습 등은 너무 작아서 알아보기 힘들었습니다.

Wan-Streamer v0.2는 당신의 디지털 친구를 훨씬 더 선명하고 크게 보이게 하면서도, 대화가 "버벅거리거나" 느려지는 느낌 없이 만들어주는 업그레이드 버전입니다. 그들이 이를 어떻게 구현했는지 쉽게 설명해 드리겠습니다.

1. 목표: 더 큰 화면, 동일한 속도

팀의 목표는 비디오 품질을 아주 작은 저해Resolution 뷰(높이 192 픽셀)에서 훨씬 더 선명한 중간 크기의 뷰(높이 640 픽셀)로 업그레이드하는 것이었습니다.

  • 문제점: 보통 영상을 더 선명하게 만드는 데는 더 많은 컴퓨터 연산 능력이 필요하며, 이는 속도를 늦추게 됩니다. 영상을 더 좋게 만들면 대개 대화가 지연되기 마련입니다.
  • 결과: 그들은 대화의 반응 속도를 정확히 동일하게 유지하면서도, 영상을 3배 더 선명하게 만드는 데 성공했습니다(이제 친구의 자세, 손 동작, 그리고 주변 방 안의 모습까지 볼 수 있습니다). 이는 마치 지연된 영상 메시지가 아니라 실제 실시간 대화를 하는 것처럼 느껴집니다.

2. 비법: "생각하는 자(Thinker)"와 "수행하는 자(Performer)"

이 속도를 얻기 위해, 팀은 디지털 친구의 뇌를 두 개의 뚜렷한 역할로 나누어 마치 계주 팀처럼 협력하게 했습니다.

  • 생각하는 자 (빠른 관리자):
    책상에 앉아 있는 매우 빠른 매니저 한 명을 상상해 보세요. 이 사람은 당신이 하는 말을 듣고, 당신의 텍스트를 읽으며, 친구가 다음에 무엇을 말해야 할지 빠르게 결정합니다. 이 매니저는 매우 효율적이며 단 **하나의 컴퓨터 칩(GPU)**에서 작동합니다. 이들의 유일한 임무는 대화가 즉각적으로 흐르도록 유지하는 것입니다. 화려한 배경을 그리는 일에는 신경 쓰지 않고, 오직 "지시 사항"(K/V 슬라이스라고 불림)을 다음 사람에게 전달하는 역할만 수행합니다.

  • 수행하는 자 (예술가 팀):
    커다란 스튜디오에서 함께 일하는 예술가 팀을 상상해 보세요. 이 팀은 당신의 친구를 고화질 영상으로 실제로 '그리는' 역할을 담당합니다. 이제 영상이 더 커지고 세밀해졌기 때문에, 예술가 한 명으로는 속도를 맞출 수 없습니다. 그래서 그들은 **"Ulysses 스타일의 컨텍스트 병렬 처리(Ulysses-style context parallelism)"**라는 특별한 팀워크 방식을 사용합니다.

    • 이것은 마치 여러 명의 화가가 거대한 벽화를 구역별로 나누어 작업하는 것과 같습니다. 각 화가는 동시에 서로 다른 구역을 맡아 작업합니다.
    • 그들은 진행 상황을 즉각적으로 공유하여 최종 결과물이 완벽하게 하나로 합쳐지도록 합니다.
    • "생각하는 자"가 필수적인 지시 사항만을 전달하기 때문에, "수행하는 자" 팀은 대화 속도를 늦추지 않으면서 오로지 영상을 멋지게 만드는 데에만 집중할 수 있습니다.

3. 이것이 중요한 이유

이전 버전에서 당신의 디지털 친구는 작은 비디오 통화 상자 안에 갇힌 사람 같았습니다. 즉, 얼굴만 볼 수 있었습니다.
v0.2에서 당신의 친구는 이제 방 안에 서 있습니다. 이제 당신은 다음을 볼 수 있습니다:

  • 친구가 어디를 보고 있는지 (시선).
  • 손을 어떻게 움직이고 있는지.
  • 테이블 근처에 어떤 물건들이 놓여 있는지.
  • 친구가 있는 방의 구조.

4. 마법의 숫자: 550 밀리초

논문에서는 특정 숫자를 언급합니다: 550 밀리초(약 0.5초). 이것은 당신이 말을 한 시점부터 친구가 반응할 때까지의 총 시간입니다.

  • "생각하는 자"와 "수행하는 자"의 팀워크는 영상이 훨씬 더 무겁고 상세해졌음에도 불구하고, 반응하는 데 걸리는 총 시간이 동일한 0.5초를 유지하도록 보장합니다.
  • "생각하는 자"는 빠른 사고(200ms)를 처리하고, "수행하는 자"는 배경 영상을 그리는 무거운 작업을 처리하며, 이 모든 과정 중에 네트워크 지연(데이터가 인터넷을 통해 전달되는 시간)까지 모두 고려됩니다.

요약하자면: Wan-Streamer v0.2는 마치 입자가 거친 근접 웹캠 채팅에서, 영상 로딩을 기다릴 필요 없이 디지털 친구의 전신과 주변 환경까지 볼 수 있는 고화질 화상 통화로 업그레이드한 것과 같습니다. 그들은 빠른 "생각하는 자"를 고용해 대화를 관리하게 하고, "수행하는 자" 팀이 병렬로 그림을 그리게 함으로써 이 데려왔습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →