← 최신 논문
⚡ electrical engineering

GVC-RT: Towards Real-Time Generative Video Compression at Ultra-Low Bitrates

GVC-RT는 비대칭 구조와 경량 디토크나이저를 채택하여 추론 시점의 병목 현상을 제거함으로써 1080p 비디오를 55 fps 이상의 속도로 처리할 수 있게 함으로써, 초저비트레이트 압축과 최첨단 충실도를 달성하는 실시간 생성 비디오 코덱입니다.

원저자: Tianjian Dang, Sixian Wang, Lei Luo, Guo Lu, Jincheng Dai

게시일 2026-08-06
📖 3 분 읽기☕ 가벼운 읽기

원저자: Tianjian Dang, Sixian Wang, Lei Luo, Guo Lu, Jincheng Dai

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 친구에게 영화를 보내려고 하는데, 인터넷 연결이 너무 느려서 초당 아주 작은 엽서 몇 장밖에 보낼 수 없다고 상상해 보세요. 비디오 압축의 세계에서 이것은 "초저비트레이트(ultra-low bitrate)"라는 도전 과제입니다. 수십 년 동안 과학자들은 비디오 데이터를 점점 더 작은 패키지로 압축하기 위해 노력해 왔습니다. 전통적인 방식은 복사기와 같습니다. 모든 픽셀을 정확히 똑같이 유지하려고 노력합니다. 하지만 사진을 너무 많이 축소하면 흐릿하고 뭉개진 덩어리처럼 변하게 됩니다.

최근에는 "생성형 비디오 압축(Generative Video Compression)"이라는 새로운 접근 방식이 등장했습니다. 단순히 픽셀을 복사하는 대신, 이 시스템은 숙련된 화가처럼 행동합니다. 몇 개의 거친 스케치(코드)를 보내고 수신 측 컴퓨터에 이렇게 말합니다. "헤이, 배가 어떻게 생겼는지 알지? 여기에 정말 멋진 배를 그려줘." 이렇게 하면 아주 적은 양의 데이터로도 놀랍도록 멋지고 사실적인 이미지를 만들어냅니다. 하지만 함정이 있습니다. 받는 쪽의 "화가"는 보통 거대하고 느린 슈퍼컴퓨터 뇌입니다. 그림을 그리는 데 시간이 너무 오래 걸려서 영상을 실시간으로 볼 수 없습니다. 마치 거장이 단 한 프레임을 완성하는 데 3일이 걸리는 것과 같습니다. 연구자들의 큰 질문은 "이 예술적인 마법을 영상을 보내는 동안 볼 수 있을 만큼 빠르게 구현할 수 있는가?"였습니다.

여기서 새로운 논문은 이 "화가"를 일반적인 비디오 플레이어의 속도로 가져오기 위해 설계된 시스템인 GVC-RT를 소개합니다. 연구진(Tianjian Dang과 동료들)은 기존의 방식이 너무 무겁다는 것을 깨달았습니다. 그들은 이러한 생성형 시스템이 왜 그렇게 느렸는지 세 가지 주요 원인을 파악했습니다. 비디오를 "스케치"로 바꾸는 과정(토큰화)이 너무 무거웠고, 스케치가 화가의 스타일과 일치하는지 확인하는 과정(정렬)이 너무 복잡했으며, 마지막 단계인 스케치를 다시 그림으로 바꾸는 과정(역토큰화)이 너무 비용이 많이 들었습니다.

이를 해결하기 위해, 그들은 영리한 "비대칭적" 접근 방식으로 시스템을 완전히 재설계했습니다. 이것은 마치 고도의 심리전이 포함된 '전화 게임(telephone game)'과 같습니다. 메시지를 보내는 사람(인코더)은 빠르고 단순한 주자이지만, 메시지를 받는 사람(디코더)은 강력하고 창의적인 화가입니다. 기존 시스템에서는 주자가 화가의 역할까지 수행해야 했기에 전체 속도가 느려졌습니다. GVC-RT에서 주자는 필수적인 정보만을 챙겨서 전달할 뿐입니다. "생성적 정렬(generative alignment)"—즉, 수신자가 정확히 어떤 스타일을 사용해야 하는지 알게 하는 무거운 작업—은 전적으로 훈련 단계로 옮겨졌습니다. 이는 게임이 시작되기 전에 화가가 주자의 특정 수신호를 완벽하게 인식하도록 가르치는 것과 같습니다. 그러면 실제 게임 중에는 확인을 위해 멈춰 설 필요가 없습니다.

나아가, 그들은 거대하고 느린 화가를 "증류된(distilled)" 버전, 즉 실력은 뛰어나지만 훨씬 더 빠르게 움직이는 경량화된 화가로 교체했습니다. 이 경량 화가는 거대하고 느린 마스터의 작업을 모방함으로써 훈련되었으며, 엄청난 계산 비용 없이도 동일한 고품질의 결과를 낼 수 있도록 학습되었습니다.

결과는 인상적입니다. 팀은 표준적이고 강력한 가정용 컴퓨터 그래픽 카드(NVIDIA RTX 4090)로 시스템을 테스트했습니다. 그들은 GVC-RT가 고해상도 1080p 비디오에 대해 **123.1 fps(초당 프레임 수)**로 인코딩하고 55.1 fps로 디코딩할 수 있다는 것을 발견했습니다. 이를 체감하기 위해 설명하자면, 표준 영화는 24 또는 30 fps로 재생되는데, 이 시스템은 여유 공간을 충분히 확보한 채 실시간 스트리밍을 처리할 수 있을 만큼 빠릅니다. 품질 측면에서, 이 시스템은 이전의 최고 모델(GLC-Video)을 크게 앞질렀으며, 인간의 눈에 똑같거나 심지어 더 좋게 보이면서도 데이터 사용량을 약 **12.4%**에서 **48.8%**까지 절감했습니다.

이 논문은 무거운 "토큰화" 단계를 제거하고 복잡한 스타일 매칭을 훈련 단계로 옮김으로써, 고품질의 예술적 비디오 압축과 실시간 속도 사이의 간극을 성공적으로 메웠음을 시사합니다. 그들은 자신들의 시스템이 여전히 강력한 소비자용 하드웨어에 의존한다는 점을 인정하면서도, 실시간 생성형 비디오 압축이 더 이상 슈퍼컴퓨터만의 꿈이 아니라 오늘날 게이밍 환경에서 볼 수 있는 기기에서도 실행 가능한 현실임을 입증했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →