← 최신 논문
💻 computer science

OmniVR: Joint Video-Audio Conditional Generation for Restoring Degraded Historical Films

OmniVR은 손상된 역사적 영화를 시각 및 오디오 열화 문제를 동시에 해결하면서 교차 모달 일관성과 자연스러운 채색을 보장하는 통합 멀티모달 DiT 내의 조건부 생성 작업으로 정식화하여 복원하는 선구적인 22B 파라미터 결합 오디오-비디오 생성 모델입니다.

원저자: Xin Lu, Zihao Fan, Mingchen Zhong, Jie Huang, Xueyang Fu, Zheng-Jun Zha

게시일 2026-08-06
📖 5 분 읽기🧠 심층 분석

원저자: Xin Lu, Zihao Fan, Mingchen Zhong, Jie Huang, Xueyang Fu, Zheng-Jun Zha

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 과거만을 볼 수 있는 마법의 카메라를 가진 시간 여행자라고 상상해 보세요. 당신은 100년 전의 낡고 먼지 쌓인 필름 릴을 발견했습니다. 그것을 재생하자 화면은 흐릿하고 깜빡거리며 흑백으로 나타나고, 소리는 마치 양철 통 안에서 들리는 것처럼 지직거리고 쉬익거리는 소음이 가득합니다. 수십 년 동안 과학자들은 이 영화들을 복원하려고 노력해 왔지만, 그들은 영상과 소리를 별개의 문제로 취급해 왔습니다. 한 팀은 영상을 깨끗하게 만드는 예술가들이고, 다른 팀은 소음(노이즈)을 고치는 오디오 엔지니어들이며, 이들은 서로 고립되어 작업합니다. 하지만 현실 세계에서 영상과 소리는 가장 친한 친구입니다. 즉, 서로에게 영향을 미칩니다. 오디오가 웅얼거리면 캐릭터가 속삭이는 것인지 아니면 단순히 멀리 있는 것인지 구분하기 어렵습니다. 영상이 흐릿하면 효과음이 동작과 일치하는지 알기 어렵습니다.

이 논문은 OmniVR라고 불리는 새로운 종류의 "디지털 복원가"를 소개합니다. 이것을 두 개의 별도 수리팀이 아니라, 엉망이 된 그림과 시끄러운 소리를 함께 보면서 원래의 장면이 실제로 어떻게 보이고 들렸는지를 알아내는 단 하나의 똑똑한 탐정이라고 생각해보세요. 연구진은 원래 무에서 유를 창조하도록 학습된 거대한 220억 개의 파라미터(AI 모델의 일종)를 가진 '두뇌'를 사용하여 이 탐정을 구축했습니다. 단순히 무언가를 만들어내는 대신, 그들은 이 두뇌가 엉망이 된 옛날 영화의 나쁜 부분들을 단서로 삼아 깨끗한 부분을 재구성하도록 "역-확산(un-diffuse)"하는 법을 가르쳤습니다. 그들은 단순히 흐릿함을 제거하거나 잡음을 없애는 것에 그치지 않고, 영상과 오디오가 서로 대화하게 만들었습니다. 이를 통해 캐릭터가 입을 움직일 때 소리가 완벽하게 일치하고, 음악이 고조될 때 장면의 분위기가 적절하게 느껴지도록 했습니다.

거대한 문제: 한쪽만 고치는 것이 충분하지 않은 이유

역사적 영화들은 타임캡슐과 같지만, 종종 망가져 있습니다. 논문은 이러한 오래된 영화들이 이중고를 겪고 있다고 지적합니다. 영상은 흐릿하고 입자가 거칠며 깜빡거리는 반면, 오디오는 쉬익거리고, 툭툭 끊기며, 소리가 빠지기도 합니다. 저자들은 이전의 방식들이 놓쳤던 중요한 점을 발견했습니다: 손상이 동시에 발생한다는 것입니다. 영상을 고친다고 해서 소리가 마법처럼 좋아지기를 기대하거나 그 반대의 경우를 기대해서는 안 됩니다. 실제로 영상을 고쳤는데 오디오를 그대로 두거나(혹은 그 반대로), 두 요소 사이의 싱크가 맞지 않게 됩니다. 이는 마치 다른 비트에 맞춰 춤을 추는 파트너와 춤을 추려는 것과 같습니다. 결과는 어색하고 부자연스러워집니다.

연구진은 연구한 대부분의 오래된 클립에서 눈과 귀가 함께 고통받고 있다는 것을 발견했습니다. 또한, 영상과 오디오를 함께 생성하도록 설계된 AI 모델의 두뇌에는 "교차 연결(cross-wiring)"이 있다는 것도 발견했습니다. 모델의 오디오 부분은 영상을 주목하고, 영상 부분은 오디오를 주목합니다. 만약 오디오를 무음 처리하면 영상 생성 방식이 변합니다. 즉, 영화를 진정으로 복원하려면 오디오와 영상을 서로 남남처럼 취급하는 것이 아니라, 서로가 서로를 도울 수 있게 해야 합니다.

해결책: 세 명의 팀

OmniVR을 만들기 위해 저자들은 "영화 제작자" AI를 "영화 복원가" AI로 바꾸기 위한 3단계 전략을 만들었습니다.

1. "가짜 오래된 영화" 공장
먼저, 팀은 AI에게 망가진 오래된 영화가 어떤 모습인지 가르쳐야 했습니다. 완벽한 "전과 후"의 쌍이 존재하는 실제 망가진 영화를 충분히 찾을 수 없었기 때문에, 그들은 디지털 공장을 건설했습니다. 그들은 고화질의 현대적인 영상과 오디오를 가져와 의도적으로 망가뜨렸습니다. 영상에는 디지털 스크래치, 먼지, 깜빡임, 흐릿함을 추가했고, 오디오에는 쉬익거리는 소리, 툭툭 튀는 소리, 웅얼거림을 추가했습니다. 이 "가짜" 손상들이 역사서에서 발견되는 실제 모습과 소리처럼 보이도록 만들었습니다. 이를 통해 AI는 이전에 본 적 없는 문제를 해결하는 연습을 할 수 있었고, 실제 얼굴과 흐릿한 덩어리의 차이를 식별하는 법을 배웠습니다.

2. "침묵의 파트너" 기술
그들이 시작한 AI는 텍est 설명(예: "달리는 고양이")으로부터 영화를 만드는 거대한 모델이었습니다. 그들은 이 모델을 처음부터 다시 학습시키고 싶지 않았습니다. 왜냐하면 시간이 너무 오래 걸릴 뿐만 아니라 모델이 창의성을 잃을 수도 있기 때문입니다. 대신, 그들은 영리한 기술을 사용했습니다. 그들은 AI에게 이렇게 말했습니다: "영화를 만드는 능력은 유지하되, 이제 텍스트 설명을 듣는 대신 우리가 주는 망가진 영화를 들어라."
그들은 망가진 영상과 망가된 오디오를 AI의 "귀"(입력 채널)에 입력함으로써 이 작업을 수행했으며, 이때 "두뇌"는 거의 동일하게 유지했습니다. 또한 **프롬프트 어닐링(prompt annealing)**이라는 특별한 기술을 사용했습니다. AI가 새로운 언어를 배우고 있다고 상상해 보세요. 처음에는 AI가 장면의 원래 텍est 설명을 읽게 하여 온기를 유지하게 했습니다. 그러다 서서히 그 설명들을 하나의 고정된 지시 사항인 "이것을 선명하고 깨끗하며 동기화되게 만들어라"로 교체했습니다. 이는 AI가 창의적인 불꽃을 잃지 않으면서도 "새로운 것을 만드는 것"에서 "오래된 것을 고치는 것"으로 부드럽게 전환할 수 있도록 도왔습니다.

3. 긴 영화를 위한 "닻(Anchor)"
오래된 영화는 매우 길 수 있지만, AI는 한 번에 짧은 구간(약 5초 또는 121 프레임)만 처리할 수 있습니다. 만약 이 구간들을 그냥 이어 붙이기만 한다면, 한 구간의 끝이 다음 구간의 시작과 약간 다르게 보여 영상이 튀거나 색상이 변할 수 있습니다. 이를 해결하기 위해 저자들은 "첫 프레임 닻(first-frame anchor)"을 사용했습니다. AI가 한 구간의 복원을 마치면, 방금 만든 마지막 프레임을 다음 구간의 "시작점"으로 사용합니다. 이는 마치 주자가 다음 사람에게 바통을 넘겨주는 이어달리기와 같습니다. 다음 주자는 앞선 주자가 멈춘 바로 그 지점에서 시작합니다. 이를 통해 긴 영화에서도 영상이 매끄럽고 연속적으로 유지됩니다.

결과: 복원의 새로운 기준

팀은 200개의 실제 역사적 클립이 포함된 OmniVRBench라는 새로운 벤치마크를 만들어 OmniVR을 테스트했습니다. 그들은 기존의 가장 뛰어난 도구들(보통 영상과 오디오를 따로 고치거나 흑백 영화에 색을 입히는 방식)과 비교했습니다.

결과는 명확했습니다: OmniVR은 영상, 오디오, 그리고 색상을 한꺼번에 성공적으로 복원한 첫 번째 방법입니다.

  • 시각적 품질: 이미지가 얼마나 "자연스럽고" 선명한지를 측정하는 척도에서, OmniVR은 다른 모든 방법보다 현저히 높은 점수를 받았습니다. 단순히 흐릿함을 제거한 것이 아니라, 사라졌던 피부 질감이나 직물의 패턴 같은 미세한 디테일을 다시 살려냈습니다.
  • 오디오 품질: 복원된 소리는 훨씬 더 선명해졌고, 쉬익거리는 소리가 줄었으며 음량도 개선되었습니다. 마치 로봇이 양철 통 안에서 말하는 것이 아니라 실제 인간이 말하는 것처럼 들렸습니다.
  • 동기화: 영상과 오디오가 함께 복원되었기 때문에, 입 모양이 단어와 완벽하게 일치했습니다. 다른 방식들은 오디오는 좋게 만들었지만 입 모양이 맞지 않거나, 그 반대의 경우가 많았습니다.
  • 색상: 단순히 무작위로 색을 입힌 것이 아니라, 조명과 장면의 분위기에 맞는 그럴듯한 색상을 입혀 흑백 영화가 컬러로 촬영된 것처럼 보이게 했습니다.

연구진은 또한 영상 복구 도구와 오디오 복구 도구를 단순히 결합하는 방식("계단식" 접근법)이 효과적이지 않다는 것을 보여주었습니다. 별개의 도구들은 서로 대화할 수 없기 때문에 실수를 범하기 쉬웠지만, 결합형 모델인 OmniVR은 이를 피했습니다. 예를 들어, 별도의 오디오 복구 도구는 타이밍을 아주 미세하게 변경하여 영상과 싱크가 어긋나게 만들 수 있지만, OmniVR은 이들을 단단히 묶어두었습니다.

핵심 요약

OmniVR은 역사를 복원하는 것이 단순히 그림이나 소리 파일을 깨끗하게 하는 것이 아니라, 둘 사이의 관계를 이해하는 것임을 증명합니다. 영상과 오디오를 하나의 연결된 이야기로 다룸으로써, 이 모델은 이전에는 잃어버린 것으로 여겨졌던 디테일을 회복할 수 있었습니다. 비록 논문에서는 프레임 자체가 완전히 사라진 극도로 손상된 영화의 경우 여전히 까다로울 수 있으며, AI가 빈틈을 메우기 위해 가끔 디테일을 "환각(hallucinate)"할 수 있다고 언급했지만, 결과는 거대한 도약입니다. 이는 과거를 단순히 정지된 이미지가 아니라, 살아 숨 쉬고 동기화된 경험으로서 다시 불러오는 방법을 제시합니다. 코드와 모델이 공개되었으므로, 이제 누구나 이 "시간 여행하는 탐정"을 사용하여 자신만의 오래된 기억을 복원할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →