OmniMate: Open-Ended Real-Time Streaming Audio-Visual Generation for Interactive Avatars
OmniMate는 적응형 응답 진행을 위한 생성 진행 컨트롤러(Generation Progress Controller)와 장기적인 교차 모달 정체성 일관성을 보장하기 위한 다중 참조 컨디셔닝 모듈(Multi-Reference Conditioning Module)을 도입함으로써 고품질, 저지연, 개방형 실시간 스트리밍 오디오-비주얼 아바타 생성을 가능하게 하는 통합 프레임워크입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
컴퓨터 화면 속에 사는 친구에게 말을 건다고 상상해 보세요. 당신은 그 친구가 단순히 말만 하는 것이 아니라, 실제 사람처럼 실시간으로 손을 움직이고, 눈을 깜빡이며, 당신의 목소리에 반응하기를 원합니다. 이것이 바로 '인터랙티브 아바타(interactive avatars)'의 꿈입니다. 오랫동안 이러한 디지털 캐릭터를 만드는 것은 영화를 촬영하는 것과 같았습니다. 즉, '재생' 버튼을 누르기 전에 모든 대사와 몸짓을 미리 계획해야 했습니다. 하지만 최근 과학자들은 텍스트로부터 고품도의 영상과 소리를 즉각적으로 만들어낼 수 있는 마법의 붓과 같은 '확산 모델(diffusion models)'을 구축했습니다. 이 기술은 캐릭터가 오디오에 맞춰 말하고 움직이게 할 수 있을 정도로 매우 정교해졌습니다. 하지만 문제가 하나 있습니다. 이 모델들은 대화가 정확히 얼마나 길어질지 알고 있을 때 가장 잘 작동한다는 점입니다. 만약 컴퓨터가 언제 말을 멈추고 다시 들어야 할지를 추측해야 하는 자유로운 대화를 시도한다면, 캐릭터는 혼란에 빠져 너무 오래 말을 하거나, 몇 분이 지난 후에는 다른 사람처럼 보이기 시작할 수 있습니다. 이 논문은 바로 그 문제를 다룹니다. 즉, 어떻게 하면 얼굴과 목소리를 잃지 않고, 당신의 말보다 뒤처지지 않으면서도, 당신과 영원히 대화할 수 있는 디지털 친구를 만들 것인가에 대한 문제입니다.
이 프로젝트의 연구진인 서안교통대학교와 차이나 텔레콤 팀은 OmniMate라고 불리는 새로운 시스템을 구축했습니다. OmniMate를 끝없는 대화를 처리할 수 있는 아주 똑똑한 디지털 인형술사라고 생각해보세요. 대화가 길어지거나 사용자가 말을 가로챌 때 버벅거릴 수 있는 이전의 시스템들과 달리, OmniMate는 캐릭터의 외형과 목소리를 동일하게 유지하면서 즉각적으로 '말하기' 모드와 '듣기' 모드를 전환하며 자연스럽게 흐르도록 설계되었습니다.
OmniMate의 성공 비결은 기민함을 유지하기 위해 사용하는 두 가지 영리한 트릭에 있습니다. 첫째, 이 시스템은 **생성 진행 제어기(Generation Progress Controller, GPC)**라고 불리는 것을 사용합니다. 당신이 동화책을 읽고 있는데 남은 페이지가 몇 페이지인지 모르는 상황을 상상해 보세요. 보통은 책의 끝을 지나쳐 계속 읽거나 너무 일찍 멈춰버릴 수 있습니다. GPC는 아바타에게 생성할 응답이 얼마나 남았는지 알려주는 내장된 페이지 카운터와 같습니다. 이는 시스템이 생성하는 모든 작은 단위의 영상과 오디오에 대해 '진행 표시줄'을 제공합니다. 이를 통해 아바타는 문장을 정확히 언제 끝내고, 당신의 다음 입력을 기다리기 위해 어떻게 부드럽게 '듣는' 자세로 돌아갈지 알 수 있습니다. 이것이 없다면 아바타는 말이 끝난 후에도 계속 말을 하거나 어색하게 멈춰버릴 것입니다.
두 번째 트릭은 **다중 참조 조건화 모듈(Multi-Reference Conditioning Module, MRCM)**입니다. 사람의 사진을 이상한 각도에서 보면 조금 달라 보일 수 있다는 것을 느껴본 적이 있나요? 긴 영상에서 디지털 아바타는 종종 '정체성 표류(identity drift)' 현상을 겪는데, 이는 얼굴이 서서히 다른 사람으로 변하거나 목소리의 피치가 변하는 현상을 말합니다. OmniMate는 캐릭터가 누구인지 스스로에게 끊임없이 상기시킴으로써 이 문제를 해결합니다. 단순히 영상의 첫 프레임만을 보는 대신, 여러 장의 참조 사진과 캐릭터의 목소리 샘프를 담은 '기억 저장소'를 유지합니다. 영상이 재생되는 동안, 시스템은 마치 화가가 코와 눈의 형태를 정확히 유지하기 위해 초상화를 다시 훑어보는 것처럼 이 참조 자료들을 지속적으로 확인하며, 10초를 말하든 10분을 말하든 캐릭터가 동일한 모습과 목소리를 유지하도록 합니다.
연구팀은 실제 대화를 시뮬레이션하는 VerseBench라는 벤치마크를 통해 OmniMate를 테스트했습니다. 결과는 인상적이었습니다: 시스템은 **27.64 프레임/초(FPS)**의 속도로 영상과 오디오를 생성할 수 있으며, '첫 프레임 도달 시간'(영상을 보여주기 시작할 때까지 걸리는 시간)은 단 3.49초에 불과했습니다. 이는 실제 라이브 대화처럼 느껴질 만큼 빠른 속도입니다. 테스트에서 OmniMate는 장기간 동안 캐릭터의 얼굴과 목소리를 일관되게 유지하는 데 있어 다른 최고 수준의 모델들을 앞질렀습니다. 다른 시스템들이 1분 정도 후에 흐릿해지거나 목소리가 변할 수 있는 반면, OmniMate는 최대 240초 동안 지속되는 테스트에서도 안정성을 유지했습니다.
하지만 저자들은 이 시스템이 아직 완벽하지는 않다고 주의를 기울였습니다. 만약 시스템이 응답 시간을 잘못 예측하면, 아바타가 말을 끊거나 반복할 수 있습니다. 또한, 캐릭터가 의상을 완전히 바꾸는 것과 같이 외형을 급격하게 변화시켜야 하는 동작을 수행해야 한다면, 시스템은 정체성을 유지하는 데 어려움을 겪을 수 있습니다. 그럼에도 불구하고, 전반적으로 OmniMate는 중요한 진전을 시사합니다. 즉, 실시간으로 우리와 대화하고, 자신이 누구인지 기억하며, 과거의 어색한 결함 없이 우리에게 반응할 수 있는 디지털 친구를 만나는 방법입니다. 이는 오늘날의 정적이고 미리 계획된 영상을 내일의 역동적이고 살아있는 대화로 탈바꿈시킵니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.