Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds
이 논문은 일관된 캐릭터 유지를 위한 샷 간 메모리(cross-shot memory)를 갖춘 롱비디오 변형과 상호작용적 탐색을 위한 기하학적 카메라 제어를 갖춘 월드 모델 변형을 특징으로 하며, 롱-호라이즌 스토리텔링과 상호작용적 월드 생성에서 최첨단 성능을 달성하기 위해 롤아웃 인식 학습(rollout-aware training)을 통해 최적화된 통합 오디오-비주얼 생성 시스템인 JoyAI-Echo-1.5를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
컴퓨터가 단 하나의 비디오 클립을 만드는 것을 넘어 전체 이야기를 엮어내고, 첫 장면부터 마지막 장면까지 캐릭터의 외형과 목소리를 동일하게 유지하며, 심지어 시청자가 디지털 풍경 속을 걸으며 고개를 돌리고 앞으로 이동할 때 완벽한 안정성을 제공할 수 있는 세상을 상상해 보십시오. 이것이 바로 인공지능이 움직이는 영상과 소리를 합성하는 법을 배우는 분야인 비디오 생성 기술의 최전선입니다. 수년 동안 이러한 시스템들은 아름다운 초상화는 그릴 수 있지만 모든 얼굴이 일관되게 유지되는 전체 갤러리를 그리는 데는 어려움을 겪는 숙련된 화가나, 몇 문장 뒤면 줄거리를 잊어버리는 이야기꾼과 같았습니다. 과제는 고립된 순간을 넘어, 성장함에 따라 형태가 어긋나거나 정체성을 잃지 않는 길고 일관된 서사와 상호작용하는 세계를 만드는 것이었습니다.
조이 퓨처 아카데미(Joy Future Academy)의 연구진은 이러한 구체적인 문제들을 해결하기 위해 설계된 새로운 시스템인 JoyAI-Echo-1.5를 선보였습니다. 이 시스템은 단순히 더 나은 단일 클립을 만드는 것에 그치지 않고, 두 가지 뚜렷하면서도 연관된 목표에 집중합니다. 즉, 캐릭터와 목소리가 일관되게 유지되는 장편 이야기를 만드는 것과, 사용자의 움직임에 정밀하게 반응하는 상호작용하는 세계를 구축하는 것입니다. 연구진은 컴퓨터에게 과거의 장면을 "기억"하는 방법을 부여하고 움직임의 기하학적 구조를 이해하도록 가르침으로써, 원래의 지침에 충실하고 안정적인 상태를 유지하며 확장된 연속 영상을 생성할 수 있다는 것을 발견했습니다.
시스템의 첫 번째 부분은 긴 이야기를 다룹니다. 이전의 시도들에서는 캐릭터가 한 장면에 등장했다가 영상이 새로운 장소로 전환되면, 그 캐릭터가 약간 다른 모습으로 나타나거나 바뀐 목소리로 말하는 경우가 있었습니다. JoyAI-Echo-1.5는 메모리 뱅크를 구축함으로써 이 문제를 해결합니다. 시스템이 이야기를 생성함에 따라, 이전 샷에서 얻은 특정 시각 및 오디오 세부 정보를 저장합니다. 캐릭터가 다시 등장할 때, 시스템은 이 메모리를 참조하여 그들의 얼굴, 의상, 목소리가 이전에 확립된 것과 일치하는지 확인합니다. 이를 위해 시스템은 단순히 짧은 조각이 아니라 이전 장면의 전체 오디오를 살펴봄으로써 화자의 고유한 톤을 포착하고, 다양한 각도에서 촬영된 캐릭터의 이미지를 저장합니다. 이를 통해 컴퓨터는 영웅이 서로 다른 환경을 통과해 여행하더라도 정체성을 잃지 않는, 연속적인 영화처럼 느껴지는 일련의 샷들을 생성할 수 있습니다.
시스템의 두 번째 부분은 사용자가 디지털 환경을 탐험하기 위해 카메라를 제어하고자 하는 상호작용하는 세계를 위해 설계되었습니다. 과거에는 컴퓨터에 "앞으로 이동" 또는 "왼쪽으로 회전"과 같은 명령을 내리면 종종 끊기거나 부자연스러운 움직임이 발생하거나, 영상이 재생됨에 따라 장면이 서서히 왜곡되고 모양이 변하는 결과가 나타났습니다. 새로운 시스템은 이러한 명령을 카메라가 공간 속에서 어떻게 움직이는지에 대한 정밀한 수학적 설명으로 변환합니다. 이 시스템은 세상을 카메라와 독립적으로 존재하는 안정적인 3차원 공간으로 취급합니다. 사용자가 움직이면 시스템은 정확한 경로를 계산하고 그에 따라 영상을 조정하여, 탐험이 얼마나 오래 지속되더라도 벽, 물체, 조명이 일관되게 유지되도록 합니다. 이를 통해 디지털 세계가 변화하는 환상이 아니라 견고하고 실제처럼 느껴지는 매끄럽고 연속적인 경험을 제공합니다.
이러한 시스템을 유용할 만큼 빠르게 만들기 위해, 연구진은 또한 이를 훈련시키는 새로운 방법을 개발했습니다. 보통 고품질의 영상을 만드는 데는 많은 단계의 계산이 필요하며 이는 오랜 시간이 걸립니다. 연구진은 시스템이 영상을 생성한 직음 바로 그 영상을 바탕으로 개선하도록 함으로써 스스로의 실수를 통해 배우도록 가르쳤습니다. '셀프 그래디언트 포싱(self-gradient forcing)'이라 불리는 이 기술을 포함하는 이 과정은, 시스템이 스스로 긴 시퀀스를 생성할 때도 안정성을 유지할 수 있게 해줍니다. 또한 생성 과정을 압축하는 방법을 사용하여, 소리와 영상 사이의 정밀한 동기화를 잃지 않으면서도 수십 단계 대신 단 몇 단계 만에 고품질의 영상을 제작할 수 있도록 했습니다.
이 연구의 결과는 다른 선도적인 시스템들과 비교 테스트되었습니다. 긴 이야기를 다루는 테스트에서, 이 새로운 시스템은 캐릭터의 일관성을 유지하고 말하는 단어와 입 모양을 맞추는 데 있어 이전의 어떤 모델보다 뛰어난 성능을 보였습니다. 상호작용하는 세계에 대한 테스트에서도, 환경의 형태를 유지하고 사용자의 움직임 명령을 정확하게 따르는 데 있어 경쟁 모델들보다 높은 점수를 기록했습니다. 특히 한 테스트에서는 카메라가 복잡한 장면을 통과하는 60초 연속 영상을 생성할 수 있었으며, 시스템은 장면이 표류하거나 왜곡되는 문제 없이 전체 과정 동안 올바른 원근법과 시각적 품질을 유지했습니다.
이 연구는 지속적인 이야기와 안정적인 상호작용 세계를 만드는 핵심이 컴퓨터가 과거를 어떻게 기억하고 현재의 기하학을 어떻게 이해하느냐에 달려 있음을 시사합니다. 시각 및 오디오 세부 사항에 대한 강력한 기억력과 움직임에 대한 정밀한 이해를 결합함으로써, 이 시스템은 시간이 지나도 일관성을 유지하는 콘텐츠를 생성할 수 있습니다. 매우 길고 복잡한 움직임 동안 카메라를 완벽하게 고정하는 것과 같은 과제가 여전히 남아있지만, 이 연구는 중요한 진전을 보여줍니다. 이는 인공지능이 고립된 클립을 만드는 수준을 넘어 전체 서사와 진화하는 세계를 지속할 수 있음을 보여주며, 더욱 몰입감 있고 신뢰할 수 있는 디지털 경험의 문을 열어줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.