Vorch-Director: Interactive World Story Model via Noise-Aware Error Rectification
Vorch-Director는 오차 누적과 정체성 드리프트를 완화하기 위해 노이즈 인식 잔차 보정 전략을 도입하고, LTX-2 확산 트랜스포머(diffusion transformer) 상에서 통합된 멀티샷 컨디셔닝을 지원하도록 태스크 임베딩과 혼합 태스크 학습을 활용함으로써 장기 오디오-비주얼 생성을 향상시키는 대화형 월드 스토리 모델이다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 이야기를 들려주는 법을 가르치고 있다고 상상해 보세요. 당신은 몇 문장을 주고, 로봇은 그다음 문장을 씁니다. 그런 다음, 그 새로운 문장을 다시 입력값으로 넣어 다음 문장을 쓰게 합니다. 이 과정을 반복하며 하나의 긴 소설을 완성하기를 기대합니다. 이것이 많은 현대 AI 비디오 생성기가 작동하는 방식입니다. 짧은 클립을 생성한 뒤, 그 클로를 '기억'으로 사용하여 다음 클립을 만들고, 이들을 하나로 엮어 긴 영화를 만듭니다. 이 과정을 **자기회귀적 연속(autoregressive continuation)**이라고 부릅니다.
하지만 이 "복사-붙여넣기" 방식에는 까다로운 문제가 있습니다. 로봇이 학습할 때는 인간이 쓴 완벽하고 깨끗한 이야기를 보여줍니다. 하지만 실제로 영화를 만들 때, 로봇은 결코 완벽할 수 없는 자신의 이전 작업물에 의존해야 합니다. 약간의 흐릿한 얼룩이 있거나, 얼굴이 약간 이상하거나, 목소리가 조금 어색할 수 있습니다. 로봇이 그 약간 결함이 있는 클립을 바탕으로 다음 장면을 만들면, 오류는 점점 더 심해집니다. 영화가 10분 정도 지나면 캐릭터들은 녹아내리는 밀랍처럼 보일 수 있고, 목소리는 웅얼거릴 수 있으며, 이야기는 엉뚱한 방향으로 흘러갈 수 있습니다. 이를 **노출 편향(exposure bias)**이라고 합니다. 로봇은 깨끗한 세상에서 학습했지만, 살아가야 하는 곳은 엉망인 세상이기 때문입니다. 과학자들은 동기화된 사운드와 함께 길고 일관되며 고품질인 영상을 생성할 수 있도록 이를 해결하려 노력해 왔지만, 지금까지의 해결책은 구멍을 고치는 대신 물을 퍼내는 방식으로 누수되는 배를 고치려 하는 것과 같았습니다.
여기, AI 비디오 생성의 스마트한 편집자 역할을 하는 새로운 접근 방식인 Vorch-Director가 등장했습니다. 이 프로젝트의 연구진은 AI 모델이 실수를 하는 방식이 무작위가 아니라는 점, 즉 모델이 어느 순간 얼마나 "노이즈(noise)"가 끼어 있거나 불확실한지에 달려 있다는 점을 깨달았습니다. 그림을 그리는 상황을 생각해 보세요. 거친 윤곽선을 그릴 때는 실수가 크고 구조적입니다(예: 머리를 너무 크게 그리는 것). 반면 세부적인 디테일을 추가할 때는 실수가 아주 작습니다(예: 삐뚤어진 눈썹). 기존 방식들은 학습 중에 AI에게 "연습용 실수"를 무작위로 던져주어 수정하도록 했지만, 어떤 종류의 실수인지에는 신경 쓰지 않았습니다. 그들은 작은 눈썹 오류를 고치기 위해 거대한 머리 크기의 교정법을 시도했을 수도 있으며, 이는 상황을 더 악화시켰습니다.
Vorch-Director는 노이즈 인식(noise-aware) 방식을 통해 판도를 바꿉니다. 이 시스템은 AI의 실수들을 모아 라이브러리를 만들되, 각 실수에 해당 실수가 발생한 특정 "노이즈 수준"을 태그로 붙입니다. AI가 새로운 장면을 생성하는 법을 배울 때, 시스템은 현재 AI가 얼마나 불확실한지를 확인합니다. 만약 AI가 "거친 스케치" 단계(높은 노이즈)에 있다면, 시스템은 큰 구조적 오류를 던져주어 이를 고치는 연습을 하게 합니다. 만약 AI가 "세밀한 디테일" 단계(낮은 노이즈)에 있다면, 아주 작고 미묘한 오류를 던져줍니다. 이를 통해 AI가 적절한 시기에 적절한 종류의 문제를 해결하는 법을 배우도록 보장합니다.
이것이 긴 이야기를 구현하기 위해, 팀은 몇 가지 영리한 기술을 도입했습니다. 그들은 매 새로운 세그먼트가 시작될 때마다 AI가 참조할 수 있는 짧고 완벽한 클립인 "클린 앵커(clean anchor)"를 만들었습니다. 이를 통해 AI는 캐릭터가 원래 누구였는지 기억하여 형태가 이상하게 변하는 것을 방지할 수 있습니다. 또한, AI에게 특수한 "이름표"(태스크 임베딩이라 불림)를 부여하여, 입력값 중 어느 부분이 지금까지의 이야기이고, 어느 부분이 참조 사진이며, 어느 부분이 새로 만들어야 할 장면인지를 정확히 알 수 있게 했습니다. 이는 카메라 각도가 바뀌거나 장소가 바뀌어도 캐릭터의 외형을 일정하게 유지하는 데 도움을 줍니다.
결과는 유망합니다. 캐릭터와 이야기의 일관성을 측정하도록 설계된 벤치마크 테스트에서, Vorch-Director는 다른 최고 모델들보다 "드리프트(drift, 변질)" 현상이 현저히 적음을 보여주었습니다. 1분 길이의 영상과 동기화된 오디오를 포함한 테스트에서, 새 모델은 얼굴을 알아볼 수 있게 유지하고 목소리를 안정적으로 유지한 반면, 다른 모델들은 캐릭터가 기괴한 덩어리로 변하거나 목소리가 알아들을 수 없게 되는 결과를 낳았습니다. 논문은 비록 시각 전용 모델의 일관성을 따라잡는 데 여전히 개선의 여지가 있다고 언급하지만, 새로운 방법은 오류의 종류를 생성 단계와 일치시킴으로써, AI가 길을 잃지 않고 훨씬 더 길고 일관되며 현실적인 이야기를 들려줄 수 있다는 것을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.