← 최신 논문
💻 computer science

Vorch-Omni: Multi-Task Orchestration of Sight and Sound

Vorch-Omni는 유연한 토큰 수준 조건화와 이중 시각적 경로를 활용하는 단일 플로우 매칭 디퓨전 트랜스포머를 통해, 태스크별 아키텍처 변경 없이 10가지 이상의 다양한 오디오-비주얼 생성, 편집 및 확장 작업을 원활하게 조율하는 통합적이고 확장 가능한 멀티태스크 프레임워크입니다.

원저자: Vorch Team, Xiaoyu Chen, Yang Ding, Cong Han, Menglin Han, Yuxin Hong, Jiebo Hou, Zequn Jie, Xiang Li, Jing Liu, Qi Liu, Yulei Lu, Siyuan Luo, Lin Ma, Xin Ma, Yinlong Qian, Peng Shi, Fang Wan, Siqi Wa
게시일 2026-08-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Vorch Team, Xiaoyu Chen, Yang Ding, Cong Han, Menglin Han, Yuxin Hong, Jiebo Hou, Zequn Jie, Xiang Li, Jing Liu, Qi Liu, Yulei Lu, Siyuan Luo, Lin Ma, Xin Ma, Yinlong Qian, Peng Shi, Fang Wan, Siqi Wang, Yaohui Wang, Yaole Wang, Yidi Wu, Siqian Yang, Mingyu Yin, Haoran Yu, Gang Yue, Lisai Zhang, Yuting Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 마스터 영화감독이 되는 법을 가르치려 한다고 상상해 보세요. 과거에는 매번 작업마다 서로 다른 로봇을 고용해야 했습니다. 단어로부터 그림을 그리는 법만 아는 로봇 하나, 비디오 클립을 더 길게 만드는 법만 아는 또 다른 로봇 하나, 캐릭터의 얼굴을 바꿀 수 있는 세 번째 로봇, 그리고 효과음을 넣을 수 있는 네 번째 로봇이 필요했죠. 이것은 마치 모든 도구가 각각 별개의 무거운 기계여서, 하나하나 따로 들고 다니며 전원을 연결해야 하는 공구함과 같습니다. 이것이 오늘날의 '생성형 AI'가 처한 세상입니다. 생성형 AI란 컴퓨터가 단순히 기존의 것을 복사하는 대신 이미지, 비디오, 소리를 새롭게 만들어내는 법을 배우는 분야를 말합니다.

과학자들이 직면해 온 큰 과제는 이 서로 다른 '로봇'들이 서로 대화를 잘 나누지 못한다는 점이었습니다. 만약 배경이 변하는 동안 캐릭터가 노래를 부르는 영상을 원한다면, 보통 세 가지 서로 다른 모델의 결과물을 하나로 이어 붙여야 하는데, 이 과정에서 종종 글리치(오류)가 발생하거나 타이밍이 어긋나거나, 보이는 것과 들리는 것이 서로 맞지 않는 이상한 현상이 발생하곤 합니다. 모두의 머릿속에 떠오르는 질문은 이것입니다. "우리가 이 모든 서로 다른 작업들을 한 번에 이해할 수 있는 하나의 거대하고 똑똑한 '지휘자'를 만들 수 있을까? 그 지휘자는 언제 새로운 것을 만들고, 언제 무언가를 똑같이 복사하며, 언제 아주 작은 디테일만 수정해야 할지를 결정하면서도, 어떻게 시각과 청각을 완벽하게 동기화할 수 있을까?"

여기, 그 답이 "예"일 수도 있음을 시사하는 새로운 프로젝트, Vorch-Omni가 등장했습니다. Vorch-Omni를 개별적인 로봇들의 집합이 아니라, 매우 다재다능한 하나의 오케스트라 지휘자로 생각해보세요. 음악을 위한 바이올리니스트와 리듬을 위한 드러머를 따로 고용하는 대신, 이 한 명의 지휘자는 전체 교향곡을 직접 지휘할 수 있습니다. 연구진은 비디오와 오디오를 하나의 통합된 언어로 취급하는 시스템을 구축했습니다. 텍스트 설명을 통해 완전히 새로운 장면을 생성하든, 방금 끝난 비디오를 연장하든, 혹은 춤 동작은 그대로 유지한 채 캐릭터의 얼굴만 바꾸든, Vorch-Omni는 이 모든 일을 수행하기 위해 동일한 핵심 두뇌를 사용합니다.

이 시스템의 비결은 입력값을 '생각'하는 방식에 있습니다. 요리사에게 지시를 내린다고 상상해 보세요. 때때로 당신은 "처음부터 버거를 만들어 주세요"(이것은 새로운 것을 생성하는 것)라고 말합니다. 때로는 "여기 버거가 있으니, 치즈만 추가해 주세요"(이것은 편집하는 것)라고 말합니다. 또한 때로는 "여기 버거 사진이 있으니, 이것을 유화처럼 그려 주세요"(이것은 참조하는 것)라고 말하기도 합니다. 과거에는 컴퓨터들이 이러한 서로 다른 요청들 때문에 혼란을 겪었습니다. Vorch-Omni는 모든 정보에 특정 '이름표'와 '좌석 번호'를 부여함으로써 이 문제를 해결합니다. 모델은 어떤 부분이 '대상'(만들어야 할 것)이고, 어떤 부분이 '소스'(유지해야 할 것)이며, 어떤 부분이 단순한 '참조'(스타일 가이드)인지를 정확히 파악합니다. 이를 통해 모델은 내부 회로를 변경하지 않고도 텍스트-비디오 생성, 목소리 복제, 영화의 특정 부분 편집 등 10가지 이상의 다양한 유형의 작업을 처리할 수 있습니다.

논문은 이 접근 방식이 특히 소리와 영상의 동기화를 유지하는 데 있어 놀라울 정도로 잘 작동한다고 제안합니다. 연구진이 이 모델을 다른 최고 수준의 시스템들과 비교 테스트했을 때, 전반적인 품질은 비슷할지라도 Vorch-Omnio가 영상과 오디오의 일치성(예: 말소리에 맞춰 입 모양이 움직이는 것)과 참조 이미지 또는 사운드 클립의 구체적인 디테일을 고수하는 능력 면에서 훨씬 뛰어났음을 발견했습니다. 모델은 단순히 연결 고리를 '추측'한 것이 아니라, 시각과 청각 사이의 관계를 이해한 것입니다.

하지만 저자들은 이것이 아직 모든 영화 제작 문제를 해결해 줄 마법의 지팡이는 아니라는 점을 주의 깊게 언급했습니다. 이 모델은 짧은 클립이나 특정 편집에는 뛰어나지만, 몇 시간 동안 일관성을 유지해야 하는 매우 길고 복잡한 이야기를 만드는 데는 여전히 어려움을 겪습니다. 또한 모든 언어의 음성을 생성하거나 극도로 미세한 편집을 처리하는 데 있어서도 완벽하지 않습니다. 그럼에도 불구하고, 논문은 이 '통합된 지휘자' 방식이 중요한 진전임을 시사합니다. 하나의 모델이 혼란 없이 얼마나 많은 역할을 수행할 수 있는지 증명함으로써, Vorch-Omni는 고품질의 동기화된 시청각 콘텐츠를 만드는 것이 단 하나의 명확한 지시를 내리는 것만큼 간단해지는 미래를 향한 문을 열어주고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →