Archon: A Unified Multimodal Model for Holistic Digital Human Generation
본 논문은 다양한 작업에 걸쳐 고충실도, 제어 가능성, 그리고 전체적인 디지털 인간 생성을 달성하기 위해 일곱 가지 모달리티를 통합하고 메모리 효율적인 비디오 재파라미터화 및"모달리티로 사고하기"와 같은 새로운 기법을 활용하는 완전히 사전 훈련된 통합 멀티모달 모델인 Archon 을 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
디지털 인간, 즉 원하는 대로 말하고 움직이고 외모를 갖출 수 있는 가상 배우를 만들고 싶다고 상상해 보세요. 보통 이를 구축하는 것은 각 부품마다 별도의 전문가를 고용해 복잡한 로봇을 조립하려는 시도와 같습니다. 목소리는 한 명, 얼굴은 또 다른 사람, 신체 움직임은 세 번째 사람, 배경은 네 번째 사람이 담당합니다. 이러한 전문가들은 종종 서로 다른 언어를 사용하기 때문에 최종 로봇은 경직되거나 오작동이 발생하거나 제어하기 어렵습니다.
이 논문은 이러한 문제를 해결하기 위해 설계된 새로운 '올인원' 디지털 두뇌인 **아르콘(Archon)**을 소개합니다. 아르콘은 전문가 팀이 아니라 인간 공연의 모든 측면을 동시에 이해하는 보편적 통역사이자 지휘자로 생각하세요.
아르콘이 작동하는 방식을 간단한 개념으로 나누어 설명하면 다음과 같습니다:
1. "보편적 통역사"(통합 멀티모달 모델)
대부분의 AI 모델은 한 가지 언어만 구사하는 전문가와 같습니다. 텍스트를 비디오로 변환하려면 하나의 모델이 필요하고, 오디오를 얼굴로 변환하려면 또 다른 모델이 필요합니다. 아르콘은 다릅니다. 아르콘은 **7 가지 다른 "언어"(모달리티)**를 동시에 학습합니다:
- 텍스트(설명과 대본)
- 오디오(음성)
- 애니메이션(3D 얼굴 움직임)
- 이미지 및 비디오
- 시맨틱 맵(눈, 코, 입의 위치를 보여주는 비디오의 단순화된 "스켈레톤")
이 모든 언어를 함께 학습하기 때문에 아르콘은 **모든 것에서 모든 것으로 생성(Any-to-Any Generation)**이 가능합니다. 대본을 입력하면 음성을 작성하고 얼굴을 애니메이션화하며 비디오를 생성합니다. 또는 비디오를 입력하면 그 사람이 어떻게 생겼는지 그리고 무엇을 말하고 있는지 설명하는 텍스트를 작성할 수도 있습니다. 마치 한 명의 예술가가 도구를 바꾸지 않고도 즉시 그림을 그리거나 노래하거나 연기하는 것과 같습니다.
2. "스마트 스케치"(시맨틱 비디오)
고품질 비디오 AI 제작의 가장 큰 문제 중 하나는 비디오 파일이 매우 크다는 점입니다. 5 초짜리 비디오를 친구에게 설명할 때 각 픽셀의 색상을 나열한다고 상상해 보세요. 시간이 무한히 걸리고 뇌가 압도될 것입니다.
아르콘은 시맨틱 비디오라는 교묘한 트릭을 사용합니다. 비디오의 모든 픽셀을 처리하려는 대신, 먼저 비디오를 **"스마트 스케치"**로 변환합니다.
- 이 스케치는 눈이 파란 점, 입이 빨간 모양, 머리카락이 갈색 덩어리로 표시된 단순화된 지도라고 생각하세요.
- 이 "스케치"는 깜빡임, 말하기, 미소 짓기 등 모든 중요한 움직임을 포착하지만 피부의 정확한 질감 같은 불필요한 세부 사항은 제거합니다.
- 이로 인해 AI 가 처리해야 하는 데이터 양이 4 배 감소하여 실행 속도가 훨씬 빨라지고 비용이 절감됩니다.
- AI 가 이 "스케치"를 생성하면 별도의 고품질 "화가"(비디오 확산 모델) 가 사실적인 세부 사항을 채워 최종적인 사진 같은 비디오를 완성합니다.
3. "단계별 사고자"(모달리티로 사고하기)
때로는 AI 에게 "오디오"에서 바로 "비디오"로 건너뛰도록 요구하는 것은 너무 어렵습니다. 마치 문법 지식이 없는 상태에서 중국어 시를 프랑스어로 번역하라고 요구하는 것과 같습니다. 그 결과는 종종 흐릿하거나 기이합니다.
아르콘은 **"모달리티로 사고하기(Thinking in Modality)"**라는 전략을 사용합니다. 바로 답을 도출하는 대신 작업을 더 작고 논리적인 단계로 나눕니다.
- 예시: 음성 녹음 파일을 주고 비디오를 요청하면 아르콘은 단순히 비디오를 추측하지 않습니다. 먼저 음성 Based 로 사람의 모양과 표정에 대해 "생각"한 후, 사람에 대한 설명을 작성하고 그 다음 비디오를 생성합니다.
- 이 단계별 접근 방식은 다리와 같은 역할을 하여 최종 비디오가 자연스럽고 음성과 완벽하게 일치하며 혼란스러운 엉망이 되지 않도록 보장합니다.
4. "마법 편집기"(모든 모달리티 편집)
아르콘은 매우 유연합니다. 대화하는 디지털 인간의 비디오가 있다고 가정해 보세요. 아르콘을 사용하면 나머지 부분을 손상시키지 않고 해당 비디오의 어떤 부분이라도 편집할 수 있습니다:
- 대본 변경: 새로운 문장을 입력하면 AI 는 사람의 얼굴과 스타일을 정확히 유지하면서 음성과 입술 움직임을 재합성하여 대본에 맞춥니다.
- 외모 변경: AI 에게 "이 사람을 더 늙어 보이게 해줘" 또는 "성별을 바꿔줘"라고 지시하면 원래 음성과 대본은 그대로 유지하면서 비디오를 업데이트하여 이를 반영합니다.
- 동작 변경: 다른 비디오를 참조하여 디지털 인간의 머리나 몸을 새로운 방식으로 움직이게 할 수 있습니다.
요약
간단히 말해, 아르콘은 디지털 인간 제작을 통합하는 단일하고 강력한 AI 시스템입니다. 이는 텍스트, 소리, 비디오를 한 번에 이해할 수 있는 하나의 통합된 두뇌로 텍스트, 소리, 비디오를 한 번에 이해할 수 있는 하나의 통합된 두뇌로 분리된 도구들의 엉망진창인 집합을 대체합니다. "스마트 스케치"를 사용하여 메모리를 절약하고 "단계별 사고"를 통해 품질을 보장함으로써 아르콘은 문장, 음성 녹음, 비디오 클립 등 거의 모든 시작점에서 사실적인 디지털 사람을 생성하고 편집할 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.