← 최신 논문
💻 computer science

MoZoo:Unleashing Video Diffusion power in animal fur and muscle simulation

MoZoo는 Role-Aware RoPE 및 비대칭 분해 어텐션과 같은 새로운 아키텍처 혁신과 합성-실제 데이터 파이프라인 및 새로운 벤치마크를 활용하여 거친 메시에서 사실적인 털과 근육 역학을 갖춘 고품질 동물 영상을 효율적으로 생성하는 생성형 역학 솔버입니다.

원저자: Dongxia Liu, Jie Ma, Xiaochen Yang, Jiancheng Zhang, Bin Xia, Zhehan Kan, Nisha Huang, Jun Liang, Wenming Yang, Jin Li

게시일 2026-05-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Dongxia Liu, Jie Ma, Xiaochen Yang, Jiancheng Zhang, Bin Xia, Zhehan Kan, Nisha Huang, Jun Liang, Wenming Yang, Jin Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

어떤 영화 제작을 위해 거칠고 회색 점토로 만든 판다 조각상을 사실적이고 폭신하며 살아있는 동물로 바꾸려 한다고 상상해 보세요.

기존 방식 (전통적 CGI):
과거에는 이를 마치 벽돌 하나하나를 쌓아 집을 짓는 것과 같았습니다. 아티스트들은 모든 근육을 수동으로 조각하고, 뼈대를 움직이도록 설정한 뒤, 털을 시뮬레이션하기 위해 수백만 개의 작은 털을 하나하나 배치해야 했습니다. 이 과정은 느리고 비용이 많이 들었으며, 모든 털의 물리 법칙을 조정하기 위해 전문가 팀이 필요했습니다.

새로운 방식 (MoZoo):
이 논문은 3D 동물용 '마법 붓'처럼 작동하는 새로운 AI 도구인 MoZoo를 소개합니다. MoZoo는 털과 근육을 처음부터 구축하는 대신, 거칠고 텍스처가 없는 3D 모델 (점토) 과 참고 자료 (실제 동물의 사진, 텍스트 설명 또는 비디오) 를 입력받아 사실적인 털과 근육 움직임을 즉시 그려냅니다.

다음은 이를 간단한 개념으로 분해한 작동 원리입니다:

1. '레시피' 문제: MoZoo-Data

AI 에게 털을 그리는 법을 가르치기 위해서는 '거친 점토'와 '실제 동물'이 짝을 이룬 수천 개의 예시가 필요합니다. 하지만 실제 영화에는 '점토' 버전이 포함되지 않으며, 최종 영화만 존재합니다.

  • 해결책: 팀은 MoZoo-Data라는 특수 파이프라인을 구축했습니다. 그들은 비디오 게임 엔진 (Unreal Engine 5) 을 이용해 수천 개의 가짜 동물 영상을 제작한 뒤, 교묘한 '역방향 트릭 (역모델)'을 활용하여 실제 야생동물 다큐멘터리를 분석하고 털과 피부를 수학적으로 '벗겨내어' 그 아래에 있는 거친 점토 뼈대가 어떻게 보일지 추론했습니다.
  • 결과: 그들은 AI 를 훈련시키기 위해 '거친 점토'와 '실제 동물' 영상으로 이루어진 62,000 개의 쌍으로 구성된 방대한 라이브러리를 만들었습니다.

2. '지휘자' 문제: Role-Aware RoPE

AI 에게 점토 판다를 실제 판다로 바꾸라고 요청하면, AI 는 '언제' 일이 발생하는지 혼란을 겪습니다.

  • 혼란: AI 에게 실제 판다가 달리는 영상과 점토 판다가 달리는 영상을 보여준다면, AI 는 실제 판다의 털이 점토 판다의 몸체와 다른 시간에 움직여야 한다고 생각할 수 있습니다. 이는 드럼과 바이올린이 서로 다른 곡을 연주하는 오케스트라를 지휘하려는 지휘자와 같습니다.
  • 해결책: 그들은 Role-Aware RoPE라는 시스템을 개발했습니다. 이는 서로 다른 입력에 특정 '시간 슬롯'을 할당하는 엄격한 지휘자라고 생각하세요.
    • **점토 영상 (몸체)**과 **목표 영상 (만들려는 것)**은 정확히 같은 시간 슬롯을 할당받아 완벽하게 함께 움직입니다.
    • **참고 영상 (털 질감)**은 '지연된' 시간 슬롯을 할당받습니다. 이는 AI 에게 다음과 같이 알려줍니다. "이 참고 자료의 털을 사용하되, 참고 자료의 움직임이 아닌 몸체의 현재 움직임에 적용하라." 이를 통해 털이 미끄러지거나 싱크가 맞지 않는 것을 방지합니다.

3. '노이즈' 문제: Asymmetric Decoupled Attention

AI 가 학습할 때, 점토 몸체의 크고 뚜렷한 세부 사항 (큰 근육과 뼈) 은 털의 작고 조용한 세부 사항을 압도하는 경향이 있습니다.

  • 혼란: 누군가가 큰 소리를 지르는 (점토 몸체 구조) 동안 속삭임 (털 세부 사항) 을 듣으려 하는 것과 같습니다. AI 는 종종 속삭임을 무시하고 큰 소리만 복사하여 매끄럽고 털이 없는 듯한 동물을 만들어냅니다.
  • 해결책: 그들은 Asymmetric Decoupled Attention이라는 필터를 구축했습니다. 한 방향으로만 보이는 유리창을 상상해 보세요.
    • AI 는 털을 어디에 둘지 알기 위해 점토 몸체를 볼 수 있습니다.
    • AI 는 털이 어떻게 생겼는지 알기 위해 참고 영상을 볼 수 있습니다.
    • 중요하게도, 점토 몸체는 털 세부 사항에 '소리칠' 수 없고, 털 세부 사항도 몸체 구조에 '소리칠' 수 없습니다. 그들은 각자의 차선에 머뭅니다. 이를 통해 AI 는 몸체의 형태를 단단하게 유지하면서도 흐릿해지지 않고 섬세하고 고품질의 털 질감을 추가할 수 있습니다.

4. 결과

팀은 MoZooBench라는 새로운 벤치마크에서 MoZoo 를 테스트했습니다.

  • 기능: 사자의 거친 3D 모델을 실제 호랑이로, 점토 곰을 실제 판다로 바꾸는 것이 가능하며, 단지 목표 동물의 사진이나 비디오를 보여주기만 하면 됩니다.
  • 더 나은 이유: 다른 AI 도구들과 비교할 때, MoZoo 는 동물의 몸체가 올바르게 움직이도록 유지합니다 (떨리는 털 없음). 또한 다른 도구들이 일반적으로 매끄럽게 만드는 개별 털과 근육의 굽힘과 같은 미세한 세부 사항을 보존합니다.

요약하자면:
MoZoo 는 털과 근육을 애니메이션화하는 어렵고 수동적인 작업을 건너뛰는 생성형 AI 입니다. 이는 거대한 자체 제작 데이터셋과 지능적인 '교통 통제' 시스템을 활용하여 거친 3D 모델을 완벽한 움직임과 섬세한 털을 가진 고화질 사실적인 동물 영상으로 즉시 변환합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →