← 최신 논문
💻 computer science

ONE-SHOT: Compositional Human-Environment Video Synthesis via Spatial-Decoupled Motion Injection and Hybrid Context Integration

이 논문은 3D 전처리 없이 인간과 환경을 분리된 신호로 주입하고 하이브리드 컨텍스트 통합을 통해 장시간 일관성 있는 합성 비디오 생성을 가능하게 하는 파라미터 효율적인 프레임워크 'ONE-SHOT'을 제안합니다.

원저자: Fengyuan Yang, Luying Huang, Jiazhi Guan, Quanwei Yang, Dongwei Pan, Jianglin Fu, Haocheng Feng, Wei He, Kaisiyuan Wang, Hang Zhou, Angela Yao

게시일 2026-04-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Fengyuan Yang, Luying Huang, Jiazhi Guan, Quanwei Yang, Dongwei Pan, Jianglin Fu, Haocheng Feng, Wei He, Kaisiyuan Wang, Hang Zhou, Angela Yao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

ONE-SHOT: 영화 같은 영상을 한 번에 만들어내는 마법 같은 도구

이 논문은 **"ONE-SHOT"**이라는 새로운 인공지능 기술을 소개합니다. 이 기술은 사람이 특정 장소에서 움직이는 영상을, 텍스트 명령과 간단한 입력만으로 마치 실제 촬영한 것처럼 자연스럽게 만들어냅니다.

기존의 기술들이 가진 문제점과 ONE-SHOT 이 어떻게 그 문제를 해결했는지, 쉬운 비유로 설명해 드릴게요.


1. 왜 이 기술이 필요한가요? (기존 기술의 문제점)

지금까지 사람이 배경 속에서 춤을 추거나 무기를 들고 움직이는 영상을 만들려면, 두 가지 큰 장벽이 있었습니다.

  • 장벽 1: 너무 복잡한 3D 작업 (무거운 배낭)
    • 기존 기술들은 사람과 배경을 완벽하게 맞추기 위해 복잡한 3D 스캔 데이터나 정교한 좌표 계산이 필요했습니다. 마치 정교한 퍼즐을 맞추기 위해 먼저 거대한 3D 조립 키트를 다 사야 하는 것처럼 번거로웠습니다.
  • 장벽 2: 자유도 vs 정밀함의 딜레마 (양날의 검)
    • 배경을 너무 정확하게 통제하려니 AI 가 창의력을 잃고 뻣뻣해졌습니다. 반대로 자유롭게 만들면 사람이 배경과 어긋나거나 (예: 바닥에 발이 빠지는 등) 영상이 일그러지는 문제가 생겼습니다.
  • 장벽 3: 긴 영상은 불가능 (기억력 부족)
    • 기존 AI 는 10 초짜리 짧은 영상은 잘 만들지만, 몇 분 동안 이어지는 긴 영상에서는 사람의 얼굴이 변하거나 배경이 뭉개지는 등 기억력을 잃어버리는 문제가 있었습니다.

2. ONE-SHOT 의 핵심 아이디어: "분리된 조립"

ONE-SHOT 은 이 모든 문제를 해결하기 위해 **"분리된 신호 (Decoupled Signals)"**라는 개념을 도입했습니다.

🎭 비유: 무대 위의 배우와 세트장

ONE-SHOT 은 영상을 만들 때 **배우 (사람)**와 **세트장 (배경)**을 완전히 분리해서 생각한 뒤, 마지막에 자연스럽게 합칩니다.

  1. 배우만 따로 연습시키기 (Canonical-Space Motion Injection)

    • AI 는 배우가 "검을 들고 태극권을 치는 동작"을 **중립적인 공간 (캔버스)**에서 먼저 익히게 합니다. 이때 배경은 신경 쓰지 않습니다.
    • 핵심: 배우의 동작을 배경과 섞지 않고 따로 주입 (Injection) 하기 때문에, 배우가 어떤 배경에 들어가도 자연스럽게 움직일 수 있습니다.
  2. 배경과 배우를 연결하는 마법의 접착제 (Dynamic-Grounded-RoPE)

    • 여기서 가장 중요한 기술이 나옵니다. 배우가 중립 공간에서 연습한 동작을, 실제 세트장 (배경) 의 특정 위치 (예: 무대 중앙) 에 정확히 붙여야 합니다.
    • 비유: 마치 스케일 조절이 가능한 투명 테이프를 붙이는 것과 같습니다. 배우의 크기와 배경의 크기가 달라도, 이 기술이 "여기에 맞춰서 크기를 조절하고 위치를 잡아라"라고 자동으로 조정해 줍니다. 덕분에 복잡한 3D 정렬 작업 없이도 사람과 배경이 완벽하게 어우러집니다.
  3. 긴 영상도 잊지 않는 기억력 (Hybrid Context Integration)

    • 영상이 몇 분 동안 이어져도 주인공의 얼굴이 변하지 않고, 카메라가 돌아와도 배경이 일관되게 유지되게 합니다.
    • 비유: AI 가 두 가지 메모장을 들고 다닙니다.
      • 고정 메모장: 주인공의 얼굴과 옷차림 (정체성) 을 기억합니다.
      • 동적 메모장: 카메라가 움직이며 보는 전체적인 분위기를 기억합니다.
    • 이 두 메모장을 계속 업데이트하며 영상을 만들기에, 1 분, 5 분, 10 분이 지나도 주인공은 똑같은 사람이고 배경은 일관됩니다.

3. 이 기술로 무엇을 할 수 있나요?

ONE-SHOT 은 다음과 같은 놀라운 일들을 가능하게 합니다.

  • 원하는 대로 조합하기: "이 배우를 이 배경에 넣고, 저 무기를 들고 춤추게 해줘"라고 하면, 배우, 배경, 동작을 각각 따로 바꿔서 조합할 수 있습니다.
  • 텍스트로 지시하기: "검을 들고 태극권을 치는 모습"이라고 텍스트로만 입력해도, AI 가 그 의미를 이해하고 정확한 동작을 구현합니다.
  • 긴 영상 제작: 몇 분 동안 이어지는 영상에서도 배경이 흔들리지 않고, 주인공의 모습이 일관되게 유지됩니다.

4. 결론: 왜 이것이 중요한가요?

ONE-SHOT 은 복잡한 3D 작업 없이도 영화 제작자나 일반인도 쉽게 고품질의 영상을 만들 수 있게 해줍니다.

  • 간단한 작업: 무거운 3D 데이터 준비가 필요 없습니다.
  • 창의성 보존: AI 의 창의적인 능력을 죽이지 않으면서도 정확한 제어가 가능합니다.
  • 실용성: 짧은 클립뿐만 아니라 긴 영상까지 자연스럽게 만들어냅니다.

요약하자면, ONE-SHOT 은 **배우와 배경을 따로따로 준비했다가, 마법 같은 기술로 완벽하게 합쳐주는 '디지털 영화 제작 도구'**라고 할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →