← 최신 논문
💻 computer science

Ctrl&Shift: High-Quality Geometry-Aware Object Manipulation in Visual Generation

이 논문은 명시적인 3D 모델링 없이도 배경 보존, 기하학적 일관성, 사용자 제어 가능성을 동시에 달성하는 엔드투엔드 확산 프레임워크인 'Ctrl&Shift'를 제안하여, 객체 제거와 참조 기반 인페인팅을 통합된 프로세스로 결합하고 다단계 학습 전략과 확장 가능한 데이터 파이프라인을 통해 현실 세계의 일반화 성능을 극대화합니다.

원저자: Penghui Ruan, Bojia Zi, Xianbiao Qi, Youze Huang, Rong Xiao, Pichao Wang, Jiannong Cao, Yuhui Shi

게시일 2026-02-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Penghui Ruan, Bojia Zi, Xianbiao Qi, Youze Huang, Rong Xiao, Pichao Wang, Jiannong Cao, Yuhui Shi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎬 Ctrl&Shift: 사진 속 물체를 마치 마법처럼 움직이는 새로운 기술

이 논문은 **"Ctrl&Shift"**라는 이름의 새로운 인공지능 기술을 소개합니다. 이 기술은 사진이나 영상 속에서 사물을 옮기거나 회전시킬 때, 마치 그 사물이 실제로 그 공간에 존재하는 것처럼 자연스럽고 기하학적으로 정확한 결과를 만들어냅니다.

기존의 기술들은 사물을 옮기면 그림자가 이상해지거나, 사물이 뭉개지거나, 배경이 찢어지는 문제가 있었습니다. 하지만 Ctrl&Shift 는 이런 문제들을 해결했습니다.

이 기술이 어떻게 작동하는지, 복잡한 수식 없이 일상적인 비유로 설명해 드리겠습니다.


1. 문제: "사진 속 사물을 옮기는 건 왜 이렇게 어려울까?"

기존의 AI 들은 두 가지 극단적인 성향을 가지고 있었습니다.

  • 3D 모델링을 하는 기술들: 건축가처럼 정밀하게 3D 공간을 재구성해서 사물을 옮깁니다. 정확하지만, 매번 새로운 장면을 위해 3D 모델을 처음부터 다시 만들어야 해서 시간이 너무 오래 걸리고, 실사 사진에는 잘 적용되지 않습니다.
  • 생성형 AI (확산 모델) 들: 그림을 그리는 화가처럼 상상력으로 사물을 옮깁니다. 배경은 잘 유지하지만, 사물의 모양이 왜곡되거나 "어? 이 의자가 왜 이렇게 찌그러졌지?" 하는 기괴한 결과가 나오기 쉽습니다.

Ctrl&Shift는 이 두 가지의 장점을 합쳐 **"3D 모델링 없이도 3D 같은 정밀함"**을 구현했습니다.


2. 해결책: "두 단계로 나누어 생각하기"

이 기술은 사물을 옮기는 작업을 두 가지 간단한 단계로 쪼개서 처리합니다. 마치 요리사가 복잡한 요리를 ① 재료 다듬기② 요리하기로 나누는 것과 같습니다.

1 단계: "사물을 지우기" (Object Removal)

먼저, 옮기고 싶은 사물이 있던 자리에서 그 사물을 완벽하게 지워버립니다. 이때 AI 는 "사물이 없었던 원래 배경"을 상상해서 채웁니다.

  • 비유: 사진 속의 커피잔을 지우면, 그 자리에 커피잔이 없던 깔끔한 테이블이 나타납니다.

2 단계: "새로운 위치에 그림자까지 맞춰서 붙이기" (Reference-guided Inpainting)

지워진 자리에, 새로운 카메라 각도에서 본 사물을 가져와서 붙입니다. 이때 중요한 점은 카메라의 위치와 각도를 정확히 통제한다는 것입니다.

  • 비유: 커피잔을 테이블의 다른 곳으로 옮기되, "내가 왼쪽에서 봤을 때 커피잔이 어떻게 보일지"를 계산해서 그림자와 빛을 완벽하게 조정해 붙입니다.

이 두 단계를 하나의 AI 가 한 번에 학습하도록 설계했기 때문에, 결과물이 매우 자연스럽습니다.


3. 핵심 기술: "비밀 지도"와 "훈련 방법"

🗺️ 비밀 지도: "상대적 카메라 포즈"

이 기술은 사물 자체의 3D 모델을 만들지 않습니다. 대신, "원래 위치"와 "옮길 위치" 사이의 차이를 수학적으로 표현한 **8 가지 숫자의 비밀 지도 (Relative Pose Descriptor)**를 사용합니다.

  • 비유: "의자를 30 도 왼쪽으로 돌리고, 2 미터 뒤로 옮기세요"라고 지시하는 것이 아니라, "의자가 원래 있던 자리에서 얼마나 움직였는지"에 대한 상대적인 차이만 알려줍니다. 이렇게 하면 어떤 사물이든 쉽게 적용할 수 있습니다.

🏋️‍♂️ 훈련 방법: "세 가지 역할극"

AI 를 가르칠 때, 한 번에 모든 것을 가르치지 않고 세 가지 역할을 나누어 훈련시켰습니다.

  1. 배우 1 (사물 제거): 사물을 지우고 배경만 채우는 연습.
  2. 배우 2 (사물 붙이기): 배경은 그대로 두고 사물만 새로운 각도로 붙이는 연습.
  3. 배우 3 (완전 조작): 위 두 가지를 합쳐서 사물을 옮기는 최종 연습.

이렇게 역할을 분리해서 훈련시켰기 때문에, AI 는 "배경", "사물", "카메라 각도"를 서로 헷갈리지 않고 정확하게 다룰 수 있게 되었습니다.


4. 데이터 공장: "가상 현실에서 실사까지"

이 AI 를 가르치기 위해 200 만 장이 넘는 데이터를 만들었습니다.

  • 가상 데이터 (Stage 1): 3D 모델로 만든 가상의 사물들을 무작위로 움직이며 "기하학적인 원리"를 먼저 배웁니다. (마치 비행 시뮬레이터에서 기본기를 다지는 것)
  • 실사 데이터 (Stage 2): 실제 사진과 영상을 가져와서, 3D 기술을 이용해 사물을 잘라내고 다시 붙이는 과정을 통해 "실제 사진 같은 질감"을 배웁니다. (마치 시뮬레이터가 끝난 후 실제 비행기를 타는 것)

5. 결론: 왜 이것이 중요한가요?

Ctrl&Shift 는 영화 제작, 증강현실 (AR), 광고 분야에서 혁신을 일으킬 수 있습니다.

  • 영화: 배우가 연기하는 도중 소품을 옮기고 싶다면, 3D 모델링 없이도 AI 가 자연스럽게 편집해줍니다.
  • 일상: 여행 사진에서 친구가 가려진 부분을 지우거나, 소파를 방 구석으로 옮기는 것처럼 사진을 편집할 때 그림자나 빛이 어색하지 않게 만들어줍니다.

한 줄 요약:

"Ctrl&Shift 는 3D 모델링이라는 무거운 장비를 들지 않고도, 사진 속 사물을 마치 마법처럼 자연스럽고 정확하게 움직여주는 새로운 AI 기술입니다."

이 기술은 이제까지 불가능했던 **"정밀한 기하학적 제어"**와 **"실제 사진 같은 자연스러움"**을 동시에 잡은 첫 번째 사례라고 할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →