← 최신 논문
🤖 AI

CRePE: Curved Ray Expectation Positional Encoding for Unified-Camera-Controlled Video Generation

본 논문은 와이드앵글 및 어안 렌즈에 대한 기존 핀홀 기반 인코딩의 한계를 효과적으로 해결하여 비디오 생성에서 통합적이고 안정적인 카메라 제어와 외부 기하학적 조건 부여를 가능하게 하는 곡선 광선 기대값과 기하학적 어텐션 어댑터를 활용하는 새로운 위치 인코딩 방법인 CRePE를 제안합니다.

원저자: Seonghyun Jin, Youngmin Kim, Sunwoo Park, Jong Chul Ye

게시일 2026-05-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Seonghyun Jin, Youngmin Kim, Sunwoo Park, Jong Chul Ye

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇 예술가에게 움직이는 영상 장면을 그리도록 가르친다고 상상해 보세요. 카메라가 어떻게 움직여야 하는지(왼쪽으로 팬, 줌인, 회전 등) 그리고 어떤 "렌즈"를 사용해야 하는지(일반 카메라, 가장자리가 늘어나는 광각 렌즈, 모든 것을 거품처럼 보이게 하는 어안 렌즈 등) 로봇에게 정확히 알려주고 싶을 것입니다.

이전 로봇 예술가들의 문제는 카메라가 바라보는 방향은 이해했지만, 그 방향에서 사물이 얼마나 멀리 떨어져 있는지는 이해하지 못했다는 점입니다. 이는 "북쪽"을 알려주는 나침반은 주지만, 산이 1 마일 떨어져 있는지 100 마일 떨어져 있는지는 알려주지 않는 것과 같습니다. 카메라가 움직일 때, 로봇은 특히 세상을 구부리는 어안 렌즈와 같은 기이한 렌즈를 사용할 때 사물이 어디에 있어야 하는지 혼란을 겪습니다.

이 논문은 이를 해결하기 위해 CRePE(Curved Ray Expectation Positional Encoding, 곡선 광선 기대 위치 인코딩)라는 새로운 도구를 소개합니다. 간단한 비유를 들어 작동 원리를 설명해 보겠습니다:

1. "흐린 손전등" 대 "레이저 포인터"

기존 방법들은 레이저 포인터처럼 작동했습니다. 카메라에서 이미지의 특정 지점으로 직선을 그어 "이 픽셀은 정확히 여기에 있다"고 말했죠. 이는 일반 카메라에서는 괜찮게 작동하지만, 광각이나 어안 렌즈에서는 실패합니다. 이러한 렌즈들은 유희관 거울처럼 빛을 휘게 만들기 때문입니다. 직선은 휘어진 현실과 맞지 않습니다.

CRePE흐린 손전등처럼 작동합니다. "이 픽셀은 정확히 X 지점에 있다"고 말하는 대신, "이 픽셀은 이 곡선 경로를 따라 어딘가에 있을 것이며, 아마도 이 거리 범위 내에 있을 것이다"라고 말합니다. 이는 시선 방향을 따라 사물이 있을 수 있는 확률 구름을 생성합니다. 이를 통해 로봇은 어안 렌즈를 사용할 때 사물까지의 경로가 직선이 아니라 곡선임을 이해할 수 있게 됩니다.

2. 비디오 토큰을 위한 "스마트 GPS"

AI 영상 생성에서 이미지는 "토큰"이라는 작은 퍼즐 조각들로 나뉩니다.

  • 기존 방식: 로봇은 각 퍼즐 조각이 향하는 방향은 알았지만, 장면 내에서 얼마나 깊숙이 있는지 알지 못했습니다.
  • CRePE 방식: CRePE는 모든 퍼즐 조각에 "스마트 GPS" 태그를 부여합니다. 해당 조각에 대한 거리불확실성 범위를 예측합니다. 로봇에게 "이 거리 조각은 대략 5 미터 거리에 있을 것이며, 오차 범위는 1 미터 정도일 것이다"라고 알려주는 것입니다.

3. "중간 관리자" 전략

이 논문은 이 새로운 "스마트 GPS"를 로봇의 뇌 (거대한 신경망) 의 어디에 배치할지 테스트했습니다.

  • 그들은 프로세스의 시작 부분이나 끝 부분에 배치하는 것은 잘 작동하지 않는다는 것을 발견했습니다.
  • 적절한 위치: 그들은 뇌의 중간 층이 이 정보를 배치하기에 가장 좋은 곳임을 발견했습니다. 이는 프로젝트의 세부 사항 (기하학) 을 알고 있으며, 최종 제품이 완성되기 전에 작업자들 (토큰) 을 완벽하게 조직할 수 있는 중간 관리자가 있는 것과 같습니다.

4. "훈련용 보조바퀴"(가짜 감독 학습)

로봇에게 이 새로운 기술을 가르치기 위해 연구자들은 "훈련용 보조바퀴" 시스템을 사용했습니다. 그들은 별도의 기존 AI(기하학 기반 모델) 를 사용하여 훈련 비디오의 거리를 추정했습니다.

  • 그들은 로봇이 이러한 추정을 완벽하게 복사하도록 강요하지 않았습니다.
  • 대신, 그들은 추정을 안전망으로 사용했습니다. 로봇의 추정이 터무니없이 잘못되었을 때, 안전망이 현실로 다시 밀어붙였습니다. 만약 안전망의 추정이 나빴다면 (예: 흐린 하늘을 볼 때), 로봇은 자신의 판단을 신뢰하도록 허용되었습니다.

5. 결과: 휘어진 렌즈로 더 나은 영화 만들기

CRePE 를 테스트했을 때:

  • 더 나은 카메라 제어: 특히 광각과 어안 렌즈를 사용할 때, 비디오가 요청된 카메라 움직임을 훨씬 더 정확하게 따랐습니다.
  • 더 나은 기하학: 카메라가 움직일 때 비디오 속 사물들이 왜곡되거나 이상하게 떠다니지 않고 제자리에 머물렀습니다.
  • 보너스 기능: 로봇이 이제 "거리"를 매우 잘 이해하기 때문에, 실제로는 다른 비디오에서 거리 지도를 교체할 수 있습니다. 이를 통해 한 비디오의 움직임과 다른 비디오의 세계 모양을 결합하여 이전에 존재하지 않았던 새로운 장면을 만들 수 있습니다.

요약하자면:
CRePE 는 AI 영상 생성기가 깊이곡선 렌즈를 이해하도록 가르치는 새로운 방법입니다. 어느 방향으로 봐야 하는지 아는 것뿐만 아니라, 사물이 얼마나 멀리 떨어져 있는지 알게 됨으로써 AI 는 기이하고 왜곡된 카메라 렌즈를 사용할 때도 매끄럽고 사실적인 영상을 만들 수 있게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →