← 최신 논문
💻 computer science

Scaling Sequence-to-Sequence Generative Neural Rendering

Kaleido 는 3D 렌더링을 시퀀스-투-시퀀스 비디오 합성 작업으로 간주하는 통합된 디코더 전용 정류 흐름 트랜스포머로, 대규모 비디오 사전 학습을 활용하여 강력한 제로샷 성능을 갖춘 최첨단 명시적 3D 자유 뷰 합성을 가능하게 합니다.

원저자: Shikun Liu, Kam Woh Ng, Wonbong Jang, Jiadong Guo, Junlin Han, Haozhe Liu, Yiannis Douratsos, Juan C. Pérez, Zijian Zhou, Chi Phung, Tao Xiang, Juan-Manuel Pérez-Rúa

게시일 2026-05-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Shikun Liu, Kam Woh Ng, Wonbong Jang, Jiadong Guo, Junlin Han, Haozhe Liu, Yiannis Douratsos, Juan C. Pérez, Zijian Zhou, Chi Phung, Tao Xiang, Juan-Manuel Pérez-Rúa

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

고양이 한 마리가 창가 난간에 앉아 있는 단일 사진을 상상해 보세요. 고양이의 뒷모습이나 옆모습을 보고 싶다면, 일반적인 컴퓨터 프로그램은 그 단일한 평면 이미지만 가지고 있기 때문에 어려움을 겪을 것입니다. 그 프로그램은 고양이가 3 차원적인 몸을 가지고 있다는 것을 '알지' 못하며, 오직 그 한 장의 이미지에 있는 픽셀들만 알 뿐입니다.

이 논문은 3 차원 비전을 바라보는 방식을 바꾸어 이 문제를 해결하는 새로운 유형의 AI인 Kaleido를 소개합니다. 완벽한 수학적 3 차원 모델 (디지털 점토 조각상과 같은) 을 구축하려는 대신, Kaleido 는 3 차원 비전을 비디오 게임으로 취급합니다.

일상적인 비유를 사용하여 작동 방식을 간단히 설명하면 다음과 같습니다:

1. 핵심 아이디어: 3 차원은 특별한 종류의 비디오일 뿐이다

저자들은 컴퓨터가 3 차원 공간을 이해하기 위해 복잡한 기하학 규칙을 배울 필요가 없다고 주장합니다. 대신, 그들은 3 차원이 단순히 특별한 유형의 비디오라는 사실을 깨달았습니다.

  • 비유: 비디오를 시간 (time) 에 따라 재생되는 프레임들의 연속으로 생각해보세요. Kaleido 는 3 차원 장면을 공간 (space) 을 따라 재생되는 이미지들의 연속으로 취급합니다.
  • 작동 원리: 만약 당신이 동상 주위를 걸어 다닌다면, 당신이 보는 이미지들은 변합니다. Kaleido 는 수백만 시간의 일반 비디오를 관찰함으로써 이러한 패턴을 학습합니다. "카메라를 왼쪽으로 움직이면 물체가 오른쪽으로 이동한다"는 것을 학습하는 것입니다. 구의 수학을 알 필요 없이, 물체 주위를 이동할 때 사물이 어떻게 보이는지에 대한 시각적 패턴만 학습하면 됩니다.

2. "Any-to-Any"의 마법

이전 AI 모델들은 경직된 로봇과 같았습니다. "1 장의 사진을 받아 5 장의 새로운 사진을 만들 수 있다"거나 "5 장의 사진을 받아 1 장의 새로운 사진을 만들 수 있다"는 식이었습니다.

Kaleido 는 카멜레온과 같습니다. 당신이 제공하는 사진의 수 (1 장, 5 장, 또는 50 장) 에 상관없이 원하는 만큼의 새로운 뷰를 생성할 수 있으며, 당신이 선택한 어떤 각도에서도 가능합니다.

  • 비유: 마법의 스케치북을 상상해보세요. 만약 이 스케치북에 집 한 장의 그림을 보여주면, 뒷면, 옆면, 그리고 내부를 즉시 그려냅니다. 만약 서로 다른 각도에서 찍은 집의 그림 열 장을 보여주면, 새로운 각도에서 집의 더 완벽하고 디테일한 버전을 그려낼 수 있습니다. 몇 장의 사진으로 시작하든 상관없습니다. 그저 적응할 뿐입니다.

3. "세상의 도서관"에서 배우기

이 작업을 정말 잘 수행하기 위해 Kaleido 는 3 차원 모델 (드물고 만들기 어렵습니다) 만 공부한 것이 아니라, 인터넷의 전체 비디오 데이터 도서관을 읽었습니다.

  • 비유: 마치 아이가 말을 배우는 것과 같습니다. 아이들은 먼저 문법책을 공부하지 않고, 수천 시간 동안 사람들이 말하는 것을 듣습니다. Kaleido 도 수백만 시간의 비디오를 '들었습니다'. 비디오는 카메라가 움직이면서 사물이 다양한 각도에서 어떻게 보이는지를 자연스럽게 보여주기 때문에, Kaleido 는 '시각적 상식'을 학습했습니다. 컵이 바닥, 윗면, 그리고 옆면을 가지고 있다는 것을 비디오에서 움직이는 모습을 보며 학습한 것입니다.

4. "레지스터 (Register)" 수정 (혼란의 안정화)

연구자들이 AI 를 더 크고 똑똑하게 만들려고 시도했을 때, 시스템이 '미쳐버리기' 시작했습니다. 컴퓨터 뇌 내부의 숫자들이 너무 커져서 오류 (계산기 오버플로우와 같은) 를 일으켰습니다.

  • 비유: 모두가 외치는 붐비는 파티를 상상해보세요. 소음이 너무 커져서 스피커가 터져버립니다. 연구자들은 시스템에 추가할 수 있는 몇 개의 '음소거 버튼 (레지스터라고 함)'을 발견했습니다. 이 버튼들은 대화를 멈추게 하지는 않지만, 추가적인 소음을 흡수하여 파티를 차분하게 유지하고 AI 를 안정화시켰습니다. 이를 통해 시스템이 충돌하지 않고 훨씬 더 크고 강력한 모델을 구축할 수 있게 되었습니다.

5. 실제로 무엇을 할 수 있는가?

이 논문은 Kaleido 가 현재 특정 작업에서 가장 뛰어나다는 것을 보여줍니다:

  • 전문가들을 능가함: 새로운 각도에서 장면이 어떻게 보이는지 추측해야 하는 테스트에서, Kaleido 는 매우 적은 수의 시작 사진만 제공받았음에도 다른 AI 모델들보다 더 좋은 성과를 냈습니다.
  • "느린" 방법과 대등함: 일반적으로 완벽한 3 차원 뷰를 얻으려면 컴퓨터에서 특정 장면을 수 시간 동안 조정해야 합니다. Kaleido 는 조정 없이 즉시 이를 수행하며, 그 높은 품질을 따라잡습니다.
  • 3 차원 모델을 구축함: Kaleido 에 사물의 몇 장의 사진을 입력하면, 완벽한 뷰를 매우 많이 생성할 수 있어 해당 사물의 실제 회전 가능한 3 차원 모델을 구축하는 데 사용할 수 있습니다.

아직 할 수 없는 것 (한계점)

저자들은 Kaleido 가 현재 무엇을 할 수 없는지 솔직하게 밝힙니다:

  • 아직 실시간 비디오 게임 엔진은 아님: 이미지를 생성하는 데 시간이 걸리기 때문에, 아직 즉각적인 액션 게임에 사용할 수는 없습니다.
  • 극단적인 각도에서는 혼란스러움: 매우 기이하고 불가능한 각도에서 무언가를 보라고 요청하면, 결과가 약간 '꿈과 같은' 모습이나 약간 잘못된 모습으로 나타날 수 있습니다.
  • 줌 (Zoom) 을 처리하지 못함: 카메라를 이동시킬 수는 있지만, 현재는 카메라 렌즈가 이동하면서 줌인/줌아웃 (돌리 줌) 하는 것을 시뮬레이션할 수는 없습니다.

요약하자면: Kaleido 는 컴퓨터에게 3 차원으로 보게 하는 새로운 방법입니다. 경직된 3 차원 지도를 구축하는 대신, 공간을 비디오처럼 취급하여 모든 각도에서 세상이 어떻게 보이는지 학습하기 위해 방대한 양의 비디오 데이터를 사용하여 새로운 뷰를 '상상'하도록 가르칩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →