← 최신 논문
💻 computer science

VGGT-Edit: Feed-forward Native 3D Scene Editing with Residual Field Prediction

VGGT-Edit 는 깊이 동기화 텍스트 주입과 잔여 변환 헤드를 활용하여 기하학적 변위를 직접 예측함으로써 기존 2D 리프팅 방법의 불일치와 흐림을 극복하고 거의 즉각적인 추론으로 고충실도 다중 뷰 일관성 결과를 달성하는 텍스트 조건부 네이티브 3D 장면 편집을 위한 피드포워드 프레임워크입니다.

원저자: Kaixin Zhu, Yiwen Tang, Yifan Yang, Renrui Zhang, Bohan Zeng, Ziyu Guo, Ruichuan An, Zhou Liu, Qizhi Chen, Delin Qu, Jaehong Yoon, Wentao Zhang

게시일 2026-05-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kaixin Zhu, Yiwen Tang, Yifan Yang, Renrui Zhang, Bohan Zeng, Ziyu Guo, Ruichuan An, Zhou Liu, Qizhi Chen, Delin Qu, Jaehong Yoon, Wentao Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

고품질 3D 룸 모델, 예를 들어 거실의 디지털 트윈을 가지고 있다고 상상해 보세요. 컴퓨터에게 "의자를 창문으로 옮겨라" 또는 "회색 소파를 흰색으로 바꿔라"라고 말하고 싶다고 가정해 봅시다.

이 논문 이전에는 이를 수행하는 것이 평면 화면에서 한 프레임씩 (모든 카메라 앵글을) 편집한 후 다시 붙여 3D 영화를 편집하려는 시도와 같았습니다. 이는 느렸으며, 종종 흐릿하거나 결함이 있는 결과를 초래했고, 의자는 보는 각도에 따라 다르게 보일 수 있었습니다.

이 논문의 저자인 VGGT-Edit는 이를 빠르고 선명하며 3D 공간에서 직접 발생하는 새로운 방식을 제안합니다. 그들이 이를 어떻게 수행했는지 간단한 개념으로 분해해 보겠습니다:

1. 문제: "2D 리프팅"의 혼란

기존 방법을 조각을 재건하려는 예술가 팀으로 생각해 보세요. 그들은 조각 자체를 작업하는 대신 10 개의 다른 각도에서 조각을 찍은 사진을 찍습니다. 그들은 각 사진을 다른 예술가에게 보내어 특정 사진에서 의자를 덮어 그립니다. 그런 다음, 그 10 개의 페인팅된 사진을 다시 3D 형태로 쌓아 올립니다.

  • 결과: 예술가들은 서로 대화하지 않았습니다. 한 사람은 의자를 빨간색으로, 다른 사람은 파란색으로 그렸습니다. 가장자리가 맞지 않습니다. 최종 3D 객체는 흐릿하고 일관성이 없어 보입니다. 방 하나에 대해 이를 수행하는 데는 몇 시간 (심지어 몇 분) 이 걸립니다.

2. 해결책: "잔차" 조각가

VGGT-Edit 는 게임을 바꿉니다. 사진을 덮어 그리는 대신, 3D 룸을 이미 존재하는 단단한 점토 블록처럼 취급합니다.

  • 동결된 백본: 방의 완벽한 사전 제작된 동상이라고 상상해 보세요. 컴퓨터는 처음부터 방 전체를 재건하려고 시도하지 않습니다. 벽, 바닥, 편집되지 않은 가구를 그대로 유지합니다.
  • 잔차 필드: 컴퓨터는 오직 변화에만 집중합니다. "의자를 옮겨라"라고 말하면 컴퓨터는 그 특정 의자를 얼마나 밀어야 하는지 정확히 계산하고 그 외에는 아무것도 하지 않습니다. 이는 의자를 이동해야 하는 특정 부분만 조각하고 나머지 동상은 untouched 로 두는 조각가와 같습니다. 이로 인해 배경은 완벽하고 안정적으로 유지됩니다.

3. 비밀 소스: 세 가지 스마트 도구

이를 완벽하게 작동시키기 위해 저자들은 시스템에 세 가지 특정 "도구"를 추가했습니다:

  • 깊이 동기화 텍스트 주입 (단어의 "GPS"):
    "의자를 옮겨라"라고 입력할 때 컴퓨터는 평면 화면에서 "의자"라는 단어가 어떻게 보이는지뿐만 아니라 3D 공간에서 의자가 어디에 있는지 알아야 합니다. 그들은 단어를 3D 좌표에 직접 매칭하는 시스템을 구축했습니다. 이는 컴퓨터에 명령에 대한 GPS 좌표를 제공하는 것과 같아, 카메라가 어떻게 움직이든 명령이 객체가 있는 정확한 위치에 도달하도록 보장합니다.

  • 뷰 인식 가중치 (신뢰 필터):
    때로는 카메라 앵글이 벽에 가려지거나 사진 가장자리에서 잘릴 수 있습니다. 컴퓨터가 그 나쁜 앵글을 듣는다면 혼란스러워집니다. 이 도구는 "나는 의자를 명확하게 볼 수 있으므로 이 카메라 앵글을 신뢰한다"고 말하고 "의자가 숨겨져 있으므로 그 앵글은 무시한다"는 필터처럼 작용합니다. 실수를 피하기 위해 가장 명확한 뷰만 듣습니다.

  • 잔차 헤드 (정밀 핀셋):
    방 전체를 다시 그리려고 시도하는 대신, 시스템의 이 부분은 변경이 필요한 특정 픽셀만 이동시키는 핀셋처럼 작용합니다. 편집에 필요한 작은 "변위 (밀거나 당기는 힘)"를 예측하여 나머지는 완벽하게 고정된 상태로 유지합니다.

4. 결과: 빠르고 선명함

전체 세계를 다시 그리는 것이 아니라 작은 부분만 조정하기 때문에:

  • 속도: 장면을 편집하는 데 약 5 초가 걸립니다. 이전 방법은 몇 분에서 몇 시간이 걸렸습니다.
  • 품질: 편집된 객체는 모든 각도에서 선명하고 일관되어 보입니다. 더 이상 흐릿한 텍스처나 "유령" 의자가 없습니다.
  • 일관성: 편집된 의자 주위를 걸어 다니면 모든 측면에서 동일하게 보입니다.

5. 훈련 데이터: "DeltaScene"

컴퓨터에게 이를 수행하는 방법을 가르치기 위해 기존 데이터를 찾을 수 없었습니다. 그들은 DeltaScene이라는 거대한 새로운 데이터셋을 구축해야 했습니다.

  • 그들은 "전"과 "후" 3D 장면의 100,000 개의 예를 생성하는 자동화 파이프라인 (로봇 공장처럼) 을 사용했습니다.
  • 그들은 AI 를 사용하여 "후" 장면이 실제로 3D 공간에서 일관성이 있는지 (2D 사진이 아닌지) 확인하고 나쁜 예를 필터링했습니다. 이는 컴퓨터가 3D 객체를 이동하는 올바른 방법을 배우도록 보장했습니다.

요약

VGGT-Edit는 느리고 결함이 있는 사진 편집 앱에서 고속 3D 조각 도구로 업그레이드하는 것과 같습니다. 음성 명령을 듣고 3D 공간에서 객체가 정확히 어디에 있는지 이해하며, 방의 나머지를 망치지 않고 장면에 정밀하고 즉각적인 변경을 가합니다. 이는 몇 시간이 걸리고 흐릿하게 보였던 과정을 완벽하게 보이는 5 초 작업으로 바꿉니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →