← 최신 논문
💻 computer science

Grounded-Exo2Ego: Structured Semantic Grounding for Robust Exocentric-to-Egocentric Video Generation

이 논문은 기하학적 앵커링과 새로운 시맨틱 그라운딩 브랜치 및 카메라 재지역화 알고리즘을 결합하여 외시점 입력을 통해 1인칭 시점 영상을 견고하게 생성함으로써, 개선된 아키텍처와 완전 자동화된 합성 데이터 생성을 통해 EgoExo4D 데이터셋에서 최첨단 성능을 달성하는 이중 브랜치 비디오 확산 프레임워크인 Grounded-Exo2Ego를 소개한다.

원저자: Shengze Wang, Michael Stengel, Tianye Li, Seonwook Park, Amrita Mazumdar, Koki Nagano, Alex Trevithick, Shalini De Mello

게시일 2026-08-24
📖 3 분 읽기☕ 가벼운 읽기

원저자: Shengze Wang, Michael Stengel, Tianye Li, Seonwook Park, Amrita Mazumdar, Koki Nagano, Alex Trevithick, Shalini De Mello

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

주방 건너편에서 누군가 요리하는 영상을 보고 있다고 상상해 보십시오. 당신은 스토브, 조리대, 요리사의 움직임까지 포함된 전체 장면을 보고 있습니다. 이제 그 시점을 즉각적으로 전환하여, 마치 그 사람이 눈을 쓰고 있는 것처럼 요리사가 보는 것을 정확히 볼 수 있다고 상상해 보십시오. 외부의 관점을 1인칭 관점으로 변환하는 이 능력은 '외심적-내심적 비디오 생성(exocentric-to-egocentric video generation)'이라 불리는 새로운 과학적 노력의 목표입니다. 이는 인간의 영상을 보고 학습할 수 있는 로봇을 구축하고, 사용자가 다른 사람의 관점에서 순간을 다시 경험할 수 있는 몰입형 가상 현실을 만드는 데 있어 매우 중요한 단계입니다. 하지만 외부에서 촬영된 영상을 내부의 시점으로 바꾸는 것은 매우 어렵습니다. 정적인 장면에서 각도를 변경하는 데는 잘 작동하는 표준 컴퓨터 비전 도구들도 여기서는 종번 실패하곤 합니다. 카메라가 넓은 뷰에서 근접 촬영으로 이동할 때, 컴퓨터는 물체 뒤에 숨겨진 것이 무엇인지, 혹은 완전히 다른 각도에서 장면이 어떻게 보여야 하는지를 추측하는 데 어려움을 겪으며, 이는 종종 왜곡되거나 흐릿하거나 일부가 누락된 이미지를 초래합니다.

NVIDIA의 연구진은 이 문제를 해결하기 위해 'Grounded-Exo2Ego'라는 새로운 시스템을 개발했습니다. 외부 뷰와 내부 뷰 사이의 기하학적 일치를 강제로 맞추려는 일반적인 방식에 의존하는 대신, 그들은 방의 형태와 그 안의 특정 사물들을 모두 이해하는 프레임워크를 구축했습니다. 연구진은 이전의 시도들이 실패한 이유가 컴퓨터가 추측한 방의 3D 형태가, 특히 원래 카메라에는 보이지 않았던 부분에 대해 틀린 경우가 많았기 때문이라는 것을 발견했습니다. 컴퓨터가 이러한 결함이 있는 3D 지도를 사용하여 새로운 뷰를 생성하려고 할 때, 결과물은 구멍이 뚫리고 표면이 뒤틀린 영상이 되었습니다. 이를 해결하기 위해 이 새로운 시스템은 이중 분기 접근 방식을 사용합니다. 한 분기는 구조적 가이드 역할을 하며, 장면의 대략적인 3D 지도를 사용하여 벽과 바닥이 어디에 있어야 하는지 컴퓨터에게 알려줍니다. 핵심 혁신인 두 번째 분기는 의미론적 가이드 역할을 합니다. 이는 영상 속의 사람, 자전거, 또는 요리 냄비와 같은 특정 사물을 식별하고, 3D 지도가 불완전하거나 깨져 있더라도 해당 사물이 어떻게 생겼으며 어디에 위치해야 하는지를 컴퓨터에게 정확히 알려줍니다.

연구진은 또한 이러한 시스템이 학습되는 방식에 숨겨진 결함이 있다는 것을 발견했습니다. 현실 세계에서 사람이 착용하는 카메라는 컴퓨터의 방 3D 재구성 모델과 완벽하게 일치하지 않습니다. 이러한 불일치는 컴퓨터가 실제 영상 데이터로부터 학습하려고 할 때, 본래 모방해야 할 현실과 일치하지 않는 왜곡된 지도로부터 학습하는 셈이 된다는 것을 의미했습니다. 이를 해결하기 위해 연구진은 훈련이 시작되기 전에 카메라의 위치를 컴퓨터의 불완전한 3D 지도 내에서 재정렬하는 새로운 프로세스를 만들었습니다. 이를 통해 컴퓨터가 일관된 그림으로부터 학습할 수 있도록 보장합니다. 나아가, 시스템에 완벽한 예시를 제공하기 위해, 그들은 수천 개의 합성 영상을 생성하는 완전 자동화된 엔진을 구축했습니다. 이 컴퓨터 생성 세계 속에서, 그들은 다양한 방 안에 애니메이션화된 3D 캐릭터들을 배치하고 외부와 내부의 관점 양쪽에서 그들을 기록함으로써, 실제 카메라로는 쉽게 포착할 수 없는 결점 없는 데이터를 모델에 제공합니다.

스포츠, 요리, 자전거 수리 등 실제 상황을 담은 도전적인 데이터셋에 테스트했을 때, 이 새로운 시스템은 기존 방식들을 크게 능가했습니다. 이 시스템은 더 선명하고 정확하며, 사물을 올바른 위치에 유지하는 능력이 훨씬 뛰어난 영상을 만들어냈습니다. 예를 들어, 기존 방식들은 종종 사람을 완전히 재구성하지 못하거나 엉뚱한 곳에 배치하곤 했지만, 새로운 시스템은 피사체와 주변 환경을 명확한 뷰로 성공적으로 생성해 냈습니다. 결과는 방의 레이아웃에 대한 대략적인 이해와 그 안의 사물들에 대한 세부적인 이해를 결합함으로써, 컴퓨터가 마침내 장면을 관찰하는 것과 타인의 눈으로 보는 것 사이의 간극을 메울 수 있음을 보여주었습니다. 이 작업은 기계가 인간의 경험을 진정으로 이해하고 복제하기 위해서는 단순한 기하학을 넘어, 렌더링하려는 사물의 의미를 배워야 한다는 점을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →