← 최신 논문
🤖 machine learning

Video Reconstruction using Diffusion-based Image-to-Video Generation with Trajectory Guidance

본 논문은 사전 훈련된 모델을 투영된 GPS 원격 측정 데이터에 조건부로 적용하여 해상 드론 영상에서 누락된 프레임을 재구성하는 궤적 유도형 이미지-비디오 확산 파이프라인을 제안하며, 이는 도메인 특화 미세 조정 없이 기존 보간 기준 대비 우수한 시각적 품질과 운동 사실성을 달성합니다.

원저자: Stelio Bompai, Ioannis Kontopoulos, Giannis Spiliopoulos, Dimitris Zissis, Konstantinos Tserpes

게시일 2026-05-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Stelio Bompai, Ioannis Kontopoulos, Giannis Spiliopoulos, Dimitris Zissis, Konstantinos Tserpes

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

두 척의 작은 배가 바다를 항해하는 라이브 드론 영상을 보고 있다고 상상해 보세요. 갑자기 인터넷 연결에 문제가 생겨 영상의 일부가 사라집니다. 당신은 간격을 마주하게 됩니다. 시작과 끝에서 배를 보지만, 중간 부분이 빠져 있습니다.

일반적으로 컴퓨터는 이 간격을 채우기 위해 그 사이에 무슨 일이 있었는지 추측합니다. 마치 아이가 두 점을 직선으로 연결하려는 것과 비슷합니다. 하지만 배가 빠르게 움직이거나 방향을 틀면 직선은 가짜처럼 보이고 흐릿해집니다.

이 논문은 영상을 더 똑똑하게 복원하는 방법을 제안합니다. 단순히 이미지만 보고 추측하는 대신, 컴퓨터는 배가 이미 가지고 있는 "비밀 지도", 즉 GPS 데이터를 활용합니다.

문제: 흐릿한 추측

전통적인 영상 복구 방법 (옛날 영화나 표준 소프트웨어에서 사용된 것들) 을 캔버스 위의 색상만 보고 장면을 재현하려는 화가에 비유해 보세요. 배가 빠르게 움직이면 화가는 페인트를 번지게 하여 흐릿한 혼란을 만듭니다. 그들은 배가 "어딘가"로 이동했다는 사실만 알 뿐, 실제로 어디로 갔는지는 모릅니다.

해결책: GPS "유령 가이드"

저자들은 GPS 로 안내되는 인형극 마리오네트 조종사와 같은 파이프라인을 구축했습니다. 작동 원리는 다음과 같습니다.

  1. 기준 프레임: 컴퓨터는 영상이 끊기기 직전의 배가 선명하게 찍힌 마지막 사진을 시작점으로 삼습니다.
  2. GPS 단서: 배들은 영상이 손상된 동안에도 정확한 위치 좌표 (위도와 경도) 를 로그 파일로 전송해 왔습니다.
  3. 변환: 컴퓨터는 이 GPS 숫자를 화면상의 "픽셀 화살표"로 변환합니다. 마치 실제 세계의 움직임에 기반해 다음 초에 배가 있어야 할 정확한 위치를 사진 위에 작은 화살표로 그리는 것과 같습니다.
  4. 마술 아티스트 (확산 모델): 컴퓨터는 이 주석이 달린 사진을 강력한 AI 아티스트 (확산 모델이라고 함) 에게 입력합니다. 이 AI 는 수백만 개의 영상을 학습하여 물, 빛, 움직임이 어떻게 보이는지 이해하도록 훈련되었습니다.
    • 보통 이 AI 는 배의 경로를 무작위로 추측할 수 있습니다.
    • 하지만 저자들이 GPS 화살표를 제공했기 때문에, AI 는 GPS 가 말해주는 대로 배를 정확하게 움직이도록 강제로 그립니다.

결과: 사실적인 재구성

이 논문은 이 방법을 "오래된 방식"의 추측 기술과 비교하여 테스트했습니다. 그들이 발견한 바는 다음과 같습니다.

  • "흐릿한" 경쟁자들: 광학 흐름 (Optical Flow) 과 RIFE 같은 전통적인 방법들은 영상이 너무 매끄러워 (만화처럼 보임) 이거나 움직임의 양이 잘못되어 생성했습니다. 실제처럼 보이기보다는 "평균화"된 것처럼 보였습니다.
  • GPS 안내 승자: GPS 데이터를 사용한 방법은 가장 자연스러운 프레임을 생성했습니다.
    • 움직임: 배들은 화면을 미끄러지는 것이 아니라 현실적인 속도와 방향으로 이동했습니다.
    • 질감: 물과 배의 디테일은 흐릿하지 않고 선명하고 자연스럽게 보였습니다.
    • 정확도: 배들은 GPS 가 말해주던 정확한 위치에 도착했습니다.

함정

저자들은 이것이 두 척의 배만을 대상으로 한 매우 짧은 클립 (단 2 초) 에 대한 테스트 실행이었다고 인정합니다. 마치 전국을 주행하기 전에 짧은 트랙에서 새로운 자동차 엔진을 테스트하는 것과 같습니다. 또한, 컴퓨터는 여전히 GPS 데이터를 올바른 선박과 매칭할 수 있도록 인간이 한 번씩 배를 클릭하여 "저것이 초록색 배고, 저것이 노란색 배야"라고 말해줘야 했습니다.

결론

이 논문은 영상의 일부가 누락되었더라도 영상 내 객체의 GPS 로그가 있다면, 해당 GPS 데이터를 활용하여 AI 가 누락된 영상을 재구성하도록 "조종"할 수 있음을 보여줍니다. 마치 AI 에게 GPS 내비게이션 시스템을 주어 객체가 어디로 가는지 추측하게 하지 않고 지도만 따르게 함으로써, 스스로 추측했을 때보다 훨씬 더 실제처럼 보이는 영상을 만들어내는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →