← 최신 논문
💻 computer science

Multiple Hypothesis Flow Estimation for Video Frame Interpolation under Matching Ambiguity

이 논문은 비디오 프레임 보간 시 발생하는 매칭 모호성을 해결하기 위해 상위 K개의 후보 대응 관계를 보존하고 라우터를 통해 가장 신뢰할 수 있는 하나를 선택하는 다중 가설 흐름 추정 프레임을 제 제안하며, 이를 통해 고스팅이나 블러와 같은 아티팩트를 줄이는 동시에 최첨단의 지각적 품질을 달성한다.

원저자: Zibo Su, Jing Kong, Ruixing Wang, Zhanhe Zhang, Kun Wei

게시일 2026-08-10
📖 6 분 읽기🧠 심층 분석

원저자: Zibo Su, Jing Kong, Ruixing Wang, Zhanhe Zhang, Kun Wei

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 일반적인 클립으로부터 부드러운 슬로 모션 영상을 만들려고 한다고 상상해 보십시오. 이를 위해 컴퓨터는 이미 존재하는 프레임 사이에 완벽하게 들어맞는 새로운 프레임을 발명해내야 합니다. 이것은 마치 마술사가 두 장의 사진 사이의 찰나에 무용수가 어떤 모습이었을지 정확히 추측하려는 것과 같습니다. 이 마술의 가장 까다로운 부분은 모든 픽셀이 첫 번째 사진에서 두 번째 사진으로 어떻게 이동했는지를 파악하는 것입니다. 보통 컴퓨터는 픽셀이 어디로 갔는지에 대해 단 하나의 "최선의 추측"만을 찾으려고 합니다. 하지만 때때로 세상은 혼란스럽습니다. 똑같이 생긴 날개를 가진 회전하는 풍차가 있거나, 똑같이 생긴 눈송이가 쌓여 떨어지거나, 빠른 속도로 움직이는 주먹이 잔상을 남기는 경우를 생각해 보십시오. 컴퓨터는 첫 번째 프레임의 픽셀을 보고 이렇게 묻게 됩니다. "너는 이 지점으로 갔니, 아니면 저 지점으로 갔니, 아니면 저기로 갔니?" 이런 까다로운 상황에서는 단 하나의 정답만 존재하는 것이 아니라, 똑같이 그럴듯한 여러 개의 답이 존재합니다. 만약 컴퓨터가 즉시 단 하나의 추측만을 선택하도록 강요받는다면, 잘못된 것을 고르거나 엉망인 절충안을 선택하게 되어 결과적으로 유령처럼 흐릿하거나 왜곡된 프레임을 만들어내게 됩니다.

이 논문은 비디오 프레임 보간(VFI) 분야의 바로 그 골칫거리를 다룹니다. 저자들은 이러한 혼란스러운 순간들을 처리하는 영리하고 새로운 방법을 제안합니다. 컴퓨터에게 즉시 단 하나의 절박한 추측을 하라고 강요하는 대신, 모든 픽셀에 대해 상위 세 개의 최선 후보(또는 "가설")를 명단에 유지하도록 허용하는 것입니다. 이는 마치 첫 번째 용의자를 보자마자 바로 체포하지 않고, 대신 세 명의 용의자를 라인업에 유지하는 형사와 같습니다. 그런 다음 컴퓨터는 일관성이나 이미지의 선명도와 같은 단서들을 살펴보고서(예: 움직임이 얼마나 일관적인지, 이미지가 얼마나 선명한지) 단 하나의 최선의 용의자를 골라 최종 답변으로 선택합니다. 결론을 내리기 전에 더 많은 증거를 수집함으로써, 이 방식은 컴퓨터가 너무 일찍 추측해야 할 때 발생하는 흐릿하고 유령 같은 실수를 방지합니다. 그 결과, 특히 사물이 회전하거나, 반복되거나, 너무 빠르게 움직여서 명확하게 보기 힘든 혼란스러운 장면에서도 훨씬 더 깨끗하고 선명한 영상을 만들어냅니다.

문제점: "단 하나의 정답"이 존재하지 않을 때

대부분의 비디오 보간 방법은 모든 질문에 단 하나의 답을 요구하는 엄격한 선생님처럼 작동합니다. 그들은 비디오의 두 프레임을 보고 모든 픽셀이 어떻게 움직였는지 정확히 계산하려고 합니다. 단순한 장면에서는 이것이 잘 작동합니다. 하지만 현실 세계는 복잡합니다. 이 논문은 이 "하나의 정답" 규칙이 무너지는 세 가지 구체적인 시나리오를 식별합니다:

  1. 반복되는 질감: 똑같은 꽃밭이나 눈더미를 상상해 보십시오. 첫 번째 프레임의 눈송이 하나를 보면 이웃한 것들과 똑같이 생겼습니다. 컴퓨터가 다음 프레임과 매칭하려고 할 때, 수십 개의 똑같이 생긴 눈송이를 보게 됩니다. 컴퓨터는 어떤 것이 "진짜" 매치인지 구분할 수 없습니다.
  2. 대칭 회전: 풍차나 헬리콥터 프로펠러를 생각해보십시오. 날개가 모두 같다면, 첫 번째 프레임의 날개는 다음 프레임에서 다른 어떤 날개와도 일치할 수 있습니다. 여기에는 단 하나의 정답이 아니라 여러 개의 정답이 존재합니다.
  3. 블러를 동반한 빠른 움직임: 무술 영화의 펀치처럼 무언가가 매우 빠르게 움직이면 잔상이 남습니다. 컴퓨터는 픽셀의 번짐을 보고 물체가 정확히 어디서 시작되었는지 또는 어디로 끝났는지 짚어낼 수 없습니다.

이 모든 경우에 "그라운드 트루스"(실제 중간에 나타나야 할 비디오 프레임)는 컴퓨터에게 고유한 단서를 제공하지 않습니다. 컴퓨터는 잘못된 픽셀들을 조합하여 기계에게는 괜찮아 보이는 그림을 만들어낼 수는 있겠지만, 인간의 눈에는 이상하게 보일 것입니다. 전통적인 방법들은 컴퓨터에게 즉시 하나의 경로를 선택하도록 강요합니다. 만약 잘못된 것을 선택하거나 두 가지 서로 다른 경로를 평균 내려고 하면, 결과는 "고스팅"(이중 이미지 현상)이나 "구조적 왜곡"(물체가 녹아내리거나 부서져 보이는 현상)이 됩니다.

해결책: "Top-K" 명단

이 논문의 저자인 Zibo Su와 동료들은 다른 접근 방식을 제안합니다. 컴퓨터에게 즉시 하나의 답을 결정하라고 요구하는 대신, 최선의 후보들을 담은 Top-K 리스트를 유지하게 하는 것입니다. 그들의 실험에서, 3개의 후보(K=3)를 유지하는 것이 가장 효과적이라는 것을 발견했습니다.

**다중 가설 흐름 추정(Multiple Hypothesis Flow Estimation, MHFE)**이라 불리는 이 시스템의 작동 단계는 다음과 같습니다:

  1. 거친 탐색 (The Coarse Search): 먼저, 컴퓨터는 전체 이미지를 살펴보고 픽셀이 이동했을 가능성이 가장 높은 상위 3곳을 찾습니다. 이들을 "앵커(anchors)"라고 부릅니다.
  2. 국소적 정교화 (The Local Refinement): 단순히 추측하는 대신, 컴퓨터는 이 3개의 앵커 각각에 대해 줌인합니다. 컴퓨터는 각 앵커 주변의 이웃을 자세히 보기 위해 특수한 "로컬 어텐션(local attention)" 도구를 사용합니다. 이는 움직임 경로를 더욱 정밀하게 만들기 위해 세부 사항을 다듬는 데 도움을 줍니다.
  3. 신뢰도 판사 (The Reliability Judge): 이제 컴퓨터는 모든 픽셀에 대해 정교화된 3가지 옵션을 갖게 됩니다. 컴퓨터는 단순히 첫 번째 것을 고르지 않습니다. 컴퓨터는 다음과 같은 단서들을 확인하는 "신뢰도 가이드 라우터(reliability-guided router)"를 사용합니다:
    • 일관성: 픽셀이 앞으로 갔다가 다시 뒤로 돌아왔을 때, 원래 위치로 돌아오는가?
    • 초점: 매치가 선명하고 뚜렷한가, 아니면 흐릿한가?
    • 확신도: 초기 탐색의 확신도가 어느 정도인가?
  4. 최종 선택: 이 단서들을 바탕으로, 라우터는 해당 픽셀에 대해 가장 신뢰할 수 있는 단 하나의 옵션을 선택합니다. 결정적으로, 컴퓨터는 하나를 선택하고 나머지는 버립니다. 이들을 함께 섞지 않습니다.

왜 "섞는 것"보다 "하나를 고르는 것"이 더 나은가

이 논문의 핵심 발견 중 하나는 서로 다른 추측들을 섞는 것이 실제로 나쁘다는 점입니다. 일부 오래된 방법들은 안전하기 위해 가능한 모든 움직임을 평균 내려고 시도했습니다. 저자들은 이러한 평균화가 "타협된 예측"을 만든다는 것을 보여줍니다. 이는 빨간 자동차와 파란 자동차를 섞으려는 것과 같습니다. 당신은 실제처럼 보이는 보라색 자동차를 얻는 것이 아니라, 칙칙하고 유령 같은 엉망인 결과물을 얻게 됩니다.

"하드 라우팅(hard routing)" 전략(하나의 승자를 선택하는 것)을 사용함으로써, 컴퓨터는 최종 이미지가 하나의 일관된 이야기로부터 구축되도록 보장합니다. 만약 컴퓨터가 확신이 없다면, 두 가지 다른 줄거리를 섞어서 혼란스러운 이야기를 하는 대신, 충분한 증거를 모아 가장 좋은 단 하나의 이야기를 선택할 때까지 기다립니다.

새로운 테스트: MA-HD

그들의 아이디어가 효과적임을 증명하기 위해, 연구진은 표준 테스트를 사용할 수 없었습니다. 왜냐하면 그 테스트들에는 이러한 까다로운 "모호한" 장면들이 충분하지 않았기 때문입니다. 그래서 그들은 MA-HD(Matching-Ambiguity High Definition)라는 새로운 벤치마크를 구축했습니다.

이 새로운 테스트 세트는 혼란 요인이 많은 1,000개의 비디오 클립을 특별히 선정하여 포함합니다:

  • 역동적인 질감: 불꽃, 물결, 눈, 비.
  • 회전: 풍차와 비행기 프로펠러.
  • 빠른 움직임: 무술 펀치와 드리프트 자동차.

그들은 이 어려운 장면들에서 기존의 최고 비디오 도구들(EMA-VFI, SGM-VFI 등)과 그들의 방법을 비교 테스트했습니다.

결과: 더 선명하고, 깨끗하며, 유령 현상이 적음

결과는 인상적이었으며, 특히 까다로운 카테고리에서 두드로웠습니다:

  • 지각적 품질: 저자들은 컴퓨터가 이미지를 인간이 보는 것과 얼마나 유사하다고 판단하는지를 측정하는 LPIPSDISTS라는 지표를 사용했습니다. 그들의 새로운 MA-HD 테스트에서, 그들의 방법은 LPIPS에서 11.14, DISTS에서 7.19를 기록했습니다. 이는 두 번째로 우수한 방법인 PerVFI(LPIPS 13.69, DISTS 7.60)보다 현저히 뛰어난 수치였습니다. 쉽게 말해, 그들의 영상은 인간의 눈에 훨씬 더 자연스럽고 덜 흐릿해 보였습니다.
  • 모호성 처리: 시각적 비교에서, 기존 방법들은 회전하는 날개나 빠른 주먹 주변에서 "유령 현상"(희미한 이중 이미지)과 "찢어짐 현상"(이미지의 일부가 찢어져 보이는 현상)을 만들어냈습니다. 새로운 방법은 날개를 선명하게 유지하고 주먹을 단단하게 유지했습니다.
  • 효율성: 이 방법은 또한 상당히 빠릅니다. MA-HD 테스트에서 약 0.78 FPS(초당 프레임 수)로 실행되며, 이는 다른 고품질 방법들과 대등한 수준이지만 절대적으로 가장 빠른 것은 아닙니다. 또한 약 6.91 GB의 메모리를 사용하는데, 이는 30 GB 이상을 요구하는 다른 무거운 방법들에 비해 훨씬 적은 양입니다.

이 논문이 배제하는 것들

저자들은 무엇이 작동하지 않는지에 대해 매우 명확하게 밝히고 있습니다:

  • 소프트 퓨전(Soft Fusion): 그들은 서로 다른 움직임 경로를 평균 내는 것에 대해 명시적으로 반대합니다. 그들의 테스트에 따르면, 후보들을 혼합하려고 했을 때(연구의 변형 B) 이미지는 품질이 급격히 떨어졌으며, 픽셀 단위의 수치는 괜찮을지 몰라도 심한 고스팅과 색이 바랜 디테일을 만들어냈습니다.
  • 확신도 전용 라우팅(Confidence-Only Routing): 그들은 학습된 "신뢰도 판사" 없이 단순히 초기 확신도 점수가 가장 높은 후보를 선택하는 버전도 테스트했습니다. 이 버전은 전체 시스템보다 성능이 떨어졌으며, 이는 스마트한 판사가 나쁜 추측을 걸러내는 데 필수적임을 입증했습니다.

결론

이 논문은 세상이 모호할 때—즉, 픽설이 이동할 수 있는 여러 가지 방법이 존재할 때—무작위로 추측하거나 모든 추측을 섞는 것이 최선이 아니라는 점을 시사합니다. 대신, 컴퓨터는 최선의 가능성들을 명단에 유지하고, 추가적인 주의를 기울여 정교화한 다음, 가장 신뢰할 수 있는 단 하나의 이야기를 선택하는 스마트한 학습 시스템을 사용해야 합니다. 그들은 이 접근 방식이, 특히 기존의 비디오 도구들을 망가뜨리는 혼란스럽고 빠르게 움직이거나 반복되는 장면들에서 훨씬 더 깨끗하고 선명하며 현실적인 슬로 모션 영상을 만들어낸다는 것을 보여주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →