← 최신 논문
🔬 optics

Engram-E2VID: Reference-Based Event-to-Video Reconstruction via Generative Activation of Appearance Engrams

Engram-E2VID는 참조 프레임으로부터 인코딩된 외관 엔그램(appearance engrams)의 생성적 활성화를 구조적으로 가이드하기 위해 1단계 확산 백본을 활용함으로써, 복잡한 움직임과 긴 시간 간격 하에서도 희소한 이벤트 스트림으로부터 타겟 RGB 프레임을 고충실도로 복구하는 참조 기반 이벤트-투-비디오 재구성 프레임워크이다.

원저자: Feiyu Ji, Xiang Li, Hao Ma, Tianxiang Huang, Qingxin Lu, Mengqi Ji, Lei Han, Xiaokang Yang, Xiaoyun Yuan

게시일 2026-08-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Feiyu Ji, Xiang Li, Hao Ma, Tianxiang Huang, Qingxin Lu, Mengqi Ji, Lei Han, Xiaokang Yang, Xiaoyun Yuan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 영화의 한 장면을 재현하려고 노력 중이지만, 오직 두 가지 매우 기묘한 도구만을 가지고 있다고 상상해 보십시오. 첫 번째는 액션이 시작되기 전 장면을 찍은 단 한 장의 완벽한 사진입니다. 두 번째는 무언가가 움직이거나 밝기가 변할 때마다 주변을 날아다니는 아주 작고 보이지 않는 불꽃들의 혼란스러운 흐름입니다. '이벤트(event)'라고 불리는 이 불꽃들은 매우 빠르고 움직임에 대해 매우 상세하게 정보를 제공하지만, 색상, 질감, 혹은 사물이 실제로 어떻게 생겼는지에 대해서는 완전히 눈이 멀어 있습니다. 그것들은 마치 형체 없는 움직임의 유령 같은 속삭임과 같습니다.

과학자들은 이 불꽃들을 사용하여 비어 있는 영화의 부분을 재건하려고 오랫동안 노력해 왔지만, 그것은 마치 바람이 어디로 불었는지 나타내는 지도만을 가지고 초상화를 그리려는 것과 같습니다. 기존의 방식들은 무언가가 너무 멀리 이동하거나 너무 빠르게 움직일 때 길을 잃기 일쑤였으며, 그 결과 흐릿하고 유령 같거나 완전히 잘못된 그림을 만들어냈습니다. 상하이 교통 대학교와 여러 기관의 연구진은 바로 이 문제를 해결하기로 했습니다. 그들은 다음과 같이 질문했습니다. "어떻게 하면 저 혼란스러운 움직임의 불꽃 흐름을 가져와서 우리의 시작 사진과 결합하여, 설령 많은 시간이 흘렀더라도 결정이 투명한 새로운 비디오 프레임을 재건할 수 있을까?"

그들이 찾아낸 답은 Engram-E2VID라고 불리는 새로운 시스템입니다. 이것을 단순히 예전 사진을 복사해서 붙여넣는 것이 아니라, 움직임의 불꽃을 사용하여 새로운 장면의 '비계(scaffold)' 또는 뼈대를 구축하는 마법 같은 건설팀이라고 생각해 보십시오. 이 비계는 시스템에게 사물들이 어디로 움직이고 있고 그 구조가 어떻게 변하고 있는지를 알려줍니다. 그런 다음, 시스템은 자신의 기억 저장소인 원래 사진 속으로 손을 뻗어 특정 '외형 엔그램(appearance engrams)'(사물이 어떻게 생겼는지에 대한 상세한 기억 조각들)을 꺼내 옵/니다.

여기서 영리한 부분이 나옵니다. 기존 방식처럼 예전 사진을 새로운 위치에 맞추기 위해 억지로 늘리는 대신(이는 보통 이미지를 왜곡되고 흐릿하게 만듭니다), 이 시스템은 스마트한 '활성화(activation)' 과정을 사용합니다. 시스템은 비계에게 묻습니다. "이봐, 여기에는 빨간 공의 질감이 필요하고, 저기에는 고양이의 털이 필요해." 그러면 비계는 적절한 지점을 가리키고, 시스템은 그곳을 채우기 위해 완벽한 기억 조각들을 가져옵니다. 만약 장면의 일부가 완전히 가려졌거나 새로운 부분이라면, 강력한 AI '상상력'(확산 모델, diffusion model)이 개입하여 빈 공간을 현실적으로 채워 넣습니다.

결과는 인상적입니다. 세 가지 실제 세계 데이터셋을 통해 테스트했을 때, 이 새로운 방식은 단순히 작동하는 수준을 넘어 훨씬 더 잘 작동했습니다. 즉, 이전의 방식들보다 훨씬 더 뛰어난 성과를 보였습니다. 구체적으로, 동일한 입력을 사용하는 기존의 가장 강력한 방법과 비교했을 때 영상 품질 점수(PSنو)를 최대 3.29 dB까지 향상시켰고, 시각적 흐릿함(LPIPS)을 최대 0.08까지 줄였습니다.

아마도 가장 흥кси로운 발견은 이 시스템이 시간을 다루는 방식일 것입니다. 보통 시작 사진과 생성하고자 하는 프레임 사이의 시간 간격이 길어질수록 결과물은 나빠지기 마련입니다. 하지만 Engram-E2VID는 훨씬 더 느리게 저하됩니다. 시간 간격이 컸을 때조차도, 다른 방식들이 흐릿해지거나 이상한 형태를 만들어내는 것과 달리, 이 시스템은 디테일을 선명하게 유지하고 구조를 정확하게 유지했습니다. 연구진은 '구조'(비계)와 '외형'(엔그램)을 분리하고 그들이 스마트한 방식으로 서로 소통하게 함으로써, 두 번째 사진의 도움 없이도 복잡하거나 빠르게 움직이거나 원래 사진에서 멀리 떨어진 장면들을 재건할 수 있다고 제안합니다. 이는 마치 친구의 얼굴이 어떻게 생겼는지 정확히 기억하고 있다면, 그 친구가 방의 완전히 다른 곳으로 이동해 뛰어다니고 있더라도, 방의 구조와 발소리만으로 그 모습을 떠올릴 수 있는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →