← 최신 논문
⚡ electrical engineering

Data-driven Video Codec with Implicit Neural Representations

이 논문은 비디오와 오디오를 하나의 과적합된 사인파 신경망(sinusoidal neural network)의 가중치로 표현하고, 이를 지식 증류, 16비트 양자화 및 무손실 인코딩을 통해 압축함으로써 H.264 및 MP3와 같은 기존 표준과 비교하여 경쟁력 있는 재구성 품질을 유지하면서도 2.61배의 압축률을 달리는 새로운 데이터 기반 비디오 코덱을 제안한다.

원저자: Nishan Khanal, Saugat Neupane, Abhinav Chalise, Nimesh Gopal Pradhan, Dinesh Baniya Kshatri

게시일 2026-07-20
📖 5 분 읽기🧠 심층 분석

원저자: Nishan Khanal, Saugat Neupane, Abhinav Chalise, Nimesh Gopal Pradhan, Dinesh Baniya Kshatri

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 친구에게 거대한 고화질 영화를 보내려고 한다고 상상해 보세요. 디지털 미디어의 세계에서 우리는 보통 비디오와 오디오를 작은 색상 타일(픽셀)로 이루어진 거대한 모자이크와 별도의 음파 스트림처럼 취급합니다. 전통적인 비디오 코덱은 이 모자이크를 관찰하여 반복되는 지루한 패턴을 찾아내고, 더 적은 수의 타일을 사용하여 이를 재구성하는 매우 영리한 지침들을 작성하는 숙련된 기록물 관리자와 같습니다. 이들은 믿을 수 없을 정도로 효율적이지만, 고정된 픽셀 격자에 의존합니다.

이제 다른 접근 방식을 상상해 보세요. 타일 자체를 저장하는 대신, 하나의 초지능적인 레시피를 저장한다면 어떨까요? 이 레시피는 수학적 함수이며, 당신이 "이 특정 위치의 특정 시간의 픽셀 색상은 무엇인가?"라고 물으면, 즉각적으로 그 정확한 색상과 소리를 답변합니다. 이것이 바로 **암시적 신경 표현(Implicit Neural Representations, INRs)**의 세계입니다. 이것은 마치 로봇에게 캔버스의 사진을 찍는 대신, 붓터치를 학습하여 그림을 기억하도록 가르치는 것과 같습니다. 만약 로봇이 레시피를 완벽하게 알고 있다면, 나중에 전체 영상을 재현하기 위해 레시피(로봇의 '두뇌' 또는 가중치)만을 저장하면 됩니다. 이 논문은 이 "레시피" 방식이 비디오와 오디오를 하나의 단일한 두뇌 안에 함께 저장할 수 있는지, 그리고 그 두뇌를 유용할 만큼 작게 줄일 수 있는지를 탐구합니다.

"단일 두뇌" 비디오 코덱

네팔 트리부반 대학교(Tribhuvan University)의 연구진들은 대담한 질문을 던졌습니다. 단일 신경망, 즉 디지털 두뇌를 구축하여 비디오 플레이어이자 사운드 시스템 역할을 동시에 수행하게 할 수 있을까? 보통 비디오와 오디오는 별개의 시스템으로 처리됩니다. 여기서 그들은 SIREN(Sinusoidal Representation Network)이라 불리는 통합된 네트워크를 구축했습니다.

이 네트워크를 마법의 번역기라고 생각해보세요. 당신은 좌표 세트를 입력합니다: 영상 속의 위치 (x, y), 영화의 프레임 (t), 그리고 소리의 정확한 시점 (T). 그러면 네트워크는 그 정확한 순간의 픽셀 색상과 소리의 볼륨을 내뱉습니다. 수백만 개의 픽셀로 가득 찬 파일을 저장하는 대신, 그들은 네트워크의 "가중치(weights)", 즉 번역기가 작동하게 만드는 수학적 설정값을 저장합니다.

하지만 문제가 있었습니다. 비디오와 오디오는 매우 다른 특성을 가집니다. 비디오는 천천히 변하는 반면(걷고 있는 사람), 오디오는 매우 빠르게 변합니다(바이올린 현의 진동). 연구진은 단일 "첫 번째 레이어"가 두 가지를 모두 잘 처리할 수 없다는 것을 발견했습니다. 그것은 마치 책을 읽으면서 동시에 교향곡을 듣기 위해 한 쌍의 안경을 사용하는 것과 같았으며, 둘 다 제대로 작동하지 않았습니다. 그래서 그들은 네트워크 시작 부분에 두 개의 별도 "안경"(초기화 레이어)을 주었습니다. 하나는 느리게 움직이는 비디오에 맞춰져 있고, 다른 하나는 빠르게 움직이는 오디오에 맞춰져 있으며, 그 후 이들을 하나의 공유된 두뇌로 병합했습니다.

압축의 마술

이 아이디어의 가장 큰 문제는 "레시피"(학습된 네트워크)가 종종 매우 크다는 점입니다. 실제로 짧은 영상의 경우, 레시피가 영상 파일 자체보다 더 클 수도 있습니다! 이를 해결하기 위해 팀은 3단계 압축 파이프라인을 사용했습니다:

  1. 스승과 제자: 먼저, 영상을 완벽하게 기억하는 크고 복잡한 "스승(Teacher)" 네트워크를 학습시켰습니다. 이 스승은 매우 컸습니다(약 9.05 MiB). 그런 다음, 지식 증류(Knowledge Distillation) 기술을 사용했습니다. 스승이 더 작고 단순한 "제자(Student)" 네트워크에게 영상을 설명한다고 상상해 보세요. 제자는 단순히 원본 영상을 배우는 것이 아니라, 스승의 답변을 흉내 내는 법을 배웁니다. 이를 통해 모델의 크기를 크게 줄였습니다.
  2. 양자화 (반올림 게임): 네트워크의 가중치는 보통 높은 정밀도(예: 32비트 숫자)로 저장됩니다. 연구진은 이 숫자들을 더 적은 비트(예: 16비트 정수)로 낮추는 실험을 했습니다. 이는 매우 정밀한 레시피인 "소금 1.000001그램 추가"를 "소금 1그램 추가"로 단순화하는 것과 같습니다. 그들은 1비트(매우 거친)부터 32비트(매우 정밀한)까지 모든 것을 테스트했습니다. 그들은 16비트에 도달했을 때 품질 향상이 멈춘다는 것을 발견했습니다. 그보다 높으면 영상이 더 좋아지지 않았지만, 그보다 낮으면 영상이 엉망이 되었습니다.
  3. 무손실 패킹: 마지막으로, 그들은 남은 데이터를 정보 손실 없이 압축하기 위해 .xz 파일 등에 사용되는 표준 압축 도구인 LZMA2를 사용했습니다.

결과: 엇갈린 성적표

팀은 여러 개의 짧은 영상을 대상으로 테스트를 진행했습니다. 결과는 다음과 같습니다:

  • 크기의 승리: 6.08 MiB 크기의 테스트 영상에 대해, 최종 압축 모델은 2.33 MiB였습니다. 이는 2.61의 압축률을 보여줍니다. 그들은 영상과 오디오를 원래 크기의 절반도 안 되는 파일로 성공적으로 압축했습니다.
  • 품질의 트레이드오프: 비디오 품질은 괜찮았지만 아주 뛰어나지는 않았습니다. 테스트한 최고의 비디오는 PSNR 28.72 dB(높을수록 좋은 품질 척도)와 SSIM 0.75를 기록했습니다. 오디오는 PSNR 24.18 dB로 무난했습니다.
  • "짧은 영상" 문제: 이것이 가장 중요한 발견입니다. 네트워크는 고정된 크기를 가지기 때문에(작동하기 위한 일정량의 "두뇌"가 필요함), 짧은 영상은 압축할 때 오히려 더 커집니다. 아주 짧은 5초짜리 클립의 경우, 압축된 파일이 원본보다 더 컸습니다. 이 방식은 고정 비용을 정당화할 만큼 영상이 충분히 길어질 때 비로소 공간을 절약하기 시작합니다.
  • 거인들과의 비교: 그들은 자신들의 방식을 업계 표준인 H.264HEVC(YouTube와 Netflix에서 사용하는 코덱)와 비교했습니다. 그 결과, 그들의 방식은 패배했습니다. 전통적인 코덱들이 훨씬 더 뛰어났으며, 종종 10배 이상의 압축률을 보였습니다. 새로운 방식은 전통적인 코덱들이 가장 낮은, 즉 가장 "거친" 품질 설정일 때만 그 품질과 대등했습니다.

왜 이것이 중요한가 (완벽하지 않더라도)

저자들은 자신들의 한계에 대해 매우 솔직합니다. 현재 이 방식이 YouTube나 Netflix를 대체할 준비가 되지 않았음을 인정합니다. 학습하는 데 너무 오래 걸리고(영상을 하나 "가르치는" 데 수천 시간의 컴퓨터 시간이 소요됨), 빠르게 움직이는 장면에 취약하기 때문입니다.

그러나 그들은 독특한 점 하나를 발견했습니다: 파일 크기가 일정하다는 것입니다. 전통적인 비디오에서는 영상의 길이가 두 배가 되면 파일 크기도 두 배가 됩니다. 하지만 이 방식에서는 일정 최소 길이를 지나면 영상이 1분인지 1시간인지에 관계없이 파일 크기가 거의 동일하게 유지됩니다. 이는 매우 긴 고해상도 콘텐츠의 경우, 이 접근 방식이 언젠가 매우 효율적일 수 있음을 시사합니다.

또한 그들은 웹 브라우저에서 실행되는 작동 가능한 프로토타입을 구축하여, 표준 웹 기술을 사용하여 이러한 "신경 비디오 레시피"를 인터넷을 통해 학습시키고, 전송하고, 재생하는 것이 가능하다는 것을 보여주었습니다.

요약하자면, 이 논문은 현재의 챔피언들을 이기는 새로운 비디오 형식을 발명한 것이 아닙니다. 대신, 비디오와 그 사운드트랙을 하나의 수학적 두뇌 안에 저장할 수 있으며, 그 두로를 파괴하지 않고도 두뇌를 사용할 수 있는 크기로 줄일 수 있다는 것을 증명했습니다. 이는 우리가 단순히 픽셀을 보내는 것이 아니라, 그것들을 상상하기 위한 지침을 보내는 미래를 향한 유망한 단계입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →