← 최신 논문
💻 computer science

NAE-VC: Neural Arithmetic Encoding as a Learned Replacement for CABAC in Modern Video Codecs

NAE-VC는 기존 비디오 코딩 표준과의 완전한 호환성을 유지하면서도 상당한 비트레이트 절감을 달성하기 위해 컨텍스트 집계, 가우시안 혼합 모델링, 하이퍼프라이어를 결합한 신경망 구조를 통해 H.264, H.265, H.266 코덱의 표준 CABAC 엔진을 대체하는 모듈형 학습 엔트로피 코딩 프레임워크이다.

원저자: Reka Sandaruwan Gallena Watthage, Anil Fernando

게시일 2026-07-17
📖 5 분 읽기🧠 심층 분석

원저자: Reka Sandaruwan Gallena Watthage, Anil Fernando

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 전 세계에 있는 친구에게 거대한 고화질 영화를 보내려고 한다고 상상해 보세요. 인터넷을 막히지 않게 하면서 이 일을 가능하게 하려면, 파일을 최대한 작게 줄여야 합니다. 이 과정을 **비디오 압축(video compression)**이라고 합니다. 이것은 여행을 위해 캐리어를 싸는 것과 같습니다. 물건들을 그냥 무작ful하게 던져 넣는 것이 아니라, 옷을 꽉 조여 접고 배치하여 낭비되는 공간이 없도록 하는 스마트한 시스템이 필요합니다.

비디오의 세계에서, 이 "스로직한 패킹 시스템"에는 **엔트로피 코딩(entropy coding)**이라는 매우 중요한 마지막 단계가 있습니다. 이는 컴퓨터가 데이터를 정확히 어떻게 1과 0의 스트림으로 기록할지 결정하는 최종 단계입니다. 수십 년 동안 업계에서는 CABAC(문맥 기반 적응형 이진 산술 부호화)라고 불리는 특정된 수작업 방식을 사용해 왔습니다. CABAC을 책을 정리하는 방법이 적힌 거대한 규칙책을 암기하고 있는, 매우 경험이 풍부하지만 다소 경직된 사서라고 생각할 수 있습니다. 그것은 훌륭하지만, 정해진 규칙을 따르며 데이터의 특이하거나 새로운 패턴에 쉽게 적응하지 못합니다. 반면, 신경망(뇌처럼 학습하는 컴퓨터 시스템)이라는 새로운 물결은 훨씬 더 나은 패턴 예측 능력을 보여주었지만, 대개는 비디오 시스템 전체를 처음부터 교체해야 합니다. 이는 도서관의 사서만 바꾸기 위해 도서관 전체를 다시 짓는 것과 같습니다.

이 논문은 NAE-VC라는 영리한 절충안을 소개합니다. 연구진들은 전체 비디오 시스템을 허물어뜨리는 대신, 기존의 규칙에 얽매인 사서(CABAC)를 교체할 수 있는 "신경망 사서"를 구축하여 나머지 비디오 시스템의 모든 부분을 그대로 유지했습니다. 그들은 이 새로운 시스템을 세 세대의 비디오 표준(H.264, H.265, H.266)에 대해 테스트했으며, 이 새로운 방식이 기존의 방식보다 일관되게 파일 크기를 더 줄인다는 것을 발견했습니다. 이는 인간이 만든 최고의 규칙이라 할지라도, 학습하는 컴퓨터가 운전대를 잡게 되면 개선의 여지가 있다는 것을 증명합니다.

문제점: 경직된 사서

수년 동안 비디오 코덱(비디오를 압축하는 소프트웨어)은 최종 패킹을 수행하기 위해 CABAC에 의존해 왔습니다. CABAC은 거대한 수기 규칙집을 암기한 사서와 같습니다. 새로운 데이터가 도착하면, 사서는 그 데이터가 다음에 나타날 확률이 얼마나 되는지 추측하기 위해 책의 특정 인덱스를 확인합니다. 데이터가 흔하다면 짧은 코드로 기록하고, 드물다면 더 긴 코드를 사용합니다.

문제는 이 규칙집이 고정되어 있다는 점입니다. 이것은 몇 년 전 인간에 의해 설계되었으며, 시청 중인 특정 영화에 따라 변할 수 없습니다. 또한 복잡한 데이터를 단순한 "예/아니오"(이진) 질문으로 분해하는데, 이는 실제 비디오에서 발견되는 풍부하고 복잡한 패턴을 손실시킵니다. 이는 마치 전체 붓터치를 이해하기보다는, 한 픽셀씩 "이것은 빨간색인가?" 또는 "파란색인가?"라는 질문만 던져서 복잡한 그림을 설명하려는 것과 같습니다.

해결책: 학습하는 사서

연구진은 NAE-VC(비디오 압축을 위한 신경 산술 인코딩)를 제안했습니다. 그 경직된 사서를 똑똑한 AI 비서로 교체한다고 상상해 보세요. 이 비서는 단순히 규칙을 찾아보는 것이 아니라, 전체 그림을 봅니다.

AI 비서는 데이터를 어떻게 패킹할지 결정하기 전에 세 가지 특별한 방식으로 단서를 수집합니다:

  1. 공간적 문맥(Spatial Context): 주변을 살핍니다. 옆 방에 무엇이 있는지 현재 방을 보고 알 수 있듯이, AI는 현재 픽셀 주변의 픽셀을 보고 다음에 무엇이 올지 예측합니다.
  2. 채널 문맥(Channel Context): 주파수를 살핍니다. 비디오 데이터에는 다양한 세부 사항의 "층"(음악의 저음과 고음 같은)이 있습니다. AI는 이러한 층들이 서로 어떻게 연관되어 있는지 이해합니다.
  3. 시간적 문맥(Temporal Context): 과거를 살핍니다. 공이 움직이는 영상을 보고 있다면, AI는 다음 프레임에서도 공이 비슷한 위치에 있을 가능성이 높다는 것을 압니다. AI는 이 움직임을 사용하여 더 나은 예측을 합니다.

AI는 **멀티 헤드 크로스 어텐션(multi-head cross-attention)**이라는 기술을 사용하여 이 모든 단서를 결합합니다(이는 네 명의 전문가가 회의를 하며 각자 다른 종류의 단서에 집중한 뒤, 최선의 예측에 투표하는 것과 같습니다). 단순히 "예 또는 아니오"를 추측하는 대신, AI는 **가우시안 혼합 모델(Gaussian Mixture Model)**을 예측합니다. 쉬운 말로, AI는 단 하나의 숫자만을 추측하는 것이 아니라, 데이터가 몇 가지 방식으로 클러스터링될 수 있음을 이해하며 전체적인 가능성의 구름을 예측합니다. 이를 통해 데이터를 훨씬 더 촘촘하게 패킹할 수 있습니다.

결과: 비트 줄이기

연구진은 이 새로운 "신경망 사서"를 세 가지 비디오 표준인 H.264, H.265, H.266의 참조 소프트웨어에 교체하여 테스트했습니다. 새로운 사서가 정말 더 나은지 확인하기 위해 다른 모든 부분은 똑같이 유지했습니다.

결과는 전반적으로 일관되었습니다:

  • H.264 (가장 오래된 표준): 새로운 시스템은 "All-Intra" 모드(모든 프레임이 독립적인 모드)에서 파일 크기를 약 4.82% 절감했고, "Low-Delay" 모드(프레임 간 의존성이 있는 모드)에서는 6.15% 절감했습니다.
  • H.265 (중간 단계 표준): 3.67%(All-Intra) 및 4.93%(Low-Delay)를 절감했습니다.
  • H.266 (가장 최신의, 가장 발전된 표준): 이 표준은 이미 매우 정교한 시스템을 갖추고 있음에도 불구하고, 새로운 AI는 여전히 2.41%(All-Intra)와 3.28%(Low-Delay)를 절감해 냈습니다.

논문은 명확한 패턴을 제시합니다: 원래 시스템이 더 발전될수록 개선할 여지는 줄어듭니다. 가장 오래되고 단순한 H.264가 AI가 개선할 수 있는 가장 많은 "여유 공간"을 가지고 있었습니다. 그러나 AI가 최신 기술인 H.266을 2% 이상 개선했다는 사실은 매우 중요합니다. 이는 인간이 아무리 잘 설계된 규칙집을 만들더라도, 학습하는 시스템은 인간이 놓친 패턴을 찾아낼 수 있음을 시사합니다.

이것이 의미하는 바

이 연구는 더 나은 압축을 위해 비디오 시스템 전체를 버릴 필요가 없다는 것을 보여줍니다. "패킹" 부분만을 스마트한 학습형 AI로 정밀하게 교체할 수 있습니다.

연구진은 또한 이것이 영상 품질에 미치는 영향도 확인했습니다. 절감 효과는 단순히 수학적인 트릭이 아니었습니다. 영상은 인간의 눈에 실제로 더 좋아 보였습니다(VMAF 및 MS-SSIM과 같은 지표로 측정됨). AI는 영상이 날카롭고 자연스럽게 보이게 만드는 중요한 디테일을 보존하는 데 더 뛰어났습니다.

한 가지 흥ered로운 발견은, 새로운 시스템이 움직임이 있는 장면(스포츠 경기나 영화 등)에서 가장 잘 작동한다는 것입니다. 왜냐하면 "시간적 문맥"(과거를 보는 것)을 사용하여 더 똑똑한 추측을 할 수 있기 때문입니다. 정적인 장면에서는 개선 폭이 작지만, 여전히 개선 효과는 존재합니다.

주의할 점

이러한 추가적인 똑똑함에는 비용이 따릅니다. 새로운 시스템은 실행하는 데 더 많은 컴퓨터 자원을 필요로 합니다. 오래된 H.264 표준의 경우, 인코딩 시간(영상을 압축하는 데 걸리는 시간)이 약 4배 증가했습니다. 이미 복잡한 최신 H.266의 경우, 시간 증가폭은 약 **15%**에 불과했습니다. 이는 이 기술이 현대의 고성능 비디오 시스템(컴퓨터가 이미 열심히 작동하고 있는 환경)이나, 속도보다 저장 공간 절약이 더 중요한 클라우드 서버에서 가장 실용적임을 시사합니다.

요약하자면, 이 논문은 비디오 압축의 마지막 단계를 학습형 AI로 교체함으로써, 차세대 비디오 기술이 나올 때까지 기다리지 않고도 기존 비디오 표준에서 더 높은 효율성을 끌어낼 수 있음을 입증합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →