← 최신 논문
💻 computer science

NPDO: Neural Prediction Direction Optimizer for Fast VVC Intra Coding

본 논문은 다중 스케일 특징 추출을 계층적 CNN 및 Vision Transformer 구조와 결합한 하이브리드 신경망 프레임워크인 NPDO를 제안하며, 이를 통해 VTM 23.0 대비 단 1.18%의 BD-Rate 증가만으로 VVC 인트라 예측 탐색 공간을 지능적으로 가지치기하여 인코딩 시간을 54.0% 단축한다.

원저자: Reka Sandaruwan Gallena Watthage, Anil Fernando

게시일 2026-07-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Reka Sandaruwan Gallena Watthage, Anil Fernando

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한, 혼란스러운 다락방의 물건들을 인터넷을 통해 보낼 작은 여행 가방에 담으려고 노력한다고 상상해 보세요. 다락방은 고화질 비디오 프레임을 나타내고, 여행 가방은 당신이 보내고자 하는 압축된 파일입니다. 과제는 무엇일까요? 다락방에는 물건을 접고 쌓는 67가지의 서로 다른 방법(이를 "예측 모드"라고 부릅니다)이 가득 차 있습니다. 가장 적은 공간을 차지하면서도 물건을 망가뜨리지 않고 완벽하게 짐을 싸는 방법을 찾기 위해, 표준 비디오 코더(VTM 23.0 참조 모델)는 이 67가지 방법을 하나하나 모두 시도합니다. 이는 마치 상자를 쌀 때마다 셔츠를 접는 모든 가능한 조합을 매번 다 시도하는 것과 같습니다. 효과는 있지만, 매우 느리고 많은 에너지를 소모합니다.

여기에 NPDO(Neural Prediction Direction Optimizer)가 등장합니다. 이는 최신 비디오 표준인 VVC를 위한 이 패킹 과정을 가속화하기 위해 설계된 새로운 "스마트 어시스턴트"입니다.

기존 방식의 문제점
이 논문은 67가지의 접는 방향을 모두 확인하는 전통적인 방식이, 특히 4K 비디오의 경우 실시간 사용에는 너무 느리다고 주장합니다. 이는 마치 필요한 책을 찾기 위해 단순히 가장 가능성 높은 선반만 확인하는 대신, 도서관의 모든 책을 다 읽어야 한다고 고집하는 사서와 같습니다. 저자들은 "수작업으로 만든(hand-crafted)" 규칙(단순한 수학적 트릭으로 방향을 추측하는 방식)에만 의존하거나, 단 한 종류의 컴퓨터 뇌(표준 카메라 같은 신경망 하나만 사용하는 방식)만을 사용하는 것을 명시적으로 배제했습니다. 그들은 이러한 오래된 방식들이 전체적인 그림을 놓치거나 복잡한 질감에 의해 혼란을 겪는다는 것을 발견했습니다.

NPDO 솔루션: 두 개의 뇌를 가진 탐정
모든 것을 확인하는 대신, NPDO는 "다락방"을 살펴보고 가장 잘 작동할 몇 가지 폴딩 방법(folding methods)을 즉각적으로 추측하는 초스마트 탐정 역할을 합니다. 이는 영리한 3단계 과정을 통해 수행됩니다:

  1. 멀티 스케일 스캔 (The Multi-Scale Scan): 먼저, NPDO는 "마법 렌료"인 이산 웨이브릿 변환(Discrete Wavelet Transform, DWT)을 사용하여 드론에서 본 숲과 지면에서 본 숲처럼 다양한 크기로 비디오의 질감을 관찰합니다. 또한 히스토그램을 사용하여 가장자리(나무의 윤곽선 같은)의 지도를 그립니다.
  2. 두 개의 뇌 팀 (The Two-Brain Team): 이 정보는 협력하는 두 가지 유형의 인공지능에 입력됩니다.
    • 로컬 전문가 (HCNN): 계층적 합성곱 신경망(Hierarchical Convolutional Neural Network)으로, 특정 나뭇잎 모양을 알아채는 것처럼 작고 국소적인 패턴을 포착하는 데 탁격합니다.
    • 글로벌 전문가 (ViT): 전체적인 레이아웃을 이해하기 위해 전체 그림을 보는 경량 비전 트랜스포머(Vision Transformer)입니다.
    • 이 두 뇌는 서로 대화하며 의견을 결합하여 최종 결정을 내립니다.
  3. 스마트 필터 (The Smart Filter): 마지막으로, 시스템은 비디오 영역이 얼마나 "무질서한지" 또는 복잡한지를 확인합니다. 만약 영역이 단순하다면(예: 파란 하늘), 3가지 폴딩 옵션만 확인합니다. 만약 복잡하다면(예: 북적이는 군중), 5가지를 확인합니다. 결코 67가지 옵션을 모두 확인하며 시간을 낭비하지 않습니다.

숫자가 말해주는 것
저자들은 이 방식이 실제로 작동하는지 확인하기 위해 수천 개의 비디오 시퀀스를 대상으로 광범위한 테스트를 실시했습니다. 그들은 단순히 추측한 것이 아니라, VTM 23.0 인코더와 비교하여 결과를 측정했습니다.

  • 속도: NPDO는 비디오 인코딩 시간을 54.0% 단축합니다. 즉, 두 배 이상 빠르다는 뜻입니다.
  • 품질: 트레이드오프(trade-off)는 미미합니다. 비디오 품질은 비트레이트 효율성(BD-Rate라는 지표) 측면에서 단 **1.18%**만 떨어집니다.
  • 정확도: 이 시스템은 추측하는 데 매우 뛰어납니다. 상위 5개의 폴딩 방향을 **98.1%**의 확률로 정확하게 선택합니다.
  • 효율성: 67개의 옵션을 테스트하는 대신, 블록당 평균 4.2개의 옵션만을 테스트하여 작업량을 93.7% 줄였습니다.

이것이 아닌 것 (What It's Not)
논문은 NPDO가 빠르긴 하지만, 비디오 코딩 시스템 전체를 대체하는 것이 아니라 단지 "인트라 예측(intra prediction)" 부분(주변 블록을 기반으로 블록이 어떻게 보이는지 예측하는 부분)을 가속화하는 것뿐이라고 주의를 기울입니다. 또한, 4K 비디오에서는 훌륭하게 작동하지만, 저자들은 저해상도 비디오(Class D 등)의 경우 분석할 질감 정보가 적기 때문에 속도 향상이 약간 덜 나타나지만, 여전히 기존 방식보다는 우수하다고 언급했습니다.

결론
이러한 시뮬레이션과 테스트에서, NPDO는 보물을 찾기 위해 모든 문을 확인할 필요가 없다는 것을 증명합니다. 작은 디테일과 큰 그림을 모두 보는 하이브리드 AI 팀을 사용함으로써, 무익한 추측의 대다수를 건너뛸 수 있습니다. 그 결과는 무엇일까요? 컴퓨터가 지치지 않으면서도 4K 비디오를 실시간(초당 30프레임)으로 인코딩할 수 있으며, 동시에 화질을 기존의 느린 전수 조사 방식과 거의 동일하게 유지할 수 있습니다. 이는 느리고 수동적인 패킹 작업을 번개처럼 빠른 자동화 작업으로 바꾸는 중요한 진전입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →