Implicit Neural Representations: A Signal Processing Perspective
이 논문은 신호 처리 관점에서 Implicit Neural Representations(INR) 의 진화를 조명하며, 이산 데이터에서 연속 함수 표현으로의 전환, 주파수 편향과 다중 스케일 표현, 그리고 의료 영상 및 3D 씬 표현 등 다양한 응용 분야에서의 활용과 향후 과제를 종합적으로 다룹니다.
이 논문은 **'임시 신경 표현 (Implicit Neural Representations, INR)'**이라는 새로운 기술을 설명합니다. 이 기술을 쉽게 이해하기 위해 기존의 방식과 새로운 방식을 **'레고 블록'**과 **'요리 레시피'**에 비유해 보겠습니다.
1. 기존 방식: 레고 블록 (Discrete Samples)
기존의 디지털 이미지, 오디오, 영상은 모두 **'레고 블록'**처럼 잘게 쪼개진 점 (픽셀) 들의 집합으로 저장됩니다.
비유: 사진을 찍으면 수백만 개의 작은 사각형 (픽셀) 이 모여 이미지를 만듭니다.
문제점: 만약 이 레고 그림을 더 크게 확대하면 (배율 조절), 블록 사이가 비어있거나 뭉개져서 깨진 것처럼 보입니다. 또한, 레고 블록이 없는 부분 (예: 사진 속의 빈 공간) 을 채우려면 임의로 블록을 끼워 넣어야 하는데, 이는 원래 그림의 자연스러운 흐름을 해칩니다. 즉, **'고정된 격자'**에 갇혀 있어 자유롭지 못합니다.
2. 새로운 방식: 요리 레시피 (Implicit Neural Representations)
이 논문이 소개하는 INR 은 레고 블록이 아니라, **'완벽한 요리 레시피'**를 저장하는 방식입니다.
비유: 요리를 할 때, 완성된 요리를 통째로 가져가는 게 아니라 "소금 1g, 설탕 2g, 10 분간 끓이기"라는 **레시피 (수학 공식)**만 가져갑니다.
장점:
무한한 해상도: 이 레시피를 보고 요리사가 어떤 그릇 (화면) 에든 요리를 만들면, 그릇이 작든 크든 (해상도가 낮든 높든) 항상 매끄럽고 완벽한 요리가 나옵니다. 픽셀이 끊기는 일이 없습니다.
자연스러운 연결: 레시피는 연속적이기 때문에, 레고처럼 뚝뚝 끊기지 않고 부드러운 곡선과 디테일을 완벽하게 표현할 수 있습니다.
3. 이 기술의 핵심 원리 (신호 처리 관점)
논문은 이 기술이 단순히 "컴퓨터가 그림을 그리는 것"을 넘어, **'신호 처리 (Signal Processing)'**의 관점에서 어떻게 작동하는지 설명합니다.
주파수 문제 (Spectral Bias):
일반적인 인공지능은 처음엔 큰 덩어리 (저주파, 예: 얼굴의 윤곽) 를 잘 배우지만, 세부적인 주름이나 질감 (고주파) 을 배우는 데 시간이 걸립니다. 마치 큰 그림을 먼저 그리고 나중에 디테일을 채우는 것과 같습니다.
해결책: 논문은 인공지능이 고주파 (세부 사항) 를 잘 배우도록 돕는 다양한 '요리법'을 제안합니다.
위치 인코딩 (Positional Encoding): 레시피에 "이 부분은 아주 빠르게 변하는 맛을 내야 해"라고 미리 알려주는 것입니다.
주기적 활성화 함수 (SIREN 등): 레시피의 기본 재료를 '진동하는 파동'으로 바꿔서, 미세한 떨림까지 자연스럽게 표현하게 합니다.
국소적 파동 (Wavelets): 전체를 다 보는 게 아니라, "이 부분만 집중해서 자세히 보자"는 식으로 영역을 나누어 처리합니다.
4. 어디에 쓰일까요? (실생활 예시)
의료 영상 (MRI 등):
상황: MRI 는 몸속을 스캔할 때 모든 점을 다 찍지 않고 일부만 찍습니다 (불완전한 데이터).
INR 활용: 찍지 않은 부분도 '레시피'를 통해 자연스럽게 채워 넣을 수 있어, 흐릿한 MRI 를 선명하고 연속적인 3D 이미지로 복원할 수 있습니다.
레이더 및 3D 스캔:
상황: 레이더는 물체의 표면만 감지할 뿐, 속을 다 볼 수 없습니다.
INR 활용: 찍힌 점들만 있는 게 아니라, 그 점들이 이어진 '매끄러운 표면'을 추론해내어 물체의 정확한 모양을 재구성합니다.
데이터 압축 (이미지/영상):
상황: 고화질 영상을 보내려면 파일이 너무 큽니다.
INR 활용: 영상 파일 전체를 보내는 대신, 그 영상을 만들어내는 **'작은 레시피 (신경망 가중치)'**만 보내면 됩니다. 수신측은 이 레시피로 원하는 크기로 영상을 다시 그릴 수 있어, 압축 효율이 매우 높습니다.
3D 게임 및 영화 (NeRF):
상황: 3D 장면을 여러 각도에서 보여주고 싶을 때, 기존에는 수많은 3D 모델을 만들어야 했습니다.
INR 활용: 한 장의 사진만 보고도 "이 공간의 3D 레시피"를 만들어냅니다. 그 후, 카메라를 어디로 돌리든 (새로운 시점) 레시피대로 매끄러운 장면을 실시간으로 그려냅니다.
5. 결론: 왜 중요한가요?
이 논문은 INR 이 단순히 "더 좋은 AI"가 아니라, 디지털 세상을 '이산적인 점 (레고)'에서 '연속적인 흐름 (레시피)'으로 바꾸는 패러다임의 전환이라고 말합니다.
기존: "이 픽셀은 빨간색, 저 픽셀은 파란색" (고정됨, 확장 불가)
INR: "이 좌표에서는 빨간색, 저 좌표에서는 파란색" (유연함, 무한 확장 가능)
결국, 이 기술은 자연스러운 연속성을 디지털 세계에 되찾아주며, 의료, 로봇, 엔터테인먼트 등 다양한 분야에서 더 정밀하고 효율적인 해결책을 제시합니다.
1. 문제 정의 (Problem)
기존의 신호 처리 및 컴퓨터 비전 시스템은 이미지를 픽셀 격자, 오디오를 샘플링된 파형, 비디오를 프레임 시퀀스 등 이산적인 (discrete) 샘플로 표현합니다. 이러한 이산적 접근법은 저장, 압축, 전송에 탁월하지만, 다음과 같은 본질적인 한계가 있습니다.
연속성의 부재: 보간 (Interpolation), 초해상도 (Super-resolution), 기하학적 왜곡, 역문제 복원 등 많은 작업은 본질적으로 연속적인 영역에서 이루어져야 하지만, 기존 방법은 이산화된 후 외부 커널이나 정규화 모델을 통해 연속성을 부여합니다.
고정된 격자의 제약: 신호 표현이 특정 샘플링 격자에 종속되어 있어, 해상도 변경이나 비균일 샘플링 시 유연성이 떨어집니다.
미분 가능성의 한계: 이산적 표현에서는 미분 연산자가 근사적으로만 계산 가능하여 물리 법칙이나 기하학적 제약 조건을 직접적으로 모델링하기 어렵습니다.
2. 방법론 (Methodology)
이 논문은 INR 을 신경망으로 매개변수화된 연속 함수로 정의하며, 이를 신호 처리의 핵심 개념인 주파수, 샘플링, 다중 해상도 관점에서 해석합니다.
가. 기본 프레임워크
연속 함수 모델링: 신호 s를 fθ:Ω⊂Rd→Rc 형태의 신경망으로 표현합니다. 여기서 θ는 가중치이며, 임의의 좌표 x에 대해 fθ(x)를 계산하여 신호 값을 얻습니다.
학습 목표: 관측된 이산 샘플 {(xi,yi)}로부터 연속 함수 fθ를 학습하여, 훈련에 사용되지 않은 좌표에서도 신호를 정확하게 복원하도록 합니다. 이는 고전적인 근사 이론에서 고정된 기저 (basis) 를 사용하는 대신, 학습된 비선형 함수 공간을 사용하는 것과 유사합니다.
나. 주파수 편이 (Spectral Bias) 및 해결 전략
신경망은 저주파 성분을 먼저 학습하고 고주파 성분을 늦게 학습하는 주파수 편이 (Spectral Bias) 현상을 보입니다. 이를 해결하기 위한 다양한 접근법이 논의됩니다.
좌표 인코딩 (Positional Encoding): 입력 좌표를 고차원 공간으로 매핑하여 (예: Random Fourier Features), 고주파 성분을 명시적으로 입력에 포함시킵니다.
주기적 활성화 함수 (Periodic Activations): SIREN 은 sin 함수를 활성화 함수로 사용하여 고주파 진동을 자연스럽게 표현하고, 미분 가능성을 유지합니다.
국소화된 진동 (Localized Oscillations): WIRE 는 가우스 윈도우로 감싸진 복소 Gabor 웨이블릿을 활성화 함수로 사용하여, 주파수 표현력과 공간적 국소성을 동시에 확보합니다.
적응형 주파수 모델링: FINER 는 활성화 함수의 주기가 입력에 따라 변하도록 하여, 신호의 다양한 스케일에 적응하도록 합니다.
가중치 재매개변수화 (Weight Reparameterization): Fourier Reparameterized Training 은 가중치를 고정된 푸리에 기저와 학습 가능한 계수의 곱으로 표현하여 고주파 학습을 용이하게 합니다.
신호 매칭 활성화 (Signal-Matched Activations): MIRE 는 신호 특성에 따라 각 층에서 다른 활성화 함수를 선택하거나 학습합니다.
다. 구조화된 표현 (Structured Representations)
다중 해상도 및 계층적 구조: MINER 는 라플라시안 피라미드를 활용하여 coarse-to-fine 방식으로 잔차 (residual) 를 학습합니다.
공간적 적응성: ACORN 은 쿼드트리/옥트리를 사용하여 공간적 복잡도에 따라 블록 크기를 동적으로 조정합니다.
Instant-NGP: 다중 해상도 격자 인코딩과 해시 테이블을 결합하여 대규모 3D 씬을 효율적으로 표현합니다.
라. 다양한 신호 모달리티 적용
오디오: 고주파 및 위상 민감도 요구로 인해 SIREN 과 같은 주기적 활성화가 효과적입니다.
비디오: NeRV 는 좌표 기반 쿼리가 아닌 프레임 단위 생성 (Generator) 방식으로 전환하여 시간적 중복성을 효율적으로 처리합니다.
초분광 이미징: 공간 좌표와 파장 좌표를 모두 입력으로 받아 연속적인 스펙트럼을 복원합니다.
3D 기하학: Occupancy Field, Signed Distance Function (SDF), Unsigned Distance Function (UDF) 등을 통해 연속적인 표면과 부피를 표현합니다.
3. 주요 기여 (Key Contributions)
신호 처리 관점의 통합적 프레임워크: INR 을 단순한 딥러닝 기법이 아닌, 연속 신호 모델로 재정의하고, 고전적인 샘플링 이론, 근사 이론, 조화 분석과 연결하여 이론적 토대를 마련했습니다.
주파수 편이 현상에 대한 체계적 분석: INR 의 성능을 결정짓는 핵심 요소인 주파수 편이를 해결하기 위한 다양한 아키텍처적 진보 (SIREN, WIRE, FINER 등) 를 주파수 관점에서 분류하고 분석했습니다.
미분 가능성과 물리 기반 모델링: INR 이 자동 미분을 통해 기울기, 라플라시안 등 미분 연산자를 정확하게 계산할 수 있음을 강조하여, 물리 법칙을 따르는 역문제 (Medical Imaging, Radar 등) 해결에 적합함을 보였습니다.
압축 및 표현의 새로운 패러다임: INR 을 "연속 디코더"로 간주하여, 가중치 자체를 압축하거나 메타러닝/하이퍼네트워크를 통해 신호를 빠르게 적응시키는 새로운 압축 및 표현 전략을 제시했습니다.
4. 결과 및 응용 (Results & Applications)
논문은 INR 이 다양한 하위 작업에서 뛰어난 성능을 보임을 입증합니다.
의료 영상 및 레이더: MRI, SAR(합성개구레이더) 등의 희소하고 노이즈가 많은 데이터에서 연속적인 신호 복원 및 기하학적 제약 조건 통합이 가능해져, 기존 이산적 방법보다 정확한 재구성을 달성합니다.
압축 (Compression): COIN, COIN++ 등은 INR 가중치를 전송하여 임의의 해상도에서 신호를 복원할 수 있게 하며, 기존 블록 기반 압축 (JPEG 등) 보다 유연한 표현을 제공합니다.
신경 방사선장 (NeRF): 3D 씬을 연속 함수로 표현하여 새로운 뷰에서의 합성 (Novel View Synthesis) 을 가능하게 하며, 기하학과 외관을 동시에 모델링합니다.
분류 및 품질 평가 (IQA): INR 의 가중치나 내부 활성화 패턴을 특징으로 사용하여 이미지 분류 및 왜곡 정도를 평가하는 새로운 접근법을 제시합니다.
5. 의의 및 시사점 (Significance)
패러다임의 전환: 신호 처리의 핵심이 "이산 샘플의 저장"에서 "연속 함수의 학습"으로 이동하고 있음을 보여줍니다.
이론과 실용의 결합: INR 의 성능 향상이 단순한 경험적 시행착오가 아니라, 신호의 스펙트럼 특성과 근사 공간 설계에 대한 깊은 이해를 바탕으로 이루어지고 있음을 규명했습니다.
미래 방향성: INR 은 단순한 표현 도구를 넘어, 물리 법칙, 불확실성 추정, 그리고 의사결정 (로보틱스, 자율주행 등) 을 위한 통합된 계산 프레임워크로 발전할 잠재력을 가집니다.
결론적으로, 이 논문은 INR 이 현대 신호 처리의 연속적인 확장이자, 데이터의 구조에 적응하는 학습된 연속 신호 모델로서 그 중요성을 강조하며, 향후 연구 방향을 이론적 엄밀성과 확장성, 물리 기반 통합을 향해 제시합니다.