Real-Time and Scalable Zak-OTFS Receiver Processing on GPUs
이 논문은 지연 - 도플러 영역의 채널 희소성을 활용하여 하드웨어와 알고리즘을 공동 설계한 GPU 기반의 확장 가능한 실시간 Zak-OTFS 수신기 아키텍처를 제안함으로써, 고이동성 통신 환경에서 OFDM 대비 우수한 견고성을 유지하면서도 99.9 퍼센타일 실시간 처리 기한을 충족하는 고성능 처리를 실현합니다.
기존 통신 방식 (OFDM) 은 마치 고속도로의 차선을 나누어 차를 보내는 것과 같습니다. 차가 많고 (데이터가 많고), 바람이 세게 불거나 (기차가 빠르게 움직이거나) 도로가 울퉁불퉁하면 차들이 서로 섞이거나 길을 잃기 쉽습니다.
하지만 이 논문에서 다루는 OTFS는 차선을 나누는 대신, 모든 차를 하나의 거대한 '시간 - 주파수 지도' 위에 배치하는 방식입니다.
장점: 바람이 불거나 도로가 울퉁불퉁해도 (기차나 자동차가 빠르게 움직여도) 데이터가 잘 섞이지 않고 안정적입니다.
단점: 이 지도가 너무 커지면, 수신기가 그 지도를 해석하는 데 엄청난 계산 능력이 필요해집니다. 마치 100 만 개의 퍼즐 조각을 한 번에 맞춰야 하는 것과 같아서, 기존 컴퓨터로는 실시간으로 처리하기가 너무 버거웠습니다.
2. 문제: 너무 무거운 퍼즐을 어떻게 풀까?
OTFS 신호를 처리하려면 거대한 수학적 행렬 (숫자 표) 을 계산해야 합니다.
기존의 문제: 이 행렬이 너무 크면 (예: 16,384 x 32 크기), 컴퓨터가 계산하는 동안 데이터가 쌓여서 실시간 통신이 불가능해집니다. 마치 100 만 조각 퍼즐을 한 사람이 손으로 하나씩 맞추려다 지쳐버리는 상황입니다.
3. 해결책: GPU 와 '똑똑한 전략'의 만남
저자들은 이 문제를 해결하기 위해 **NVIDIA GPU(게임용 그래픽 카드)**를 사용했고, 여기에 세 가지 똑똑한 전략을 더했습니다.
전략 1: 미리 준비된 레시피 (컴팩트 행렬 연산)
비유: 요리를 할 때 매번 "소금 얼마나 넣지? 후추는?"을 계산하는 대신, 미리 계산해 둔 레시피 카드를 사용하는 것입니다.
설명: 통신 신호를 변환할 때 필요한 복잡한 수학 값들은 미리 계산해 두었다가, 실제 작업할 때는 그냥 가져다 쓰기만 합니다. 이렇게 하면 매번 다시 계산할 필요가 없어 속도가 비약적으로 빨라집니다.
전략 2: 빈칸을 무시하는 눈 (구조화된 희소성)
비유: 거대한 스포츠 경기장에 10 만 명의 관중이 있다고 가정해 보세요. 하지만 실제로 앉은 사람은 100 명뿐이고 나머지는 빈 자리입니다.
바보 같은 방법: 빈 자리까지 하나하나 확인하며 "누구 있나?"라고 묻는 것. (시간 낭비)
똑똑한 방법: "오직 100 명만 있는 자리만 확인하자!"라고 정하는 것.
설명: 무선 신호는 실제로는 매우 '희소 (Sparse)'합니다. 즉, 거대한 지도에서 신호가 실제로 존재하는 곳은 아주 드뭅니다. 저자들은 이 빈칸을 아예 무시하고 중요한 부분만 골라 계산하는 방식을 개발했습니다. 메모리도 훨씬 적게 쓰고, 계산 속도도 수백 배 빨라졌습니다.
전략 3: 멈추지 않는 리듬 (분기 없는 반복)
비유: GPU 는 수천 명의 군인처럼 동시에 일을 합니다. 만약 "이 사람은 멈추고, 저 사람은 계속해"라고 지시하면, 모든 군인이 멈춰서 기다려야 하므로 속도가 느려집니다.
설명: 기존 방식은 "계산이 충분해지면 멈춰라"라고 했지만, GPU 에서는 "정해진 횟수만큼만 무조건 계산해라"가 더 빠릅니다. 저자들은 미리 실험을 통해 "이 정도 횟수면 충분하다"를 찾아냈고, 멈추는 지점을 미리 정해두어 GPU 가 멈춤 없이 계속 달릴 수 있게 했습니다.
4. 결과: 얼마나 빨라졌나요?
이 모든 기술을 합쳐서 만든 시스템은 놀라운 성과를 냈습니다.
속도: 기존에는 처리하기 너무 무거웠던 거대한 데이터 (16,384 x 32 그리드) 를 2 밀리초 (0.002 초) 이내에 처리했습니다. 이는 데이터가 도착하는 속도보다 훨씬 빠릅니다.
처리량: 초당 900Mbps 이상의 데이터를 처리할 수 있게 되었습니다. (기존 5G 보다 훨씬 빠르고 안정적인 속도입니다.)
확장성: 작은 GPU(모바일용) 에서부터 거대한 서버용 GPU 까지 모두에서 잘 작동했습니다.
5. 결론: 왜 이것이 중요한가요?
이 논문은 **"복잡한 수학적 문제를 하드웨어 (GPU) 의 특성에 맞춰 똑똑하게 변형하면, 불가능해 보였던 실시간 통신이 가능해진다"**는 것을 증명했습니다.
앞으로 고속으로 움직이는 기차, 드론, 자율주행차 등에서도 통신이 끊기지 않고 매우 빠르게 이루어질 수 있는 기반을 마련한 것입니다. 마치 거대한 퍼즐을 수천 명이 동시에, 빈칸은 무시하고, 미리 준비된 레시피대로 맞추어 순식간에 완성해낸 것과 같습니다.
이 논문은 차세대 (NextG) 고이동성 통신 시스템에서 Orthogonal Time Frequency Space (OTFS) 변조 방식의 실시간 처리를 가능하게 하는 확장 가능한 GPU 기반 Zak-OTFS 수신기 아키텍처를 제안합니다. 저자들은 하드웨어와 알고리즘의 공동 설계 (Co-design) 를 통해 지연 - 도플러 (DD) 도메인의 채널 희소성을 활용하여 계산 복잡도와 메모리 오버헤드를 획기적으로 줄였습니다.
주요 내용은 다음과 같습니다.
1. 문제 정의 (Problem)
OTFS 의 복잡도 문제: OTFS 는 고이동성 채널에서 기존 OFDM 보다 우수한 강인성을 제공하지만, 지연 - 도플러 (DD) 도메인에서의 명시적 표현은 대규모 행렬 연산을 필요로 합니다. 특히 DD 그리드 크기 (M, N) 가 커질수록 신호 처리 복잡도가 기하급수적으로 증가하여 실시간 처리가 불가능해집니다.
실시간 처리의 한계: 기존 연구들은 주로 소규모 그리드 (수십수백 개) 에 국한되었거나, 프레임 단위 실시간 처리 (프레임 지속 시간 내 DSP 완료) 를 달성하지 못했습니다. 대규모 그리드 (예: M, N 이 수천수만 개) 에서 채널 추정 및 등화 (Equalization) 과정의 고차원 연산은 CPU 나 기존 GPU 구현으로는 지연 시간 (Latency) 요구 사항을 충족하기 어렵습니다.
2. 방법론 (Methodology)
저자들은 GPU 아키텍처의 특성과 Zak-OTFS 수신기의 DSP 특성을 결합한 하드웨어 - 알고리즘 공동 설계를 통해 세 가지 핵심 최적화를 수행했습니다.
압축된 행렬 연산 (Compact Matrix Operations):
Zak 변환 (DZT/IDZT) 및 채널 추정 과정에서 반복적으로 사용되는 위상 인자 (Phase factors) 를 오프라인에서 미리 계산하여 보조 행렬로 저장했습니다.
이를 통해 런타임 시 복잡한 지수 함수 계산 대신, GPU 가 최적화한 GEMM (General Matrix Multiply) 및 Hadamard 곱 연산으로 변환하여 처리 속도를 높였습니다.
구조화된 희소성 활용 (Structured Sparsity, SS):
무선 채널은 일반적으로 제한된 수의 경로 (P) 만 가지므로, DD 도메인 채널 행렬 (Hdd) 은 본질적으로 희소합니다.
저자들은 Hdd가 밀집 행렬 (Dense Matrix) 이 아니라 구조화된 희소 행렬임을 발견했습니다. 즉, MN×MN 크기의 행렬을 명시적으로 생성하지 않고, 우세한 경로 (Dominant Paths) 의 인덱스와 계수만 저장하는 구조화된 희소 (SS) 표현을 도입했습니다.
이를 통해 행렬 - 벡터 곱 (MVM) 의 계산 복잡도를 O((MN)2)에서 $O(PMN)$으로 줄였으며, 메모리 사용량도 대폭 감소시켰습니다.
분기 없는 반복 등화기 (Branchless Iterative Equalizer):
GPU 의 SIMT (Single Instruction, Multiple Threads) 아키텍처에서는 조건부 분기 (if-else) 가 성능을 저하시킵니다. 기존 CGA (Conjugate Gradient Algorithm) 의 동적 조기 종료 (Early Termination) 는 동기화 오버헤드를 유발합니다.
대신, 오프라인 프로파일링을 통해 BER (Bit Error Rate) 수렴을 기준으로 최적의 반복 횟수를 사전에 결정하고, 런타임 시 고정된 반복 횟수로 실행하는 '분기 없는 (Branchless)' 전략을 채택했습니다. 이는 파이프라인 정체를 방지하고 GPU 자원을 효율적으로 활용하게 합니다.
3. 주요 기여 (Key Contributions)
GPU 기반 Zak-OTFS 수신기 설계: 컴팩트 행렬 연산, 채널 희소성 활용, 분기 없는 등화기를 결합하여 GPU 에서 고효율 Zak-OTFS 처리를 실현했습니다.
대규모 그리드 확장성: DD 그리드 크기를 최대 **(16384, 32)**까지 확장하여 실시간 처리를 달성한 최초의 구현입니다. (기존 연구들은 대부분 수백 이하의 그리드 크기)
종합적인 평가: 다양한 하드웨어 플랫폼 (Intel Xeon CPU, NVIDIA Jetson Orin, RTX 6000 Ada, A100, H200) 과 Veh-A 채널 모델 하에서 지연 시간, 처리량, BER 성능을 광범위하게 평가했습니다.
4. 실험 결과 (Results)
실시간 처리 달성: DD 그리드 크기 (16384, 32) 에서 99.9 백분위수 (p99.9) 처리 지연 시간이 2.13 ms (프레임 2 개 분량) 이내로 유지되었습니다. 이는 실시간 처리 데드라인을 성공적으로 충족하는 것입니다.
높은 처리량 (Throughput):
16QAM 변조 및 245.76 MHz 대역폭에서 906.52 Mbps의 처리량을 달성했습니다.
QPSK 변조 시에는 491.44 Mbps를 달성했습니다.
성능 비교:
기존 LMMSE (행렬 역행렬 필요) 는 메모리 및 계산 오버헤드로 인해 실시간 처리가 불가능했습니다.
제안된 SS-CGA는 LMMSE 와 유사하거나 더 나은 BER 성능을 유지하면서도, GPU 에서 MRC 등화기보다 훨씬 확장 가능한 성능을 보였습니다.
CPU 대비 GPU 는 대규모 그리드에서 훨씬 낮은 지연 시간과 더 안정적인 분포를 보였습니다.
5. 의의 및 결론 (Significance)
이 연구는 OTFS 기술이 차세대 고이동성 통신 (NextG) 에서 실용화되기 위해 필요한 실시간 신호 처리의 병목 현상을 해결했습니다. 하드웨어 (GPU) 의 병렬 처리 능력을 알고리즘 (채널 희소성, 고정 반복 등화) 과 깊이 연계한 설계는 대규모 DD 그리드를 가진 OTFS 시스템을 상용화할 수 있는 길을 열었습니다. 특히, 메모리 대역폭과 계산 능력을 극대화하여 수천~수만 개의 그리드 크기를 실시간으로 처리할 수 있음을 입증함으로써, 고속 이동 환경 (고속철도, 항공 등) 에서의 OTFS 적용 가능성을 크게 높였습니다.