Design Rules for Extreme-Edge Scientific Computing on AI Engines
이 논문은 극단적 엣지 과학 컴퓨팅을 위한 AI 엔진과 프로그래머블 로직 간의 최적 구현 방안을 규명하기 위해 체계적인 아키텍처 분석과 지연 시간 조정 자원 동등성 (LARE) 지표를 제시하고, 이를 통해 프로그래머블 로직으로는 수용 불가능한 대규모 신경망의 성공적인 AI 엔진 배포를 입증합니다.
원저자:Zhenghua Ma, G Abarajithan, Dimitrios Danopoulos, Olivia Weng, Francesco Restuccia, Ryan Kastner
과학자들 (예: CERN 의 입자 가속기 연구진) 은 매초 수조 개의 데이터를 쏟아냅니다. 이 중 진짜 중요한 '보석' 같은 데이터만 골라내야 하는데, 이 과정은 **40MHz(1 초에 4000 만 번)**라는 엄청난 속도로 일어나야 합니다.
문제: 이 속도로 데이터를 처리하려면, 모든 계산 도구 (모델의 무게) 를 칩 내부에 꽉 채워야 합니다. 외부에서 가져오면 너무 느려서 폭풍을 따라잡을 수 없기 때문입니다.
기존 방식 (PL): 지금까지는 'programmable logic (PL)'이라는 만능 공방을 썼습니다. 여기서는 작업자 (회로) 가 데이터마다 딱 맞게 일을 합니다. 작은 작업에는 아주 훌륭하지만, 작업량이 늘어나면 공방이 꽉 차서 작업자들이 서로 부딪히거나, 같은 도구를 여러 사람이 번갈아 써야 해서 속도가 급격히 느려집니다.
🚀 2. 새로운 대안: AI 엔진 (AIE) 이란?
이제 새로운 대안인 **AI 엔진 (AIE)**이 등장했습니다. 이는 수천 명의 전문 요리사들이 줄지어 서 있는 거대한 공장과 같습니다.
특징: 각 요리사 (프로세서) 가 매우 빠르고, 재료를 바로 옆에서 받아서 요리합니다.
장점: 공방 (PL) 이 꽉 차서 일을 못 할 때, 이 공장 (AIE) 은 훨씬 더 많은 일을 처리할 수 있습니다.
단점: 하지만 이 공장은 **규칙적인 일 (예: 행렬 곱셈)**만 잘합니다. 그리고 요리사들이 서로 어떻게 재료를 주고받는지 (데이터 흐름) 를 설계자가 직접 정해주지 않으면, 요리사들이 빈손으로 서 있거나 재료가 막혀서 비효율적이 될 수 있습니다.
🤔 3. 핵심 질문: 언제 공방 (PL) 을 쓰고 언제 공장 (AIE) 을 써야 할까?
연구진은 두 가지 큰 질문을 던졌습니다.
언제 (When): 작은 작업은 공방이 빠르지만, 언제부터 공장이 더 나을까?
어떻게 (How): 공장을 쓸 때, 요리사들을 어떻게 배치해야 가장 빨리 요리할 수 있을까?
📏 4. 해결책 1: 'LARE'라는 저울 (언제 쓸까?)
연구진은 **LARE(Latency-Adjusted Resource Equivalence)**라는 새로운 **'저울'**을 만들었습니다.
비유: "이 일을 공방에서 할 때, 도구를 몇 번이나 돌려 써야 (Reuse) AIE 공장 속도와 같아질까?"를 계산하는 것입니다.
결과:
작은 작업: 공방이 도구를 한 번만 써도 되므로 공방이 더 빠릅니다.
큰 작업: 공방은 도구를 수십 번 돌려 써야 하므로 속도가 느려집니다. 이때는 AIE 공장이 압도적으로 빠릅니다.
이 저울을 통해 과학자들은 "내 작업 크기가 이 선을 넘으면 AIE 를 써라"라고 명확하게 판단할 수 있게 되었습니다.
🧩 5. 해결책 2: 요리사 배치법 (어떻게 쓸까?)
AIE 공장을 쓸 때, 단순히 요리사들을 줄 세우는 것만으로는 부족했습니다. 연구진은 최적의 배치 규칙을 찾아냈습니다.
규칙 1 (작은 조각으로 나누기): 요리사 한 명이 한 번에 처리할 수 있는 재료의 양을 딱 맞춰야 합니다. 너무 적으면 요리사가 놀고, 너무 많으면 재료가 막힙니다.
규칙 2 (가로 vs 세로): 공장은 가로로 넓게 늘리는 것이 좋습니다. (세로로 늘리면 재료가 이동하는 길이 길어져서 느려집니다.)
규칙 3 (너무 많이 늘리지 않기): 요리사를 너무 많이 늘리면 오히려 재료가 이동하는 데 시간이 걸려서 속도가 떨어집니다. "적당히"가 핵심입니다.
규칙 4 (공방과 공장 사이 이동 비용): 공방과 공장 사이를 오가는 것에는 약 4% 의 시간 손실이 발생합니다. 그래서 불필요하게 두 곳 사이를 오가게 하면 안 됩니다.
🏆 6. 결론: 과학의 새로운 지평
이 연구 덕분에, 예전에는 공방 (PL) 에서는 절대 처리할 수 없었던 거대한 모델들 (VAE, 양자 비트 판독기 등) 이 이제 AIE 공장에서 40MHz라는 초고속 요구사항을 충족하며 작동하게 되었습니다.
한 줄 요약:
"작은 일은 만능 공방 (PL) 이 빠르지만, 일이 커지면 전문 공장 (AIE) 이 더 빠릅니다. 다만 공장을 쓸 때는 요리사 (프로세서) 들을 가로로 넓게 배치하고 불필요한 이동을 줄이는 규칙을 따르면, 과학자들은 이제 상상했던 것보다 훨씬 더 큰 데이터를 실시간으로 분석할 수 있게 되었습니다."
이 논문은 과학자들이 **"어떤 하드웨어를 언제, 어떻게 써야 최고의 성능을 낼지"**에 대한 명확한 지도를 그려준 것입니다.
이 논문은 극한 엣지 (Extreme-Edge) 과학 컴퓨팅 환경, 특히 고에너지 물리학 (예: CERN 의 LHC) 과 같은 실시간 센서 데이터 처리 분야에서 **AI 엔진 (AIE, AI Engine)**과 프로그래머블 로직 (PL, Programmable Logic) 중 언제, 어떻게 신경망 (NN) 을 구현해야 하는지에 대한 설계 규칙을 제시합니다.
주요 내용은 다음과 같습니다.
1. 문제 정의 (Problem)
극한 엣지 과학 컴퓨팅의 요구사항: 초당 수천만 개의 이벤트 (예: LHC 의 40 MHz) 를 처리해야 하며, 마이크로초 단위의 지연 시간 (latency) 과 높은 처리량 (throughput) 이 요구됩니다. 이를 위해 모든 모델 가중치는 온칩 (on-chip) 에 상주해야 하며, 배치 크기 (batch size) 는 매우 작아야 합니다.
기존 PL 구현의 한계: HLS4ML 과 같은 도구를 사용한 공간적 데이터 흐름 (spatial dataflow) 아키텍처는 작은 네트워크에서는 효과적이지만, 모델 크기가 커지면 FPGA 의 PL 자원이 빠르게 고갈됩니다. 이를 해결하기 위해 연산 유닛의 재사용 (reuse) 을 증가시키면 성능이 급격히 저하되고, 합성 도구의 실행 시간이 길어지거나 실패하는 문제가 발생합니다.
AIE 의 잠재력과 불확실성: 현대 FPGA SoC 에 포함된 AIE 는 높은 연산 밀도와 추가 온칩 메모리를 제공하지만, PL 과는 근본적으로 다른 아키텍처와 프로그래밍 모델을 가집니다. 따라서 극한 엣지 과학 워크로드에 대해 AIE 가 언제 PL 을 대체해야 하며, 어떻게 최적화해야 하는지에 대한 체계적인 방법론이 부족했습니다.
2. 방법론 (Methodology)
저자들은 PL 과 AIE 간의 성능 및 자원 효율성을 체계적으로 분석하기 위해 다음과 같은 접근 방식을 취했습니다.
마이크로 벤치마킹 및 아키텍처 특성화: 단일 밀집 레이어 (dense layer) 를 대상으로 PL 의 재사용 인자 (reuse factor) 변화에 따른 성능/자원 트레이드오프와 AIE 의 성능을 비교했습니다.
지연 시간 조정 자원 동등성 (LARE) 지표 도입: AIE 구현이 PL 구현보다 우월해지는 결정 기준 (Decision Boundary) 을 정의했습니다.
LARE (Latency-Adjusted Resource Equivalence): 특정 레이어 모양에서 AIE 의 성능과 동일한 성능을 PL 이 달성하기 위해 필요한 최소한의 PL 자원량을 계산합니다.
의사결정: 가용 PL 자원이 LARE 값을 초과하면 PL 이 유리하고, 그렇지 않으면 AIE 가 유리합니다.
데이터 흐름 최적화 설계 규칙 도출: AIE 에서 저지연 과학 추론을 수행하기 위한 2 단계 틸링 (tiling) 전략을 제안했습니다.
API 레벨 틸링: 벡터 처리 유닛 (VPU) 의 효율적인 활용을 위한 최적의 API 타일 크기 결정.
공간적 (Spatial) 틸링: AIE 어레이 전체에 워크로드를 분배하는 전략 및 PL-AIE 경계 오버헤드 분석.
3. 주요 기여 및 설계 규칙 (Key Contributions & Design Rules)
A. LARE 지표
모델 크기뿐만 아니라 레이어 모양과 자원 예산에 따라 PL 과 AIE 의 교차점이 달라짐을 규명했습니다.
이 지표를 통해 특정 워크로드 크기와 자원 제약 하에서 AIE 배포가 언제 유리한지 정량적으로 판단할 수 있습니다.
B. AIE 최적화 설계 규칙 (7 가지)
API 타일 크기: 극한 엣지 과학 컴퓨팅에는 기본 API 타일 크기 **S = (4, 8, 8)**가 가장 좋은 성능과 세분화를 제공합니다.
작업 비대칭성: 고정된 워크로드 크기에서 출력 차원 (N) 이 입력 축소 차원 (K) 보다 클 때 성능이 더 좋습니다. 따라서 API 틸링 시 N 차원을 우선시해야 합니다.
공간적 틸링 방향: AIE 어레이 전체에 레이어를 분산할 때는 열 (column) 방향으로 확장하는 것이 행 (row) 방향보다 지연 시간을 줄이는 데 유리합니다.
체감 수익 (Diminishing Returns): 과도한 공간적 병렬화는 성능 향상을 가져오지 않습니다. 각 타일당 워크로드가 최소 8x16x32 정도여야 효율적입니다.
타일 수의 한계: 더 많은 컴퓨팅 타일을 사용하는 것이 항상 성능을 향상시키는 것은 아닙니다.
컬럼 고갈 (Column Exhaustion) 비용: AIE 어레이의 물리적 너비를 초과하여 레이어가 여러 밴드 (band) 로 나누어지면 메모리 리소스 경쟁으로 인해 성능이 저하됩니다. 가능한 한 단일 밴드 내에서 최대 열 수를 사용해야 합니다.
PL-AIE 경계 오버헤드: PL 과 AIE 사이를 오가는 경계 횟수가 2 회 (입력/출력) 를 초과할 때마다 약 3.9% 의 지연 시간 오버헤드가 발생합니다. 따라서 이 비용을 고려하여 하이브리드 분할을 결정해야 합니다.
4. 실험 결과 (Results)
저자들은 LHC 트리거 시스템의 40 MHz 처리량 요구사항을 충족하지 못했던 3 가지 실제 과학 워크로드 (VAE, Qubit Readout, Deep Autoencoder) 를 대상으로 실험했습니다.
PL 한계: 기존 HLS4ML 을 사용한 PL 구현은 자원 재사용을 높여야 했기 때문에 성능이 40 MHz 요구사항을 충족하지 못했습니다 (예: VAE 의 경우 20.8 MHz).
비최적 AIE: 단순 매핑 (레이어당 1 타일) 을 적용한 AIE 는 PL 과 유사하거나 약간 더 나은 성능을 보였습니다.
최적화된 AIE: 제안된 설계 규칙 (LARE 기반 선택 및 틸링 최적화) 을 적용한 결과, 성능이 최대 4 배 이상 향상되었습니다.
예: VAE 모델의 경우 20.8 MHz (PL) → **97.9 MHz (최적화 AIE)**로 향상되어 40 MHz 요구사항을 명확히 초과했습니다.
이는 기존 PL 로는 구현 불가능했던 더 큰 신경망 모델을 온칩 추론으로 성공적으로 확장할 수 있음을 입증했습니다.
5. 의의 (Significance)
과학 컴퓨팅의 새로운 지평: 극한 엣지 과학 애플리케이션에서 PL 의 자원 제약을 극복하고, 더 크고 복잡한 신경망을 온칩에서 실시간으로 실행할 수 있는 길을 열었습니다.
체계적인 의사결정 도구: 연구자와 엔지니어가 특정 워크로드와 자원 제약 하에서 PL 과 AIE 중 어떤 플랫폼을 선택해야 하는지에 대한 정량적인 지표 (LARE) 와 구체적인 설계 가이드라인을 제공합니다.
AIE 활용의 최적화: AIE 가 고처리량 배치 처리뿐만 아니라, 저지연 이벤트 기반 과학 추론에서도 효과적으로 활용될 수 있음을 입증하고, 이를 위한 구체적인 데이터 흐름 최적화 기법을 제시했습니다.
결론적으로, 이 논문은 FPGA 기반 과학 컴퓨팅에서 AIE 가 PL 의 대안이 될 수 있는 구체적인 시점과 방법을 제시하며, 극한 엣지 환경에서의 실시간 AI 추론 한계를 확장하는 중요한 기여를 했습니다.