← 최신 논문
⚡ electrical engineering

Precision-Aware Variable Bit Processing Elements for Hardware-Efficient Systolic Array Designs

본 논문은 FP32, TF32 및 BF16 형식 전반에 걸쳐 유사한 CNN 정확도를 유지하면서 면적, 전력 및 지연(각각 최대 92%, 93%, 54%)을 대폭 절감하기 위해 열(column) 절단 및 컴프레서 통합을 적용한 NSGA-II 최적화 근사 부동 소수점 곱셈기를 활용하는 하드웨어 효율적인 시스톨릭 어레이 설계를 제안한다.

원저자: Dantu Nandini Devi, Madhav Rao

게시일 2026-08-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Dantu Nandini Devi, Madhav Rao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 사회에서 우리의 디지털 기기들은 사진 속 얼굴을 인식하거나, 언어를 번역하거나, 교통 상황을 탐색하기 위해 방대한 양의 계산을 끊임없이 수행하고 있습니다. 이러한 작업의 핵심에는 이미지와 데이터에 담긴 복잡한 패턴을 처리하는 데 필수적인 곱셈이라는 특정 유형의 수학적 연산이 자리 잡고 있습니다. 수십 년 동안 엔지니어들은 종이에 적힌 숫자처럼 모든 자릿수를 정확하게 계산하도록 이 곱셈을 수행하는 컴퓨터 칩을 구축해 왔습니다. 이러한 방식은 정확성을 보장하지만, 대가가 따릅니다. 즉, 완벽한 정밀도를 유지하기 위해 필요한 회로가 크고, 많은 전력을 소비하며, 열을 발생시킨다는 점입니다. 더 빠르고 강력한 컴퓨팅에 대한 우리의 요구가 커짐에 따라, 이러한 회로를 더 작게 만드는 물리적 한계에 도달하고 있으며, 이는 미래 기술의 병목 현상을 초0으로 만들고 있습니다.

이 문제를 해결하기 위해 약간의 통제된 오차를 수용하는 대신 엄청난 속도와 효율성을 얻는다는 다른 철학이 등장했습니다. 근사 컴퓨팅(approximate computing)이라고 알려진 이 개념은 사진 속 고양이를 식별하거나 비디오 파일을 압축하는 것과 같은 많은 실제 작업에서, 인간의 눈과 뇌가 약간 부정확한 수학으로 인해 발생하는 미세한 차이를 감지할 수 없다는 아이디어에 기반합니다. 만약 컴퓨터가 계산의 가장 어려운 부분을 건너뛸 수 있다면, 훨씬 적은 전력을 사용하면서도 훨씬 빠르게 작업을 마칠 수 있습니다. 연구자들의 과제는 최종 결과물을 망치지 않으면서 정확히 어느 정도의 정밀도를 희생할 수 있는지 알아내는 것이었으며, 이는 가능한 설계 선택지들의 광활한 지형을 탐색해야 하는 균형 잡기 과정이었습니다.

한 연구팀은 이러한 오차 허용 작업에 특화된 새로운 종류의 하드웨어 가속기를 설계함으로써 이 과제에 도전했습니다. 그들은 시스톨릭 어레이(systolic array)라고 불리는 구조에 집중했는데, 이는 마치 파도처럼 데이터를 서로 전달하며 행렬 곱셈을 효율적으로 수행하는 작은 프로세싱 단위들의 격자 구조입니다. 연구자들은 이 격자에서 가장 에너지를 많이 소비하는 부분이 각 단위 내부의 곱셈기라는 점을 깨달았습니다. 모든 곱셈기를 완벽하게 만드는 대신, 그들은 전략적으로 결함이 있는 '불완전한' 곱셈기를 만드는 방법을 개발했습니다. 계산 중에 숫자의 덜 중요한 비트를 의도적으로 버리고, 작은 반대되는 오차를 도입하는 특수 회로를 사용함으로써, 그들은 실수가 서로 상쇄되는 시스템을 만들어냈습니다. 이를 통해 하드웨어는 놀라운 효율성을 유지하면서도 실용적인 용도로 충분히 정확한 결과를 생성할 수 있게 되었습니다.

속도와 정확도 사이의 완벽한 균형을 찾기 위해 연구진은 추측에 의존하지 않았습니다. 그들은 자연의 진화 과정을 모방한 강력한 탐색 알고리즘을 사용하여 수백만 가지의 가능한 설계 구성을 탐색했습니다. 이 불완전한 곱셈기를 만드는 모든 가능한 방법이 담긴 거대한 도서관을 상상해 보십시오. 알고-리즘은 체계적으로 조합을 테스트하여, 최상의 절충안을 제공하는 설계는 유지하고 너무 부정확하거나 효율성이 떨어지는 설계는 폐기했습니다. 그들은 과학 계산에 사용되는 고정밀 형식부터 인공지능을 위해 특별히 설계된 더 압축된 형식에 이르기까지, 숫자를 처리하는 세 가지 서로 다른 표준 포맷에 걸쳐 이 설계들을 테스트했습니다. 목표는 작업의 특정 요구 사항에 맞춰 불완전함의 수준을 맞춤화할 수 있는지 확인하는 것이었습니다.

이러한 탐색의 결과는 놀라웠습니다. 연구진이 최적화된 불완전한 설계를 사진의 노이즈를 제거하거나 저장용으로 이미지를 압축하는 것과 같은 이미지 처리 작업에 적용했을 때, 하드웨어는 현저히 작아지고 빨라졌습니다. 어떤 경우에는 새로운 설계가 기존의 완벽하게 정밀한 버전과 비교했을 때 칩의 물리적 크기를 최대 92% 줄이고 전력 소비를 93%까지 절감했습니다. 놀랍게도, 이러한 막대한 절감 효과는 가시적인 품질의 저하를 초래하지 않았습니다. 근사 하드웨어로 생성된 이미지는 높은 수준의 시각적 충실도를 유지하며, 정밀한 하드웨어로 만든 이미지와 육안으로 거의 구별할 수 없었습니다.

연구 결과는 패턴 인식을 위해 사용되는 인공지능 모델에 적용되었을 때 더욱 설득력이 있었습니다. 연구진은 필기체 숫자, 의류, 일상적인 물건들이 포함된 표준 데이터셋을 사용하여 그들의 설계를 테스트했습니다. 여러 사례에서, 근사 곱셈기를 사용하는 것이 오히려 인공지능의 성능을 향 향상시켰습니다. 예를 들어, 의류를 인식하도록 훈련된 모델은 불완전한 하드웨어를 사용할 때 완벽한 하드웨어를 사용할 때보다 더 높은 정확도를 달ort했습니다. 이 역설적인 결과는 근사화로 인해 도입된 작은 양의 노이즈가, 마치 인간의 뇌가 얼굴을 더 빠르게 인식하기 위해 사소한 세부 사항을 무시하는 것처럼, 컴퓨터가 더 잘 일반화할 수 있도록 도와줄 수 있음을 시사합니다. 테스트된 가장 복잡한 데이터셋의 경우, 최고의 성능을 보인 근사 설계들은 정밀한 방식과 대등하거나 더 나은 분류 정확도를 제공하면서도 하드웨어 크기에서 최대 92%, 전력에서 93%의 절감 효과를 제공했습니다.

이 연구는 더 효율적인 컴퓨팅으로 가는 길이 항상 더 좋고 정밀한 도구를 만드는 것을 의미하지는 않는다는 것을 보여줍니다. 대신, 정밀함이 진정으로 필요한 곳과 안전하게 완화될 수 있는 곳을 이해하는 데서 찾을 수 있습니다. '완벽함'보다는 '충분히 좋은' 하드웨어를 설계하기 위해 지능적인 탐색 과정을 사용함으로써, 연구진은 훨씬 더 작고 빠르며 에너지 효율적인 컴퓨터 칩을 구축하는 것이 가능하다는 것을 보여주었습니다. 이 설계들은 이제 다른 엔지니어들이 사용할 수 있도록 공개되어, 인공지능의 증가하는 요구 사항을 처리하면서도 에너지 자원을 낭비하지 않는 차세대 기기를 구축하는 새로운 길을 제시하고 있습니다. 이 연구는 컴퓨팅의 세계에서 때로는 약간의 오류가 시스템을 더 잘 작동하게 만드는 데 정확히 필요한 요소가 될 수 있음을 확인시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →