← 최신 논문
💻 computer science

BF16 Component-Product Emulation of FP32 and FP64 GEMM on Intel AMX

이 논문은 피연산자를 여러 개의 저정밀도 성분으로 분해하고 이를 더 높은 정밀도로 누적함으로써, 경쟁력 있는 처리량과 조절 가능한 정확도를 달est하는, Intel AMX BF16 행렬 곱을 활용하여 고정밀 FP32 및 FP64 GEMM 연산을 에뮬레이션하는 CPU 지향 알고리즘을 제시한다.

원저자: Bing Cui, Yu Liu

게시일 2026-09-07✓ Author reviewed
📖 3 분 읽기☕ 가벼운 읽기

원저자: Bing Cui, Yu Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 컴퓨터는 내부 구조에서 점차 커지는 분열을 겪으며 구축되고 있습니다. 한쪽에는 인공지능을 위해 특별히 설계된 강력한 엔진들이 있는데, 이들은 수십억 개의 단순한 계산을 매우 빠르게 수행하는 데 탁월합니다. 이 엔진들은 숫자가 짧고 단순할 때 가장 잘 작동하며, 엄청난 속도를 위해 아주 미세한 디테일을 희생합니다. 다른 한쪽에는 기상 패턴 시뮬레이션, 원자 결합 모델링, 또는 유체 흐름 예측과 같은 과학적 발견의 세계가 있으며, 이는 여전히 길고 정밀한 숫자에 의존하고 있습니다. 이러한 과학적 계산은 안정성과 정확성을 유지하기 위해 모든 디테일이 필요하지만, 이를 처리하는 표준 컴퓨터 부품들은 새로운 AI 엔진보다 종종 느리고 비효율적입니다. 이는 딜레마를 생성합니다. 과학자들은 새로운 하드웨어의 속도를 필요로 하지만, 그들의 작업이 요구하는 정밀도를 잃어서는 안 되기 때문입니다.

중국의 Maginfra Co., Ltd. 연구진은 Intel AMX라고 불리는 특정 유형의 컴퓨터 칩을 사용하여 이 간극을 메울 방법을 탐구했습니다. 그들의 목표는 빠르고 저정밀도인 AI 엔진이 과학에 필요한 느리고 고정밀인 수학 연산을 수행하도록 속이는 것이었습니다. 칩에게 직접 어려운 수학 문제를 풀라고 요청하는 대신, 그들은 문제를 더 작고 단순한 조각들로 나누었습니다. 매우 긴 거리를 정수 단위의 눈금만 있는 자로 측정하려고 노력하는 상황을 상상해 보십시오. 당신은 전체 정수 단위를 측정하고, 그다음 남은 분수를 측정하고, 그다음 남은 아주 작은 조각을 측정하여 이들을 모두 더함으로써 정밀한 총합을 얻을 수 있습니다. 연구진은 이와 동일한 논리를 숫자에 적용했습니다. 그들은 하나의 복잡한 숫자를 AI 엔진이 쉽게 처리할 수 있는 여러 개의 단순한 부분으로 나누었습니다. 그런 다음 이 부분들에 대해 많은 횟수의 빠른 계산을 수행하고, 그 결과들을 주의 깊게 다시 합쳐서 최종적으로 매우 정확한 답을 재구성했습니다.

연구팀은 이 접근 방식을 두 가지 다른 정밀도 수준에서 테스트했습니다. 먼저, 그들은 많은 과학적 응용 분야의 표준인 단정밀도(single-precision) 수학을 다루었습니다. 그들은 각 숫자를 세 부분으로 나누고 여섯 개의 특정 계산을 실행함으로써, 기존의 가장 우수한 소프트웨어만큼 정확하면서도 훨씬 더 빠르게 결과를 얻을 수 있다는 것을 발견했습니다. 테스트에 사용된 컴퓨터 칩에서 이 방식은 표준적인 수학 방식보다 1.14배에서 2.56배 더 빠르게 작동했습니다. 속도 향상은 숫자를 나누고 다시 조립하는 오버헤드가 순수한 계산 속도에 비해 덜 중요해지는 대규모 데이터 세트에서 가장 두드러졌습니다.

그들이 더욱 정밀하고 가장 까다로운 과학 시뮬레이션에 사용되는 배정밀도(double-precision) 수학으로 넘어갔을 때, 도전 과제는 커졌습니다. 여기서 연구진은 각 숫자를 여섯 부분으로 나누어야 했습니다. 계산 결과가 극도로 세심하게 재조립되어야 했기 때문에 과정은 더 복로 복잡해졌습니다. 그들은 여섯 개에서 스물한 개의 작은 계산 조각을 유지하는 다양한 버전의 방법을 테스트했습니다. 그들은 명확한 트레이드오프(trade-off)를 발견했습니다. 더 많은 조각을 유지할수록 답은 더 정확해졌지만, 프로세스는 더 느려졌습니다. 단 여섯 개의 조각만 사용했을 때, 이 방식은 매우 큰 문제들에 대해 기존 소프트웨어보다 충분히 빨랐으며 최대 1.7배 더 빠른 속도를 냈습니다. 그러나 정확도를 높이기 위해 더 많은 조각을 추가함에 따라, 그것들을 관리하는 데 드는 추가 작업이 속도 이점을 갉아먹었습니다. 결국, 스물한 개의 조각을 유지하려고 시도하자 기존 방식보다 더 느려졌지만, 정확도는 더 높아졌습니다.

이 연구는 또한 이 기술이 모든 상황에 적용되는 보편적인 해결책은 아니라는 점을 강조했습니다. 이 방식은 계산되는 숫자들이 특정 범위 내에 머물러 있을 때 가장 잘 작동하는데, 이는 마치 제한된 길이의 자가 특수한 조정 없이는 너무 방대하거나 너무 작은 거리를 측정할 수 없는 것과 비슷합니다. 연구진은 그들의 방법이 모든 유형의 숫자, 특히 극도로 크거나 극도로 작은 숫자에 대해서는 작동하지 않으며, 기존 소프트웨어와 비트 단위까지 완벽하게 일치하는 것을 보장하지 않는다는 점을 언급했습니다. 대신, 이는 데이터가 해당 방법의 한계 내에 있다면 높은 속도와 높은 정확도를 필요로 하는 과학자들에게 새로운 도구를 제공합니다. 저정밀도 하드웨어를 사용하여 고정밀 문제를 해결할 수 있음을 보여줌으로써, 이 연구는 인공지능을 위해 구축된 특화된 엔진이 과학적 발견의 무거운 짐을 가속화할 수 있는 미래를 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →