Hardware-Aware FP4 FlashAttention-4
이 논문은 비인과적 추론을 위한 Direct-P와 FP8 그래디언트를 사용하는 인과적 경로를 채택함으로써 Blackwell의 FP4 텐서 코어의 한계를 극복하는 하드웨어 인식형 FP4 FlashAttention-4를 소개하며, 이를 통해 MXFP4 훈련에서 관찰되는 발산 문제를 피하면서 포워드 처리량을 최대 2.13배, 단일 GPU 훈련 업데이트 속도를 최대 1.14배 향상시켰습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능의 세계에서 가장 강력한 모델들은 문맥을 이해하기 위해 "어텐션(attention)"이라 불리는 메커니즘에 의존합니다. 독자가 긴 문서를 훑어보는 모습을 상상해 보십시오. 어텐션은 모델이 나머지 부분은 무시하면서 문장 내에서 가장 관련 있는 단어들에 집중하고, 먼 거리의 아이디어들을 연결할 수 있게 해줍니다. 이를 위해 컴퓨터는 모든 단어를 다른 모든 단어와 비교하여 그 관계를 결정하는 방대한 일련의 계산을 수행합니다. 수년 동안 이러한 계산은 건물을 측정하기 위해 아주 미세하고 정밀한 눈금이 있는 자를 사용하는 것과 유사하게, 고정밀 숫자를 사용하여 수행되어 왔습니다. 이는 모델이 올바르게 학습하도록 보장하지만, 속도가 느리고 엄청난 양의 에너지를 소비합니다. 모델이 커짐에 따라 속도의 필요성은 매우 중요해집니다. 연구자들은 최근 훨씬 더 작고 거친 숫자—4비트 부동 소수점 값—를 사용하여 이러한 비교를 훨씬 빠르게 수행할 수 있는 칩을 개발했습니다. 하지만 단순히 더 작은 숫자로 전환하는 것만으로는 충분하지 않습니다. 데이터의 흐름을 관리하는 소프트웨어 또한 변해야 하며, 그렇지 않으면 속도 이점이 사라집니다.
Graphcore의 한 연구자는 "Direct-P"라고 부르는 새로운 방법으로 이 특정 병목 현상을 해결했습니다. 그들의 연구는 모델이 정보를 처리하여 답을 생성하는 "순방향(forward)" 패스와, 실수를 통해 학습하는 "역방향(backward)" 패스에 초점을 맞춥니다. 연구자는 새로운 칩이 숫자를 믿기 힘들 정도로 빠르게 곱할 수 있는 반면, 그 중간 단계인 원시 점수(raw scores)를 확률로 변환하는 과정이 모든 것을 느리게 만들고 있다는 것을 발견했습니다. 이것은 마치 모든 부품을 전달하기 전에 작업자가 모든 부품을 주의 깊게 측정해야 하기 때문에 계속 멈춰 서는 초고속 조립 라인과 같았습니다. 연구자는 복잡한 스케일링과 반올림을 포함하는 표준적인 방식의 이 변환 처리가 새로운 하드웨어의 속도 이점을 상쇄하는 교통 체증을 유발한다는 것을 발견했습니다.
이를 해결하기 위해, 연구자는 변환 과정을 직접적이고 간소화되도록 재설계했습니다. 정밀한 확률을 계산한 다음 반올림하는 대신, 그들의 방법은 원시 점수를 하드웨어가 사용하는 특정 코드로 직접 매핑합니다. 이는 지연을 일으켰던 중간 단계의 중간 관리자를 제거합니다. 이 접근 방식을 최신 세대의 데이터 센터 칩에서 테스트했을 때, 결과는 놀라웠습니다. 특정 형태의 데이터에 대해, 새로운 방법은 고정밀 숫자에 의존했던 이전 표준보다 정보를 2배 이상 빠르게 처리했습니다. 이는 비디오 생성 및 언어 이해와 같은 복잡한 작업에 충분히 정확한 출력을 유지하면서도 달성되었습니다. 비디오 생성 모델을 포함한 테스트에서, 새로운 방법은 표준 방식보다 거의 2배 더 빨랐으며, 결과물은 유한하고 사용 가능했지만, 더 느리고 정밀한 버전과 비교했을 때 측정 가능한 편차와 낮은 유사도를 보였습니다.
그러나 이야기는 속도에 관한 것뿐만이 아닙니다. 모델이 학습하려고 할 때 어떤 일이 일어나는지에 대한 것이기도 합니다. 연구자는 모델이 지식을 업데이트하는 역방향 패스를 포함하여 전체 학습 과정에 이 초고속 저정밀 숫자를 사용할 수 있는지 탐구했습니다. 그들은 순방향 패스는 풀 스피드로 실행될 수 있는 반면, 역방향 패스는 신중한 타협이 필요하다는 것을 발견했습니다. 학습 중에 확률 값을 위해 가장 빠른 4비트 형식을 사용하려고 시도했을 때, 학습 과정은 불안정해졌고 모델은 개선되지 못했습니다. 숫자들이 너무 거칠어져서 학습 신호가 무너졌기 때문입니다. 결과적으로, 연구자는 학습이 안정적으로 유지되려면 나머지 계산이 더 빠른 4비트 형식을 사용하더라도 확률 값에는 약간 더 정밀한 8비트 형식을 사용해야 한다고 결정했습니다. 이 하이브리드 접근 방식은 단일 강력한 칩에서 전체 학습 주기를 약 14% 가속화했으며, 이는 대규모 모델에 있어 상당한 이득입니다.
연구자는 또한 컴퓨터 칩 자체의 물리적 한계도 살펴보았습니다. 그들은 계산의 속도가 더 이상 주요한 문제가 아니라는 것을 발견했습니다. 문제는 칩 내부에서 데이터가 어떻게 저장되고 이동하느냐였습니다. 칩에는 숫자를 다루는 동안 보유하는 작고 초고속인 메모리 영역이 있습니다. 연구자는 이 메모리 공간이 완전히 가득 차서, 계산의 서로 다른 단계들을 중첩(overlap)시킬 여유가 없다는 것을 발견했습니다. 그것은 마치 요리사가 칼이 아무리 날카롭더라도 현재의 채소를 다 썰기 전까지는 다음 채소를 썰기 시작할 수 없을 정도로 조리대가 꽉 찬 주방과 같았습니다. 메모리 공간이 완전히 점유되었기 때문에, 칩은 여러 단계를 동시에 작업할 수 없었으며, 이는 전체 프로세스가 얼마나 더 빨라질 수 있는지에 제한을 두었습니다.
이 연구는 인공지능을 더 빠르게 만드는 방법에 대해 우리가 생각하는 방식의 중요한 변화를 강조합니다. 단순히 더 빠른 계산기를 만드는 것만으로는 부족합니다. 하드웨어의 역량을 활용할 수 있도록 전체 워크플로우를 재설계해야 합니다. 연구자는 확률을 계산하는 방식을 바꾸고 데이터의 흐름을 신중하게 관리함으로써 막대한 속도 향상을 끌어낼 수 있음을 보여주었습니다. 그러나 그들은 또한 엄연한 한계가 존재함을 증명했습니다. 칩의 메모리 제약은 가장 빠른 산술 연산을 사용하더라도 중첩이 가능한 수준에 천장이 있음을 의미합니다. 그들이 제시하는 미래의 길은 단순히 더 빠른 산술이 아니라, 칩의 자원이 결코 기다리는 일이 없도록 데이터를 조직하는 더 스마트한 방식에 있습니다. 이 원시적인 속도와 신중한 데이터 관리 사이의 균형이 차세대 인공지능을 효율적으로 구동하게 할 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.