← 최신 논문
💻 computer science

FP8 is All You Need (Part 1): Debunking Hardware FP64 as the HPC Holy Grail

이 논문은 네이티브 FP64 하드웨어가 고성능 컴퓨팅에 더 이상 필수적이지 않음을 주장하며, NVIDIA의 B300과 같은 AI 최적화 GPU가 FP8 텐서 처리량과 오자키 스킴 II(Ozaki Scheme II)를 결합함으로써 전체 FP64 정확도와 메모리 대역폭 제한 성능을 달출할 수 있고, 이를 통해 감소된 네이티브 배정밀도 실리콘에도 불구하고 이전 세대의 능력을 능가할 수 있음을 입증한다.

원저자: Satoshi Matsuoka

게시일 2026-06-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Satoshi Matsuoka

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

논문 설명: "FP8은 그것만으로 충분하다 (Part 1)"

거대한 문제: "고정밀도(High-Precision)" 절벽

슈퍼컴퓨터의 세계를 무거운 트럭(과학 데이터)을 운반하도록 설계된 거대한 고속도로 시스템이라고 상상해 보세요. 수십 년 동안 규칙은 이랬습니다: "이 무거운 트럭들을 안전하게 운반하려면, 'FP64'(배정밀도)라고 불리는 특정 초강력 다리를 반드시 사용해야 한다."

하지만 이 논문은 차세대 컴퓨터 칩(특히 NVIDIA의 "Blackwell Ultra" 및 "Rubin" GPU)이 더 이상 이런 강한 다리를 짓지 않기로 결정했다고 주장합니다. 대신, 그들은 "FP8"(AI에 사용되는 저정밀도 형식)을 위한 수천 개의 작고 믿을 수 없을 정도로 빠른 차선들을 만들고 있습니다.

  • 과거의 방식: 칩에 40톤의 교통량을 처리할 수 있는 튼튼한 다리(FP64)가 있었습니다.
  • 새로운 방식 (B300/Rubin): 칩에서 튼튼한 다리를 아예 없애버렸습니다. 이제는 1.3톤만 견딜 수 있는 작고 흔들거리는 Footbridge(보도교)를 가지고 있는 대신, 거대한 AI 차선(FP8)은 5,000톤을 처리할 수 있습니다.

결과: 만약 이 새로운 칩에서 오래된 과학용 소프트웨어를 실행하려고 하면, 교통 체증이 그 작은 보도교에서 발생합니다. 거대한 AI 차선들은 비어 있는 채로 쓸모없이 방치됩니다. 논문은 이를 "FP64 절벽"이라고 부릅니다.

해결책: "오자키 스킴(Ozaki Scheme)" (마법의 번역기)

이 논문은 영리한 우회 방법을 제안합니다. 새로운 강한 다리를 만드는 대신, 거대한 AI 차선이 마치 강한 다리인 것처럼 흉내를 내면 어떨까요?

여기서 Ozaki Scheme II가 등장합니다. 이것을 "중국인의 나머지 정리(Chinese Remainder Theorem)"라는 수학적 트릭을 사용하는 마스터 번역기라고 생각하면 됩니다.

  • 비유: 아주 길고 복잡한 비밀 메시지(고정밀도 숫자)를 강 너머로 보내야 하는데, 사용할 수 있는 배가 작아서 짧고 단순한 쪽지만 실을 수 있다고 상상해 보세요.
  • 트릭: 메시지를 한꺼번에 보내는 대신, 번역기는 메시지를 10개 또는 12개의 아주 작고 단순한 쪽지(잔여물, residues)로 나눕니다.
  • 실행: 이 10개의 쪽지를 빠른 AI 차선을 사용하여 동시에 강 너머로 보냅니다.
  • 재조립: 반대편에서 가르너 알고리즘(Garner's algorithm)이라는 빠른 수학 공식이 10개의 쪽지를 다시 엮어서 원래의 완벽한 고정밀도 메시지로 만들어냅니다.

쪽지들이 단순하기 때문에, AI 차선은 이들을 엄청나 된 속도로 운반할 수 있습니다. 논문은 이 방식을 통해, 기존의 강한 다리가 가진 정확도를 유지하면서도 AI 차선의 속도를 얻을 수 있다고 주장합니다.

"텐서-메모리 평형(Tensor-Memory Equilibrium)" (새로운 교통 법규)

저자들은 이 방법이 작동함을 증명하기 위해 **텐서-메모리 평형(TME)**이라는 새로운 모델을 만들었습니다.

  • 과 old 관점: "다리가 약하면 시스템 전체가 느려진다."
  • 새로운 관점: "다리가 약하더라도, 그곳으로 이어지는 도로가 충분히 넓다면 우리는 계속 차를 움직이게 할 수 있다."

논문은 대부분의 과학적 작업(기상 시뮬레이션이나 유체 역학 등)에서 병목 현상은 수학 계산이 아니라 메모리 대역폭(데이터가 칩으로 로드되는 속도)에서 발생한다는 것을 보여줍니다.

  • 좋은 소식: 새로운 칩들은 엄청난 메모리 대역폭을 가지고 있습니다.
  • 문제점: 기존의 수학 연산 장치들은 이 대역폭을 사용하기에는 너무 느렸습니다.
  • 해결책: 오자키 스킴은 데이터를 로드하는 동안 빠른 AI 수학 장치를 사용하여 데이터를 처리합니다. 이를 통해 시스템은 약한 다리의 속도가 아니라 메모리 대역폭의 속도로 구동될 수 있습니다.

결과: 정확도를 잃지 않고 속도 높이기

논문은 새로운 칩(B300 및 Rubin)에서 테스트를 진행하고 이전 세대(H100 및 B200)와 비교했습니다.

  1. "무거운" 수학 (밀집 행렬 곱셈, Dense Matrix Multiplication):

    • 새로운 칩의 네이티브 FP64: 매우 느림 (1.3 TFLOPS).
    • 새로운 칩의 Ozaki 스킴: 매우 빠름 (500 TFLOPS).
    • 결과: 새 칩은 자체 네이티브 모드보다 380배 빠르며, 이전 세대의 최고 성능 칩보다 12배 더 빠릅니다.
  2. "메모리 집약적" 작업 (스텐실, SpMV):

    • 이 작업들은 보통 계산 속도가 아니라 데이터를 얼마나 빨리 읽느냐에 의해 제한됩니다.
    • 네이티브 FP64: 약한 다리의 속도에 갇혀 있습니다.
    • Ozaki 스킴: 거대한 메모리 대역폭의 속도에 맞춰 작동합니다.
    • 결과: 새 칩은 기존의 "균형 잡힌" 칩들과 대등한 성능을 보여주면서도, 훨씬 더 많은 원시 전력을 사용할 수 있게 해줍니다.

"4층 구조"의 안전망

논문은 모든 유형의 과학 코드를 위해 이 방식이 작동하려면 "4층 건물"이 필요하다고 주장합니다.

  1. FP8 층: 거대한 AI 차선 (새로운 칩들이 풍부하게 보유하고 있음).
  2. INT32 층: 특정 수학적 기법(FFT)을 위한 백업 차선.
  3. FP32 층: 단순한 수학을 위한 표준 차선.
  4. FP64 층: 기존의 튼튼한 다리.

논문의 결론: 우리는 더 이상 4층(네이티브 FP64)이 필요하지 않습니다. 첫 세 개의 층이 오자키 번역기와 결합하면 전체 건물을 지탱하기에 충분히 튼튼합니다.

주의 사항: "건설 작업"이 필요함

논문은 이것이 마법이 아니며 엔지니어링이 필요하다고 인정합니다.

  • 단순히 오래된 소프트웨어를 꽂는다고 작동하는 것이 아닙니다. 이 번역기를 사용하도록 "배관"(커널 코드)을 새로 작성해야 합니다.
  • 희망적인 부분: 저자는 이 논문을 쓰는 데 사용된 것과 같은 AI 코딩 어시스턴트들이 패턴을 번역하는 데 매우 뛰어나기 때문에, 이 "건설 작업"은 몇 년이 아닌 몇 달 안에 완료될 수 있다고 주장합니다.

요약

이 논문은 "네이티브" 배정밀도(FP64) 실리콘이 필요한 시대는 끝났다고 주장합니다. 엔비디아의 최신 칩들이 이를 위한 하드웨어를 제거했음에도 불구하고, 우리는 수학적 트릭(오자키 스킴)을 사용하여 그들의 거대한 AI 엔진을 완벽한 배정밀도 계산기로 바꿀 수 있습니다.

핵심 요점: 더 이상 FP64 실리콘이라는 "성배"를 찾을 필요가 없습니다. 충분한 FP8 성능과 적절한 소프트웨어 번역기만 있다면, FP8은 그것만으로 충분합니다. 세계에서 가장 복잡한 과학 시뮬레이션을 실행하기에 말입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →