← 최신 논문
🤖 machine learning

Demystifying Numerical Instability in LLM Inference: Achieving Reproducible Inference for Mission-Critical Tasks with HEAL

본 논문은 KV 텐서에 대한 INT16 양자화와 16비트 텐서 코어 상의 대수적 오차 보상을 결부터 결합함으로써, 전역 FP32 파이프라인의 과도한 성능 및 메모리 비용 없이 이기종 GPU 간의 미션 크리티컬한 LLM 추론 재현성을 달성하는 하이브리드 오차 완화 프레임워크인 HEAL을 소개한다.

원저자: Zhenting Zhu, Lucas Thai, Shan Yu, Yicheng Liu, Yifan Qiao, Chenxi Wang, Harry Xu, Junyi Shu

게시일 2026-06-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhenting Zhu, Lucas Thai, Shan Yu, Yicheng Liu, Yifan Qiao, Chenxi Wang, Harry Xu, Junyi Shu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

큰 문제: AI의 "흔들리는 손"

당신이 매우 중요한 법정(의료 진단이나 법적 판결 같은 상황)의 판사라고 상상해 보세요. 당신은 증인(AI)에게 똑같은 질문을 할 때마다, 어떤 마이크나 녹음실을 사용하더라도 항상 정확히 똑같은 증언을 하도록 요구해야 합니다.

LLM(대규모 언어 모델)의 세계에서 이것은 현재 악몽과 같습니다. 설령 당신이 AI에게 똑같은 설정으로 똑같은 질문을 던지더라도, 답변이 미세하게 달라질 수 있기 때문입니다.

  • 시나리오: 당신이 "이 질병의 코드는 무엇인가요?"라고 묻습니다.
  • 실행 1: AI가 "코드 A"라고 답합니다.
  • 실행 2: AI가 "코드 B"라고 답합니다.

일상적인 대화에서는 문제가 되지 않습니다. 하지만 금융, 의료, 법률 분야에서는 글자 하나만 틀려도 재앙이 될 수 있습니다. 이 논문은 이를 **비재현성(non-reproducibility)**이라고 부릅니다.

조사: 왜 AI는 마음이 흔들리는가?

연구진(UCLA, 버클리 등)은 알고 싶었습니다. 왜 AI는 의견을 바꾸는 걸까?

그들은 AI가 수학을 "모호한(fuzzy)" 방식으로 수행하고 있다고 의심했습니다. 범인을 찾기 위해 그들은 이 모델을 실행하는 컴퓨터 칩(GPU)의 내부를 들여다보았습니다.

오해:
대부분의 사람들은 AI가 속도를 높이기 위해 모든 수학 계산을 낮은 정밀도(예: 눈금이 큼직큼직한 자를 사용하는 것)로 수행한다고 생각했습니다. 즉, "모호함"이 수학 자체에서 온다고 생각했습니다.

진짜 범인 (커널 경계 - Kernel Boundary):
연구진은 칩 내부의 수학 계산은 사실 매우 정밀하다는 것을 발견했습니다(레이저로 측정된 자를 사용하는 것처럼 말이죠). 문제는 계산의 서로 다른 부분 사이의 '문턱', 즉 **경계(boundaries)**에서 발생합니다.

비유: 양동이 릴레이 (Bucket Brigade)
불을 끄기 위해 한 팀의 작업자들이 줄을 서서 물 양동이(데이터)를 전달하는 장면을 상상해 보세요.

  1. 손 안에서의 상태: 작업자들은 양동이를 아주 안정적으로 들고 있습니다 (칩 내부의 수학 계산은 정밀합니다).
  2. 전달 단계: 한 작업자가 다음 사람에게 양동이를 건네줄 때, 물을 약간 다른 용기에 부어야 합니다.
  3. 물 흘림: 물을 부을 때마다 아주 적은 양의 물이 밖으로 샙니다.
  4. 결과: 줄이 짧다면 물 한 방이 새는 것은 중요하지 않습니다. 하지만 LLM에서는 이 줄이 수 마일이나 됩니다 (수천 개의 레이어). 이 작은 물방들이 쌓입니다. 끝에 도달했을 때, 양동이는 비어 있거나 양이 틀려져 있어 AI가 잘못된 답을 선택하게 만듭니다.

이 "물 흘림" 현상은 컴퓨터가 공간을 아끼기 위해 데이터를 더 작은 용기(낮은 정밀도)에 저장할 때 발생하며, 데이터를 이동할 때마다 미세한 디테일을 잃게 됩니다.

기존의 해결책: "무식한 힘" 방식 (Brute Force)

이 논문이 나오기 전에는 이를 해결하는 두 가지 방법이 있었지만, 둘 다 끔찍했습니다.

  1. "엄격한 순서" 방식: 작업자들이 혼란을 겪지 않도록 특정하고 엄격한 순서대로 양동이를 전달하도록 강제합니다.
    • 단점: 매우 느리며 특정 유형의 하드웨어에서만 작동합니다. 다른 브랜드의 GPU로 바꾸면 작동하지 않습니다.
  2. "큰 양동이" 방식: 전체 과정에서 작은 용기를 아예 사용하지 않습니다. 전체 라인에 걸쳐 거대하고 무거운, 초정밀 양동이(FP32)를 사용합니다.
    • 단점: 너무 무거워서 작업자들이 느릿느릿 움직이게 됩니다. AI는 13배나 느려져 실시간 애플리케이션에는 쓸모가 없게 됩니다.

새로운 해결책: HEAL (하이브리드 오차 완화 - Hybrid Error ALleviation)

저자들은 HEAL이라 불리는 영리한 절충안을 제안합니다. 전체 라인을 무겁게 만들거나 경직되게 만드는 대신, 물이 새는 특정 지점들을 고치는 방식입니다.

1. "스마트 패킹" 기술 (Attention을 위해)

  • 문제: "Key"와 "Value" 양동이(Attention에 사용되는 데이터)는 종종 대부분 비어 있거나 단순한 숫자들로 이루어져 있습니다. 여기에 거대한 양동이를 쓰는 것은 낭비입니다.
  • 해결책: HEAL은 특수한 "포장 테이프"(INT16 양자화)를 사용합니다. 데이터를 더 작고 딱 맞는 패키지로 압축합니다.
  • 마법: 패키지는 작지만, 작업자들은 수학 계산을 하기 위해 이를 두 개의 작은 양동이(Dual-FP16)로 풀어냅니다. 이를 통해 모든 것을 느리게 만들지 않으면서도 물의 높이(정밀도)를 높게 유지합니다.

2. "오차 보상" 기술 (수학 계산을 위해)

  • 문제: 무거운 수학 계산(GEMM)을 할 때, 표준 양동이는 미세한 정밀도를 잃습니다.
  • 해결책: HEAL은 수학을 두 단계로 나눕니다.
    • A단계: 표준 양동이로 주요 수학 계산을 수행합니다.
    • B단계: A단계에서 흘러나온 아주 작은 물방울들을 잡기 위해 아주 작은 양동이로 빠르게 "정리" 수학 계산을 수행합니다.
    • 결과: 거대한 양동이의 정밀도를 얻으면서도, 무거운 작업에는 빠른 가벼운 양동이만을 사용합니다.

결과: 빠르고, 정확하며, 신뢰할 수 있음

연구진은 자신들이 만든 새로운 벤치마크인 MCR-Bench(미션 크리티컬 재현성 벤치마크)를 통해 이 새로운 방법을 테스트했습니다. 여기에는 의료, 법률, 금융 분야의 까다로운 질문들이 포함되어 있습니다.

  • 재현성: HEAL은 매우 느리고 무거운 "큰 양동이" 방식과 동일한 수준의 "완벽한 일관성"을 달ей했습니다.
  • 속도: 무거운 방식보다 7.1배 더 빨랐습니다.
  • 메모리: 무거운 방식과 달리 추가 메모리를 요구하지 않았습니다.

핵심 요약

이 논문은 AI를 신뢰할 수 있게 만들기 위해 전체를 느리게 만들 필요가 없다는 것을 증명합니다. 단지 데이터가 전달되는 과정에서 발생하는 특정 "누수" 지점들만 때우면 됩니다.

한 마디로 요약하면:
경주용 자동차 엔진이 꺼지는 것을 막기 위해 엔진 전체를 느리고 무거운 트랙터 엔진으로 교체하는 대신, 저자들은 기존 엔진의 볼트를 조이는 방법을 찾아냈습니다. 이제 자동차(AI)는 트랙터만큼 신뢰할 수 있으면서도, 여전히 경주에서 이길 수 있을 만큼 빠릅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →