← 최신 논문
🤖 machine learning

Finer is Better (with the Right Scaling)

본 논문은 양자화 블록 크기가 축소될 때 대규모 언어 모델의 성능이 저하되는 역설을 해결하여, 그 원인이 두꺼운 꼬리를 가진 분포가 FP4 포맷과 부적절하게 상호작용하기 때문임을 입증하고, 4-over-6 스케일링과 언더플로우 방지와 같은 표적 알고리즘 개입을 통해 표준 하드웨어 준수 포맷이 더 세밀한 입자로 최적의 품질을 달성할 수 있음을 보여줍니다.

원저자: Clemens Schaefer, Gil Tabak

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Clemens Schaefer, Gil Tabak

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"더 세분화된 것이 더 좋다 (적절한 스케일링과 함께)"라는 논문에 대한 설명을 쉬운 언어와 일상적인 비유로 정리합니다.

큰 문제: "너무 세분화된" 역설

여행을 위해 가방을 꾸리는 상황을 상상해 보세요. 엄청난 양의 옷 (데이터) 이 있고, 제한된 공간 (메모리) 만 있습니다. 모든 것을 넣기 위해 옷을 점점 더 작은 묶음 (이를 블록이라고 합니다) 으로 잘라 더 효율적으로 정리하기로 결정합니다.

직관적으로 생각하면 다음과 같습니다. "묶음이 작을수록 모든 것을 더 잘 넣을 수 있지 않나요?"

AI 세계에서는 이를 **양자화 (quantization)**라고 부릅니다. 과학자들은 AI 모델을 더 작고 빠르게 만들기 위해 이러한 묶음을 축소해 왔습니다. 하지만 이상한 역설에 부딪혔습니다. 묶음을 너무 작게 만들면, AI 의 성능이 오히려 떨어졌습니다. 마치 가방을 너무 꼼꼼하게 정리하다가 옷을 으깨서 쓸모없게 만든 것과 같습니다.

왜 이런 일이 발생했을까요?

이 논문의 저자들은 이 "너무 세분화된" 역설이 왜 발생했는지 조사했습니다. 그들은 두 가지 주요 원인을 발견했습니다.

1. "0" 오류 (비어 있는 상자)
숫자만 담을 수 있는 상자가 있다고 상상해 보세요. 숫자가 아주 작으면, 상자의 자 (규격) 가 이를 0 으로 반올림할 수 있습니다. 만약 작은 숫자들로 가득 찬 묶음이 있다면, 자는 "좋아, 이 묶음 안의 모든 것은 0 이야"라고 말하고 전체를 버릴 수 있습니다.

  • 해결책: 이 논문은 간단한 규칙을 제안합니다. 절대로 자가 0 이라고 말하게 하지 마세요. 숫자가 너무 작다면, 자로 하여금 가능한 가장 작은 양의 숫자를 사용하도록 강제하세요. 이렇게 하면 정보가 살아남습니다.

2. "거친 자" 문제 (조잡한 격자)
이것이 더 큰 문제입니다. AI 는 이러한 묶음을 측정하기 위해 특정 유형의 "자" (E4M3라고 함) 를 사용합니다. 이 자는 특히 높은 범위에서 눈금 사이의 간격이 매우 큽니다.

  • 비유: 눈금이 1 피트, 2 피트, 4 피트, 6 피트만 있는 자로 산맥을 측정하려고 한다고 상상해 보세요.
    • 작은 언덕 (작은 데이터 블록) 이 있다면, 자는 5.9 피트 언덕을 6 피트로 반올림하도록 강요할 수 있습니다. 이는 엄청난 오차입니다!
    • 묶음을 더 작게 만들면, 이러한 큰 숫자들이 그 거칠고 어색한 6 피트 통에 강제로 들어가는 경우가 더 많아집니다. 묶음이 작을수록 이러한 나쁜 반올림이 더 자주 발생하며, AI 의 성능은 더 나빠집니다.

해결책: 어떻게 고쳤을까요?

저자들은 세 가지 주요 해결책을 테스트하여 올바른 도구를 사용한다면 더 세분화된 블록이 실제로 더 좋다는 것을 증명했습니다.

1. "0 으로 가지 마라" 규칙
그들은 단순히 시스템이 스케일링 인자가 0 이 되는 것을 절대 허용하지 않도록 프로그래밍했습니다.

  • 결과: 이는 아주 작은 숫자에 대한 문제를 해결했지만, 6 으로 반올림되는 "큰" 숫자에 대한 문제는 해결하지 못했습니다.

2. "4 또는 6" 선택 (4 대 6 방법)
이것이 이 논문의 "비밀 무기"입니다. 하나의 고정된 자 대신, 시스템이 각 묶음에 대해 두 가지 특정 설정 중 하나를 선택할 수 있습니다. 4 또는 6입니다.

  • 비유: 상자를 꾸리는 상황을 상상해 보세요. 때로는 물건이 "중형" 상자 (4) 에 가장 잘 맞고, 때로는 "대형" 상자 (6) 에 가장 잘 맞습니다. 모든 것을 "대형" 상자에 강제로 넣는 것 (작은 물건을 으깨버림) 대신, 시스템은 확인합니다. "이 두 상자 중 어떤 것이 이 특정 묶음에 가장 잘 맞을까?"
  • 결과: 이를 통해 AI 는 어색한 반올림 오류를 피할 수 있었습니다. 이 방법을 사용했을 때, "역설"은 사라졌습니다. 더 작은 묶음이 갑자기 훨씬 더 좋아졌고, 원래 그랬어야 하듯이 작동했습니다.

3. "무식한 힘" 확인
그들의 주장을 증명하기 위해, 그들은 완벽한 측정 방법을 찾기 위해 묶음을 측정하는 모든 가능한 방법을 컴퓨터로 검색해 보았습니다.

  • 결과: 이는 이론적으로 완벽한 측정 방법을 선택한다면 더 작은 묶음이 항상 더 잘 작동한다는 것을 증명했습니다. 이전까지 AI 가 실패했던 이유는 작은 묶음이 나빠서가 아니라, 나쁜 측정 방법을 사용했기 때문이었습니다.

현실 세계 테스트: 실제 AI 에서 작동할까요?

그들은 네 가지 유명한 AI 모델 (Granite, Llama, DeepSeek, Qwen) 로 이를 테스트했습니다.

  • 문제: 두 개의 모델 (Granite 와 Llama) 은 역설이 예측한 대로 묶음이 작아질수록 성능이 떨어졌습니다.
  • 해결: "4 또는 6" 선택과 "0 으로 가지 마라" 규칙을 적용했을 때, 이러한 모델들은 더 나빠지지 않았습니다. 오히려 묶음이 작아질수록 더 좋아졌습니다.
  • 비교: 그들은 또한 눈금이 더 많은 더 정교하고 비싼 자 (UE5M3) 를 사용해 보기도 했습니다. 이 방법도 잘 작동했지만, 더 많은 하드웨어 성능이 필요했습니다. 그들의 "4 대 6" 트릭을 사용하면 값싸고 표준적인 자를 사용하면서도 동일한 훌륭한 결과를 얻을 수 있었습니다.

결론

이 논문은 AI 모델을 더 작고 효율적으로 만드는 것 (작은 블록 사용) 은 훌륭한 아이디어라고 결론 내립니다. 이전까지 실패했던 이유는 아이디어 자체의 결함이 아니라 사용된 "측정 테이프"의 결함 때문이었습니다.

데이터를 측정하는 방식을 더 지능적으로 선택함으로써 (특히 "4 대 6" 방법을 사용하여), 우리는 비싼 새로운 하드웨어 없이도 AI 모델을 더 작고, 빠르고, 정확하게 만들 수 있습니다. 역설은 해결되었습니다. 적절한 스케일링이 있다면, 더 세분화된 것이 실제로 더 좋습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →