← 최신 논문
💬 NLP

Is Finer Better? The Limits of Microscaling Formats in Large Language Models

이 논문은 마이크로스케일링 양자화에서 블록 크기를 줄이는 것이 좁은 텐서 분포와 제한된 스케일 동적 범위 사이의 상호작용으로 인해 역설적으로 모델 성능을 저하시킬 수 있음을 밝히며, 이를 통해 저자들은 정확도를 유지하면서도 글로벌 스케일링 연산의 필요성을 제거하는 새로운 FP8 unsigned E5M3 포맷을 제안한다.

원저자: Andrea Fasoli, Monodeep Kar, Chi-Chun Liu, Swagath Venkataramani, Viji Srinivasan, Leland Chang, Naigang Wang

게시일 2026-01-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Andrea Fasoli, Monodeep Kar, Chi-Chun Liu, Swagath Venkataramani, Viji Srinivasan, Leland Chang, Naigang Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

개요: 모델의 크기 줄이기

거대 언어 모델(LLM)이 방대한 지식의 도서관이라고 상상해 보세요. 이 도서관을 작은 배낭에 담아(스마트폰에서 빠르게 실행되거나 에너지를 절약할 수 있도록) 만들기 위해, 과학자들은 책의 크기를 줄이는 방법을 시도해 왔습니다. 이를 위해 데이터를 "양자화(quantizing)"하는데, 이는 숫자를 더 적은 비트로 표현하기 위해 반올림하는 것을 의미합니다 (예를 들어 "3.14"를 그냥 "3"으로 쓰는 것과 같습니다).

최근에는 **마이크로스케일링(Microscaling)**이라는 새로운 기술이 인기를 끌었습니다. 전체 도서관을 하나의 커다란 자로 측정하는 대신, 작은 책 그룹마다 각각의 작은 자를 사용하는 방식입니다. 그 논리는 이랬습니다: "그룹이 작을수록, 그 안의 책들을 더 정확하게 측정할 수 있다."

놀라운 사실: 작다고 항상 좋은 것은 아니다

이 논문의 연구자들은 이상한 결함을 발견했습니다. 그들은 그룹(또는 블록)을 더 작게 만들수록 모델이 항상 더 똑똑해질 것이라고 예상했습니다. 하지만 특정 모델에서는 정반대의 현상이 일어난다는 것을 발견했습니다.

비유: 눈금이 빠진 자
당신이 아주 작은 조약돌을 측정하고 있다고 상상해 보세요.

  • 기존 방식: 1인치마다 눈금이 있는 커다란 자를 사용합니다. 조약돌을 잘 측정할 수 없어서 대충 짐작하게 됩니다.
  • 새로운 방식 (마이크로스케일링): 조약돌에 딱 맞는 아주 작은 자로 바꿉니다. 이것이 더 좋겠죠?
  • 문제점: 이 작은 자에는 결함이 있습니다. 이 자의 "영점(zero point)"과 "가장 작은 눈금" 사이의 간격이 너무 넓습니다. 만약 조약돌이 너무 작다면, 자는 그것을 전혀 인식하지 못합니다. 그저 "이것은 0이다"라고 말해버립니다.

연구자들은 데이터의 "블록"이 너무 작아지면, 그것을 측정하는 데 쓰이는 "자"(이를 스케일/scale이라 부름)의 정밀도가 떨어진다는 것을 발견했습니다. 자가 너무 미세한 숫자를 표현하지 못하는 것입니다. 그래서 비록 더 작은 그룹을 측정하고 있음에도 불구하고, 자가 너무 투박해서 오히려 더 많은 정보를 잃게 됩니다.

이로 인해 저자들이 **"퍼플렉시티 역전(Perplexity Inversion)"**이라고 부르는 현상이 발생했습니다. 보통은 블록을 줄일수록 모델이 더 좋아지지만, 이 결함 때문에 블록이 너무 작아지면 모델이 갑자기 나빠집니다.

왜 이런 일이 발생하는가?

연구자들은 수학적으로 파고들어 범인을 찾아냈습니다. 바로 **스케일(Scale)**입니다.

이 시스템에서는 모든 숫자 그룹이 해당 그룹의 숫자가 얼마나 큰지를 알려주는 "스케일" 값을 가집니다.

  1. 넓은 그룹: 그룹 안에 큰 숫자와 작은 숫자가 섞여 있으면 스케일이 큽니다. 자는 잘 작동합니다.
  2. 좁은 그룹: 그룹 안에 아주 작은 숫자들만 있다면(예: 0.0001), 이를 정확히 측정하기 위해 스케일도 매우 작아야 합니다.
  3. 결함: 현재의 하드웨어는 특정 유형의 자(FP8 E4M3)를 사용하는데, 이 자는 표현 범위가 제한적입니다. 스케일이 너무 작아지면 이를 감당할 수 없습니다. 블록 크기가 줄어들면 그 안의 숫자들도 너무 작아져서, 자의 "최소 설정값"보다도 작아지게 됩니다. 그러면 컴퓨터는 모든 것을 0으로 반올림해 버리고, 모델은 정보를 잊어버리게 됩니다.

해결책: 더 나은 자

저자들은 단순히 문제점을 지적하는 데 그치지 않고, 이를 고치기 위한 더 나은 도구를 만들었습니다.

그들은 **FP8 Unsigned E5M3 (UE5M3)**라는 새로운 형식을 제안했습니다.

  • 해결책: 기존의 자가 "크기(지수)"를 위한 4개의 표시와 "상세도(가수)"를 위한 3개의 표시를 가지고 있다고 생각해 보세요.
  • 업그레이드: 사용하지 않는 비트(작은 스위치) 하나를 가져와서 추가적인 "크기" 표시로 전환했습니다. 이제 이 자는 5개의 크기 표시와 3개의 상세도 표시를 갖게 되었습니다.

이것이 도움이 되는 이유:
이 새로운 자는 숫자를 0으로 반올림하지 않고도 훨씬 더 작은 숫자를 측정할 수 있습니다. 즉, 자의 "바닥" 부분을 확장하여 아주 작은 조약돌들도 명확하게 볼 수 있게 만든 것입니다.

결과

연구자들은 이 새로운 자를 여러 AI 모델(Llama, Granite 등)에 테스트했습니다.

  • 수정 전: 블록을 매우 작게 만들었을 때, 모델들이 혼란을 느껴 더 많은 실수를 저질렀습니다.
  • 새로운 자 (UE5M3) 사용 시: 모델들은 아주 작은 블록에서도 정확도를 유지했습니다. 실제로, 숫자를 측정하기 전에 수동으로 숫자를 늘려주는 복잡한 우회 방법을 사용했을 때만큼 성능이 좋았으며, 그 과정에서 필요한 비싸고 번거로운 단계도 필요하지 않았습니다.

요약

이 논문은 AI 압축에 있어 **"작은 것이 항상 더 좋은 것은 아니다"**라는 교훈을 줍니다. 데이터 그룹을 너무 많이 줄이면, 그것을 읽는 측정 도구가 망가질 수 있습니다. 측정 도구의 설계(범위를 나타내는 비트 하나를 추가하는 것)를 살짝 수정함으로써, 그 결함을 해결했고 AI 모델이 똑똑함을 잃지 않으면서도 더 효율적으로 압축될 수 있게 만들었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →