Measuring Maximum Activations in Open Large Language Models
본 논문은 27 개의 현대적 오픈 LLM 체크포인트에 걸쳐 최대 활성화 크기를 종합적으로 측정하여, 피크 값이 파라미터 수보다는 모델 계열과 아키텍처에 따라 거의 네 자릿수까지 변동하며, 특히 MoE 모델이 밀집형 모델에 비해 현저히 낮은 피크를 보임을 밝혀냄으로써 최대 활성화가 안정적인 저비트 양자화를 보장하기 위해 보고되어야 할 결정적이고 비단조적인 속성임을 확립한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대하고 디지털 도서관을 짓고 있다고 상상해 보세요. 그곳의 책들은 매우 빠르지만 다소 약한 로봇이 읽습니다. 이 로봇(AI 모델)은 단어를 하나씩 읽으며 이야기를 이해하기 위해 일련의 방들(레이어)을 통과합니다. 이 방들 안에서 로봇은 처리하는 모든 단어에 대해 '흥분 수준'(활성화)을 생성합니다.
대부분의 경우, 이러한 흥분 수준은 차분하고 관리 가능합니다. 하지만 때로는 찰나의 순간, 로봇이 특정 단어를 두고 극도로 흥분하여 에너지가 거대한 스파이크를 일으키기도 합니다.
이 논문은 소형부터 초대형까지, 그리고 다양한 제조사(예: Qwen, Gemma, GPT-OSS 등)에서 만든 27 가지 버전의 이러한 로봇에 대한 안전 점검 보고서와 같습니다. 연구자들은 단순하지만 결정적인 질문에 답하고자 했습니다: 이러한 에너지 스파이크는 얼마나 높게 치솟을 수 있으며, 로봇의 크기가 스파이크의 높이를 결정할까요?
다음은 그들이 발견한 바를 간단한 비유로 설명한 것입니다:
1. '볼륨 조절' 문제
로봇의 내부 에너지를 볼륨 조절 노브라고 생각하세요. 공간을 절약하고 값싼 하드웨어에서 로봇을 더 빠르게 실행하기 위해 엔지니어들은 종종 볼륨을 낮은 설정으로 줄이려 합니다(양자화).
- 문제: 로봇이 갑자기 1,000,000 의 볼륨으로 비명을 지르는데, 당신의 볼륨 조절 노브가 최대 10,000 만 처리하도록 설정되어 있다면, 그 비명은 '잘려나가거나' 왜곡됩니다. 로봇은 그 단어의 뉘앙스를 잊어버리게 되고, 전체 이야기가 엉망이 됩니다.
- 발견: 연구자들은 이러한 모든 로봇에 걸쳐 가장 큰 비명(최대 활성화)을 측정했습니다. 그들은 '크기'가 극적으로 다양하다는 사실을 발견했습니다. 어떤 로봇(예: Qwen3.5)은 속삭임 같지만, 다른 로봇(예: Gemma3)은 이륙하는 제트 엔진과 같습니다.
2. 크기가 항상 더 큰 소리를 내는 것은 아님
더 큰 로봇(더 많은 파라미터)이 자연스럽게 더 큰 소리를 낼 것이라고 생각할 수 있습니다.
- 비유: 더 큰 차가 항상 더 큰 엔진 소리를 낸다고 가정하는 것과 같습니다.
- 현실: 연구자들은 이것이 사실이 아니라고 발견했습니다. 한 가족의 작은 로봇이 다른 가족의 거대한 로봇보다 훨씬 더 크게 비명을 지를 수 있습니다. '크기'는 단순히 얼마나 큰지에 따라 결정되기보다 누가 만들었는지(아키텍처)와 어떻게 훈련시켰는지(레시피)에 더 의존합니다.
- 예시: 유사한 크기의 Qwen3.5 로봇에 비해 Gemma3 로봇이 약 700,000 배 더 크게 비명을 지르는 것으로 발견되었습니다.
3. 'MoE' 단축키
일부 로봇은 '전문가 혼합(Mixture of Experts, MoE)'이라는 특별한 트릭을 사용합니다. 모든 책을 한 명의 거대한 사서가 읽는 대신, 각 책마다 올바른 2~3 명의 전문가만 호출되는 100 명의 작은 전문가들이 있는 도서관이라고 상상해 보세요.
- 발견: 이러한 'MoE' 로봇들은 훨씬 조용한 것으로 발견되었습니다. 그들의 가장 큰 비명은 같은 크기의 '밀집형'(비전문가) 사촌들보다 14 배에서 23 배 낮았습니다. 전문가를 사용하는 것이 에너지를 더 잘 통제하는 것 같습니다.
4. 비명은 어디서 일어날까요?
연구자들은 로봇의 뇌에서 정확히 어디서 이러한 스파이크가 발생하는지 추적했습니다.
- 발견: 거의 모든 경우(24 개 로봇 중 22 개)에서 가장 큰 비명은 정보가 한 방에서 다음 방으로 흐르는 주요 복도(잔여 스트림)에서 발생했습니다. 이는 보통 사이드 룸(주의력 룸이나 수학 룸 등)에서 일어나지 않았습니다.
- 패턴: 어떤 로봇은 일찍 스파이크를 일으켜 소리를 내며 유지하는 반면(점프 앤 홀드), 다른 로봇은 천천히 쌓이다가 마지막에 가장 크게 비명을 지릅니다(점진적인 상승).
5. 훈련이 볼륨을 변화시킴
연구자들은 새로운 기술을 배우는 학생처럼 훈련의 다른 단계에 있는 로봇들도 살펴보았습니다.
- 발견: 로봇이 더 오래 훈련할수록(더 많은 책을 볼수록) 약간 더 크게 소리를 내는 경향이 있습니다. 이는 거대한 점프는 아니지만, 로봇이 똑똑해질수록 '볼륨'이 서서히 올라갑니다.
빌더들을 위한 결론
이 논문은 로봇의 크기를 볼 뿐으로는 로봇이 얼마나 크게 소리를 낼지 추측할 수 없다고 결론 내립니다.
- 교훈: 이러한 로봇을 작은 장치(예: 스마트폰)에서 실행되도록 줄이기 전에, 반드시 그들의 가장 큰 비명을 먼저 측정해야 합니다. 그렇지 않으면 볼륨 조절 노브를 너무 낮게 설정하게 되어, 로봇이 갑작스러운 에너지 스파이크를 처리하지 못해 환각을 보거나 실수를 하게 될 수 있습니다.
저자들은 이러한 로봇을 구축하는 사람들이 압축을 시도하기 전에 이 '크기'를 확인할 수 있도록 측정 도구를 공개했습니다. 이를 통해 로봇이 안정적이고 정확하게 유지되도록 보장합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.