← 최신 논문
🤖 machine learning

Fantastic Pretraining Optimizers and Where to Find Them II: Hyperball Optimization

이 논문은 가중치 행렬과 그 업데이트의 프로베니우스 노름(Frobenius norm)을 상수 값으로 고정함으로써 Muon과 같은 행렬 기반 옵티마이저의 성능 스케일링 한계를 해결하고, 표준적인 디커플드 가중치 감쇠(decoupled weight decay)와 비교하여 대규모 언어 모델에서 유의미한 토큰 등가 속도 향상 및 개선된 학습률 전이 성능을 달축성하는 단순한 옵티마이저 래퍼인 Hyperball을 소개한다.

원저자: Kaiyue Wen, Xingyu Dang, Kaifeng Lyu, Tengyu Ma, Percy Liang

게시일 2026-06-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kaiyue Wen, Xingyu Dang, Kaifeng Lyu, Tengyu Ma, Percy Liang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대하고 복잡한 로봇(대규모 언어 모델)에게 인간의 언어를 말하는 법을 가르치려 한다고 상상해 보세요. 이를 위해 당신은 '선생님'(옵티마이저)을 사용하여 로봇의 내부 설정값(가중치)을 실수에 따라 단계별로 조정합니다.

오랫동안 최고의 선생님은 AdamW였습니다. 최근에는 Muon이라는 더 빠른 새로운 선생님이 발견되었습니다. Muon은 AdamW라는 세단에 비하면 스포츠카와 같아서, 보통 로봇이 훨씬 더 빠르게 학습하도록 돕습니다.

하지만 이 논문의 저자들은 한 가지 문제를 발견했습니다. 스포츠카가 경주가 길어질수록 속도가 느려진다는 점입니다. 로봇을 더 크게 만들고 더 많은 데이터를 학습하게 했을 때, Muon의 속도 우위는 압도적인 30% 차이에서 고작 10% 차이로 줄어들었습니다.

저자들은 질문했습니다. 경주가 아무리 거대해져도 스포츠카의 속도를 유지할 수 있을까?

그들의 해답은 Hyperball이라는 새로운 도구입니다.

문제점: "부드러운" 브레이크

표준적인 학습 방법에서 선생님은 "가중치 감쇠(weight decay)"라는 기술을 사용합니다. 이것은 로봇의 설정을 매 단계마다 0을 향해 부드럽게 조이는 부드럽고 보이지 않는 브레이크라고 생각하면 됩니다.

  • 목표: 이 브레이크는 로봇의 설정값이 너무 날뛰지 않도록 제어하는 것입니다.
  • 문제점: 로봇이 커질수록 이 부드러운 브레이크는 예측 불가능해집니다. 이는 단순히 설정값의 크기를 조절하는 데 그치지 않고, 로봇이 새로운 방향을 배우는 속도까지 의도치 않게 변화시킵니다. 이는 마치 자동차를 운전할 때 브레이크가 밟히는 강도가 계속 변해서, 빠르고 곧게 운전하기 어렵게 만드는 것과 같습니다.

해결책: "Hyperball"

Hyperball은 어떤 선생님(Muon이나 Adam 등)이라도 감쌀 수 있는 래퍼(wrapper)이며, 게임의 규칙을 바꿉니다. 부드러운 브레이크를 사용하는 대신, 로봇의 설정을 거대하고 단단한, 보이지 않는 구(sphere)(즉, "하이퍼볼") 안에 넣습니다.

작동 방식은 다음과 같은 간단한 비유로 설명할 수 있습니다:

  1. 구(Sphere): 로봇의 설정값이 거대한 비치볼 표면 위에 떠 있는 하나의 점이라고 상상해 보세요. 비치볼의 크기는 고정되어 있습니다. 이 점은 표면 어디든 움직일 수 있지만, 중심에 더 가까워지거나 중심에서 더 멀어질 수는 없습니다. 중심으로부터의 거리는 항상 정확히 동일합니다.
  2. 단계(Step): 선생님이 변화를 주고 싶을 때, 로봇에게 "이 방향으로 움직이라"고 지시합니다.
  3. 튕김(Bounce): 로봇은 그 방향으로 발을 내디딥니다. 만약 그 발걸음이 비치볼 밖으로 밀려나게 만든다면, Hyperball은 즉시 로봇을 다시 표면 위로 튕겨 올려서 중심으로부터의 거리를 일정하게 유지합니다.

이것이 왜 더 나은가

설정값을 이 구의 표면에 머물게 함으로써, Hyperball은 이전에 뒤섞여 있던 두 가지 요소를 분리합니다:

  • 크기: 설정값의 크기는 이제 고정되고 일정합니다 (비치볼의 반지름처럼).
  • 방향: 로봇은 오로지 어느 방향으로 회전할지에만 온전히 집중할 수 있습니다.

저자들은 기존의 "부드러운 브레이크"(가중치 감류)가 간접적으로 이 역할을 수행하려 했지만, 매우 지저분한 방식이었다고 주장합니다. Hyperball은 이를 직접적으로 수행합니다.

결과

저자들은 이를 최대 12억 개의 파라미터를 가진 모델(매우 큰 규모)까지 테스트했습니다:

  • 속도: Hyperball을 적용한 Muon을 사용했을 때, 로봇은 표준 방식보다 20~30% 더 빠르게 학습했습니다. 이는 이전의 Muon 방식이 이 정도 규모에서 약 10%의 우위만을 보였던 것과 비교하면 엄청난 개선입니다.
  • 안정성: 다양한 모델 크기에 맞춰 학습 속도(학습률)를 조정하기가 훨씬 쉬워졌습니다. 기존 방식에서는 모델 크기를 바꿀 때마다 설정을 완전히 새로 튜닝해야 했지만, Hyperball을 사용하면 마치 만능 열쇠처럼 동일한 설정이 다양한 크기에서도 잘 작동했습니다.

그 이면의 이론

이 논문은 이러한 유형의 AI 모델에서 중요한 것은 설정값이 0으로부터 떨어진 거리가 아니라, 설정값이 가리키는 방향이라고 설명합니다.

  • 기존 방식: 선생님은 학습 속도를 일정하게 만들기 위해 거리를 적절히 조절하려고 부드러운 브레이크를 사용했습니다.
  • Hyperball 방식: 선생님은 처음부터 거리를 완벽하고 고정된 크기로 잠가 버립니다. 이를 통해 선생님은 순수하게 로봇을 올바른 방향으로 조종하는 데에만 집중할 수 있습니다.

요 요약

Hyperball은 AI의 내부 설정이 비치볼 표면 위의 점처럼 고정된 크기를 유지하도록 강제하는 간단한 기법입니다. 이는 전통적인 "브레이킹" 방식이 유발하던 혼란을 제거하여, 고급 옵티마이저인 Muon이 AI 모델이 거대한 규모로 성장하더라도 빠르고 효율적인 상태를 유지할 수 있게 해줍니다. 이는 지저분하고 간접적인 과정을 깔끔하고 직접적인 과정으로 바꾸어 놓았습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →