← 최신 논문
🤖 machine learning

When to use what Schatten-pp norm in deep learning?

이 논문은 Schatten-\infty 방식인 Muon이 고차원 설정에서 탁월한 반면, Chinchilla 스케일링과 같은 저차원 영역에서는 더 작은 Schatten-pp 기하학이 실제로 최적이라는 것을 입증함으로써 Schatten-pp 노름 옵티마이저에 관한 상충하는 관찰 결과들을 해결하며, 이러한 발견은 Muon의 웜업 미요구 및 대규모 배치 선호도를 설명하는 p>2p>2에 대한 새로운 노이즈 강건 가속 결과에 의해 뒷받침된다.

원저자: Thomas Pethick

게시일 2026-06-16
📖 4 분 읽기☕ 가벼운 읽기

원저자: Thomas Pethick

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

큰 질문: 어떤 "자(Ruler)"를 사용해야 할까요?

당신이 광활하고 안개가 자욱한 계곡(AI 모델이 학습하려는 과정)에서 가장 낮은 지점을 찾으려고 한다고 상상해 보세요. 이를 위해서는 지면이 얼마나 가파른지 측정하고 어느 방향으로 발을 내디딜지 결정할 "자"가 필요합니다.

딥러닝의 세계에는 **샤텐-pp 노름(Schatten-pp norms)**이라고 불리는 다양한 종류의 자가 있습니다.

  • 샤텐-2 (유클리드): 우리가 보통 사용하는 표준적이고 직선적인 자입니다 (Adam과 같은 옵티마이저).
  • 샤텐-\infty ("Muon" 자): 단 하나의 가장 가파른 절벽에만 집중하는 특별하고 딱딱한 자입니다. 최근에는 이 자를 사용하는 Muon이라는 방법이 일부 테스트에서 매우 빠르게 작동하여 큰 인기를 끌었습니다.
  • 샤텐-pp ("골디락스" 자): 너무 부드럽지도, 너무 딱딱하지도 않게 경사를 측정하는 그 중간 단계의 자들입니다.

혼란:
사람들은 어떤 자가 최고인지를 두고 논쟁했습니다.

  • 어떤 이들은 "Muon (샤텐-\infty)이 최고다! 가장 빠르다!"라고 말했습니다.
  • 다른 이들은 "아니다, Muon은 과대평가되었다. 엄청난 양의 데이터로 학습할 때는 표준적인 방법들이 더 잘 작동한다"라고 말했습니다.

논문의 답변:
저자인 토마스 페식(Thomas Pethick)은 이렇게 말합니다: "당신들 둘 다 맞습니다. 하지만 당신들은 서로 다른 크기의 계곡을 보고 있습니다."

최고의 자는 전적으로 데이터의 양 대비 문제의 크기에 달려 있습니다.


두 가지 영역: 작은 연못 vs 거대한 대양

이 논문은 세상을 두 가지 주요 시나리오로 나눕니다.

1. "저차원(Low-Dimensional)" 영역 (작은 연못)

  • 무엇인가: 상대적으로 작은 모델을 사용하거나 짧은 학습 과정을 거칠 때 발생합니다 (논문에서 언급된 작은 게임의 "스피드런" 같은 경우). 모델의 복잡성보다 당신이 밟는 단계(데이터)의 수가 훨씬 많을 때입니다.
  • 비유: 당신이 작고 잘 밝혀진 정원을 걷고 있다고 상상해 보세요. 당신은 전체 경로를 볼 수 있습니다.
  • 최고의 자: 이 시나리오에서는 **샤텐-\infty 자 (Muon)**가 실제로 최고가 아닙니다. 놀랍게도, 더 작은 pp-자(표준 유클리드 자에 더 가까운 것)가 더 빠릅니다.
  • 이유: 작은 정원에서는 단 하나의 가파른 절벽에 과도하게 집중할 필요가 없습니다. 대신 빠르게 가속하기 위해 더 부드럽고 균형 잡힌 접근 방식이 필요합니다. 논문은 여기서 "더 부드러운" 자를 사용하는 것이 속도 향상을 가져다준다는 것을 증명합니다.

2. "고차원(High-Dimensional)" 영역 (거대한 대양)

  • 무엇인가: 거대한 AI 모델(LLM 등)을 사용하는 대규모 학습 과정입니다. 모델은 믿을 수 없을 정도로 복잡하며 데이터 또한 방대합니다.
  • 비유: 수천 개의 섬이 있는 거대하고 어두운 대양을 항해하고 있다고 상상해 보세요. 당신은 전체 지도를 볼 수 없습니다.
  • 최고의 자: 여기서 **샤텐-\infty 자 (Muon)**가 빛을 발합니다. 이 자는 이러한 거대하고 복잡한 지형의 특수한 "거칠기"를 처리하도록 설계되었습니다.
  • 주의점: 이 거대한 대양에서 Muon이 제대로 작동하게 하려면, 매우 큰 배치 사이즈(batch size)(대양의 아주 넓은 단면을 한 번에 보는 것)가 필요합니다. 만약 이 영역에서 작은 배치 사이즈로 Muon을 사용하려고 하면 실패하게 됩니다.

"배치 사이즈(Batch Size)"의 비밀

이 논문의 핵심 발견 중 하나는 배치 사이즈(AI가 한 단계를 밟기 전에 얼마나 많은 예시를 살펴보는지)에 관한 것입니다.

  • 규칙: 논문은 당신이 자를 바꿀 때(즉, p=2p=2에서 p=p=\infty로 바꿀 때), 이상적인 배치 사이즈도 함께 변해야 한다는 수학적 규칙을 도출했습니다.
  • 비유: 자를 배에 비유해 보세요.
    • **작은 배 (표준 자)**는 적은 인원(작은 배치 사이즈)으로도 항해할 수 있습니다.
    • **거대한 크루즈선 (Muon/샤텐-\infty)**은 안정성을 유지하고 빠르게 움직이기 위해 거대한 승무원(거대한 배치 사이즈)이 필요합니다. 만약 크루즈선을 단 두 명의 인원으로 운항하려 한다면, 배는 제자리에서 뱅글뱅글 돌 뿐일 것입니다.
  • 통찰: 이것이 왜 사람들이 "스피드런"(작은 모델에 거대한 배치를 사용하는 경우)에서는 Muon이 잘 작동하지만, 대규모 벤치마크(배치 사이즈가 특정 기하학적 구조에 맞춰 충분히 커지지 않은 경우)에서는 고전하는지를 설명해 줍니다.

왜 "웜업(Warmups)"이 필요한가요?

일부 AI 트레이너들이 "웜업"(천천히 시작해서 속도를 높이는 과정)이 필요하다는 말을 들어보셨을 겁니다.

  • 논문의 발견: **샤텐-\infty 자 (Muon)**는 매우 견고하기 때문에 웜업이 필요하지 않습니다. 즉, 즉시 전속력으로 시작할 수 있습니다.
  • 대조: 만약 저차원 영역에서 더 작은 pp-자를 사용한다면, 가속을 붙이기 위해 웜업 단계가 필요합니다.

"친칠라(Chinchilla)"와의 연결고리

이 논문은 AI의 유명한 법칙인 **친칠라 스케일링(Chinchilla scaling)**과 이 내용을 연결합니다. 이 법칙은 "데이터가 많아질수록 모델도 더 크게 만들어야 한다"고 말합니다.

  • 반전: 논문은 친칠라 스케일링을 따르더라도, 우리는 여전히 "저차원 영역"(작은 정원)에 머물러 있는 경우가 많다고 주장합니다.
  • 결과: 우리가 종종 이 "작은 정원" 영역에 있기 때문에, 순수한 Muon (샤텐-\infty)을 사용하는 것은 유한한 pp-노름 옵티마이저(HTMuon이나 Soft-Muon 같은 것)를 사용하는 것보다 오히려 덜 효율적일 수 있습니다. 이것이 왜 최근의 "더 부드러운" 자를 사용하는 방법들이 일부 대규모 테스트에서 Muon을 이기기 시작했는지를 설명해 줍니다.

요약: 당신의 자를 선택하는 방법

논문은 다음과 같은 간단한 가이드를 제시하며 결론을 맺습니다.

  1. "저차원" 영역에 있다면 (모델이 작거나, 모델 크기에 비해 데이터의 양이 매우 많은 경우):

    • 극단적인 샤텐-\infty (Muon)를 무조건 사용하지 마세요.
    • 대신 유한한 샤텐-pp 노름(더 "부드러운" 자)을 사용하는 것을 고려해 보세요. 이것이 더 빠르게 가속하고 노이즈를 더 잘 처리합니다.
    • 참고: 학습 중에 자를 바꿀 수도 있습니다! "딱딱한" 자로 시작해서 나중에 "부드러운" 자로 전환할 수 있습니다.
  2. "고차원" 영역에 있다면 (엄청난 복잡성을 가진 경우):

    • 샤텐-\infty (Muon)가 적절한 선택일 가능성이 높지만, 반드시 제대로 작동시키기 위해 매우 큰 배치 사이즈를 사용해야 합니다.

핵데 핵심: 단 하나의 "최고"인 옵티마이저는 없습니다. 최고의 도구는 문제의 크기와 당신이 가진 데이터의 양에 따라 달라집니다. 커뮤니티의 혼란은 사람들이 서로 다른 "영역"에서 도구들을 테스트하면서도 그 차이를 인지하지 못했기 때문에 발생했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →