← 최신 논문
📊 statistics

Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers

본 논문은 임베딩, LM 헤드, SwiGLU MLP, MoE 라우터와 같은 다양한 파라미터 블록의 특정 공변성 구조와 그래디언트 업데이트 규칙을 정렬하는 최적화기 설계를 위한 대칭성 호환 원리를 제시하며, 광범위한 사전 학습 실험을 통해 이러한 맞춤형 최적화기가 최종 검증 손실과 학습 안정성 측면에서 일관되게 AdamW 보다 우수함을 입증한다.

원저자: Tim Tsz-Kit Lau, Weijie Su

게시일 2026-05-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tim Tsz-Kit Lau, Weijie Su

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대하고 복잡한 로봇에게 새로운 언어를 가르치려 한다고 상상해 보세요. 이 로봇은 여러 가지 다른 부분으로 구성되어 있습니다: 어휘 사전, 문장을 처리하는 뇌, 그리고 어떤 전문가를 상담할지 결정하는 의사결정 시스템입니다.

수년 동안 이 로봇을 가르치는 표준적인 방법은 범용적인 일괄 적용 페인트 브러시를 사용하는 것과 같았습니다. "학습 페인트"에 브러시를 담그고 로봇의 모든 부분에 무작위로 찍어 바르는 방식입니다. 그 부분이 실제로 무엇을 하는지와 관계없이 말입니다. 이 방법 ( AdamW라고 함) 은 로봇의 뇌에 있는 모든 작은 숫자를 독립적이고 고립된 점으로 취급합니다. 그럭저럭 작동은 하지만, 로봇의 일부가 실제로 구조화된 격자, 표, 또는 상호 연결된 네트워크라는 사실을 무시합니다.

이 논문은 모든 것에 단일 브러시를 사용하는 것을 중단해야 한다고 주장합니다. 대신 로봇의 각 부분에 맞는 특수 도구를 사용해야 합니다. 저자들은 이를 **"대칭성 호환 원칙 (Symmetry-Compatible Principle)"**이라고 부릅니다.

다음은 그들이 간단한 비유를 사용하여 설명하는 방식입니다:

1. 문제: "좌표 단위 (Coordinate-Wise)" 오류

대부분의 현재 최적화기는 로봇의 뇌를 긴 평면 숫자 목록처럼 취급합니다. 도시 사진이 있다고 상상해 보세요. "좌표 단위" 최적화기는 사진 하나하나의 픽셀 밝기를 하나씩 독립적으로 조정하여 사진을 고치려 합니다. 그것은 건물이 연결된 구조라는 사실이나 하늘이 부드러운 그라데이션을 가진다는 사실을 인식하지 못합니다. 이는 데이터의 **기하학적 구조 (형상과 구조)**를 무시합니다.

2. 해결책: 작업에 맞는 도구 선택

저자들은 신경망의 서로 다른 부분들이 서로 다른 "대칭성 (재배열해도 깨지지 않는 규칙)"을 가지고 있다고 말합니다. 최적화기는 이러한 규칙을 존중해야 합니다.

  • 사전 (임베딩 및 LM 헤드):

    • 형상: 어휘 목록을 행이 단어이고 열이 특징인 거대한 스프레드시트라고 생각하세요. 단어의 순서 (행) 를 섞어도 의미가 변하지 않지만, 특징 (열) 을 자유롭게 회전시킬 수는 없습니다.
    • 옛 방식: 범용 최적화기는 모든 단어 - 특징 쌍을 별도의 점으로 취급합니다.
    • 새 방식: 이 논문은 "행 노름 (Row-Norm)" 또는 "오른쪽 스펙트럼 (Right-Spectral)" 업데이트를 사용할 것을 제안합니다.
    • 비유: 모든 픽셀을 페인트하는 대신, 각 단어 (행) 의 밝기를 그 단어가 얼마나 활발하게 사용되는지에 따라 조정합니다. 단어가 거의 사용되지 않으면 부드럽게 밀어주고, 자주 사용되면 더 강하게 밀어줍니다. 이는 단어들이 목록의 고유한 항목이라는 사실을 존중합니다.
  • 뇌의 숨은 층 (SwiGLU MLP):

    • 형상: 이 층들은 서로 바꿀 수 있는 "뉴런"을 가지고 있습니다. 뉴런 A 와 뉴런 B 를 서로 바꾸더라도 수학적으로 동일하게 작동합니다.
    • 새 방식: 이 논문은 "행 인식 (Row-Aware)" 또는 "열 인식 (Column-Aware)" 업데이트를 제안합니다.
    • 비유: 일하는 팀을 상상해 보세요. 두 명의 직원의 이름을 바꾸더라도 팀은 여전히 기능합니다. 최적화기는 이를 인식하여 각 직원을 고립된 개인으로 취급하는 대신 팀 전체의 노력을 함께 조정합니다.
  • 전문가 스위치보드 (MoE 라우터):

    • 형상: "혼합 전문가 (Mixture of Experts)" 모델에서 라우터는 어떤 전문가를 호출할지 결정합니다. 전문가들은 상호 교환 가능합니다 (이름을 바꾸면 전문가 1 과 전문가 2 는 동일합니다). 또한 라우터는 "공유 이동 (shared shift)"을 가지며 (모든 점수에 상수를 더해도 선택이 변하지 않음), 이는 라우터가 점수 차이에만 의존함을 의미합니다.
    • 새 방식: 이 논문은 "중앙화된 행 노름 (Centered Row-Norm)" 또는 "왼쪽 스펙트럼 (Left-Spectral)" 업데이트를 제안합니다.
    • 비유: 동일한 전문가 팀에게 업무를 배정하는 관리자를 상상해 보세요. 관리자는 누가 "전문가 1"인지 "전문가 2"인지 신경 쓰지 않습니다. 새로운 최적화기는 관리자가 팀을 하나의 집단으로 대우하도록 보장하며, 임의의 레이블에 혼동되지 않고 그들의 집단적 업무량을 조정합니다.

3. 결과: 더 나은 로봇

저자들은 Qwen, Gemma, OLMoE 와 같은 여러 가지 언어 모델을 훈련시켜 이 아이디어를 테스트했습니다. 그들은 범용적인 "일괄 적용" 최적화기를 모델의 특정 부분에 대한 특수한 대칭성 인식 도구로 대체했습니다.

무슨 일이 일어났습니까?

  • 더 나은 성능: 거의 모든 테스트에서 로봇은 더 빠르게 학습했고, 범용 방법으로 훈련된 로봇보다 더 낮은 오류율 (더 나은 검증 손실) 로 끝났습니다.
  • 안정성: 훈련 과정이 더 매끄러웠으며, 갑작스러운 오류 급증이 적었습니다.
  • 확장성: 더 큰 모델과 거대한 어휘를 가진 모델에서 이러한 이점이 더욱 두드러졌습니다.

결론

이 논문은 옛 방법이 "고장 났다"거나 다시는 사용되지 않을 것이라고 주장하지 않습니다. 대신 기하학이 중요함을 주장합니다. 전구 나사를 조이는데 망치를 사용하지 않는 것처럼, 복잡한 신경망의 모든 부분에 범용적인 좌표 기반 최적화기를 사용해서는 안 됩니다.

뇌의 업데이트 대상 부분의 특정 형상과 대칭성에 맞춰 "학습 도구"를 설계함으로써, 우리는 더 좋고, 효율적이며, 안정적인 AI 모델을 구축할 수 있습니다. 이는 AI 를 무작위 숫자의 가방으로 취급하는 것에서 기하학적 구조를 가진 객체로 취급하는 것으로의 전환입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →