← 최신 논문
🤖 machine learning

Nora: Normalized Orthogonal Row Alignment for Scalable Matrix Optimizer

본 논문은 행별 모멘텀 투영을 통해 가중치 노름과 각속도를 안정화하면서 최적의 O(mn)\mathcal{O}(mn) 계산 복잡도로 구조화된 전조건화를 근사함으로써 효율성, 안정성 및 속도를 통합하는 확장 가능한 행렬 최적화기인 Nora 를 소개합니다.

원저자: Jinghui Yuan, Jiaxuan Zou, Shuo Wang, Yong Liu, Feiping Nie

게시일 2026-05-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jinghui Yuan, Jiaxuan Zou, Shuo Wang, Yong Liu, Feiping Nie

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"확장 가능한 행렬 최적화를 위한 정규화 직교 행 정렬 (Nora: Normalized Orthogonal Row Alignment for Scalable Matrix Optimizer)"이라는 논문을 쉬운 언어와 일상적인 비유로 설명합니다.

큰 그림: 거대한 뇌를 가르치는 것

인공지능 (AI) 뇌, 예를 들어 대규모 언어 모델 (LLM) 을 훈련한다고 상상해 보세요. 이 뇌는 인간의 언어를 배우도록 조정해야 하는 수십억 개의 작은 노브와 스위치 (매개변수) 로 구성되어 있습니다.

이 노브들을 조정하는 과정을 **최적화 (optimization)**라고 합니다. '최적화기 (optimizer)'는 노브들이 얼마나, 그리고 어떤 방향으로 회전해야 하는지 알려주는 교사입니다.

오랫동안 가장 인기 있는 교사는 Adam이었습니다. 하지만 Adam 은 뇌의 노브들을 평평하고 지저분한 구슬 더미처럼 취급합니다. 이 노브들이 실제로는 깔끔하고 구조화된 격자 (행렬) 로 배열되어 있다는 사실을 인식하지 못합니다.

최근 Muon이라는 새로운 교사가 등장했습니다. Muon 은 격자 구조를 이해하는 데 탁월하지만, 매우 느리고 계산 비용이 많이 듭니다. 마치 각 노브 회전마다 복잡한 수학 방정식을 풀기 위해 멈추는 교사처럼요. 또 다른 교사인 RMNP는 빠르지만 때로는 노브들을 잘못된 방향으로 흔들게 만들어 훈련을 불안정하게 만듭니다.

Nora는 이 논문에서 소개된 새로운 교사입니다. Nora 는 '골디락스' 최적화기라고 주장합니다. RMNP 처럼 빠르고, Muon 처럼 똑똑하며, 훈련이 궤도에서 벗어나거나 충돌하지 않도록 안정적으로 유지합니다.


훌륭한 교사의 세 가지 규칙

저자들은 완벽한 최적화기는 세 가지 규칙을 충족해야 한다고 주장합니다:

  1. 효율성: 더 빠르게 학습하기 위해 스마트한 '격자 구조'를 활용해야 합니다.
  2. 안정성: 시스템을 흔들지 않아야 합니다. 노브가 너무 많이 흔들리면 AI 는 배운 것을 잊어버립니다.
  3. 속도: 계산 비용이 저렴하여 실행에 영원히 걸리지 않아야 합니다.

대부분의 기존 교사들은 이 중 하나에서 실패합니다. Muon 은 너무 느리고, RMNP 는 너무 불안정합니다. Nora 는 이 세 가지를 모두 해결하는 것을 목표로 합니다.


Nora 의 작동 원리: '댄스 플로어' 비유

Nora 를 이해하기 위해 AI 의 가중치 (노브) 를 춤추는 무대 위의 댄서들로 상상해 보세요.

1. 문제: '방사형' 흔들림

현대 AI 에서 댄서의 크기보다 그들이 향하는 방향이 더 중요합니다. 이를 **규모 불변성 (scale invariance)**이라고 합니다.

  • 실수: 기존 최적화기들은 때때로 댄서들을 방의 중심을 향해 직접 밀거나 밀어냅니다 (방사형 이동). 이는 벽으로 이동하면서 제자리에서 빙글빙글 도는 댄서와 같습니다. 이는 춤 동작을 배우는 데 도움이 되지 않으며, 에너지를 낭비하고 어지럽게 만듭니다 (불안정).
  • 목표: 우리는 댄서들이 중심과의 거리를 바꾸지 않고 방향만 바꾸는 옆으로 (접선 방향) 이동하기만 하기를 원합니다.

2. 해결책: '행 단위' 투영

Nora 는 **행 단위 직교 투영 (Row-wise Orthogonal Projection)**이라는 교묘한 트릭을 사용합니다.

  • 가중치 행렬을 행별로 나열된 댄서들의 격자로 상상해 보세요.
  • 한 줄의 댄서들에게 움직이라고 하기 전에 Nora 는 확인합니다: "너는 중심을 향해 이동하려고 하니?"
  • 만약 그렇다면 Nora 는 그 이동 부분을 잘라냅니다. 댄서들이 현재 위치와 수직인 방향으로만 이동하도록 투영합니다.
  • 결과: 댄서들은 자신의 '댄스 원' 위에 머무르게 되어 시스템이 안정적으로 유지되고 어지러워지지 않습니다.

3. 속도 트릭: '대각선 단축'

'똑똑한' 교사 (Muon) 는 전체 격자를 위한 완벽한 경로를 한 번에 계산하려고 합니다. 이는 시간이 오래 걸리는 무거운 수학 (뉴턴 - 슐츠 반복) 을 필요로 합니다.

  • Nora 의 단축: 저자들은 이러한 AI 격자에서 '행'들이 어느 정도 독립적으로 작용한다는 것을 발견했습니다. 그들은 수학 문제의 대각선만 보면 스마트한 경로를 근사할 수 있다는 사실을 깨달았습니다.
  • 전체 격자에 대한 거대하고 복잡한 계산을 수행하는 대신, Nora 는 각 행을 개별적으로 **정규화 (재조정)**합니다.
  • 비유: 모든 차를 동시에 완벽하게 경로 계산하는 교통 통제관 (느림) 대신, Nora 는 모든 차에게 직진하고 앞차와의 안전 거리를 유지하라고 말합니다 (빠름).

왜 Nora 가 더 좋은가? (결과)

이 논문은 다양한 크기 (6 천만 개 및 1 억 3 천 5 백만 개 매개변수) 의 AI 모델 (LLaMA) 에서 Nora 를 테스트하여 Muon, RMNP, Mano 와 비교했습니다.

  1. 더 나은 성능: Nora 는 다른 최적화기들에 비해 **최소 오차율 (손실)**과 최고의 '퍼플렉시티 (perplexity)'(AI 가 얼마나 혼란스러운지 측정하는 지표) 를 달성했습니다. 이는 언어를 더 잘 학습했음을 의미합니다.
  2. 더 빠른 훈련: Nora 는 무거운 수학을 건너뛰고 단순한 행 정규화만 수행하므로 훨씬 빠릅니다.
    • 작은 모델의 경우, 무거운 수학 방법보다 약 10 배 빠릅니다.
    • 거대한 모델 (10 억 개 매개변수) 의 경우, 70 배 이상 빠릅니다.
  3. 안정성: '방사형 흔들림'을 제거함으로써 Nora 는 훈련을 매끄럽게 유지했으며, 다른 방법들은 때로는 진동하거나 멈추곤 했습니다.

"두 줄의 코드" 주장

이 논문에서 가장 흥미로운 주장 중 하나는 모든 수학적 정교함에도 불구하고 Nora 의 핵심 로직이 놀라울 정도로 간단하다는 것입니다. 저자들은 최적화기의 전체 '두뇌'가 단 두 줄의 코드로 작성될 수 있다고 명시했습니다. 이는 다른 개발자들이 기존 시스템을 완전히 다시 작성하지 않고도 쉽게 Nora 를 연결할 수 있게 합니다.

요약

Nora는 AI 뇌를 훈련시키는 새로운 방법입니다. 빠른 최적화기의 불안정성과 똑똑한 최적화기의 느림을 해결합니다. 이는 다음과 같이 이루어집니다:

  1. 불필요한 움직임을 제거하여 (AI 를 안정적으로 유지).
  2. 스마트한 단축을 취하여 (AI 를 빠르게 유지).
  3. 더 잘 학습하여 (최고의 결과를 얻음).

이 논문은 수학적으로 이것이 작동함을 증명하고, 실험을 통해 현재 이러한 거대 모델을 훈련시키는 가장 효율적인 방법임을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →