← 최신 논문
🤖 machine learning

Training nGPT

이 논문은 로짓 그래디언트 프리컨디셔닝(Logit Gradient Preconditioning)과 게이티드 아담 더블유(GatedAdamW)와 같은 기술을 결빙하여, 14B 파라미터 규모의 하이브리드 맘바-트랜스포머 MoE 모델이 약 절반의 훈련 토큰만을 사용하여 비정규화된 대응 모델들과 동일한 검증 손실을 달성할 수 있게 하는 정규화된 트랜스포머(nGPT)를 위한 실용적인 훈련 레시피를 제시한다.

원저자: Ilya Loshchilov, Boris Ginsburg

게시일 2026-08-04
📖 5 분 읽기🧠 심층 분석

원저자: Ilya Loshchilov, Boris Ginsburg

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계를 컴퓨터가 이야기를 쓰고, 수학 문제를 풀고, 인간처럼 대화하는 법을 배우려고 노력하는 거대하고 북적이는 도서관이라고 상상해 보세요. 이를 위해 컴퓨터는 '뉴럴 네트워크(신경망)'라고 불리는 특별한 수학적 구조를 사용하는데, 이는 마치 서로 복잡하게 연결된 뉴런들의 거대한 그물망과 같습니다. 이 그물망 내부에서 정보는 숫자의 형태로 이동하며, 네트워크는 이 뉴런들 사이의 연결 강도를 조 조정함으로써 학습합니다. 오랫동안 과학자들은 이 숫자들이 엉망이 될 수 있다는 점을 발견해 왔습니다. 때로는 너무 커지기도 하고, 때로는 아무것도 남지 않을 만큼 작아지기도 하며, 이로 인해 시스템이 더 똑똑해지기 위해 어느 방향으로 움직여야 할지 혼란에 빠지기도 합니다. 이는 마치 배낭의 무게가 계속 변하는 가파르고 안개 낀 산을 오르는 것과 같습니다. 한 걸음 앞으로 나아갔다가도 바로 다시 미끄러져 내려올 수 있기 때문입니다. 이 연구의 목표는 컴퓨터가 훨씬 더 빠르고 효율적으로 학습의 산을 오를 수 있도록 배낭을 메는 더 나은 방법을 찾는 것입니다.

여러분이 읽게 될 이 논문은 Ilya Loshchilov와 Boris Ginsburg가 이끄는 NVIDIA 팀의 연구 결과입니다. 그들은 구체적인 문제, 즉 모든 내부 숫자가 완벽하고 보이지 않는 구(sphere) 위에 머물도록 강제함으로써 어떻게 AI 모델을 더 잘 학습시킬 수 있는지에 대해 다룹니다. 이것은 "어떠한 거리를 걷더라도 항상 도시 중심에서 정확히 1마일 떨어져 있어야 한다"라는 규칙과 같습니다. '정규화(normalization)'라고 불리는 이 규칙은 숫자가 너무 커지거나 작아지는 것을 방지하여 컴퓨터가 집중력을 유지하도록 돕습니다. 저자들은 'nGPT(normalized GPT)'라고 불리는 이전의 아이디어를 바탕으로, 긴 시퀀스를 기억하는 데 뛰어난 'Mamba-2'와 문맥 이해에 탁적인 'Transformer'라는 두 가지 서로 다른 기술을 결합한 매우 현대적이고 강력한 유형의 AI를 테스트했습니다. 그들은 이 새로운 학습 규칙이 하이브리드 모델을 기존 방식보다 더 빠르게 학습시킬 수 있는지 확인하고자 했습니다.

핵심 아이디어: 새로운 학습 레시피

저자들은 단순히 한 가지 요소를 수정하는 데 그치지 않고, 이 AI 모델들을 위한 완전히 새로운 '학습 레시피'를 만들어냈습니다. 로봇에게 걷는 법을 가르친다고 상상해 보세요. 기존 방식(AdamW라고 불리는 표준 방식)은 로봇이 때로는 거대하고 서투른 발걸음을 내딛고, 때로는 아주 작고 주저하는 발걸음을 내딛으며 결국 길을 찾기를 바라는 채로 비틀거리며 돌아다니게 하는 것과 같습니다. 그들이 'nGPT 학습 레시Recipe'라고 부르는 새로운 방식은 로봇이 완벽한 발걸음을 유지할 수 있도록 매우 구체적인 규칙이 적용된 러닝머신 위에 올려두는 것과 같습니다.

이들이 수행한 작업을 일상적인 개념으로 나누어 설명하면 다음과 같습니다:

1. 로짓 그래디언트 프리컨디셔닝 (볼륨 조절 노브)
AI가 문장의 다음 단어를 예측하려고 할 때, '로짓(logits)'이라고 불리는 점수 목록을 생성합니다. 기존 시스템에서는 학습이 진행됨에 따라 이 점수들의 볼륨이 이상하게 커지거나 작아질 수 있어, 로봇이 얼마나 강하게 밀어야 할지 혼란을 줄 수 있었습니다. 저자들은 조절 가능한 스케일 벡터인 특별한 '볼륨 조절 노브'를 추가했습니다. 하지만 여기서 영리한 점은, 단순히 노브를 돌리기만 하면 로봇의 걷는 법에 대한 기억을 망칠 수 있다는 사실을 깨달았다는 것입니다. 그래서 그들은 **로짓 그래디언트 프리컨디셔닝(Logit Gradient Preconditioning)**이라는 트릭을 발명했습니다. 이는 소리를 변화시키는 볼륨 노브가 있지만, 로봇이 실수로부터 배우려고 할 때 시스템이 자동으로 볼륨을 정상 수준으로 다시 낮추어 로보가 혼란스럽지 않게 만드는 것과 같습니다. 이를 통해 예측의 '크기'가 변하더라도 학습 과정이 안정적으로 유지됩니다.

2. 로그 스케일 학습률 감쇠 (스피드 레이서)
보통 AI를 학습시킬 때, 자동차 운전자가 가속 페달에서 서서히 발을 떼는 것처럼 빠른 학습 속도로 시작하여 점차 속도를 줄입니다. 저자들은 기존의 방식(매끄러운 곡선 형태)이 그들의 새로운 '구(sphere)' 시스템에는 최적이 아니라는 것을 발견했습니다. 대신 그들은 '로그 스케일 학습률 감쇠(Logarithmic Learning Rate Decay)'를 사용했습니다. 이는 출발선에서 엄청난 속도로 질주하다가 처음에는 자신의 위치를 파악하기 위해 매우 빠르게 속도를 줄인 뒤, 나머지 경주 동안은 길고 꾸준한 꼬리를 그리며 순항하는 레이스 카를 상상해 보세요. 이 '앞부분에 집중된(front-loaded)' 스케줄은 모델이 기초를 빠르게 배우고, 이후 긴 시간 동안 기술을 정교하게 다듬을 수 있게 하여 훨씬 더 효율적이었습니다.

3. GatedAdamW (스마트한 문지기)
로봇의 뇌를 업데이트하는 표준 방식은 AdamW입니다. 저자들은 이를 GatedAdamW로 업그레이드했습니다. 표준 방식이 아주 작고 거의 눈에 띄지 않는 업데이트조차 모두 통과시키는 문지기라면, GatedAdamW는 '스마트한 문'을 가진 문지기입니다. 만약 업데이트가 너무 작으면(속삭임처럼 작으면), 문지기는 "오늘은 안 돼"라고 부드럽게 말하며 이를 차단합니다. 반면 업데이트가 크다면(외침처럼 크다면), 문은 활짝 열립니다. 이는 로봇이 사소하고 무의미한 조정에 에너지를 낭비하는 것을 방지하고, 크고 중요한 변화에 집중할 수 있도록 돕습니다.

4. 각도 단계 제한 (안전 목줄)
로봇이 구 위를 걷고 있기 때문에, 너무 큰 발걸음을 내디디면 통제력을 잃고 회전하거나 엉뚱한 쪽으로 튕겨 나갈 수 있습니다. 저자들은 '각도 단계 제한(Angular Step Cap)'을 추가했는데, 이는 마치 안전 목줄과 같습니다. 만약 로봇이 너무 큰 발걸음을 떼려고 하면, 목줄이 부드럽게 로봇을 안전하고 작은 각도로 끌어당깁니다. 이는 로봇이 결코 거칠고 위험한 도약을 하지 못하게 하여 여정을 매끄럽고 안정적으로 유지해 줍니다.

결과: 더 효율적인 학습

팀은 이 새로운 레시피를 10억 개에서 140억 개의 파라미터(로봇의 '뇌 크기')에 이르는 일련의 AI 모델에 테스트했습니다. 그들은 자신들의 새로운 nGPT 모델을 기존 방식으로 학습된 표준 GPT 모델들과 비교했습니다.

결과는 인상적이었습니다. 새로운 nGPT 모델은 표준 모델보다 지속적으로 낮은 에러율(검증 손실로 측정됨)을 달umps 달성했습니다. 구체적으로, 140억 파라미터 nGPT 모델은 표준 140억 모델과 동일한 숙련도에 도달했지만, 그 과정에서 약 절반의 학습 토큰(모델이 읽는 텍ка스트의 양)만을 필요로 했습니다. 즉, 동일한 목적지에 도달하기 위해 nGPT 모델은 표준 모델에 비해 약 절반의 텍스트만 읽어도 된다는 뜻입니다.

논문은 이러한 개선이 단 하나의 트릭이 아니라, 이 모든 새로운 규칙들이 함께 작동한 결과임을 시사합니다. 또한 그들은 '스마트 게이트'의 특정 설정(샤프니스 파라미터 aa라고 불리는)을 테스트했으며, 부드러운 게이트(a=0.5a=0.5)가 엄격한 게이트보다 약간 더 효과적이라는 것을 발견했습니다. 하지만 가장 큰 승리는 게이트 자체보다는 전체적인 새로운 학습 시스템에서 왔습니다.

이것이 의미하는 바

저자들은 자신들이 이 규칙들의 모든 가능한 변형을 시도한 것은 아니라는 점(완전한 '절제 실험/ablation study'를 수행한 것은 아님)을 유념해야 하며, 따라서 아직 발견하지 못한 더 나은 설정이 있을 수 있습니다. 그러나 그들이 찾아낸 결과는 견고합니다. AI가 완벽한 구 위를 걷도록 강제하고, 더 스마트하고 통제된 방식으로 발걸음을 떼게 함으로써, 이러한 거대 모델들을 훨씬 적은 데이터와 시간으로 더 똑똑하게 가르칠 수 있다는 것입니다. 이는 우리가 인터넷 전체를 먹일 필요 없이, 훨씬 더 효율적인 부분만을 사용하여 더 나은 AI를 구축할 수 있음을 보여주는 실질적인 레시피입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →