On the Principles Behind Neural Network Optimizers
이 논문은 Adam 옵티마이저의 수렴 논쟁을 해결하고, 진화하는 헤시안 구조를 통해 트랜스포머에서 SGD보다 우수한 이유를 설명함으로써 Adam 옵티마이저에 대한 원칙적인 이론적 토대를 제공하며, 이러한 통찰력을 활용하여 성능을 유지하면서도 메모리 사용량을 절반으로 줄이는 새로운 옵티마이저인 Adam-mini를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 인공지능은 섬세한 균형 잡기에 의존하고 있습니다. 컴퓨터가 사진 속의 고양이를 인식하거나 일관된 이야기를 쓰도록 가르치기 위해, 연구자들은 거대한 수학적 시스템을 오차의 지형 속으로 안내하며, 최저점을 찾기 위해 내부 설정값을 끊임없이 조정해야 합니다. 이 과정을 '훈련(training)'이라고 부르며, 이 지형을 탐색하는 데 사용되는 도구가 바로 옵티마이저(optimizer)입니다. 수년 동안 업계의 표준은 Adam이라 불리는 알고리즘이었습니다. 이는 코드를 작성하고, 언어를 번역하며, 대화를 나눌 수 있는 가장 강력한 언어 모델들의 기본 엔진입니다. 그러나 그 보편성에도 불구하고, Adam의 수학적 기초는 불안정했습니다. 거의 10년 동안, 유명한 이론적 결과는 Adam이 단순한 문제에서도 통제력을 잃고 폭주하며 처참하게 실패할 수 있다고 시사해 왔습니다. 이는 역설을 만들어냈습니다. 가장 진보된 AI를 구동하는 도구가 이론적으로는 고장 났음에도 불구하고, 실제로는 완벽하게 작동하고 있었던 것입니다. 연구자들은 왜 이론이 현실과 일치하지 않는지, 그리고 자신들이 의존하는 도구가 정말로 안전한 것인지 의문을 품게 되었습니다.
홍콩 중문대학교 선전 캠퍼스의 장위순(Yushun Zhang)의 새로운 박사 학위 논문은 문제를 새로운 각도에서 바라봄으로써 이 역설을 해결합니다. 이 연구는 단순히 이론을 보완하는 것에 그치지 않고, 이 모델들이 해결하는 문제의 본질 자체를 재검토합니다. 연구자는 Adam이 실패할 것이라는 공포가 실제 훈련이 어떻게 일어나는지를 반영하지 못하는 특정한 인위적인 설정에 기반했다는 것을 발견했습니다. 훈련 중에 사용되는 데이터 덩어리의 크기에 초점을 맞추도록 관점을 바꿈으로써, 이 연구는 설정값이 특정 작업에 맞게 적절히 조정된다면 Adam이 실제로 안전하다는 것을 증명합니다. 더 중요한 것은, 이 논문이 현대 신경망의 데이터 내부에 숨겨진 기하학적 구조를 밝혀냈다는 점입니다. 이 구조는 왜 Adam이 대규모 언어 모델과 같은 복잡한 작업에서는 경쟁자보다 뛰어난 성능을 보이는 반면, 더 단순한 작업에서는 성능이 떨어지는지를 설명해 줍니다. 알고 보니, 이 모델들의 내부 지형은 혼란스러운 엉킴이 아니라, 구별되고 조직된 블록들의 집합체였습니다. 이 패턴을 인식함으로써 연구자는 메모리 요구량을 절반으로 줄이면서도 성능을 희생하지 않는, 더 효율적인 새로운 옵티마이저인 Adam-mini를 설계할 수 있었습니다.
이야기는 Adam이 신뢰할 수 있는지에 대한 오랜 논쟁에서 시작됩니다. 수년 동안 널리 인용된 한 논문은 Adam이 발산할 수 있다, 즉 훈련 과정이 안정되기는커녕 무한대로 치솟을 수 있다고 주장했습니다. 이 주장은 알고리즘의 설정에 따라 규칙이 변하는 문제에서 알고리즘을 테스트했을 때의 특정 수학적 예시에 기반한 것이었습니다. 하지만 현실 세계에서 연구자들은 도구에 맞추기 위해 문제를 바꾸지 않습니다. 대신 문제를 고정하고 도구를 문제에 맞게 조정합니다. 장위순의 연구는 실제 훈련에서처럼 문제가 고정되어 있을 때 Adam이 발산하지 않는다는 것을 보여줍니다. 대신, Adam은 명확한 상전이(phase transition)를 보입니다. 즉, 설정이 잘못 선택되면 실패할 수 있지만, 올바르게 선택되면 안전하게 수렴합니다. 이 안전성의 핵심은 알고리즘이 과거의 정보에 얼마나 많은 가중치를 둘지를 제어하는 특정 설정에 있습니다. 연구는 더 큰 데이터셋에 대해서는 안정성을 확보하기 위해 이 설정값이 더 높아야 한다고 증명합니다. 이 발견은 엔지니어들이 실제로 관찰해 온 내용과 일치합니다. 즉, 작은 배치(batch)의 데이터로 대규모 언어 모델을 훈련할 때 이 설정을 높이면 훈련이 무너지는 것을 방지할 수 있다는 것입니다. 이 논문은 수정 없이 표준 버전의 Adam을 적절히 튜닝했을 때 사용하는 것이 안전하다는 것을 입증하는 최초의 엄밀한 수학적 증명을 제공합니다.
Adam이 안전하다는 것을 확립한 후, 연구는 더 당혹스러운 질문으로 넘어갑니다. 왜 Adam이 트랜스포머(Transformer)와 같은 복잡한 모델에서는 주요 경쟁자인 SGD보다 훨씬 더 잘 작동하면서, 더 단순한 모델에서는 성능이 떨어지는가 하는 점입니다. 이에 답하기 위해 연구자는 오차 지형의 형태, 특히 모든 방향에서 오차가 어떻게 변하는지를 설명하는 '헤시안(Hessian)'이라는 수학적 객체를 살펴보았습니다. 단순한 문제에서 이 지형은 모든 경로가 서로 연결된 울창한 숲처럼 조밀하고 엉켜 있습니다. 이러한 환경에서는 각 설정을 개별적으로 조정하는 Adam의 전략이 비효직적입니다. 그러나 연구자가 심층 신경망과 트랜스포머의 헤시안을 조사했을 때, 놀라운 패턴이 나타났습니다. 훈련이 진행됨에 따라, 복잡하고 엉킨 지형은 구별되고 분리된 블록들의 구조로 단순화되었습니다. 거대한 스프레드시트를 상상해 보십시오. 모든 셀이 서로에게 영향을 주는 대신, 영향력이 특정 행과 열에 국한되어 있는 모습입니다. 이 네트워크들에서 특정 출력 뉴런이나 특정 어텐션 헤드(attention head)를 제어하는 파라미터들은 자신들만의 고립된 그룹을 형성합니다.
이 블록 형태의 구조가 Adam 성공의 비밀입니다. 지형이 독립적인 블록들로 나뉘어 있기 때문에, 각 파라미터에 고유한 학습률을 할당하는 Adam의 방식이 매우 효과적이 됩니다. Adam은 한 블록의 설정을 조정하면서 다른 블록의 설정을 실수로 망가뜨리지 않을 수 있습니다. 반면, SGD와 같은 더 단순한 옵티마이저는 전체 시스템에 단일 학습률을 적용하는데, 이는 다양한 속도와 규모를 가진 이러한 서로 다른 블록들을 다루는 데 어려움을 겪습니다. 연구는 이 블록 구조가 우연이 아니라는 점 또한 밝혔습니다. 이는 네트워크가 구축되는 방식, 구체적으로 계산 과정 중 대규모 행렬의 연속적인 곱셈으로부터 자연스럽게 발생합니다. 네트워크가 훈련됨에 따라 시스템의 먼 부분들 사이의 연결은 희미해지며, 그 자리에 이러한 깨끗하고 분리된 블도 남게 됩니다. 이 통찰은 왜 Adam이 현대 AI의 엔진인지 설명해 줍니다. 즉, 그것이 해결하는 문제들이 옵티마이저의 설계와 완벽하게 일치하는 숨겨진 기하학적 구조를 가지고 있기 때문입니다.
이 숨겨진 블록 구조에 대한 이해를 바탕으로, 연구자는 Adam-mini라는 새로운 옵티마이저를 개발했습니다. 표준 Adam 알고리즘은 모델의 모든 개별 파라미터에 대해 고유한 학습률을 추적하기 때문에 메모리를 많이 소모합니다. 거대 언어 모델의 경우, 이는 모델 자체보다 두 배 많은 데이터를 저장해야 함을 의미하며, 이는 훈련을 늦추고 가용 하드웨어에서 실행할 수 있는 모델의 크기를 제한하는 병목 현상을 만듭니다. 새로운 통찰은 파라미터들이 블록 단위로 구성되어 있기 때문에, 모든 파라미터마다 고유한 학습률을 가질 필요가 없다는 것이었습니다. 대신, 각 전체 블록에 하나의 학습률을 할 할당할 수 있습니다. 이 간단한 변화는 메모리 사용량을 50% 줄여줍니다. 새로운 옵티마이저인 Adam-mini는 파라미터를 자연스러운 블록 구조에 따라 그룹화합니다. 대부분의 레이어는 행(row) 단위로, 특정 부분은 어텐션 헤드 단위로 그룹화하여 각 그룹에 단일 학습률을 적용합니다.
이러한 재설계의 결과는 즉각적이고 실용적입니다. 3,900만 개에서 10억 개의 파라미터를 가진 모델을 훈련하는 테스트에서, Adam-mini는 절반의 메모리만을 사용하면서도 표준 Adam 옵티마이저와 대등한 성능을 보여주었습니다. 이 효율성 덕분에 연구자들은 동일한 하드웨어로 더 큰 모델을 훈련하거나 기존 모델을 더 빠르게 훈련할 수 있습니다. 이 접근 방식은 이미 DeepSeek과 Kimi K3 모델 팀을 포함한 주요 AI 연구소들에 채택되었으며, 이들은 차세대 시스템을 훈련하기 위해 이 방법의 변형을 사용하고 있습니다. 또한 이 논문은 블록 단위 학습률(block-wise learning rates) 원칙이 다른 고급 옵티마이저에도 적용되어, 핵심 로직을 변경하지 않고도 효율성을 높일 수 있음을 보여주었습니다. 신경망 훈련의 숨겨진 기하학을 밝혀냄으로써, 이 연구는 이 분야를 불확실성과 시행착오의 영역에서 원칙 있는 설계의 영역으로 이동시켰습니다. 이는 인공지능을 위한 가장 효과적인 도구가 단순히 운 좋은 추측이 아니라, 그들이 해결하는 문제의 특정한 수학적 구조에 완벽하게 조율된 알고리즘임을 입증합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.