← 최신 논문
🤖 machine learning

A Defense of the Quadratic Model

이 논문은 중간 체크포인트에서 테일러 전개를 통해 적용된 단순 이차 모델이 대규모 언어 모델의 최적화 역학을 놀라울 정도로 정확하게 예측할 수 있음을 입증하며, 이를 통해 구조화된 헤시안 스펙트럼을 밝히고 훈련이 일반적으로 배치 크스에 의존하는 확률적 안정성 경계에서 발생함을 확인한다.

원저자: Alexandru Meterez, Pranav Ajit Nair, Depen Morwani, Cengiz Pehlevan, Sham Kakade, Alex Damian

게시일 2026-07-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Alexandru Meterez, Pranav Ajit Nair, Depen Morwani, Cengiz Pehlevan, Sham Kakade, Alex Damian

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 밤에 안개가 자욱한 거대한 산맥을 항해하려고 노력하고 있다고 상상해 보십시오. 이 산은 거대 인공지능(AI)의 "손실 지형(loss landscape)"이며, 매우 복잡한 지형입니다. AI가 내딛는 모든 발걸음은 가장 낮은 골짜기(최상의 성능)를 찾기 위한 시도입니다. 문제는 이 산이 너무나 거대하고 뒤틀려 있어서 전체 지도를 한눈에 볼 수 없다는 것입니다. 수년 동안 과학자들은 AI가 어떻게 움직이는지 예측하기 위해 단순하고 평평한 지도나 이상적인 모델을 사용해 왔습니다. 때때로 이 지도들이 효과를 발휘하기도 하지만, 종종 너무 단순해서 쓸모가 없거나 계산하기에는 너무 복사합니다. 큰 질문은 이것입니다. 우리가 단순하고 평평한 지도를 사용하여 이 혼돈스러운 산을 통과하는 AI의 여정을 예측할 수 있을까요?

이를 이해하려면 몇 가지를 알아야 합니다. 먼저, AI 모델은 "최적화(optimizing)"를 통해 학습하는데, 이는 단순히 실수를 줄이기 위해 아주 작은 발걸음을 내딛는 것을 의미합니다. 둘데, "헤시안(Hessian)"은 특정 지점에서 지면이 얼마나 가파르거나 굽어 있는지를 설명하는 수학적 방법입니다. 곡률을 알면 한 걸음이 당신을 골짜기로 이끌지, 아니면 절벽 위로 올릴지 예측할 수 있습니다. 마지막으로, "안정성의 가장자리(edge of stability)"라는 개념이 있는데, 이는 마치 절벽 끝에서 걷는 것과 같습니다. 지면이 너무 가팔라서 한 번의 실수만으로도 굴러떨어질 수 있지만, AI는 어떻게든 떨어지지 않고 계속 걸어갑니다. 이 논문은 가장 단순한 지도, 즉 평평한 이차 함수 형태의 근사치(quadratic approximation)가 실제로 거대 AI의 행동을 예측할 수 있는지 묻고 있습니다.

이것을 이해하기 위해, 저자들은 30억 개의 단어로 학습된 1억 5천만 개의 파라미터를 가진 대규모 언어 모델(LLM)을 대상으로 이 단순한 "이차 모델(quadratic model)"을 스트레스 테스트하기로 했습니다. 그들은 전체의 미친 듯한 산 전체를 이해하려고 노력하는 대신, AI가 현재 있는 위치 주변의 작고 평평한 지면만을 보고 다음 몇 단계를 예측할 수 있는지 확인하고자 했습니다.

그들은 놀랍고 멋진 사실을 발견했습니다. 단순한 그릇 모양의 지도가 작동한다는 것입니다! 학습 과정의 매 10%마다 학습을 멈추고, 그 정확한 지점에서 평평한 이차 함수 버전의 문제를 만들었을 때, 이 단순한 모델은 다음 10%의 학습 과정을 정확하게 예측할 수 있었습니다. 이는 설령 산이 울퉁불퉁하고 엉망이라 할지라도, AI가 특정 "그릇 모양"의 골짜기에서 많은 시간을 보내기 때문에 단순한 그릇 모양의 지도가 다음 행방을 알려주기에 충분하다는 것을 의미합니다. 예측은 학습 초반보다 후반부에 더 뛰어났습니다.

단순한 지도가 작동한다는 것을 증명한 후, 그들은 AI 학습 과정의 내부를 들여다보는 데 사용했습니다. 그들은 "헤시안 스펙트럼(Hessian spectrum)", 즉 모든 서로 다른 경사와 곡률의 목록을 살펴보았습니다. 그들은 이 목록이 무작위가 아니라 매우 구체적인 구조를 가지고 있다는 것을 발견했습니다. 목록의 윗부분은 어휘(unembedding layer)를 처리하는 부분에 의해 지배되며, 길게 이어지는 뒷부분은 보편적인 "거듭제곱 법칙(power law)"을 따릅니다. 이는 AI가 아주 작은 배치(batch)의 데이터를 사용하는지 혹은 거대한 배치를 사용하는지에 관계없이 꼬리 부분의 모양이 동일하며, 최적화 속도를 높이기 위해 사용하는 특정 기법(preconditioners)에도 영향을 받지 않는다는 것을 의미합니다. 이는 혼돈 속에 숨겨진 보편적인 패턴입니다.

마지막으로, 그들은 "안정성의 가장자리"를 조사했습니다. 그들은 AI가 골짜기 한가운데에서 조심스럽게 걷고 있는지, 아니면 절벽 가장자리에서 춤을 추고 있는지 알고 싶었습니다. 학습률(learning rate)과 배치 크기(데이터 덩어리의 크기)를 조정해 본 결과, AI는 실제로 가장자리에서 춤을 추고 있다는 것을 발견했습니다. AI가 작은 배치를 사용할 때는 데이터의 무작위 노이즈 때문에 휘청거리는 "확률적 안정성의 가장자리(stochastic edge of stability)"에서 춤을 추며, 거대한 배치를 사용할 때는 단계 자체의 수학적 구조 때문에 불안정해지는 "결정론적 가장자리(deterministic edge)"에서 휘청거립니다. 두 경우 모두, AI는 안정적인 한계 지점에서 바로 작동하고 있으며, 이는 이러한 위태로운 균형 잡기가 실제로 모델이 가장 잘 학습하는 방식임을 시사합니다.

논문은 AI의 세계가 믿을 수 없을 정도로 복잡하지만, 이를 일련의 단순한 국소적 이차 문제들로 취급함으로써 이해할 수 있다고 결론짓습니다. 전체 산에 대한 하나의 불가능한 이론을 세우는 대신, AI가 서 있는 국소적인 그릇을 보면 됩니다. 이 단순한 모델은 단순한 장난감이 아닙니다. 그것은 실제 세상의 AI 사전 학습(pretraining)이 실제로 어떻게 작동하는지에 대한 놀라울 정도로 정확한 대리 모델(proxy)이며, 이 거대한 시스템들을 이해하고 개선할 수 있는 다루기 쉬운 새로운 방법을 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →