← 최신 논문
📊 statistics

SGD at the Edge of Stability: Stochastic Stabilization with Large Learning Rates

이 논문은 다중 클래스 교차 엔트로피 손실에 대해 큰 학습률을 사용하는 확률적 경사 하강법(SGD)에 대한 날카로운 수렴 보장을 확립하며, 내재된 확률성이 알고리즘이 수렴을 보장하기 위해 안정성 경계의 진동과 제어된 하강 사이를 교차하며 스스로 안정화되도록 한다는 것을 입증한다.

원저자: Konstantinos Emmanouilidis, Lachlan MacDonald, Salma Tarmoun, Rene Vidal

게시일 2026-07-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Konstantinos Emmanouilidis, Lachlan MacDonald, Salma Tarmoun, Rene Vidal

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 아주 울퉁불퉁하고 구불구불한 언덕 아래로 무거운 바위를 굴려 내려보내어 바닥(완벽한 해결책)에 도달하려고 노력하고 있다고 상상해 보세요. 머신러닝의 세계에서 이 바위는 당신의 AI 모델이고, 언덕은 (모델이 얼마나 틀렸는지를 나타내는 지도인) '손실 지형(loss landscape)'이며, 바닥은 모델이 실수를 가장 적게 하는 지점입니다.

오랫동안 과학자들은 바위를 아주 부드럽고 조심스럽게 밀어야 한다고 믿었습니다. 만약 너무 세게 밀면(높은 '학습률'을 사용하면), 바위가 벽에 부딪히거나, 가장자리 너로 날아가 버리거나, 혹은 루프에 갇혀 결코 바닥에 도달하지 못할 것이라고 생각했습니다. 이것이 바로 "고전적 이론"이었습니다.

하지만 현대 AI에서 엔지니어들은 이상한 점을 발견했습니다. 바위를 매우 강하게 밀었을 때, 오히려 바위가 더 빠르게 바닥에 도달하며 때로는 부드럽게 밀었을 때보다 더 좋은 지점을 찾아낸다는 사실을 말이죠. 이 현상을 **"안정성의 가장자리(Edge of Stability)"**라고 부릅니다. 이것은 마치 자동차가 접지력의 한계치까지 몰아붙이며 운전하는 것과 같습니다. 차체가 흔들리고 미끄러지긴 하지만, 여전히 앞으로 나아가는 상태를 말합니다.

문제는 이 "흔들리는 운전"을 설명하는 대부분의 수학이 결정론적인(deterministic) 세상(도로의 모습이 정확히 어떻게 생겼는지 아는 세상)을 위해 작성되었다는 점입니다. 하지만 실제 현실의 AI는 **확률적 경사 하강법(Stochastic Gradient Descent, SGD)**을 사용합니다. 즉, AI는 전체 도로를 한꺼번에 보는 것이 아니라, 어느 방향으로 밀지 결정하기 전에 아주 작고 무작위적인 도로의 일부(미니 배치)만을 봅니다. 이는 **노이즈(무작위성)**를 혼합시킵니다.

이 논문은 다음과 같은 질문을 던집니다: 이 무작위 노이즈가 안정성의 가장자리에서 발생하는 "흔들리는 운전"에 어떤 영향을 미칠까요? AI는 충돌할까요, 아니면 스스로 안정화되는 방법을 찾아낼까요?

저자들이 발견한 내용을 쉬운 비유를 통해 설명하면 다음과 같습니다.

1. 두 가지 운전 모드

저자들은 높은 학습률과 무작위 노이즈를 사용할 때, AI의 여정이 단순히 혼란스러운 난장판이 아니라는 것을 발견했습니다. 실제로 AI는 두 가지 뚜렷한 모드 사이를 전환합니다.

  • "미끄러지는" 단계 (안정성의 가장자리): 바위가 너무 세게 밀려서 턱에 부딪혀 격렬하게 튀어 오르기 시작한다고 상상해 보세요. 오차(바닥으로부터 떨어진 거리)가 위아래로 요동칩니다. 겉보기에는 불안정해 보입니다. 이 단계에서 AI는 언덕의 "곡률(경사도 변화)"에 의해 지배됩니다.
  • "활주하는" 단계 (안정적 영역): 결국 AI는 일정한 리듬을 찾습니다. 여전히 강하게 밀리고 있음에도 불구하고, 평균적으로 바닥에 가까워지는 구역에 진입합니다. 오차가 꾸준히 감소합니다.

2. "자기 안정화"의 마법

가장 놀라운 발견은 AI가 무작위성을 어떻게 다루는지에 대한 것입니다.

노이즈가 없는 완벽한 세상이라면, 너무 세게 밀었을 때 목표를 지나쳐 다시 돌아오지 못할 수도 있습니다. 하지만 노이즈가 존재하는 실제 세상에서 저자들은 SGD에 내장된 자기 교정 메커리즘이 있다는 것을 증명했습니다.

  • 비유: 폭풍우가 치는 가운데 외줄 타기를 하고 있다고 상상해 보세요(노이즈). 때때로 바람이 당신을 줄 밖으로 밀어냅니다(AI가 안정 영역을 벗어남).
  • 발견: 저자들은 설령 바람이 당신을 줄 밖으로 밀어내더라도, 줄의 형태(크로스 엔트로피 손실의 수학적 구조)가 자석처럼 작용한다는 것을 보여줍니다. 그것은 당신을 다시 줄 위로 끌어당깁니다. 당신이 줄에서 몇 번 발을 헛디딜 수는 있겠지만, 당신은 항상 특정하고 예측 가능한 단계 안에 다시 돌아오게 됩니다.
  • 결과: AI는 충돌하지 않습니다. AI는 흔들리고 무작위 노이즈 때문에 잠시 안정 영역을 벗어나기도 하지만, 즉시 스스로를 교정하여 안전하고 안정적인 경로로 돌아옵니다. 이 과정은 반복되지만, AI가 점점 더 똑똑해짐에 따라(손실이 낮아짐에 따라), AI는 안정적인 경로에서 보내는 시간이 점점 더 많아지고 벗어나는 시간은 줄어듭니다.

3. 단순한 모델과 복잡한 모델 모두에 적용됨

저자들은 단순히 직선 형태의 모델(선형 분류기)만 살펴본 것이 아닙니다. 그들은 2층 신경망(딥러닝의 기본 형태)도 살펴보았습니다.

  • 그들은 추가된 복잡성과 무작위 노이즈가 있음에도 불구하고 동일한 규칙이 적용된다는 것을 증명했습니다.
  • 그들은 이러한 자기 안정화가 일어날 수 있게 하는 특정 "활성화 함수(AI 내부의 수학적 스위치)"를 식별했습니다. 그들은 현대 AI에서 흔히 쓰이는 도구들(GELU 또는 Softplus 등)이 이 규칙에 완벽하게 부합한다는 것을 보여주었습니다.

4. 결과로 증명함 (실험)

그들의 수학이 단순한 이론에 불근하지 않음을 확인하기 위해, 저자들은 실제 데이터(MNIST 필기 숫자 및 CIFAR-10 이미지)를 사용하여 실험을 진행했습니다.

  • 그들은 매우 큰 학습률(기존 교과서에서 안전하다고 말하는 수준보다 훨씬 높은)을 사용하여 AI 모델을 훈련했습니다.
  • 결과: 모델이 폭주하거나 터지지 않았습니다. 대신 손실(오차)이 빠르게 떨어졌습니다. 모델은 더 빠르게 훈련되었고 높은 정확도를 달양성했는데, 이는 "안정성의 가장자리에서의 흔들리는 운전"이 안전할 뿐만 아니라 종종 더 우수하다는 것을 확인시켜 줍니다.

요약

이 논문은 왜 현대의 AI가 "무모한" 학습률을 사용할 때도 잘 작동하는지를 설명합니다. 알고 보니 훈련 과정의 **무작위성(노이즈)**은 단순한 방해 요소가 아닙니다. 그것은 문제의 형태와 상호작용하여 자기 안정화 루프를 만들어냅니다.

AI는 안정성의 가장자리에서 비틀거리고 흔들릴 수 있지만, 자신을 붙잡아 안정적인 경로로 되돌려 놓는 보이지 않는 안전망을 가지고 있습니다. 덕분에 AI는 조심스럽고 느리게 운전할 때보다 더 빠르게 훌륭한 해결책에 도달할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →