← 최신 논문
🔬 condensed matter

Tunneling the Loss Landscape: Bypassing Memorization with Monte Carlo Parameter Swapping

이 논문은 신경망에서의 "그로킹(grokking)" 현상을 운동학적 정지 및 낮은 파라미터 이동성을 특징으로 하는 유리질 완화 과정으로 해석하며, 암기 상태를 우회하기 위해 무작위 탐색을 도입하여 일반화를 가속화하는 상태 인지 몬테카를로 파라미터 스와핑(SAM-Swap) 최적화 방법을 제안한다.

원저자: Lai Shun Chan, Xiaotian Zhang, Yue Shang, Ge Zhang, Entao Yang

게시일 2026-08-04
📖 6 분 읽기🧠 심층 분석

원저자: Lai Shun Chan, Xiaotian Zhang, Yue Shang, Ge Zhang, Entao Yang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 수학 시험을 위해 암기하며 공부하는 학생을 지켜보고 있다고 상상해 보세요. 처음에는 그저 모든 연습 문제의 답을 통째로 외우고 있습니다. 그는 연습 문제지에서 만점을 받지만, 만약 당신이 아주 약간만 다른 질문을 던진다면 그는 어떻게 해야 할지 전혀 알지 못합니다. 이것이 바로 "암기(memorization)"입니다. 그러다 갑자기, 똑같은 문제들을 멍하니 바라보며 긴 시간을 보낸 끝에, 무언가 '탁' 하고 깨달음이 옵니다. 학생은 더 이상 답을 암송하는 것이 아니라 그 뒤에 숨겨된 논리를 이해하기 시작합니다. 이제 그는 한 번도 본 적 없는 새로운 문제들도 풀 수 있게 되었습니다. 이 단순한 암기에서 진정한 이해로 넘어가는 급격한 변화는 인공지능을 연구하는 과학자들을 당혹스럽게 만든 미스터리입니다.

AI의 세계에서 이 현상은 "그로킹(grokking, 깨달음)"이라고 불립니다. 이는 컴퓨터 모델이 데이터셋을 학습할 때, 데이터를 완벽하게 암기하는 데는 성공하지만 아주 오랫동안 새로운 데이터로 일반화하는 데는 실패하는 현상을 말합니다. 그러다 갑자기 패턴을 파악하고 천재적으로 변하는 것이죠. 과학자들은 모델이 왜 이렇게 오랫동안 "암기 모드"에 갇혀 있는지 궁금해했습니다. 단순히 느린 것일까요, 아니면 갇혀 있는 것일까요? 이에 답하기 위해 연구자들은 물리학, 특히 "유리(glass)" 연구에서 아이디어를 빌려오고 있습니다. 유리가 너무 빠르게 냉각되어 무질서한 상태로 굳어버린 액체라는 것을 알고 계실 겁니다. 완전히 고체는 아니지만, 그렇다고 흐를 수도 없는 상태죠. 과학자들은 AI 모델이 학습 중에 이와 유사한 "유리 같은(glassy)" 상태에 빠져, 바로 눈앞에 더 나은 해결책이 있음에도 불구하고 그것을 찾지 못한 채 얼어붙어 있다고 생각합니다.

이 새로운 논문은 바로 그 아이디어를 깊이 파고듭니다. 라이 슌 찬(Lai Shun Chan)과 동료들이 이끄는 연구진은 그로킹이 실제로 "유리 같은" 행동의 일종임을 증명하고자 했으며, 더 중요한 것은 모델을 이 얼어붙은 상태에서 탈출시키는 방법을 찾는 것이었습니다. 그들은 단순히 모델을 관찰하기만 한 것이 아니라, 모델의 내부 "두뇌"(파라미터)가 정확히 어떻게 움직이는지 측정할 수 있는 특별한 도구 세트를 구축했습니다. 그들은 모델이 암기 단계 동안 매우 느리고 반복적이며, 좁은 경로에 갇힌 듯 움직인다는 것을 발견했습니다. 마치 붐비는 방을 지나가려는 사람이 옆으로 몸을 틀지도 못한 채 직선으로만 발을 끌며 이동해야 하는 상황과 같습니다.

얼어붙은 두뇌 이야기

"그로킹" 정체의 미스터리
당신이 로봇에게 퍼즐을 풀도록 훈련시키고 있다고 상상해 보세요. 당신은 로봇에게 수천 개의 예시를 보여줍니다. 처음에는 로봇이 정확한 답을 외우는 데 있어서는 슈퍼스타입니다. 연습 테스트에서 100점을 받죠. 하지만 당신이 로봇이 본 적 없는 새로운 퍼즐을 주면, 로봇은 처참하게 실패합니다. 로봇은 아주, 아주 오랫동안 계속 실패합니다. 그러다 갑한히, 수천 번의 시도 끝에 규칙을 깨닫고 새로운 퍼즐에서도 100점을 받습니다. 이것이 "그로킹"입니다.

한동안 과학자들은 이것이 로봇이 학습하는 방식의 기이한 특성일 뿐이라고 생각했습니다. 하지만 새로운 이론은 로봇이 "얼어붙었다"고 제안합니다. 강물이 겨울에 얼어붙는 것을 생각해 보세요. 물(학습 과정)의 흐름이 멈춘 것입니다. 로봇은 "유리 같은" 상태에 갇혔습니다. 해결책이 존재하지 않는 것이 아니라, 로봇이 내부 부품을 충분히 움직여서 그 해결책을 찾을 수 없는 상태인 것입니다.

얼어붙음을 측정하는 세 가지 도구
이를 증명하기 위해 저자들은 로봇의 두뇌가 작동하는 모습을 관찰할 수 있는 세 부분으로 구성된 도구 세트를 만들었습니다. 그들은 다음과 같은 것을 알고 싶었습니다: 로봇가 움직이고 있는가? 루프에 갇혀 있는가? 그리고 새로운 경로를 탐색하고 있는가?

  1. 파라미터 가동성 (Parameter Mobility, PM): "보폭" 측정기.
    로봇이 걷고 있다고 상상해 보세요. 학습 초기에는 학습하면서 크고 자신감 넘치는 발걸음을 내딛습니다. 하지만 암기 단계에 접어들면, 저자들은 로봇의 발걸음이 아주 작고 거의 보이지 않을 정도로 변한다는 것을 발견했습니다. 마치 로토가 한 발로 서서 겨우 움찔거리는 것과 같습니다. 논문은 로봇의 내부 숫자들이 움직이는 거리가 엄청난 양(약 1에서 0.0001로)만큼 급감함을 보여줍니다. 물리적으로 갇혀 있는 것입니다.

  2. 레플리카 상관관계 (Replica Correlation, RC): "쌍둥이 테스트".
    이 부분이 가장 흥잡한 부분입니다. 연구진은 로봇의 "쌍둥이"를 만들었습니다. 똑같은 지점에서 시작된 두 대의 동일한 로봇에게 아주 작은 무작위 자극을 주었습니다. 만약 로봇들이 자유롭게 탐색할 수 있다면, 그들은 빠르게 서로 다른 방향으로 갈 것입니다. 하지만 암기 단계 동안 쌍둥이들은 서로 딱 붙어 있었습니다. 자극을 주어도 그들은 정확히 같은 경로를 따랐습니다. 이 "이력 의존성(history dependence)"은 로봇이 현재 상태에 너무 묶여 있어서 다른 방식으로 문제를 해결하는 것을 상상조차 할 수 없음을 의미합니다. 마치 좁은 터널을 지나가려는 두 사람과 같습니다. 아무리 몸을 흔들려고 해도 결국 같은 줄을 따라갈 수밖에 없습니다.

  3. 프랙탈 차원 (Fractal Dimension, FD): "꿈틀거림" 탐지기.
    이것은 로봇이 걷는 경로의 모양을 측정합니다. 만약 로봇이 탐색 중이라면, 그 경로는 복잡하고 구불구불하며 회전이 많을 것입니다(높은 차원). 하지만 그로킹 정체기 동안 경로는 단순하고 지루한 직선이 됩니다. 저자들은 프랙탈 차원이 거의 1로 떨어지는 것을 발견했습니다. 이는 로봇이 좌우로 회전하지 못한 채 좁은 "채널" 같은 터널 속에서 직선으로만 움직이고 있음을 의미합니다. 좁은 복도에 갇힌 것입니다.

"유리" 이론의 확인
이 논문은 이러한 조합—작은 발걸음, 분리되지 않는 쌍둥이, 그리고 직선 경로—이 "유리 같은" 시스템의 특징임을 시사합니다. 로봇은 단순히 느린 것이 아니라, 운동학적으로 억제된 상태입니다. 해결책(출구)이 바로 저기에 있음에도 불구하고, 로봇은 그 상태에서 벗어날 수 없습니다. 저자들은 학습 과정이 시스템을 너무 빨리 냉각시켜서, 더 나은 해결책으로 이완될 기회를 갖기도 전에 시스템을 이 얼어붙은 상태로 잠가버린다고 주장합니다.

마법의 "스왑(Swap)" 기술
그렇다면 어떻게 얼어붙은 유리 로봇을 녹일 수 있을까요? 물리학에서 과학자들은 유리가 이완되는 것을 돕기 위해 "스왑 몬테카를로(Swap Monte Carlo)"라는 방법을 사용합니다. 입자들의 위치를 교환하여 더 나은 배치를 찾도록 돕는 방식입니다. 저자들은 이를 AI 모델에 적용했습니다.

그들은 SAM-Swap이라는 새로운 도구를 만들었습니다. 작동 방식은 다음과 같습니다:

  • 로봇의 경로를 관찰합니다.
  • 경로가 너무 직선이 되면(프랙탈 차원이 1.1 미만으로 떨어지면), 로봇이 갇혔다는 것을 알 수 있습니다.
  • 그런 다음 동일한 레이어 내에서 로봇의 내부 숫자 값들을 무작위로 교환합니다.

여러분은 "잠깐, 숫자를 바꿔버리면 로봇이 배운 것을 망치지 않을까?"라고 생각할 수도 있습니다. 놀랍게도 그렇지 않습니다. 저자들은 이 스왑이 모델을 망가뜨리는 것이 아니라, 부드러운 흔듦 역할을 한다는 것을 발견했습니다. 이는 로봇이 갇혀 있는 "채널"을 깨뜨리고 새로운 경로를 탐색할 수 있게 해줍니다.

결과: 더 빠른 "아하!" 순간
결과는 극적이었습니다. 표준 학습 방식(AdamW라고 불리는 방법)을 사용했을 때, 로봇이 마침내 일반화하는 데 약 3,000 에포크(학습 사이클)가 걸렸습니다. 하지만 SAM-Swap 기술을 사용하자 로봇은 단 650 에포크 만에 일반화되었습니다. 이는 엄청난 속도 향상입니다!

또한 이 논문은 무작위 노이즈를 추가하는 방식(정전기로 로봇을 흔드는 것과 같은 방식)과 같은 다른 방법들과 비교했습니다. 노이즈를 추가하는 것도 어느 정도 도움이 되었지만, 구조화된 "스왑"이 훨씬 더 효과적이었습니다. 핵심적인 발견은, 유리 상태에서 벗어나기 위해서는 로봇이 단순히 직선으로 발을 끄는 것이 아니라, "확산(diffusion)"처럼 무작위로 움직이고 탐색하는 동작이 필요하다는 것입니다.

이것이 의미하는 바
이 논문은 단순히 "그로킹은 이상하다"라고 말하는 데 그치지 않습니다. 왜 그런 일이 일로나는지 측정하는 방법과 이를 해결하는 도구를 제공합니다. 이는 모델이 학습하는 타이밍이 단순히 문제의 수학적 계산에 관한 것이 아니라, 모델이 거치는 여정에 관한 것임을 시사합니다. 만약 여정이 너무 곧고 좁아지면 모델은 갇히게 됩니다. 약간의 조직된 혼돈(스왑)을 도입함으로써, 우리는 모델이 자유로워지고 더 빨리 학습하도록 도울 수 있습니다.

저자들은 이 실험이 특정 수학 과제(모듈로 산술)와 특정 유형의 모델을 대상으로 수행되었음을 주의 깊게 언급합니다. 그들은 이 방법이 여기서 잘 작동하지만, 언어나 시각 분야에서 사용되는 더 크고 복잡한 모델에서도 작동하는지 확인할 필요가 있다고 제안합니다. 그러나 움직임의 기하학적 구조를 이해함으로써 "터널"을 뚫고 지나갈 수 있다는 핵심 아이디어는 AI가 학습하는 방식에 대한 강력하고 새로운 관점을 제시합니다.

요컨대, 이 논문은 때때로 더 빨리 배우기 위해서 더 강하게 밀어붙일 필요는 없다고 말합니다. 그저 상황을 조금 흔들어 놓음으로써 모델이 다른 경로를 택할 수 있게 해주면 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →