← 최신 논문
🤖 machine learning

Post-Grokking Collapse at the Representation-Readout Interface in Muon-Trained Transformers

이 논문은 Muon으로 훈련된 트랜스포머가 표현-판독 인터페이스(representation-readout interface)에서의 불안정성으로 인해 모듈로 산술을 학습한 후 일반화가 실패하는 "포스트 그로킹 붕괴(post-grokking collapse)"를 보인다는 점을 입증하며, 이는 특정 모델 구성 요소를 동결하거나 과업에 정렬된 회로를 재조정함으로써 해결될 수 있는 발산하는 옵티마이저 역학 및 마스킹 효과로 특징지어지는 현상이다.

원저자: Ali Janati, Kaoutar El Maghraoui, Andrei Kanavalau, Anass Belfatmi

게시일 2026-08-10
📖 5 분 읽기🧠 심층 분석

원저자: Ali Janati, Kaoutar El Maghraoui, Andrei Kanavalau, Anass Belfatmi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 아주 구체적인 수학 퍼즐을 가르치고 있다고 상상해 보세요. 이 퍼즐은 두 숫자를 더한 뒤 큰 소수로 나눈 나머지를 찾는 것입니다. 처음에는 로봇이 마치 단어장을 통째로 외우는 학생처럼 답을 단순히 암기하는 것처럼 보입니다. 하지만 그러다 갑엔 '그로킹(grokking)'이라 불리는 마법 같은 일이 일어납니다. 긴 정체기 끝에, 로봇은 단순히 암기하는 것을 넘어 실제로 패턴을 '이해'하게 됩니다. 이제 로봇은 한 번도 본 적 없는 숫자들에 대해서도 완벽하게 문제를 풀 수 있습니다. 이는 과학자들에게 매우 중요한 일인데, 인공지능이 단순히 암기하는 것이 아니라 어떻게 '생각하는 법'을 배우는지 이해하는 데 도움을 주기 때문입니다.

하지만 여기 함정이 있습니다. 때때로 로봇이 해답을 찾아낸 후에도, 여전히 같은 퍼즐로 훈련을 받고 있음에도 불구하고 다시 그 답을 잊어버리기 시작합니다. 이는 마치 대수학을 드디어 이해한 학생이, 방금 풀었던 똑같은 문제에서 다시 실수를 연발하는 것과 같습니다. 과학자들은 로봇의 내면을 들여다보기 위해 특별한 도구들을 사용합니다. 그들은 로봇이 문제를 풀기 위해 사용하는 특정 패턴(마치 노래의 음표와 같은 것)을 관찰하여, 로봇이 여전히 올바른 음표를 사용하고 있는지 확인합니다. 여기서 핵심적인 질문은 이것입니다. 로봇은 왜 잊어버리는가? 로봇이 음표를 배우는 것을 멈췄기 때문인가, 아니면 다른 무언가가 일어나고 있는 것인가?


사라진 천재의 미스터리

이 연구에서 연구자들은 모듈로 덧셈(modular addition) 퍼즐을 풀도록 훈련된 '트랜스포머(Transformer)'라는 특별한 유형의 AI 로봇을 관찰했습니다. 그들은 로봇을 가르치기 위해 두 명의 서로 다른 '선생님(최적화 도구)'을 사용했습니다. AdamW라는 이름의 선생님은 표준적이고 신뢰할 수 있는 강사입니다. 또 다른 이름인 Muon은 더 새롭고 빠른 선생님으로, 로봇이 퍼즐을 훨씬 더 빠르게 이해하도록 돕는 것처럼 보입니다.

연구 결과, Muon은 확실히 속도광였습니다. Muon은 AdamW가 걸리는 시간의 절반 정도밖에 걸리지 않고도 로봇이 '그로킹'의 순간, 즉 깨달음의 순간에 도달하도록 도왔습니다. 하지만 반전이 있습니다. Muon이 찾아낸 해법은 믿을 수 없을 정도로 취약합니다. 로봇이 퍼즐을 해결하고 나면, 정확도가 100%에서 거의 0%로 떨어졌다가 다시 회복되는 과정을 반복하며 자주 실패하기 시작합니다. 이는 로봇이 여전히 같은 문제를 학습하고 있음에도 불구하고 계속해서 일어납니다. AdamW 역시 완전히 안전한 것은 아니지만, 훨씬 덜 자주, 그리고 훨씬 덜 심각하게 실패합니다.

깨진 악수 (The Broken Handshake)

그렇다면 무엇이 잘못된 것일까요? 연구자들은 문제가 로봇이 수학을 잊어버린 것이 아님을 발견했습니다. 로봇은 여전히 자신의 '두뇌' 속에 정답을 완벽하게 간직하고 있습니다. 문제는 로봇의 두 부분 사이의 깨진 악수입니다. 즉, '생각하는 부분(표현, representation)'과 '답을 내놓는 부분(출력 헤드, readout)' 사이의 문제입니다.

로봇의 뇌를 책이 가득한 도서관(생각)이라고 하고, 로봇의 입을 그 책을 소리 내어 읽는 사서(답)라고 상상해 보세요.

  • **도서관(은닉층, hidden layers)**은 매 초마다 책에 새로운 메모를 적어 넣습니다.
  • **사서(출력 헤드, output head)**는 그 책들을 읽고 답을 내놓으려 노력합니다.

Muon 선생님과 함께라면, 도서관은 업데이트될 때마다 책에 조금씩 다른 언어로 새로운 메모를 적어 내려가는데, 사서는 계속해서 예전 언어로 그 책들을 읽으려고 합니다. 처음에는 둘이 서로를 이해하며 잘 해나갑니다. 하지만 도서관이 사서가 적응하는 속도보다 더 빠르게 언어를 바꾸기 때문에, 결국 둘은 서로를 이해하지 못하게 됩니다. 도서관은 여전히 올바른 수학을 적고 있지만, 사서는 엉뚱한 단어를 읽고 있는 것입니다.

연구자들은 한쪽을 고정함으로써 이를 증명했습니다. 도서관이 언어를 바꾸는 것을 멈추자 로봇은 완벽한 상태를 유지했습니다. 사서가 읽는 스타일을 바꾸는 것을 멈추었을 때도 로봇은 완벽했습니다. 하지만 두 부분이 모두 자유롭게 움직이도록 허용하자, 둘은 서로 어긋났고 로봇은 실패하기 시작했습니다.

기계 속의 유령 (The Ghost in the Machine)

가장 혼란스러운 부분은 이것입니다. 로봇이 실패하고 있을 때조차, '도서관'에는 여전히 완벽한 해답이 들어있다는 점입니다. 연구자들은 수학을 알고 있는 부분만을 골라내기 위해 특별한 필터를 사용했습니다. 그렇게 했을 때, 해답은 여전히 100% 정확했습니다!

결국 로봇은 회로 마스킹(circuit masking) 현상을 겪고 있는 것입니다. 도서관이 올바른 답을 외치고 있지만, 로봇의 나머지 부분이 정확히 같은 볼륨으로 틀린 답을 외치고 있다고 상상해 보세요. 사서는 엉망진창인 소리를 듣고 잘못된 답을 내놓게 됩니다. 정답은 여전히 그곳에 있지만, 소음에 묻혀버린 것입니다.

연구자들은 다른 것은 바꾸지 않고 오직 정답이 있는 부분(수학 패밀리)의 볼륨만 높였을 때, 로봇이 즉시 다시 100% 정확도로 돌아간다는 것을 보여주었습니다. 수학이 사라진 것이 아니라, 단지 소음 속에 길을 잃었을 뿐이었습니다.

기존 도구들이 놓친 이유

보통 과학자들은 로봇이 문제를 푸는 데 사용하는 '음표'를 살펴봄으로써 로봇이 제대로 작동하는지 확인합니다. 그들은 올바른 음표가 존재하는지, 그리고 그 음표가 충분히 큰지를 체크합니다. 이 연구에서 그런 도구들은 로봇이 괜찮다고 말했습니다. 음표는 존재했고, 이전과 거의 똑같이 들렸습니다.

하지만 로봇은 그럼에도 불구하고 실패하고 있었습니다. 이는 도구들이 '음표'만 보고 있었을 뿐, 사서가 사용하는 '볼륨'이나 '언어'를 보지 못했기 때문입니다. 음표는 완벽했지만, 사서가 그것을 제대로 듣지 못하고 있었던 것입니다. 이는 라디오 방송이 선명하게 송출되고 있는지 확인하면서도, 정작 라디오가 엉뚱한 주파수에 맞춰져 있다는 사실은 알아채지 못하는 것과 같습니다.

심층 분석 (The Deep Dive)

연구자들은 또한 로봇을 더 '깊게'(더 많은 사고 층을 추가) 만들었을 때 어떤 일이 일 발생하는지도 테스트했습니다. 그들은 Muon이 학습 속도를 더욱 높인다는 것을 발견했지만, '깨진 악수'의 문제는 더 악화되었습니다. 더 깊은 모델에서는 로봇의 뇌가 한 섹션에서 수학을 작성하면, 답을 읽는 부분은 다른 섹션에 위치하게 되어 둘이 더 빠르게 어긋나게 됩니다.

또한 연구자들은 Muon 선생님의 특수한 '정규화(normalization)' 기술(업데이트를 안정적으로 유지하는 방법)을 제거하여 실험해 보았습니다. 이 기술을 제거하자 로봇은 수학을 매우 좁고 집중된 방식으로 학습했지만, 결국 완전히 무너져 내려 회복하지 못했습니다. 이는 이 특별한 기술이 로봇이 빠르게 학습하고 지식을 넓게 퍼뜨리도록 돕기도 하지만, 동시에 이러한 유형의 '드리프트(drift) 실패'에 더 취약하게 만든다는 것을 시사합니다.

핵심 요점

이 논문의 주요 교훈은 로봇의 각 부분이 동기화되지 않으면 빠른 학습은 위험할 수 있다는 것입니다. 로봇은 수학을 잊어버린 것이 아니라, 수학을 아는 부분과 그것을 말하는 부분 사이의 연결 고리를 잃어버린 것입니다.

연구자들은 학습이 끝난 후 '말하는' 부분(출력 및 임베딩)을 고정하면 로봇이 안정적으로 유지된다는 것을 발견했습니다. 이는 불안정성이 로봇이 수학을 못 해서 생기는 것이 아니라, 두 부분이 서로 다른 속도로 움직이며 공유하는 언어를 잃어버리기 때문에 발생한다는 것을 시사합니다.

요약하자면, 로봇은 천재이지만 갑자기 말을 더듬기 시작한 상태입니다. 왜냐서 뇌와 입이 서로 다른 방언을 사용하고 있기 때문입니다. 수학은 내면에 완벽하게 살아있지만, 두 방언을 일치시킬 방법이 없다면 그 천재는 자신의 능력을 제대로 보여줄 수 없습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →