← 최신 논문
🤖 machine learning

The Grokked Illusion: True Equilibrium Mitigates Catastrophic Forgetting

이 논문은 고엔트로피 신경망이 기존의 AdamW로 학습된 모델과 달리, 동일한 일반화 성능에도 불구하고 치명적 망각에 대한 강건성을 유지한다는 사실을 밝히며, 이러한 현상은 가중치의 높은 유효 랭크(effective rank)로 나타나는 더 풍부한 특징 표현에 기인한 "그로킹 환상(grokked illusion)"이라 명명되었다.

원저자: Xiaotian Zhang, Lai Shun Chan, Yue Shang, Entao Yang, Ge Zhang

게시일 2026-08-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xiaotian Zhang, Lai Shun Chan, Yue Shang, Entao Yang, Ge Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 수학 퍼즐을 푸는 법을 가르치고 있다고 상상해 보세요. 당신은 로봇이 똑똑하기를 바라면서도, 동시에 강인하기를 바랍니다. 인공지능의 세계에서 '똑똑하다'는 것은 보통 로봇이 이전에 본 적 없는 문제를 보고도 올바르게 해결할 수 있다는 것을 의미합니다. 이것을 **일반화(generalization)**라고 부릅니다. 하지만 여기에는 숨겨진 함정이 있습니다: 로봇은 어느 한 순간에는 믿을 수 없을 정도로 똑똑할 수 있지만, 동시에 믿을 수 없을 정도로 취약할 수도 있습니다. 만약 첫 번째 기술을 마스터하자마자 바로 새로운 기술을 배우라고 요구한다면, 로봇은 방금 배운 모든 것을 갑자기 잊어버릴 수도 있습니다. 이것을 **파괴적 망각(catastrophic forgetting)**이라고 합니다.

과학자들은 오랫동안 질문해 왔습니다: 무엇이 로봇의 두뇌를 진정으로 견고하게 만드는가? 그것은 단지 정답을 맞히는 것인가, 아니면 그 답을 저장하는 방식에 대한 더 깊은 무언가가 있는 것인가? 도서관을 생각해 보세요. 완벽한 책들을 갖춘 도서관(높은 일반화)이 있을 수 있지만, 만약 선반이 부실하거나 책들이 위태롭게 쌓여 있다면, 단 한 권의 새 책을 추가하는 것만으로도 전체 탑이 무너질 수 있습니다. 이 논문은 로봇의 두뇌의 '형태'—구체적으로, 기억 속에 얼마나 많은 '움직일 수 있는 여유(wiggle room)'가 있는지—가 새로운 정보를 처리하면서도 기존의 정보를 잃지 않는 데 결정적인 역할을 하는지 탐구합니다.


"그로킹(Grokked)"의 환상: 완벽한 점수가 약점을 숨길 때

이 연구의 연구진은 매혹적인 아이디어를 테스트하기로 했습니다: 완벽한 점수가 강한 기억을 보장하는가? 이를 알아내기 위해, 그들은 모듈로 산술(기본적으로 숫자를 더하고 나머지를 찾는 방식, 예를 들어 67시간 후에 다시 시작되는 시계와 같은 방식)이라는 간단한 수학 게임을 사용하여 통제된 실험을 설정했습니다.

그들은 두 가지 서로 다른 유형의 AI 모델을 이 게임에 대해 훈련시켰으며, 두 모델 모두 100% 완벽한 점수를 얻을 때까지 진행했습니다.

  1. "표준(Standard)" 모델: 이 모델은 흔히 쓰이는 표준적인 방법(AdamW라고 불림)으로 훈련되었습니다. 이 모델은 과제를 빠르게 학습하여 완벽한 점수를 얻었습니다.
  2. "고엔트로피(High-Entropy)" 모델: 이 모델은 특수한 물리 기반 방법(Wang-Landau 분자 역학이라고 불림)을 사용하여 훈련되었습니다. 이 모델 역시 100% 완벽한 점수를 얻었지만, 해답들이 존재하는 수학적 공간 내에서 더 "큰" 영역에서 발견되었습니다. 표준 모델을 좁고 작은 골짜기에 앉아 있는 것으로 본다면, 고엔트로피 모델은 거대하고 넓은 고원을 찾아낸 것과 같습니다.

두 모델은 서류상으로는 동일해 보였습니다. 둘 다 수학 게임에서 100% 완벽했습니다. 하지만 연구진은 그들이 비밀스러운 차이점을 숨기고 있다고 의심했습니다.

노이즈 주입 테스트: 의도적인 망각

그들의 강인함을 테스트하기 위해, 연구진은 속임수를 썼습니다. 그들은 두 모델에게 이렇게 말했습니다. "좋아요, 당신들은 수학을 잘하는군요. 이제 이 무의미한 데이터 목록을 외우세요." 그들은 훈련 과정에 "노이즈(noise)"—무작위 레이블이 붙은 무작위의 의미 없는 숫자들—를 주입했습니다. 그들은 모델들이 원래의 수학 게임을 기억하려고 노력하는 동시에, 이 새로운 쓰레기 데이터를 완벽하게 암기하도록(새로운 데이터에 대해 99.8%의 정확도를 얻도록) 강요했습니다.

결과는 충격적이었으며, 저자들이 **"그로킹의 환상(Grokked Illusion)"**이라고 부르는 현상을 드러냈습니다.

  • 표준 모델 (AdamW): 새로운 무의미한 데이터를 암기하기 시작하자마자, 이 모델은 무너지기 시작했습니다. 원래의 수학 게임을 해결하는 능력이 100%에서 75% 미만으로 급락했습니다. 새로운 것을 수용하기 위해 기존의 기술을 "잊어버린" 것입니다. 이는 마치 학생이 무작위 전화번호 목록을 외우려고 노력하자마자 기본적인 덧셈을 갑자기 잊어버린 것과 같았습니다.
  • 고엔트로피 모델: 이 모델은 탱크와 같았습니다. 동일한 무의 의미 없는 데이터를 완벽하게 암기한 후에도, 원래의 수학 기술을 거의 온전히 유지하며 95%에서 98%의 정확도를 유지했습니다. 이 모델은 기존의 정보를 잃지 않고 새로운 정보를 담아낼 수 있었습니다.

이 논문은 표준 모델의 "완벽한" 점수는 환상이었다고 제안합니다. 그것은 강해 보였지만, 실제로는 취약했습니다. 반면 고엔트로피 모델은 진정으로 견고했습니다.

왜 하나는 실패하고 다른 하나는 성공했는가?

연구진은 무엇이 달랐는지 확인하기 위해 이 모델들의 "두뇌"를 파고들었습니다. 그들은 **특이값 분해(Singular Value Decomposition)**라는 수학적 도구를 사용했습니다(모델이 정보를 저장하기 위해 얼마나 많은 "방향"을 사용하는지 보여주는 X-ray라고 생각하면 됩니다).

그들은 고엔트로피 모델이 훨씬 더 높은 "유효 계수(effective rank)"를 가지고 있다는 것을 발견했습니다. 쉬운 말로, 이 모델의 두뇌는 문제를 해결하기 위해 훨씬 더 넓고 다양한 도구 세트를 사용했다는 뜻입니다. 단순히 몇 개의 좁고 취약한 경로에만 의존하지 않았습니다. 대신, 풍부하고 분산된 특징 네트워크를 가지고 있었습니다.

노이즈가 들어왔을 때:

  • 표준 모델은 자신의 몇 안 되는 좁은 경로들을 새로운 데이터에 맞추기 위해 재조정해야 했고, 이 과정에서 기존의 경로가 파괴되었습니다.
  • 고엔트로피 모델은 너무나 많은 "여유 공간"과 다양한 경로를 가지고 있었기에, 기존의 수학 기술을 방해하지 않고도 새로운 노이즈를 흡수할 수 있었습니다. 이는 마치 넓고 튼튼한 다리가 무거운 트럭(새로운 데이터)이 지나가도 기초를 흔들지 않고 버티는 반면, 좁은 다리(표준 모델)는 동일한 무게에 무너지는 것과 같았습니다.

이것이 미래에 의미하는 바

이 연구는 완벽한 일반화가 완벽한 강인함을 의미하는 것은 아니다라고 결론짓습니다. 모델이 시험에서 A+를 받았다고 해서, 삶이 예상치 못한 변수를 던졌을 때 실패하지 않는다는 보장은 없습니다.

저자들은 모델의 기억의 "형태"가 중요하다고 제안합니다. 모델이 수학적 세계에서 더 큰 "고엔트로피" 공간을 차지할수록, 새로운 것을 배워야 할 때 기존의 것을 더 잘 기억하는 경alah이 있습니다. 이는 미래에 우리가 AI를 훈련할 때 단순히 정답을 맞히는 것뿐만 아니라, 솔루션 공간 내에서 "더 넓은 골짜기"를 찾도록 훈련해야 함을 암시합니다. 이는 AI가 미래를 배울 때 과거를 잊지 않도록 도와주어, 상황이 끊임없이 변하는 현실 세계의 작업에서 훨씬 더 신뢰할 수 있는 AI를 구축하는 데 도움이 될 수 있습니다.

이러한 결과는 현재 수학 퍼즐을 이용한 시뮬레이션에 기반하고 있지만, 저자들은 이 원리가 훨씬 더 크고 복잡한 AI 시스템에도 적용될 수 있다고 믿으며, 이를 통해 기계가 어제의 학습 내용을 잊어버리는 오래된 문제를 해결할 수 있을 것이라고 보고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →