← 최신 논문
🧬 biology

Emergent Generalization by Representation Learning in Artificial Neural Networks

이 논문은 정보 병목 현상을 통해 인공 신경망이 저차원 표현을 학습하도록 강제하는 것이 일반화 달성에 필수적임을 입증하며, 이 과정은 복잡한 과제를 학습하는 생쥐의 해마 활동에서 관찰되는 것과 유사한 비단조적 인과적 창발 역학에 의해 특징지어지며, 이를 통해 인지 작용에서 창발적 표현의 기능적 및 인과적 역할을 뒷받침한다.

원저자: Hardik Rajpal, Dan Goodman

게시일 2026-07-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hardik Rajpal, Dan Goodman

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

당신이 로봇에게 미래를 예측하는 법을 가르치려 한다고 상상해 보세요. 하지만 여기 반전이 있습니다. 로봇은 노이즈의 바다에 빠져 허우적거리고 있습니다. 매 초마다 로봇은 엄청나고 혼란스러운 데이터의 홍수를 받아들이는데, 이는 마치 TV 화면의 정전기 같은 눈보라 속에서 날씨를 예측하려는 것과 같습니다. 이것이 바로 컴퓨터든 뇌든, 고차원 데이터를 다루는 과학자들이 직면한 문제입니다.

핵심적인 질문은 이것입니다: 시스템은 그 모든 노이즈 아래에 숨겨져 있는 '진짜' 패턴을 어떻게 찾아내는 걸까요? 단순히 노이즈를 암기하는 것일까요, 아니면 숨겨진 더 단순한 지도를 찾아내는 것일까요?

마법의 병목 구간 (The Magic Bottleneck)

이 연구에서 연구진들은 시계열 예측 게임을 해결하기 위해 특별한 종류의 로봇 뇌(신경망)를 구축했습니다. 그들은 복잡하게 소용돌이치는 수학적 형태인 "어트랙터(attractor)"(점이 특정 패턴을 따라 움직이는 보이지 않는 회전 무대라고 생각하세요)에 의해 생성된 데이터를 로봇에게 입력했습니다.

로봇은 이 무대의 다음 움직임을 예측해야 했습니다. 하지만 함정이 있었습니다. 데이터가 뒤섞여 있었다는 점입니다. 로봇은 무대를 "무작위 직교 투영(random orthogonal projection)"이라는 무작위로 변하는 렌즈를 통해 보고 있었기에, 근본적인 움직임은 동일함에도 불구하고 무대의 모습은 매번 완전히 다르게 보였습니다.

연구진은 로봇이 이 춤을 실제로 배우고, 무대가 바뀌거나 렌즈가 이동하더라도 올바르게 예측하기 위해서는 반드시 "병목(bottleneck)"이 필요하다는 사실을 발견했습니다.

이 병목 구간을 붐비는 파티장의 좁은 복도라고 생각해 보세요. 만약 모든 사람이 한꺼번에 복도로 달려들려고 하면 혼돈이 발생합니다. 하지만 복도가 좁다면, 사람들은 서로 밀착하여 지나가야 하고, 무거운 코트(불필요한 노이즈)를 벗어 던진 채 질서 정연한 그룹으로 통과하게 됩니다. 로봇은 이 병목 구간을 통해 데이터를 강제로 통과시킴으로써, 춤의 압축된 저차원 "비밀 코드"를 학습했습니다. 이 병목 구간이 없었다면 로봇은 훈련 데이터의 특정 노이즈를 단순히 암기했을 것이고, 게임의 규칙이 바뀌었을 때 완전히 실패했을 것입니다. 병목 구간이 있었기에 로봇은 춤의 '정수(essence)'를 학습했고, 한 번도 본 적 없는 움직임까지 예측할 수 있었습니다.

"그로킹(Grokking)"의 롤러코스터

여기서 정말 기묘하고 멋진 일이 벌어집니다. 당신은 로봇이 예측을 잘하게 됨에 따라 실력이 직선적으로 똑똑해질 것이라고 생각할 수도 있습니다. 하지만 연구진은 로봇의 내부 "비밀 코드"가 롤러코스터를 탔다는 놀라운 사실을 발견했습니다.

그들은 "인과적 창발성(causal emergence)"이라는 개념을 측정했습니다. 새 떼를 상상해 보세요. 개별적인 새 한 마리만 봐서는 그 떼가 다음에 어디로 갈지 예측할 수 없습니다. 하지만 떼의 중심(매크로 뷰)을 본다면, 개별 새들의 합보다 훨씬 더 잘 예측할 수 있습니다. 이것이 바로 창발성입니다. 즉, 전체는 부분의 합보다 강력합니다.

로봇이 훈련됨에 따라, 내부 코드는 단순히 좋아지기만 한 것이 아니라 세 가지 뚜ం 단계의 과정을 거쳤습니다:

  1. 암기 단계 (The Memorization Phase): 처음에는 로봇의 내부 코드가 통합적이고 예측적인 전체로서의 능력이 오히려 나빠졌습니다. 로봇은 훈련 데이터의 구체적인 세부 사항을 암기하는 데 몰두하고 있었습니다.
  2. 하락기 (The Dip): "창발성"이 최저점을 찍는 지점에 도달했습니다.
  3. 상승기 (The Rise): 갑자기, 특정 지점을 지난 후 코드가 새로운 형태로 급격히 변화했습니다. 코드는 매우 조직적이고 예측 가능해졌습니다. 이는 로봇의 오차율(틀린 정도)이 내내 매끄럽게 감소하고 있었음에도 불구하고 일어난 일이었습니다.

이 "하락과 상승" 패턴은 저자들이 **비단조적 궤적(non-monotonic trajectory)**이라고 부르는 것입니다. 이는 시스템이 일반화(단순한 예시가 아닌 규칙을 배우는 것)하기 위해서는, 새로운 구조를 구축하기 전에 노이즈를 "학습하지 않는(unlearning)" 단계를 거쳐야 함을 시사합니다. 이 현상은 모델이 혼란스러워 보이는 기간을 거친 뒤 갑자기 "깨닫는" 현상인 "그로킹(grokking)"과 연결되어 있다고 논문은 설명합니다.

생쥐와의 연결고리

가장 흥식한 부분은 무엇일까요? 연구진은 로봇에서 멈추지 않았습니다. 그들은 실제 생쥐를 관찰했습니다.

그들은 생쥐가 먹이를 찾기 위해 경로를 교차하며 달리는 W자형 미로를 통과하는 과정을 연구했습니다. 그리고 두 가지 뇌 영역, 즉 CA1(해마의 일부, 뇌의 GPS 역할)과 내측 전전두엽 피질(mPFC, 의사결정과 관련됨)의 신경 활동을 기록했습니다.

연구진이 동일한 "창발성" 수학 모델을 사용하여 생쥐의 뇌 활동을 분석했을 때, 정확히 똑같은 롤러코스터 패턴을 발견했습니다. 생쥐가 8번의 훈련 세션 동안 미로를 학습함에 따라, 뇌 활동의 "창발성"은 처음에 떨어졌다가 이후 크게 상승했습니다. 이 상승은 생쥐가 최종적인 성과를 내기 전 단계에서 일어났습니다.

이는 뇌 역시 로봇처럼 복잡한 과업을 학습하기 위해 이러한 압축된 "신경 매니폴드(neural manifolds)"(숨겨진 지도)를 구축해야 할지도 모른다는 점을 시사합니다. 이는 단순한 부수 효과가 아니라, 학습 과정의 필수적인 단계처럼 보입니다.

의미와 한계

이 논문은 압축된 저차원 표현을 학습하는 것이 일반화를 위한 기능적인 초능력이라는 강력한 근거를 제시합니다. 압축 없이는 시스템이 노이즈를 암기하는 데 갇히게 된다는 것을 보여줍니다.

하지만 저자들은 과도한 낙관론을 경계합니다. 그들은 압축이 일반화에 항상 필수적이라는 것을 증명한 것은 아님을 명시적으로 밝히고 있습니다(다른 연구들은 네트워크가 압축 없이도 일반화할 수 있음을 보여준 바 있습니다). 또한, 로봇 모델은 완벽하게 작동했지만 이는 시뮬레이션이며, 실제 뇌가 이를 수행할 수 있게 하는 정확한 "가소성 메커니즘"(물리적인 배선 변화)은 아직 알지 못한다고 언급했습니다.

더불어, 로봇 모델은 다음 단계를 예측할 수는 있지만, 스스로 새로운 시나리오를 만들어내는 완전한 생성 모델로 기능할 수는 없습니다.

결론

이 연구는 실리콘 기반이든 생물학적 기반이든, 진정한 지능은 특정한 종류의 "아하!(aha!)" 순간을 필요로 할 수 있다는 점을 시사합니다. 그것은 단순히 정답을 맞히는 것이 아닙니다. 게임의 규칙이 바뀌더라도 작동할 수 있는 더 단순하고 강력한 지도를 만들기 위해 자신의 내부 세계를 재구성하는 것입니다. 뇌(그리고 똑똑한 로봇)는 세상을 이해하기 위한 비밀 소스 역할을 하는 "신경 매니폴드"를 구축하기 위해 혼란과 재구조화의 단계를 거쳐야 할지도 모릅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →