← 최신 논문
🔬 condensed matter

Criticality in Neural Network Function Space through Wilsonian Fixed Points and Finite-Width Corrections

이 논문은 유한한 너비의 신경망을 가우시안 고정점에서 발생하는 상호작용하는 양자장론으로 해석하는 윌슨적 프레임워크를 제안하며, 여기서 임계성은 비가우시안 상호작용을 도입하는 유한한 너비 보정으로부터 발생하고, 이를 통해 네트워크 구조와 학습 역학을 함수 공간에서의 복잡성, 표현력, 그리고 상(phase)과 같은 행동의 발현과 연결한다.

원저자: Eric Howard, Iftekher S. Chowdhury, Hardique Dasore, Hom Nath Dhungana

게시일 2026-08-24
📖 4 분 읽기☕ 가벼운 읽기

원저자: Eric Howard, Iftekher S. Chowdhury, Hardique Dasore, Hom Nath Dhungana

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

딥러닝은 기계가 보고, 말하고, 추론하는 방식을 변화시켰지만, 이러한 시스템 뒤에 숨겨진 수학적 메커니즘은 여전히 대부분에게 블랙박스로 남아 있다. 이 미스터리의 핵심에는 근본적인 질문이 자리 잡고 있다. 즉, 신경망이 학습할 때 실제로 내부에서 어떤 일이 일어나는가 하는 점이다. 전통적으로 과학자들은 이러한 시스템을 오차를 최소화하기 위해 조정해야 하는 수많은 조절 가능한 숫자들, 즉 매개변수들의 집합으로 보아왔다. 그러나 더 추상적인 관점이 등장했는데, 이는 신경 네트워크를 내부 설정값이 아니라 그것이 생성할 수 있는 함수의 확률 분포로 이해하는 것이 더 낫다는 제안이다. 이 관점에서 신경망은 가능성을 생성하는 생성기이며, 그 행동은 조절하는 특정 노브(knobs)보다는 그것이 만들어내는 함수의 형태에 의해 정의된다. 이러한 관점의 전환은 연구자들이 매우 넓거나 안정성의 가장자리로 내몰릴 때 시스템이 어떻게 스스로를 조직하는지 이해하기 위해 통계 물리학과 양자장론의 도구들을 적용할 수 있게 해준다.

맥쿼리 대학교와 찰스 스터트 대학교의 연구팀은 이러한 추상적인 관점을 채택하여 신경망이 왜 특정한 방식으로 행동하는지를 설명하는 새로운 프레임워크를 개발했다. 그들은 신경망의 행동을 물리적 시스템에서 발견되는 상태인 '임계성(criticality)', 즉 물질이 질서와 혼돈 사이의 경계에 놓여 있는 상태의 관점을 통해 이해할 수 있다고 제안한다. 분석에서 그들은 이상적인 무한 너비의 신경망을 평온하고 평평한 풍경과 유사한 단순하고 예측 가능한 기준점으로 취급한다. 그런 다음 연구진은 네트워크의 크기가 유한할 때 발생하는 현상을 조사하는데, 이때는 단순함을 깨뜨리는 작고 복잡한 상호작용이 도입된다. 연구진은 이러한 유한 크기 효과가 단순히 무시해야 할 기술적 오류가 아니라, 오히려 복잡한 패턴을 학습하고 풍부한 행동을 표현할 수 있는 신경망의 능력의 원천이라고 주장한다.

그들 연구의 핵심은 네트워크의 크기와 복잡성 사이의 관계를 재해석하는 것이다. 수년 동안 이 분야의 지배적인 직관은 더 많은 매개변수를 추가하는 것이 시스템을 더 복잡하게 만들고 통제하기 어렵게 만든다는 것이었다. 저자들은 함수 공간의 언어로 볼 때, 네트워크를 더 넓게 만드는 것이 오히려 그 행동을 단순화한다는 것을 보여줌으로써 이에 도전한다. 네트워크가 무한히 넓어짐에 따라, 그 출력은 완벽하게 예측 가능해지며 모든 복잡한 상호작용이 사라지는 가우시안 프로세스(Gaussian process)라는 단순한 통계 법칙을 따르게 된다. 이 무한 극한에서 신경망은 본질적으로 '자유로운(free)' 상태이며, 어려운 현실 세계의 문제를 모델링하는 데 필요한 복잡한 연결성이 결여되어 있다. 연구진은 신경망의 진정한 힘은 레이어의 유한한 크기에서 비롯되며, 이것이 필수적인 상호작용을 다시 도입한다고 제안한다.

이를 이해하기 위해 저자들은 물리에서 빌려온 방법론인 윌슨 접근법(Wilsonian approach)을 사용하는데, 이는 시스템을 서로 다른 척도에서 바라볼 때 어떻게 변화하는지를 연구하는 방식이다. 그들은 무한 너비 극한을 시스템이 향하는 안정적인 상태인 고정점(fixed point)으로 식별한다. 실제 네트워크의 유한한 너비는 이 완벽한 안정성으로부터 벗어나게 하는 작은 섭동(perturbation), 즉 작은 밀침 역할을 한다. 연구진은 이러한 밀침을 세 가지 범주로 분류한다. 어떤 것들은 네트워크가 넓어짐에 따라 사라지고, 어떤 것들은 시스템을 지배할 만큼 커지며, 또 다른 것들은 임계 행동을 만들어내기 위해 미세하게 조정될 수 있는 섬세한 경계 위에 놓여 있다. 그들은 신경망의 가장 흥고롭고 유용한 특성들—예를 들어 제한된 데이터로부터 일반화하는 능력이나 복잡한 구조를 학습하는 능력—이 네트워크가 이 임계 경계 근처에서 작동할 때 나타난다는 것을 발견했다.

이 논문은 이러한 행동을 측정할 수 있는 몇 가지 구체적인 방법을 제공한다. 연구진은 네트워크가 넓어짐에 따라 실제 출력과 이상적인 무한 너비 예측 사이의 차이가 특정 수학적 쇠퇴 법칙을 따르며 예측 가능한 방식으로 줄어든다는 것을 보여준다. 그들은 서로 다른 입력 간의 복잡하고 비선형적인 상호작용을 나타내는 네트워크의 '연결된(connected)' 부분들이 너비가 증가함에 따라 약해진다는 것을 입증한다. 이는 과잉 매개변수화(overparameterization)가 흔히 복잡성을 더하는 것으로 생각되지만, 실제로는 이러한 상호작용을 억제하고 시스템을 더 단순한 가우시안 상태로 이동시키는 과정임을 확인시켜 준다. 반대로, 유한한 너비를 가진 네트워크는 이러한 상호작용을 유지함으로써 단순한 통계 법칙에서 벗어나 실제 데이터의 미묘한 차이를 포착할 수 있게 한다.

연구의 핵심 발견 중 하나는 학습하기에는 너무 경직되어 있거나 통제하기에는 너무 혼란스러운 네트워크의 경계를 설명하는 개념인 '혼돈의 가장자리(edge of chaos)'를 재정의하는 것이다. 저자들은 이 경계를 그들의 프레임워크에 매핑하여, 이것이 입력과 출력 사이의 상관관계가 붕괴하거나 폭발하지 않고 여러 레이어에 걸쳐 지속되는 임계 표면(critical surface)에 해당함을 보여준다. 이 임계 근접 영역에서 네트워크는 새로운 패턴을 학습할 만큼 민감하면서도, 학습한 것을 유지할 수 있을 만큼 안정적이다. 그들은 신경망을 훈련하는 것이 본질적으로 무작위적인 시작점에서 이러한 임계 상호작용이 균형을 이루는 영역으로 이동하며 밑바탕이 되는 통계적 구조를 변형하는 과정이라고 주장한다.

연구진은 또한 대규모 네트워크가 훈련 예시보다 더 많은 매개변수를 가지고 있음에도 불구하고 왜 종종 보지 못한 데이터에서 더 나은 성능을 보이는지에 대한 미스터리를 다룬다. 그들의 프레임워크는 훈련 데이터를 너무 밀접하게 맞추려는 특정 노이즈 섞인 상호작용은 억제하는 한편, 현실 세계에 적용되는 더 넓고 안정적인 구조는 보존할 때 일반화가 일어난다고 제안한다. 반면, 과적합(overfitting)은 네트워크가 이러한 특정적이고 불안정한 상호작용을 증폭할 때 발생한다. 유효장론(effective field theory)의 관점에서 신경망을 바라봄으로써, 저자들은 유용한 복잡성과 해로운 노이즈를 구분할 수 있는 방법을 제공하며, 가장 성능이 좋은 네트워크는 유한한 너비 효과가 표현력을 가질 만큼 강하면서도 불안정을 초래하지 않을 정도로 적절한 제어된 임계 영역에 위치하는 네트워크라고 제안한다.

궁극적으로 이 연구는 매개변수의 수에서 벗어나 생성하는 함수의 구조로 초점을 전환함으로써 신경망을 이해하는 새로운 어휘를 제공한다. 이는 딥러닝의 마법이 더 많은 노브를 돌리는 데서 오는 것이 아니라, 시스템이 학습하기에 충분히 복잡하면서도 일반화하기에 충분히 단순한 적절한 균형을 찾는 데서 온다는 것을 시사한다. 저자들은 미래의 연구가 단순히 손실 함수를 추적하는 것을 넘어, 상관관계와 상호작용이 훈련 중에 어떻게 진화하는지를 관찰함으로써 이러한 임계 특성을 직접 측정하는 데 집중해야 한다고 제안한다. 신경망을 상호작용하는 물리적 시스템으로 취급함으로써, 이 접근 방식은 인공지능이 학습하는 방식에 대한 더 체계적인 이해를 제공하며, 임계성과 척도의 근본 원리에 기반하여 더 나은 아키텍처와 훈련 방법을 설계할 수 있는 길을 열어준다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →