← 최신 논문
🤖 machine learning

Learning reshapes power-law anisotropy in internal representations

이 논문은 스펙트럼 지수가 정적인 상태로 유지되는 체제와 달리, 선형 및 비선형 네트워크에서의 특징 학습이 입력 통계량과 작업 구조 사이의 역동적인 상호작용을 통해 이 지수의 비단조적 진화를 유도한다는 점을 입증함으로써 신경 표현에서 나타나는 멱법칙 이방성의 배후에 있는 메커니즘을 규명한다.

원저자: Asahi Nakamuta, Jun-nosuke Teramae

게시일 2026-08-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Asahi Nakamuta, Jun-nosuke Teramae

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 인공지능의 엔진인 신경망은 종종 원시 데이터를 복잡한 결정으로 변환하는 '블랙박스'로 묘사되곤 한다. 신경망이 어떻게 작동하는지 이해하기 위해 과학자들은 네트워크가 정보를 처리하면서 생성하는 고차원적 패턴인 '내부 표현(internal representations)'을 들여다본다. 이러한 패턴의 형태를 측정하는 핵심적인 방법 중 하나는 정보의 서로 다른 방향들이 갖는 중요도가 어떻게 분포되어 있는지를 살펴보는 것이다. 생쥐의 뇌에서부터 가장 진보된 언어 모델에 이르기까지, 많은 시스템에서 이 분포는 특정한 규칙을 따른다. 즉, 몇몇 방향이 방대한 양의 정보를 보유하는 반면, 나머지 방향은 점진적으로 줄어드는 양을 보유하며, 이는 '멱법칙(power law)'이라 불리는 예측 가능한 수학적 곡선을 따라 급격히 감소한다. 이러한 불균형성, 즉 이방성(anisotropy)은 네트워크가 학습하고 일반화하는 효율성에 있어 매우 중요한 것으로 여겨진다. 오랫동안 연구자들은 이 패턴이 단순히 네트워크에 입력된 데이터의 지문처럼, 데이터가 남긴 정적인 반영이라고 가정해 왔다. 그러나 새로운 한 연구는 이러한 관점에 도전하며, 이 패턴이 단순히 상속된 것이 아니라 학습 과정 자체에 의해 능동적으로 재형성되는 것임을 시사한다.

교토 대학교의 연구팀은 이러한 재형성이 정확히 어떻게 일어나는지 밝혀내기 위해 연구를 시작했다. 그들은 넓은 은닉층을 가진 2층 구조의 단순화된 신경망 모델을 '교사-학생(teacher-student)' 시나리오에 배치하여 집중적으로 조사했다. 이 설정에서 학생 네트워크는 이미 멱법칙 구조를 가진 데이터를 사용하여, 교사가 정의한 과업을 학습하려고 시도한다. 연구진은 다음과 같은 질문을 던졌다. 학생 네트워크는 단순히 교사의 패턴을 복제하는가, 아니면 학습 행위 자체가 내부 표현의 기하학적 구조를 변화시키는가? 네트워크가 시간에 따라 어떻게 변화하는지를 규정하는 방정식들을 수학적으로 풀이함으로써, 그들은 그 답이 네트워크가 어떻게 훈련되느냐에 전적으로 달려 있다는 것을 발견했다. 그들은 네트워크가 단 하나의 고정된 패턴으로 수렴하지 않는다는 사실을 찾아냈다. 대신, 내부 정보의 형태는 학습함에 따라 역동적으로 진화하며, 학습 과정에서 뚜렷한 단계들을 거치게 된다.

이 연구는 이러한 패턴의 진화가 직선적인 경로가 아니라, 서로 다른 체제(regimes)를 통과하는 여정임을 보여준다. 네트워크가 과업을 해결하기 위해 내부 구조를 능동적으로 재구성하는 '특징 학습(feature-learning)' 모드로 훈련될 때, 패턴의 변화는 극적으로 일어난다. 초기에 네트워크의 내부 상태는 입력 데이터와 일치한다. 하지만 학습이 시작되면 패턴이 변화한다. 연구진은 네트워크가 최대 4단계의 서로 다른 조직화 단계를 거친다는 것을 확인했다. 학습의 가장 초기 단계에서 패턴은 더욱 편향되어, 정보가 소수의 방향에 더욱 집중된다. 학습이 계속됨에 따라 이 가파름은 완화되며, 패턴은 교사가 네트워크에 요구하는 특정 과업에 의해 결정되는 새로운 안정적인 형태로 자리 잡는다. 이 새로운 형태는 원래의 데이터 구조와 과업의 요구 사항이 혼합된 결과물이며, 그 결과 최종 패턴은 원시 데이터 및 초기 상태 모두와는 다른 모습을 띠게 된다.

결정적으로, 연구진은 이러한 역동적인 재형성이 네트워크가 특징을 깊이 있게 학습할 수 있도록 허용될 때만 발생한다는 것을 보여주었다. 만약 네트워크가 내부 구조를 거의 변경하지 않고 주로 초기 무작위 설정에 의존하는 체제에서 훈련된다면, 패턴은 고정된다. 이 상태에서는 내부 표현이 입력 데이터를 단순히 반영할 뿐, 유의미한 재구성을 거치지 않고 시작 당시와 거의 동일하게 유지된다. 이러한 차이는 매우 중요하다. 왜냐하면 실제 신경망에서 관찰되는 멱법칙 패턴이 데이터 자체의 필연적인 결과가 아님을 증명하기 때문이다. 대신, 그것은 입력의 통계적 특성과 학습 과업의 구체적인 목표 사이의 특정한 능동적 상호작용의 결과이다.

연구팀은 이러한 발견이 단순히 단순화된 수학적 모델의 특이 현상이 아 아닌지 확인하기 위해, 실제 세계의 인공지능과 더 유사하게 작동하는 더 복잡한 비선형 네트워크를 대상으로 이론을 테스트했다. 결과는 유효했다. 더욱 현실적인 시스템에서도 특징 학습 체제에서는 내부 표현의 형태가 훈련 중에 변화했지만, 초기 무작위 설정에 주로 의존하는 체제에서는 정적인 상태를 유지했다. 이 연구는 생물학적 뇌와 인공 뇌에서 관찰되는 멱법칙 이방성이 유동적인 속성임을 시사한다. 그것은 데이터의 고정된 특성이 아니라, 시스템이 환경에 적응하는 방식의 역동적인 서명이다. 이 연구는 네트워크의 내부 상태라는 미시적 기하학이 어떻게 형성되는지에 대한 명확하고 분석적인 설명을 제공하며, 시스템이 접하는 데이터와 그 시스템이 발전시키는 지능 사이의 관계를 이해하는 새로운 방법을 제시한다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →