← 최신 논문
🤖 machine learning

How the Hessian-Spectrum of Neural Networks Depends on Data

이 논문은 임의의 구조와 데이터셋을 가진 선형 네트워크에 대한 헤시안 행렬의 고유값을 유도하여 분류 작업에서의 솔루션 날카로움(sharpness)이 단일 클래스 내 샘플의 최대 비율에 의해 직접적으로 결정됨을 밝히는 한편, 이러한 이론적 통찰이 단순화된 가정을 완화하고 비선형성을 도입하더라도 견고하게 유지됨을 입증한다.

원저자: Jasraj Singh, Enea Monzio Compagnoni, Antonio Orvieto

게시일 2026-07-16
📖 6 분 읽기🧠 심층 분석

원저자: Jasraj Singh, Enea Monzio Compagnoni, Antonio Orvieto

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 고양이, 개, 새를 인식하도록 가르치려 한다고 상상해 보세요. 단순히 사진 한 장을 건네며 "배워라"라고 말하는 것이 아니라, 언덕과 계곡이 존재하는 거대하고 보이지 않는 풍경을 제공하는 것입니다. 로봇이 틀린 답을 낼 때마다, 로봇은 더 나은 답을 향해 경사면을 따라 미끄러져 내려갑니다. 이 풍경을 "손실 지형(loss landscape)"이라고 부르며, 이 지형을 가로지르는 로봇의 여정을 "최적화(optimization)"라고 합니다. 하지만 까다로운 점은, 이 지형이 단순히 울퉁불퉁한 것이 아니라 절벽, 평원, 날카로운 봉우리가 있는 거칠고 뒤틀린 산맥과 같다는 것입니다. 로봇이 어떻게 움직이는지 이해하기 위해 과학자들은 **헤시안 행렬(Hessian matrix)**이라는 수학적 도구를 살펴봅니다. 헤시안을 특정 지점의 지형이 얼마나 가파른지를 알려주는 지형도라고 생각하면 됩니다. 지형이 매우 가파르면(날카로우면) 로봇이 주변을 격하게 요동치며 움직일 수 있고, 지형이 평평하면 로봇이 갇히거나 너무 느리게 움직일 수 있습니다. 이러한 "가파름"을 이해하는 것은 과학자들이 더 빠르게 학습하고 실수를 줄이는 더 나은 로봇을 만드는 데 도움이 됩니다.

바젤 대학교와 튀빙겐의 엘리스(ELLIS) 연구소의 연구진은 이 지도의 수학적 원리를 파헤치기로 했습니다. 그들은 다음과 같은 질문을 던졌습니다: 데이터 자체의 형태가 지형의 가파름을 어떻게 변화시키는가? 그들은 "신경망"(AI의 한 종류)의 수학적 모델을 구축하고, "만약 다양한 종류의 데이터(샘플이 아주 많거나, 특이한 특징을 가졌거나, 레이블이 불균형한 데이터 등)를 이 네트워크에 입력한다면 헤시안은 어떻게 변할까?"라고 물었습니다. 그들은 단순히 추측한 것이 아니라, 이 지도의 "고윳값(eigenvalues)"(지면의 가파른 정도를 알려주는 숫자)에 대한 정확한 공식을 유도해 냈습니다. 그들의 거대한 발견은 무엇이었을까요? 솔루션의 가파름은 단순히 네트워크가 얼마나 복잡한지에 달려 있는 것이 아니라, 데이터의 분포와 직접적으로 연결되어 있다는 것입니다. 구체적으로, 특정 클래스의 데이터(예: "고양이")가 다른 클래스보다 훨씬 더 흔하다면, 솔루션은 더 "날카로워(sharper)"집니다. 그들의 수학은 몇 가지 이상적인 가정(예: 완벽하게 둥근 데이터 구름)을 바탕으로 구축되었지만, 그들이 발견한 규칙은 비선형 활성화 함수와 같은 실제 세계의 무질서함을 추가했을 때도 놀라울 정도로 잘 유지되었습니다.

학습 지형의 모양

이 연구진이 발견한 내용을 이해하기 위해, 먼저 등장인물들을 만나봅시다. 그들은 오늘날 우리가 사용하는 AI 뇌의 단순화된 버전인 "선형 신경망(linear neural network)"을 연구했습니다. 원재료(입력 데이터)가 여러 스테이션(층, layers)을 통과하여 완성품(예측)이 되는 공장 조립 라인을 상상해 보세요. "가중치(weights)"는 각 스테이션에 있는 기계의 설정값입니다. 목표는 제품이 타겟과 완벽하게 일치하도록 이 설정들을 조정하는 것입니다. 연구진은 "평균 제곱 오차(Mean-Squared Error, MSE)" 손실을 사용했는데, 이는 로봇의 추측과 실제 정답 사이의 거리를 측정하고 이를 제곱하여 그 숫자를 최대한 작게 만들려는 세련된 방식입니다.

로봇이 어떻게 움직이는지 보기 위해, 그들은 에러 지형의 곡률을 설명하는 거대한 숫자 격자인 **헤시안(Hessian)**을 살펴보았습니다. 계산량이 많은 복잡한 헤시안을 정확히 계산하는 대신, 그들은 일반화된 가우스-뉴턴(Generalized Gauss-Newton, GGN) 근사라는 영리한 지름길을 사용했습니다. 이것을 모든 곳을 직접 걸어서 확인하는 대신 위성 사진을 사용하여 지형을 추정하는 것이라고 생각하면 됩니다. 로봇이 학습함에 따라 에러가 줄어들면, 이 위성 사진은 믿을 수 없을 정도로 정확해집니다.

게임의 규칙

연구진은 수학 문제를 풀기 위해 매우 깨끗하고 이상적인 세계를 설정하는 것부터 시작했습니다. 그들은 데이터가 "등방성(isotropic)"이라고 가정했는데, 이는 특징들이 마치 완벽하게 둥근 점 구름처럼 모든 방향으로 균등하게 퍼져 있음을 의미합니다. 또한 네트워크 층들이 "강하게 균형 잡혀(strongly balanced)" 있다고 가정했는데, 이는 한 층의 설정이 다음 층과 완벽하게 정렬되어 있어 마치 동기화된 무용단처럼 움직임을 의미합니다.

이러한 완벽한 조건 하에서, 그들은 아름다운 패턴을 발견했습니다. 단순한 2층 네트워크의 경우, 지형의 가파름(고윳값)은 각 층에 있는 가중치의 제곱된 "강도"(특이값, singular values)의 합에 의해 결정됩니다. 이는 산의 전체 가파름이 두 개의 주요 경사면의 가파름의 합과 같다고 말하는 것과 같습니다. 그들은 지형의 가장 날카로운 지점이 단순히 첫 번째 층과 두 번째 층의 가중치 크기의 제곱합이라는 것을 발견했습니다. 이는 가파로움이 두 층 중 가장 큰 것에 불과하다고 제안했던 이전의 아이디어와 상충되는 것으로, 두 층 모두가 전체 가파름에 기여한다는 것을 증명했습니다.

이것을 더 깊은 네트워크(2개 층보다 많은 층)로 확장했을 때, 그들은 만약 층들이 "균형을 유지한다면"(무용단이 계속 동기화를 유지한다면), 가파로움이 층의 수와 가중치의 강도를 포함하는 특정 공식을 따른다는 것을 발견했습니다. 여기서 핵심적인 발견은 대부분의 지형이 사실상 평평하다는 것입니다! 로봇이 움직일 수 있는 수천 개의 방향 중에서, 실제로 가파른 방향은 아주 적으며 나머지는 거의 0에 가깝습니다. 이는 왜 AI 모델들이 종ًا "평평한 방향의 덩어리(bulk of flat directions)"를 가지고 있는 것처럼 보이는지를 설명해 줍니다. 이는 실제 실험에서도 관찰되는 현상입니다.

데이터가 지형을 만드는 방식

이 논문에서 가장 흥ente한 부분은 데이터 자체가 이 지형의 모양을 어떻게 결정하는가 하는 점입니다. 연구진은 다음과 같이 물었습니다: "만로 데이터셋을 바꾸면 어떻게 될까?"

  1. 데이터셋 크기: 놀랍게도, 데이터 포인트가 일정하다면 솔루션의 날카로움은 샘플의 수에 의존하지 않습니다. 100장의 사진을 넣든 10,000장을 넣든, 최종 솔루션의 가파름은 동일하게 유지됩니다. 이는 더 많은 데이터가 항상 특정한 방식으로 더 날카롭거나(또는 더 평평하게) 만든다는 기존의 믿음에 도전하는 것입니다.
  2. 깊이(Depth): 층의 개수가 중요합니다. 만약 입력 데이터가 출력 레이블보다 "작다면", 네트워크를 더 깊게 만드는 것은 솔루션을 더 날카롭게 만듭니다. 이는 계단에 더 많은 단계를 추가하는 것과 같습니다. 만약 계단이 고르지 않다면, 전체 구조는 더 위태로워집니다.
  3. 특징의 크기(Feature Magnitude): 데이터 특징이 크고 넓게 퍼져 있으면(높은 분산), 솔루션은 더 날카로워집니다. 팽팽하게 당겨진 줄 위에서 균형을 잡으려고 노력한다고 상상해 보세요. 그것은 느슨한 줄보다 움직임에 훨씬 더 민감합니다.
  4. 레이블 분포 (결정적 발견): 이것이 이 논문의 "스모킹 건(결정적 증거)"입니다. 분류 작업(고양이, 개, 새를 분류하는 것과 같은)의 경우, 솔루션의 날카로움은 클래스들이 얼마나 불균형한가와 직접적인 관련이 있습니다. 만약 한 클래스가 불균형하게 많은 샘플을 가지고 있다면(예: 고양이 90%, 개 10%), 솔루션은 더 날카로워집니다.
    • 잠깐, 하나의 지배적인 클래스가 있는 데이터셋이 배우기 더 쉽지 않나요? 직관적으로는 그렇습니다. 거의 모든 것이 고양이라면 "고양이"라고 추측하기가 더 쉽습니다. 그러나 수학적으로는 이 "쉬운" 솔루션이 더 날카로운 정점 위에 놓여 있습니다.
    • 이는 단순한 데이터셋이 더 "평평한"(더 견고한) 솔루션을 이끈다는 이전의 아이디어와 상충됩니다. 저자들은 학습 자체는 더 쉬울 수 있지만, 데이터가 불균형할 때 수학적 지형은 실제로 더 위태롭다(날카롭다)고 제안합니다.

현실 세계에서의 이론 검증

연구진은 자신들의 수학이 "완벽한" 가정(둥근 데이터 구름, 균형 잡힌 층)에 의존하고 있다는 것을 알고 있었습니다. 그래서 그들은 용기 있게 행동했습니다. 그들은 이론이 살아남는지 확인하기 위해 규칙을 하나씩 깨뜨려 보았습니다.

  • "둥근 데이터" 규칙 깨기: 그들은 완벽하게 둥글지 않은 실제의 지저분한 데이터(MNIST 숫자나 CIFAR 객체 이미지와 같은)를 사용했습니다. 비록 정확한 수학이 완벽하게 들어맞지는 않았지만, 경향성은 유지되었습니다. 날카로움은 여전히 레이블의 불균형과 상관관계가 있었습니다.
  • "균형 잡힌 층" 규칙 깨기: 그들은 네트워크를 강제로 균형 잡히게 만드는 대신, 표준적인 방식인 무작위 초기화를 사용했습니다. 역시, 이론은 유효했습니다. 네트워크가 훈련됨에 따라 자연스럽게 균형을 이루게 되었고, 날카로움은 여전히 그들의 예측을 따랐습니다.
  • 비선형성 추가: 그들은 네트워크를 실제 뇌와 더 비슷하게 만들기 위해 "Tanh" 활성화 함수(AI에서 흔히 쓰이는 비선형 요소)를 추가했습니다. 결과는 완벽한 수학과는 약간 달랐지만, 질적인 행동은 동일했습니다. 레이블의 불균형이 여전히 날카로움을 유도했습니다.

시사점

간단히 말해서, 이 논문은 AI의 학습 여정의 "가파름"이 단지 AI 자체의 속성이 아니라는 것을 알려줍니다. 그것은 데이터의 기하학적 구조에 깊이 뿌리박고 있습니다. 만약 데이터가 한쪽으로 치우쳐 있다면(한 클래스가 다른 클래스들을 압도한다면), AI는 수학적으로 더 "날카로운" 솔루션을 찾게 되며, 설령 그 솔루션을 찾는 것이 더 쉽더라도 말입니다. 저자들은 이러한 날카로움이 데이터 구조, 특히 단일 클래스에 속하는 샘플의 최대 비율의 직접적인 결과라고 제안합니다.

그들의 발견이 선형 네트워크와 특정 수학적 설정에서 도출된 것이긴 하지만, 실제 세계의 복잡성(비선형성, 불균형한 가중치, 지저분한 데이터)을 추가했을 때도 이러한 규칙들이 지속된다는 사실은 데이터 분포와 지형의 날카로움 사이의 이 관계가 딥러닝의 근본적인 진리임을 시사합니다. 이는 AI의 세계에서, 당신이 기계에 먹이는 데이터가 단순히 무엇을 배울지를 가르치는 것이 아니라, 학습 지형의 모양을 결정하여 로봇이 솔루션으로 부드럽게 미끄러져 들어갈지 아니면 날카로운 정점 위에서 위태롭게 균형을 잡을지를 결정한다는 것을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →