← 최신 논문
🤖 machine learning

Hidden Heroes and Gradient Bloats: Layer-Wise Redundancy Inverts Attribution in Transformers

본 논문은 트랜스포머의 경사 기반 귀속 분석이 중복된 초기 계층 구성 요소를 과대평가("경사 과부하") 하고 중요한 후기 계층 구성 요소를 과소평가("숨은 영웅") 하여 인과적 중요성을 체계적으로 오인식하므로, 오류 있는 기계적 해석을 피하기 위해 인과적 검증이 필요함을 밝힌다.

원저자: Donald Ye

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Donald Ye

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

복잡한 기계의 어떤 부분이 실제로 무거운 일을 하고 있는지 파악하려고 한다고 상상해 보세요. 당신은 간단한 규칙을 사용하기로 결정합니다: "기계가 작동할 때 부품이 더 크게 비명을 지를수록, 그 부품이 더 중요할 것이다."

AI(특히 트랜스포머) 세계에서는 이 '비명'을 **기울기 크기 (gradient magnitude)**라고 부릅니다. 과학자들은 오랫동안 AI 의 뇌 중 '기울기'(변화에 대한 강한 반응) 가 높은 부분이 기계의 지능에 가장 중요하다고 가정해 왔습니다.

이 논문인 "숨겨진 영웅과 기울기 비대증 (Hidden Heroes and Gradient Bloats)"은 이러한 가정이 위험하게 잘못되었다고 주장합니다. 사실, 기계는 종종 잘못된 곳에서 가장 크게 비명을 지르고 있습니다.

연구자들이 발견한 내용을 간단한 비유로 정리해 보겠습니다:

1. 두 가지 캐릭터: "비대증 (Bloats)"과 "영웅 (Heroes)"

연구자들은 AI 모델에 서로 매우 다른 두 가지 유형의 구성 요소가 있으며, 이들이 기계의 서로 다른 부분에 위치해 있음을 발견했습니다.

  • 기울기 비대증 (The Gradient Bloats, 시끄러운 입):

    • 거주지: 초기 층 (기계의 시작 부분).
    • 행동: 그들은 매우 시끄럽습니다. 당신이 그들을 조정하면 높은 '기울기' 신호로 비명을 지릅니다.
    • 현실: 그들은 대부분 중복입니다. 20 명의 합창단원들이 모두 같은 음을 부르는 것과 같습니다. 한 명을 침묵시켜도 나머지 19 명이 여전히 노래하고 있기 때문에 노래는 거의 변하지 않습니다. 그들은 시끄럽기 때문에 중요해 보이지만, 개별적으로는 큰 일을 하지 않습니다.
    • 논문의 주장: 기울기 귀속 (기울기 크기) 은 이러한 부분들이 가장 중요하다고 잘못 판단합니다.
  • 숨겨진 영웅 (The Hidden Heroes, 조용한 천재):

    • 거주지: 후기 층 (기계의 끝 부분).
    • 행동: 그들은 매우 조용합니다. 그들의 '기울기' 신호는 미미합니다.
    • 현실: 그들은 필수입니다. 오케스트라의 지휘자와 같습니다. 지휘자를 제거하면 지휘자 자신이 큰 소리를 내지 않더라도 음악이 무너집니다.
    • 논문의 주장: 기울기 귀속은 이러한 부분을 완전히 무시하여 중요하지 않다고 순위 매깁니다.

2. 실험: 정렬 대 역전

연구자들은 AI 를 위한 두 가지 간단한 수학 퍼즐로 이를 테스트했습니다:

  • 작업 A: 리스트 역전 (예: [1, 2, 3][3, 2, 1]로 변환).
    • 결과: 여기서 '시끄러움' 테스트는 그럭저럭 작동했습니다. 중요한 부분들이 어느 정도 시끄러웠기 때문입니다.
  • 작업 B: 리스트 정렬 (예: [3, 1, 2][1, 2, 3]로 변환).
    • 결과: '시끄러움' 테스트는 붕괴했습니다. 완전히 실패했습니다. AI 의 '시끄러운 입들'(비대증) 이 1 위를 차지한 반면, '조용한 천재들'(영웅) 은 쓸모없다고 순위 매겨졌습니다.

최악의 경우, 테스트는 실제로 거꾸로였습니다: 가장 크게 비명을 지르는 부분들이 안전하게 삭제할 수 있는 부분들이었고, 조용한 부분들이 절대 유지해야 할 부분들이었습니다.

3. "중복의 함정"

왜 기계는 잘못된 부분에서 그렇게 크게 비명을 지르는 것일까요?

논리는 **집단적 중복 (collective redundancy)**이라는 개념으로 이를 설명합니다.

  • 10 명의 사람 (비대증) 이 줄을 잡고 있는 팀을 상상해 보세요. 한 사람을 당기면 모두 긴장을 느끼므로 모두 비명을 지릅니다.
  • AI 의 '기울기'는 그 긴장을 측정합니다. 10 명이 비명을 지르는 것을 보고 "와, 10 명 모두 엄청나게 중요해!"라고 생각합니다.
  • 하지만 실제로 한 사람의 줄을 끊으면 나머지 9 명이 그것을 지탱하므로 아무 일도 일어나지 않습니다.
  • 그러나 조용한 영웅(맨 끝에서 매듭을 잡고 있는 사람)의 줄을 끊으면 전체가 무너집니다.

연구자들은 '시끄러운 입들'을 하나씩 제거하면 AI 가 거의 알아차리지 못한다는 것을 발견했습니다. 하지만 한 번에 모두 제거하면 AI 가 충돌했습니다. 이는 '시끄러운 입들'이 핵심 엔진이 아니라 단순히 중복된 안전망이었다는 것을 증명합니다.

4. 큰 실수

논문의 결론은 AI 를 이해하기 위해 '기울기 크기'에 의존하는 것은 누가 가장 많이 말하느냐로 영화를 판단하는 것과 같습니다.

  • 초기 층(비대증이 사는 곳)은 기본 특징을 수집하는 '시끄러운' 일을 하고 있습니다.
  • 후기 층(영웅이 사는 곳)은 실제로 논리 퍼즐을 해결하는 '조용한' 일을 하고 있습니다.

AI 수학의 특성상 초기 층이 자연스럽게 더 시끄럽기 때문에, '시끄러움 테스트'는 초기 층이 운영의 두뇌라고 오인하게 만듭니다. 실제로는 정렬과 같은 복잡한 작업의 경우, 두뇌는 테스트가 완전히 간과하는 조용한 후기 층 구성 요소들입니다.

요약

  • 신화: "AI 의 한 부분이 강하게 반응하면, 그것이 가장 중요한 부분이다."
  • 진실: 강하게 반응하는 부분들은 종종 단순한 중복된 소음일 뿐입니다. 진정으로 중요한 부분들은 종종 조용하며 과정의 후기 단계에 숨겨져 있습니다.
  • 위험: 과학자들이 AI 를 더 작게 만들기 위해 (가지치기) 이 '시끄러움' 테스트를 사용한다면, 실수로 숨겨진 영웅들(AI 의 지능을 파괴) 을 잘라내고 기울기 비대증들(쓸모없는 부분에 공간을 낭비) 을 유지할 수 있습니다.

이 논문은 연구자들이 AI 가 어떻게 작동하는지에 대한 주장을 하기 전에 '시끄러움' 테스트 하나만 믿는 것을 멈추고, 실제로 어떤 부분이 고장 나는지 보기 위해 '인과적 (causal)' 테스트 (부분을 실제로 제거해 봄) 를 사용해야 한다고 촉구하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →