← 최신 논문
🤖 machine learning

Anatomical Heterogeneity in Transformer Language Models

이 논문은 트랜스포머 언어 모델의 모든 레이어가 동일한 계산 자원을 필요로 한다는 가정을 반박하여, 레이어 간 구조적·기능적 이질성을 실증적으로 규명하고 레이어 중요도에 따라 자원을 할당하는 '성장 트랜스포머 훈련'을 통해 비용 절감과 성능 향상을 동시에 달성할 수 있음을 보여줍니다.

원저자: Tomasz Wietrzykowski

게시일 2026-03-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tomasz Wietrzykowski

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🧠 AI 의 해부학: 모든 층이 똑같지 않다는 놀라운 발견

토마스 비에트르지코프스키 (Tomasz Wietrzykowski) 의 2026 년 논문 **"변환기 언어 모델의 해부학적 이질성"**은 인공지능 (AI) 이 어떻게 작동하는지에 대한 우리의 상식을 뒤집는 흥미로운 연구를 담고 있습니다.

이 논문은 **"AI 는 모든 부분이 똑같은 역할을 하는 기계가 아니라, 사람처럼 각기 다른 중요도를 가진 장기들이 모여 있는 생물체와 같다"**는 사실을 발견했습니다.

이 복잡한 내용을 일상적인 비유로 쉽게 설명해 드리겠습니다.


1. 기존의 생각 vs. 새로운 발견

  • 기존의 생각 (균일한 공장): 우리는 AI 를 만들 때, 모든 층 (Layer) 에 똑같은 자원과 시간을 투자합니다. 마치 공장에서 모든 부품에 똑같은 기름을 바르고 똑같은 시간을 들여 조립하는 것과 같습니다. "모든 층이 똑같이 중요할 거야"라고 믿었죠.
  • 새로운 발견 (생물체): 이 연구는 SmolLM2-135M 이라는 작은 AI 모델을 해부해 보니, 층마다 역할과 중요도가 천차만별임을 발견했습니다. 어떤 층은 '생명의 핵심'이고, 어떤 층은 '쓸모없는 장기'이며, 심지어는 '오히려 없애야 더 좋은' 층까지 있었습니다.

2. AI 의 해부도: 6 가지 핵심 발견

연구팀은 30 개의 층을 분석하여 다음과 같은 놀라운 구조를 찾아냈습니다.

① '핵심 두뇌'와 '쓰레기통'의 차이

  • 핵심 두뇌 (8~11 층): 이 부분만 건드려도 AI 가 완전히 망가집니다. 마치 인간의 뇌간이나 심장을 건드리는 것과 같아서, 이 부분을 없애면 AI 는 "무엇을 해야 할지" 전혀 모르게 됩니다. (퍼플렉시티라는 성능 지표가 6 만 배나 나빠짐!)
  • 쓰레기통 (중복 층): 10 개 이상의 층은 실제로는 별 쓸모가 없습니다. 이들을 없애거나 무작위로 바꿔도 AI 는 여전히 잘 작동합니다.
  • 반역자 층 (Anti-layers, 14, 17 층): 이것이 가장 놀라운 발견입니다. 이 층들은 오히려 AI 성능을 떨어뜨립니다. 마치 우리 몸의 '충수 (맹장)'처럼, 원래는 기능이 있었을지 몰라도 지금은 오히려 해가 되는 존재입니다. 이 층을 없애거나 무작위로 바꾸면 AI 가 더 똑똑해집니다!

② 예측 불가능한 정밀도

  • AI 의 숫자 (가중치) 는 수학적으로 매우 규칙적으로 변합니다. (예: 1 층과 2 층의 숫자 패턴이 비슷함).
  • 하지만 이 규칙을 이용해 수학적으로 예측된 숫자로 AI 를 만들면? AI 는 완전히 망가집니다.
  • 비유: 사람의 손가락 길이가 규칙적으로 변한다고 해서, 그 규칙대로 손가락을 만들어 붙인다고 해서 그 손으로 글을 쓸 수 있는 것은 아닙니다. AI 는 정확한 미세한 조화가 필요하지, 대략적인 예측으로는 안 됩니다.

③ '회복 속도'로 중요도를 측정하다

  • AI 의 특정 층에 소음을 섞어서 망가뜨린 뒤, 다시 학습시켜 원래 상태로 돌아오게 했습니다.
  • 핵심 층 (두뇌): 망가지면 다시 복구하는 데 시간이 매우 오래 걸리거나, 아예 복구되지 않습니다. (매우 중요함)
  • 중복 층: 망가져도 순식간에 다시 정상으로 돌아옵니다. (별로 중요하지 않음)
  • 결론: 이 '회복 속도'를 보면, 각 층이 얼마나 많은 학습 시간을 필요로 하는지 알 수 있습니다.

④ '약하게 줄이기'가 유일한 해법

  • 불필요한 층을 없애거나 (Zero), 다른 층을 복사해서 (Clone) 넣는 등 여러 방법을 시도했습니다. 모두 실패했습니다.
  • 성공한 방법: 원래 숫자를 0.9 배로 살짝 줄이는 것 (Scale ×0.9) 뿐이었습니다.
  • 비유: 불필요한 층은 AI 에게 '작은 보정'을 해주는 역할입니다. 이걸 아예 없애거나 다른 것으로 바꾸면 방향이 틀어지지만, 약하게만 줄이면 AI 는 여전히 잘 작동합니다.

⑤ '성장 학습 (Growth Training)'이라는 새로운 교육법

  • 기존 방식: 모든 층을 동시에, 똑같은 양만큼 학습시킵니다. (비효율적)
  • 새로운 방식 (성장 학습): 생물체가 태어나서 성장하듯 단계별로 학습시킵니다.
    1. 태아기: 가장 중요한 '핵심 두뇌' 층만 먼저 학습시킵니다.
    2. 성장기: 그 다음으로 중요한 층들을, 이미 학습된 두뇌를 베끼는 방식으로 시작합니다.
    3. 성숙기: 마지막으로 나머지 층들을 다듬습니다.
  • 결과: 이 방법으로 학습한 AI 는 동일한 학습 시간과 비용으로, 기존 방식보다 4.7 배나 더 똑똑해졌습니다. 또한 학습 시간도 13% 단축되었습니다.

3. 이 연구가 우리에게 주는 메시지

이 논문은 AI 를 단순한 '계산기'가 아니라, 생물학적 성장 원리를 따르는 존재로 바라보게 합니다.

  • 비유: 우리가 아이를 키울 때, 모든 과목에 똑같은 시간을 투자하지 않죠? 먼저 걷고 말하기 (기초) 를 가르치고, 그다음에 수학이나 과학 (심화) 을 가르칩니다. AI 도 마찬가지입니다.
  • 핵심: AI 의 '핵심 두뇌'에 집중해서 시간을 더 주고, '쓸모없는 장기'는 아예 없애거나 시간을 줄여야 합니다. 이렇게 하면 더 적은 비용으로 더 똑똑한 AI를 만들 수 있습니다.

요약

이 연구는 **"AI 의 모든 층은 똑같지 않다"**는 것을 증명했습니다.

  1. 핵심 층은 생명을 지키는 심장처럼 중요합니다.
  2. 반역자 층은 오히려 없애야 성능이 좋아집니다.
  3. 성장 학습을 통해 단계별로 자원을 배분하면, AI 는 훨씬 더 빠르고 똑똑하게 자라납니다.

이제 AI 를 만들 때는 "모두에게 똑같이"가 아니라, "각자의 역할에 맞게" 학습시키는 것이 정답이라는 것을 알게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →