← 최신 논문
💬 NLP

Linear Representations of Hierarchical Concepts in Language Models

이 논문은 언어 모델이 계층적 개념을 도메인별 저차원 부분 공간에 위치하면서도 도메인 간에 매우 유사한 선형 표현으로 인코딩하여, 다양한 도메인과 레이어에서 해석 가능한 선형 변환을 통해 계층 관계를 효과적으로 복원할 수 있음을 규명합니다.

원저자: Masaki Sakata, Benjamin Heinzerling, Takumi Ito, Sho Yokoi, Kentaro Inui

게시일 2026-04-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Masaki Sakata, Benjamin Heinzerling, Takumi Ito, Sho Yokoi, Kentaro Inui

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"대규모 언어 모델 (LLM) 이 머릿속에서 어떻게 '계층적인 개념'을 저장하고 있는지"**를 탐구한 연구입니다.

쉽게 말해, AI 가 "서울은 동아시아에 속하고, 동아시아는 아시아에 속한다"는 식의 **상하 관계 (계층)**를 어떻게 이해하고 있는지, 그리고 그 정보가 AI 의 뇌 (내부 표현) 에서 어떤 형태로 존재하는지 찾아낸 이야기입니다.

이 복잡한 연구를 일상적인 비유로 풀어보겠습니다.


1. 연구의 핵심 질문: AI 는 '가나다순'으로 정리해 놓았을까?

우리는 AI 가 정보를 단순히 나열해 두는 게 아니라, **나무처럼 가지가 뻗어 있는 구조 (계층)**로 정리해 두리라고 추측해 왔습니다. 예를 들어, '동물'이라는 큰 가지 아래에 '포유류', 그 아래에 '고양이'가 있는 식이죠.

하지만 이전 연구들은 AI 의 '최종 답변을 내는 부분' (단어 예측 층) 만을 봤기 때문에, AI 가 중간에 정보를 어떻게 처리하는지, 그리고 여러 단어로 이루어진 복잡한 개념 (예: '바비 루스'라는 사람) 을 어떻게 다루는지 알 수 없었습니다.

이 논문은 **AI 의 '중간 뇌' (은닉층)**를 샅샅이 뒤져서 계층 구조가 어떻게 저장되어 있는지 확인했습니다.

2. 주요 발견 1: AI 는 '선형적인 나침반'을 가지고 있다

연구진은 AI 의 내부에서 계층 관계를 찾아내는 **선형 변환 (Linear Transformation)**이라는 도구를 개발했습니다. 이를 **'선형 계층 인코딩 (LHE)'**이라고 부릅니다.

  • 비유: AI 의 뇌를 거대한 도서관이라고 상상해 보세요.
    • 과거 연구는 도서관의 '책장 끝' (최종 답변) 만 봤습니다.
    • 이 연구는 도서관의 중간 복도를 샅샅이 뒤졌습니다.
    • 그 결과, AI 는 "서울"이라는 책이 "동아시아"라는 책으로 가는 **정해진 길 (나침반 방향)**을 가지고 있다는 것을 발견했습니다.
    • 이 나침반을 이용하면, AI 가 "서울은 어디에 속해?"라고 생각할 때, 그 정보가 선형적으로 (직선적으로) 정리되어 있다는 것을 증명할 수 있었습니다.

3. 주요 발견 2: 정보는 '작은 방'에 모여 있다 (저차원 서브스페이스)

AI 의 뇌는 수만 개의 차원 (매우 복잡한 공간) 으로 이루어져 있는데, 계층 정보는 그중 **매우 작은 방 (약 150~250 개의 차원)**에 모여 있었습니다.

  • 비유: AI 의 뇌는 거대한 고층 빌딩입니다.
    • 계층 정보는 이 빌딩의 수천 개 층 중 150~250 층 사이의 특정 층에만 집중되어 있습니다.
    • 나머지 층은 다른 일을 하고 있지만, '상하 관계'를 다룰 때는 이 특정 층만 활발히 움직인다는 뜻입니다.

4. 주요 발견 3: 분야마다 '별도의 방'이 있지만, '구조'는 비슷하다

흥미로운 점은 이 '작은 방'이 주제 (도메인) 마다 다르다는 것입니다.

  • **지리 (국가/도시)**에 대한 계층 정보는 '지리 전용 방'에,

  • **인물 (선수/과학자)**에 대한 계층 정보는 '인물 전용 방'에 저장됩니다.

  • 하지만 이 서로 다른 방들 안의 **가구 배치 (구조)**는 놀랍도록 비슷합니다.

  • 비유:

    • '지리'와 '인물'이라는 두 개의 서로 다른 아파트가 있다고 칩시다.
    • '지리 아파트'의 150 층과 '인물 아파트'의 150 층은 완전히 다른 방입니다. (지리 정보를 인물 정보로 바로 옮길 수는 없습니다.)
    • 하지만 두 아파트의 150 층을 자세히 보면, 방의 구조와 가구 배치가 거의 똑같습니다.
    • 즉, AI 는 "어떤 주제든 계층을 다룰 때는 같은 방식 (구조) 으로 정보를 정리한다"는 공통된 규칙을 가지고 있다는 뜻입니다.

5. 실험 결과: AI 의 생각을 '조종'할 수 있다

연구진은 이 발견을 이용해 AI 의 생각을 실제로 바꿀 수 있었습니다.

  • 비유: AI 가 "서울은 동아시아에 속한다"고 생각할 때, 연구진이 **계산된 나침반 (벡터)**을 이용해 "동아시아"라는 개념을 지우고 "유럽"이라는 개념을 집어넣었습니다.
  • 그랬더니 AI 가 **"아, 그럼 서울은 유럽에 속하는구나!"**라고 오답을 내뱉었습니다.
  • 이는 계층 정보가 AI 의 단순한 기억이 아니라, 실제로 AI 가 다음 단어를 예측하는 데 핵심적인 역할을 하고 있음을 의미합니다.

6. 결론: AI 는 매우 논리적이고 해석 가능한 방식으로 세상을 이해한다

이 논문은 AI 가 무작위로 정보를 쌓아 올린 것이 아니라, **매우 체계적이고 해석 가능한 방식 (선형적 구조)**으로 계층 지식을 저장하고 있음을 증명했습니다.

  • 한 줄 요약: AI 는 거대한 뇌 속에서 계층 정보를 작은 방정해진 구조로 정리해 두었으며, 우리는 그 구조를 찾아내어 AI 의 생각을 조종할 수 있습니다.

이 연구는 AI 가 어떻게 '이해'하는지 그 내부 작동 원리를 밝히는 중요한 한 걸음이며, 향후 AI 를 더 투명하고 안전하게 만드는 데 기여할 것으로 기대됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →