← 최신 논문
💬 NLP

LLMs Explain't: A Post-Mortem on Semantic Interpretability in Transformer Models

이 논문은 대규모 언어 모델에 널리 사용되는 해석 가능성 방법들, 구체적으로 어텐션 기반 설명과 임베딩을 통한 특징 매핑이 근본적인 방법론적 결함과 아티팩트로 인해 의미론적 이해나 언어적 추상화를 신뢰성 있게 탐지하는 데 실패한다고 주장하며, 이로써 퍼베이시브 컴퓨팅 맥락에서 현재의 LLM 해석 가능성에 대한 주장의 타당성에 이의를 제기한다.

원저자: Alhassan Abdelhalim, Janick Edinger, Sören Laue, Michaela Regneri

게시일 2026-02-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Alhassan Abdelhalim, Janick Edinger, Sören Laue, Michaela Regneri

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 이야기를 쓰고, 질문에 답하고, 언어를 번역할 수 있는 매우 똑똑하고 마법 같은 검은 상자가 있다고 상상해 보세요. 사람들은 이 상자를 "대규모 언어 모델(LLM)"이라고 부릅니다. 이 상자가 맡은 일을 너무나 잘하기 때문에, 엔지니어와 과학자들은 이 모델이 어떻게 생각하는지 알고 싶어 합니다. 그들은 상자 내부를 들여다보고 그 안의 톱니바퀴가 어떻게 돌아가는지 보고 싶어 합니다.

이 논문은 본질적으로 과학자들이 이 상자 내부를 들여히 들여다보기 위해 시도해 온 두 가지 대중적인 방법에 대한 "사후 분석(post-mortem, 의학적 부검)"입니다. 저자인 함부르크 대학교 연구진은 모델이 진정으로 언어를 이해하고 있는지 확인하기 위해 이 두 가지 방법을 사용했습니다.

판결: 두 방법 모두 실패했습니다. 그들은 단순히 "약한" 설명을 찾아낸 것이 아니라, 그 방법들 자체가 잘못된 가정에 기반하고 있다는 것을 발견했습니다. 과학자들이 "보라, 모델이 이것을 이해하고 있다!"라고 말하기 위해 사용했던 "증거"는 사실 테스트 설정 방식이 만들어낸 환상에 불과했습니다.

다음은 그들이 테스트한 두 가지 방법과 그것들이 왜 고장 났는지에 대한 설명이며, 쉬운 비유를 사용했습니다.

방법 1: "스포트라이트" (어텐션 분석)

이론:
이 AI 모델들에는 "어텐션 헤드(attention heads)"라고 불리는 부분들이 있습니다. 과학자들은 이것이 스포트라이트처럼 작동한다고 생각했습니다. 만약 모델이 "개(dog)"에 대해 이야기하고 있고, 스포트라이트가 "래브라도두들(Labradoodle)"이라는 단어에 비춰진다면, 이론은 다음과 같았습니다. "아하! 모델이 '개'와 '래브라도두들'이 서로 연관되어 있다는 것을 알기 때문에 둘을 연결하고 있구나!"

현실 점검:
연구자들은 정보가 모델의 층(layers, 즉 모델의 "두뇌")을 통과하며 이동할 때, 이 스포트라이트가 실제로 동일한 단어에 계속 집중되어 있는지 테스트했습니다.

  • 비유: 당신이 교실에서 쪽지를 전달하고 있다고 상상해 보세요. 당신은 종이에 "개"라고 적습니다. 당신은 다음 학생에게 종이를 넘기고, 그 학생은 낙서를 추가합니다. 당신은 다음 학생에게 종이를 넘기고, 그 학생은 종이를 접어서 다른 쪽지와 섞어버립니다. 종이가 교실 뒤쪽까지 도달할 때쯤이면, 그 종이는 여러 가지 다른 쪽지들이 뒤섞인 구겨진 공 모양이 되어 있습니다.
  • 발견: 연구자들은 정보가 모델의 더 깊은 층에 도달할 때쯤이면, "쪽지"(단어 표현)가 이미 다른 쪽지들과 함께 녹아 섞여 버린다는 것을 발견했습니다. "스포트라이트"는 더 이상 원래의 단어를 비추고 있는 것이 아니라, 많은 단어가 뒤섞인 혼란스러운 덩어리를 비추고 있습니다.
  • 결론: 과학자들이 모델이 어떤 단어에 "주목(attend)"하고 있는지 보여주는 예쁜 그림들을 그릴 때, 그들은 의미 있는 것처럼 보이는 패턴을 보고 있는 것이지만, 그것은 사실 혼합 과정에서 생긴 인위적인 결과물(artifact)일 뿐입니다. 모델이 반드시 단어 사이의 관계를 생각하고 있는 것이 아니라, 단지 수학적으로 그렇게 보일 뿐입니다.

방법 2: "번역기" (임베딩 속성 추론)

이론:
두 번째 방법은 모델의 내부 숫자들(임베딩)을 비밀 암호처럼 취급하여 모델이 무엇을 "아는지" 확인하려고 합니다. 과학자들은 이 숫자들을 인간의 특성으로 해독하는 "번역기"(작은 컴퓨터 프로그램)를 만들려고 시도합니다.

  • 예시: 만약 모델이 "사과(Apple)"에 대한 숫자 벡터를 가지고 있다면, 번역기는 "사과"가 "빨갛고", "먹을 수 있으며", "나무에서 자란다"는 것을 예측할 수 있을까요? 만약 번역기가 높은 점수를 받는다면, 과학자들은 *"보라! 모델은 사과가 무엇인지 알고 있다!"*라고 말합니다.

현실 점검:
연구자들은 번역기가 실제로 의미를 해독하고 있는지, 아니면 그저 속임수를 쓰고 있는 것인지 테스트했습니다.

  • 비유: 당신이 어떤 사람의 키를 보고 그 사람이 좋아하는 색깔을 맞히려고 한다고 상상해 보세요.
    • 속임수: 만약 모든 사람이 키가 크면 "파란색"을 좋아한다는 데이터셋이 있다면, 키를 바탕으로 "파란색"을 예측하는 번역기를 만들었을 때 완벽한 점수를 얻을 것입니다.
    • 현실: 하지만 만약 데이터를 바꿔서 "키 큰 사람들"이 이제 "빨간색"을 좋아하게 된다면, 그리고 당신의 번역기가 여전히 "파란색"을 완벽하게 맞힌다면, 그것은 당신의 번역기가 실제로 색깔에 대해 배우고 있었던 것이 아님을 의미합니다. 그것은 단지 데이터의 형태나 색상 목록이 짧고 반복적이라는 사실을 암기했을 뿐입니다.
  • 발견: 연구자들은 번역기에 엉뚱한 데이터를 입력해 보았습니다. 단어를 뒤섞거나, "사과"를 무작위의 헛소리로 바꾸거나, 특성을 뒤섞었습니다(예: "사과"를 "찌르는 성질이 있고 치명적인 것"과 연관시킴).
  • 결과: 번역기는 여전히 높은 점수를 받았습니다! 의미가 진짜인지 가짜인지는 중요하지 않았습니다. 높은 점수는 실제 개념을 이해했기 때문이 아니라, 데이터셋의 수학적 구조(데이터가 얼마나 희소하거나 밀집되어 있는지 등)에 의해 발생한 것이었습니다.

이것이 왜 중요한가요?

저자들은 우리가 현재 이러한 AI 모델에 의존하는 복잡한 시스템(자율주행 자동차나 의료 진단 도구 같은)을 구축하고 있다고 주장합니다. 이러한 시스템을 안전하고 효율적으로 만들기 위해, 엔지니어들은 다음을 수행하기 위해 이러한 "해석 가능성(interpretability)" 방법들을 사용합니다:

  1. 디버깅 (시스템이 왜 실수를 했는지 찾아내기 위해).
  2. 압축 (시스템을 더 작게 만들어 휴대폰에서 실행할 수 있도록 하기 위해).
  3. 신뢰 구축 (시스템이 안전한지 결정하기 위해).

위험성: 만약 시스템을 점검하는 데 사용되는 도구가 고장 났다면, 우리는 시스템이 실제로 작동하지 않는데도 제대로 작동하고 있다고 믿을 수 있습니다. 이는 마치 환자의 열을 체크하기 위해 고장 난 체온계를 사용하는 것과 같습니다. 체온계가 항상 "36.5도"라고 표시한다면, 당신은 실제 질병을 놓칠 수도 있습니다.

핵심 요약

이 논문은 이 두 가지 방법이 설득력 있는 이야기(예쁜 그림과 높은 점수)를 만들어내기는 하지만, 실제 과학적 설명을 제공하지는 못한다고 결론짓습니다.

  • **어텐션 맵(Attention maps)**은 흐릿한 사진을 보고 그것이 단지 노이즈일 뿐인데도 얼굴이 보인다고 스스로를 설득하는 것과 같습니다.
  • **속성 추론(Property inference)**은 실제 글자가 아니라 문자열의 길이를 바탕으로 비밀번호를 추측하는 것과 같습니다.

저자들은 AI가 쓸모없다고 말하는 것이 아닙니다. 이 특정 도구들이 AI가 무엇을 "생각하는지" 알려준다고 가정하는 것을 멈춰야 한다고 말하는 것입니다. 특히 이 모델들이 현실 세계의 시스템을 제어할 때는, 결과를 신뢰하기 전에 우리의 가정을 훨씬 더 엄격하게 테스트해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →