← 최신 논문
💬 NLP

Mechanistic Interpretability as Statistical Estimation: A Variance Analysis

이 논문은 기계론적 해석 가능성(mechanistic interpretability)이 근본적으로 인과 매개 점수(causal mediation scores)의 높은 내재적 분산으로 인해 고통받는 통계적 추정 문제라고 주장하며, 이는 회로 발견 파이프라인이 불안정하고 취약한 결과를 생성하게 만드므로 엄격한 통계적 강건성 및 안정성 보고로의 전환이 필요함을 역설한다.

원저자: Maxime Méloux, François Portet, Maxime Peyrard

게시일 2026-06-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Maxime Méloux, François Portet, Maxime Peyrard

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

개요: 흔들리는 나침반으로 도시 지도 그리기

당신이 복잡한 도시(신경망)의 지도를 그려서, 어떻게 A 지점에서 B 지점까지 도달하는지(문제를 해결하는지) 이해하려고 노력하고 있다고 상상해 보세요. 기계적 해석 가능성(Mechanistic Interpretability) 분야의 과학자들은 도시 탐험가와 같습니다. 그들은 이 도시가 의사결정을 내릴 때 사용하는 구체적인 "도로"와 "교차로"(뉴런과 연결)를 찾고자 합니다. 그들은 이러한 특별한 경로를 **"회로(circuits)"**라고 부릅니다.

이 논문은 현재 이 탐험가들이 미친 듯이 회전하는 나침반을 사용하고 있다고 주장합니다. 그들은 자신들이 '단 하나의 진정한 지도'를 찾고 있다고 생각하지만, 실제로는 날씨의 미세한 변화나 나침반을 잡는 방식에 따라 매번 서로 다른 지도를 그리고 있는 것입니다.

핵심 문제: "회전하는 나침반" (분산)

연구진은 이 회로들을 찾아내는 도구들이 근본적으로 불안정하다는 것을 발견했습니다. 그들은 이 문제를 세 가지 층위의 불안정성으로 나누었습니다.

1. 원시 신호 자체가 노이즈가 심함 (내재적 변동성)

비유: 폭풍 속에서 특정 풍속을 측정하려고 한다고 상상해 보세요. 만약 정확히 한 순간에 측정한다면 하나의 숫자를 얻을 것입니다. 하지만 1초 후에 다시 측정하면, 무작ful한 난류 때문에 바람이 약간 더 강해지거나 약해질 수 있습니다.
논문의 주장: AI의 특정 부분에 대한 "중요도"는 바위의 무게처럼 고정된 숫자가 아닙니다. 그것은 풍속과 더 비슷합니다. 당신이 보고 있는 특정 입력(폭풍)에 따라 급격하게 변합니다. 논문은 설령 이를 완벽하게 계산하더라도, 단일 연결에 대한 점수가 너무 심하게 요동치기 때문에 이것이 실제로 중요한 것인지 아니면 그저 무작위적인 돌풍인지 구분하기 어렵다는 것을 보여줍니다.

2. 도구가 노이즈를 더함 (근사 오류)

비유: 바람을 완벽하게 측정하는 데 시간이 너무 많이 걸리기 때문에, 탐험가들은 풍속을 추측하기 위해 저렴하고 빠른 센서(EAP와 같은 근사법)를 사용합니다. 하지만 이 저렴한 센서는 매우 떨립니다. 이 센서는 이미 변동성이 큰 바람 위에 자체적인 정전기와 오류를 추가로 얹어버립니다.
논문의 주장: 과학자들이 시간을 아끼기 위해 사용하는 빠른 방법들(Edge Attribution Patching 등)은 훨씬 더 많은 노이즈를 유발합니다. 이러한 방법들은 기존의 신호보다 오히려 더 불안정하게 보이도록 만드는 경우가 많습니다. "신호 대 잡음비(signal-to-noise ratio)"가 너무 낮아서, 도구들이 실제 신호가 아닌 그저 정전기만을 잡아내고 있는 경우가 많습니다.

3. 단계마다 지도가 바뀜 (집계 불안정성)

비유: 최종 지도를 그리기 위해 탐험가들은 100개의 서로 다른 측정을 수행한 뒤 그 평균을 냅니다. 하지만 측정값 자체가 너무 흔들리기 때문에, 만약 100개의 측정 목록을 아주 조금만 바꿔도(예를 들어 하나를 다른 것으로 교체해도) 최종 지도는 완전히 달라집니다. 어떤 날은 지도가 고속도로를 보여주지만, 다음 날은 비포장도로를 보여줍니다.
논문의 주장: 과학자들이 "회로"를 구축하기 위해 이러한 흔들리는 점수들을 결합할 때, 그 결과는 믿을 수 없을 정도로 취약합니다.

  • 데이터의 변화: 지도를 학습시키기 위해 약간 다른 데이터 세트를 사용하면, 완전히 다른 회로를 발견하게 됩니다.
  • 방법의 변화: 설정값(예를 들어 숫자를 평균 내는 방식)을 살짝 바꾸기만 해도, 다른 회로가 나타납니다.
  • 섭동(Perturbation)의 변화: AI를 테스트하기 위해 "파괴"하는 방식(counterfactual)을 바꾸면, 발견되는 회로가 다시 이동합니다.

"죽은 연어" 효과

이 논문은 현재의 방법들이 "죽은 연어"의 인공물(artifact)을 만들어내기 쉽다고 언급합니다.
비유: 신경과학에서 연구자들은 통계적 노이즈를 보정하지 않았을 뿐인데, 죽은 연어의 뇌에서 "뇌 활동"이 나타나는 것을 발견한 적이 있습니다. 논문은 AI 연구자들도 이와 똑같은 일을 하고 있을 수 있다고 시사합니다. 즉, 실제 회로를 찾는 것이 아니라 우연히 일치한 무작위 노이즈를 보고 회로라고 믿고 있는 것일 수 있다는 것입니다.

연구진이 발견한 것 (증거)

그들은 다양한 AI 모델(GPT-2, Llama 등)과 작업(수학 또는 문법 등)에 대해 실험을 수행했습니다.

  • 결과: 동일한 실험을 약간씩 다른 데이터로 100번 반복했을 때, 발견된 "회로"들은 거의 겹치지 않았습니다. 때로는 겹치는 부분이 10% 미만인 경우도 있었습니다.
  • 결론: 기다리고 있는 단 하나의 "진정한 회로"란 존재하지 않습니다. 대신, 가능한 회로들의 구름(cloud)이 존재하며, 현재의 방법들은 그 구름 속에서 무작위적인 한 점을 찍어 그것을 진실이라고 부르고 있는 것뿐입니다.

제안된 해결책: 추측하지 말고, 불확실성을 측정하라

저자들은 "AI 해석를 포기하라"고 말하는 것이 아닙니다. 대신 "우리가 알고 있다는 척하는 것을 멈추라"고 말합니다.

새로운 규칙:

  1. 분산을 보고하라: 단 하나의 지도만 보여주지 마세요. 100개의 지도를 보여주고, "이것이 평균이며, 이만큼 차이가 난다"라고 말하세요.
  2. 안정성을 확인하라: 회로를 찾았다고 주장하기 전에, 데이터를 약간 바꿨을 때도 그 회로가 유지되는지 확인하세요. 만약 작은 변화에도 회로가 사라진다면, 그것은 신뢰할 수 없는 것입니다.
  3. 불확실성을 수용하라: 이러한 발견을 절대적인 사실(예: "비가 올 것이다")이 아니라 기상 예보(예: "강수 확률 70%")처럼 다루세요.

요약

이 논문은 기계적 해석 가능성이 현재 통계적 문제를 인정하지 않은 채 과학을 하려 한다고 주장합니다. 이는 트램펄린 위에 서서 산의 높이를 측정하려는 것과 같습니다. 저자들은 이 분야가 단 하나의 완벽한 "지면 진실(ground truth)" 회로를 찾는 것을 멈추고, 자신들의 발견이 얼마나 흔들리고 가변적인지를 보고하기를 바랍니다. 이러한 불안정성을 인정해야만 비로소 우리는 AI의 마음을 그려낸 지도를 신뢰할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →