Position: Mechanistic Interpretability Must Disclose Identification Assumptions for Causal Claims
본 논문은 기계적 해석 가능성 연구가 필요한 가정을 명시적으로 밝히지 못함으로써 검증 지표와 인과적 식별을 혼동하는 경우가 많다고 주장하며, 저자들이 식별 전략과 인과적 주장의 견고성을 명확히 서술하도록 요구하는 새로운 공개 규범을 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
복잡한 기계 (인공지능) 가 왜 그런 행동을 하는지 파악하려는 형사가 되어 상상해 보십시오. 당신은 특정 기어 (회로나 특징) 가 특정 행동의 원인이라고 의심합니다. 그 기어를 제거하자 기계가 작동하지 않게 됩니다. 당신은 "아하! 그 기어가 원인이었다!"라고 선언합니다.
이 논문은 인공지능의 '기계적 해석 가능성 (mechanistic interpretability)' 분야에서 연구자들이 증거 규칙을 따르지 않고 이러한 선언을 지나치게 자주 하고 있다고 주장합니다. 그들은 원인을 찾았다고 주장하지만, 왜 그들의 실험이 단순한 우연이 아닌 원인임을 증명하는지 설명하지는 못합니다.
다음은 이 논문의 주장을 간단한 비유로 풀어낸 것입니다:
1. 핵심 문제: "검증 (Validation)"은 "식별 (Identification)"이 아니다
이 논문은 두 가지 개념 사이에서 중요한 구분을 내립니다:
- 검증 (무엇): "기어를 제거했더니 기계가 멈췄다." 이는 사실입니다. 성공적인 테스트입니다.
- 식별 (왜): "그 기어만이 기계를 멈추게 했으며, 숨겨진 백업 기어나 기어를 제거한 행위의 부수적 효과가 아니라는 것을 나는 확실히 안다."
비유:
의사라고 상상해 보십시오. 환자에게 약을 주었더니 열이 내렸습니다.
- 검증: "약을 먹인 후 열이 내렸다." (이는 사실입니다).
- 식별: "약이 열을 내리게 만들었다." (이는 가정을 필요로 합니다).
아마도 열이 내린 것은 하루 중 열이 자연스럽게 내려가는 시간대였기 때문일 수 있습니다. 환자가 동시에 물을 마셨을 수도 있습니다. 약이 효과가 없었더라도 열이 저절로 내려가던 중이었을 수도 있습니다.
인공지능 연구에서 논문들은 종종 "우리는 인공지능의 이 부분을 변경했고 행동이 변했으므로 이 부분이 원인이다"라고 말합니다. 이 논문은 그들이 그 변화의 다른 설명이 있을 수 없음을 증명하는 단계를 건너뛰고 있다고 주장합니다. 그들은 환자가 자연스러운 발열 주기를 가지고 있었는지 확인하지도 않은 채, "열이 내려감" (검증) 을 "약이 작동함" (식별) 의 증거로 취급하고 있습니다.
2. "숨겨진 가정"의 함정
연구자가 원인을 찾았다고 주장할 때마다, 그들은 보이지 않는 가정들의 위에 서 있습니다. 이 논문은 이러한 가정들이 현재 숨겨져 있다고 말합니다.
비유:
마술사가 "내가 지팡이를 휘두르자 토끼가 사라졌다"고 주장한다고 상상해 보십시오.
- 숨겨진 가정: "토끼가 뒷문으로 뛰어나가지 않았다."
- 숨겨진 가정: "내가 지팡이를 휘두르기 전에 토끼가 이미 사라지지 않았다."
인공지능 논문에서 "마술"은 다음과 같은 것들입니다:
- 활성화 패치 (Activation Patching): "우리는 인공지능의 뇌 일부를 교체했다. 행동이 변했다."
- 숨겨진 가정: "우리가 실수로 이 일을 수행하는 잠자는 백업 시스템을 깨우지 않았다."
- 희소 오토인코더 (SAEs): "우리는 '정직'이라는 개념을 나타내는 인공지능 내의 특정 '특징'을 찾았다."
- 숨겨진 가정: "이 특징은 다른 것들의 messy 한 혼합물이 아니라, '정직'처럼 보일 뿐인 독특한 독립적인 구성 요소가 아니다."
이 논문은 10 개의 주요 논문을 감사 (audit) 하고 30 개를 더 확인한 결과, 단 한 건도 이러한 숨겨진 가정들을 나열하는 전용 섹션을 가지고 있지 않았다고 발견했습니다. 그들은 마술 (결과) 만 보여주고 "봐라, 작동한다!"라고 말하며, 그들이 우주가 따르는 어떤 규칙을 가정하고 있는지 인정하지 않습니다.
3. "대체" 오류
이 논문은 현재의 습관을 **"검증 지표 대체 (Validation Metric Substitution)"**라고 부릅니다.
비유:
자동차 정비사가 "차가 시동이 걸렸으니 엔진을 고쳤다"고 말한다고 상상해 보십시오.
- 오류: 정비사는 결과 (차가 시동이 걸림) 를 증거 (정확히 어떤 부분을 고쳤고 다른 어떤 것도 차를 시동시킬 수 없었음) 로 대체하고 있습니다.
- 현실: 배터리의 자기 충전, 정비사의 키 충돌, 혹은 엔진이 처음부터 문제없었던 것 때문에 차가 시동이 걸렸을 수 있습니다.
인공지능 논문에서 연구자들은 "신뢰성 (faithfulness, 설명이 모델과 일치하는가)"이나 "완전성 (completeness, 모든 부분을 찾았는가)"과 같은 지표를 보고합니다. 이 논문은 이러한 것들이 단지 "차가 시동이 걸린 순간"에 불과하다고 주장합니다. 그것들을 갖는 것은 좋지만, 그들이 증거가 되게 만드는 가정들을 명시하지 않는 한 인과관계의 증거가 아닙니다.
4. 제안된 해결책: "공개 프로토콜"
저자는 이 분야가 **계량경제학 (Econometrics, 경제 데이터 연구)**의 규칙을 차용해야 한다고 제안합니다. 경제학에서 "X 가 Y 의 원인이다"라고 주장하려면 명시적으로 다음을 서술해야 합니다:
- 주장 내용: "우리는 X 가 Y 의 원인이라고 주장한다."
- 전략: "우리는 이를 증명하기 위해 Z 방법을 사용한다."
- 가정: "우리는 [조건 A] 와 [조건 B] 가 참이라고 가정한다."
- 스트레스 테스트: "[조건 A] 가 거짓이라면 우리의 결론은 무너진다. 이것이 참인지 어떻게 테스트했는지 여기 있다."
비유:
단순히 "약이 효과가 있었다"라고 말하는 대신, 의사는 다음과 같은 보고서를 작성해야 합니다:
- "우리는 약이 열을 내리게 했다고 주장한다."
- "우리는 환자가 다른 약을 복용하지 않았다고 가정한다."
- "우리는 열이 자연적으로 가라앉는 중이 아니었다고 가정한다."
- "환자가 만약 다른 약을 복용했다면 우리의 결론은 틀렸다. 그들이 복용하지 않았음을 보여주는 데이터가 여기 있다."
5. 감사 결과
저자는 회로 발견과 오토인코더 등 다양한 방법을 다루는 분야의 10 개의 핵심 논문을 살펴본 후, 30 개를 더 확인했습니다.
- 결과: 30 개 논문 중 0 개도 식별 가정을 나열하는 전용 섹션을 가지고 있지 않았습니다.
- 결과: 대부분의 논문 (엄격함에 따라 30 개 중 약 19 개에서 26 개) 은 가정이 참임을 증명하는 대신 "검증 지표" (예: "인공지능이 예상대로 행동했다") 를 대체재로 사용했습니다.
- 결과: 가장 신중한 논문들조차 다른 연구의 오류를 발견했음에도, 그 오류를 발견하는 데 사용된 가정을 명시적으로 나열하지는 않았습니다.
요약
이 논문은 정직함과 명확성을 요구하는 호소입니다. 이는 인공지능 연구가 잘못되었다고 말하는 것이 아니라, 불완전하다고 말합니다.
현재 연구자들은 "봐라, 우리는 원인을 찾았다!"라고 말합니다.
이 논문은 "잠시 멈추고 그 주장을 하기 위해 어떤 규칙을 가정하고 있는지 우리에게 말해 주십시오. 규칙을 알려주지 않는다면, 당신의 '원인'이 진짜인지 아니면 운 좋은 추측인지 알 수 없습니다"라고 말합니다.
이 논문은 이 분야가 "우리의 마술이 얼마나 멋진지 봐라"에서 "마술이 정확히 어떻게 작동하는지, 그리고 왜 이것이 마술이 아님을 우리가 알고 있는지"로 나아가기를 요구하고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.