← 최신 논문
🤖 machine learning

The Curse of Multiple Mediators: Hidden Interaction Effects in Activation Patching

이 논문은 기계론적 해석 가능성(mechanistic interpretability)에서의 활성화 패칭(activation patching) 추정치가 자연적 간접 효과와 다른 구성 요소의 상태에 의존하는 상호작용 효과를 본질적으로 혼재시킨다는 점을 밝히며, 연구자들이 이러한 상호작용을 제거하기보다는 이를 프롬프트 의존적 인과 기제와 탐욕적 구성 요소 순위 매기기(greedy component ranking)의 한계를 식별하기 위한 진단 도구로 활용해야 한다고 주장한다.

원저자: Sankaran Vaidyanathan, David Arbour, Aaron Mueller, Scott Niekum, David Jensen

게시일 2026-06-29
📖 5 분 읽기🧠 심층 분석

원저자: Sankaran Vaidyanathan, David Arbour, Aaron Mueller, Scott Niekum, David Jensen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: "솔로 연주"의 환상

당신이 밴드의 특정 파트를 담당하는 음악가가 누구인지 알아내려고 한다고 상상해 보세요. 당신에게는 **활성화 패칭(Activation Patching)**이라는 마법 같은 도구가 있습니다. 이 도구는 "시간 여행 음소거 버튼"처럼 작동합니다.

특정 음악가(예를 들어 기타리스트)를 테스트하기 위해 당신은 다음 과정을 거칩니다:

  1. 밴드가 노래를 완벽하게 연주하는 것을 녹음합니다 (Clean Input/정상 입력).
  2. 밴드가 약간 엉망으로 연주하는 버전을 녹음합니다 (Corrupted Input/오염된 입력).
  3. 패칭(The Patch): 완벽한 녹음본에서 기타리스트의 연주 부분만 가져와서 엉망인 녹음본에 붙여넣습니다.
  4. 결과: 만약 노래가 더 좋게 들린다면, 당신은 기타리스트가 영웅이라고 가정합니다. 만약 노래가 똑같이 별로라면, 당신은 기타리스트가 중요하지 않다고 가정합니다.

수년 동안 연구자들은 AI 모델(신경망)의 어떤 부분이 중요한지를 순위 매기기 위해 이 방법을 사용해 왔습니다. 그들은 이 측정값을 NIE(Natural Indirect Effect, 자연 간접 효과)라고 부릅니다.

문제점: "숨겨진 악수(Handshake)"

이 논문은 이 "솔로 연주" 테스트가 **상호작용 효과(Interaction Effects, INT)**를 무시하기 때문에 결함이 있다고 주장합니다.

실제 밴드에서 음악가들은 혼자 연주하는 것이 아니라 서로의 소리를 듣습니다. 기타리스트가 솔로를 연주하더라도, 드러머가 일정한 비트를 유지해주어야만 그 솔로가 제대로 들릴 수 있습니다. 만약 드러머가 박자를 놓치고 있다면, 기타리스트가 아무리 실력이 좋아도 그 솔로는 엉망으로 들릴 수 있습니다.

AI 모델에도 **잔차 스트림(Residual Stream)**이라는 "뒷문"이 존재합니다. 이것은 당신이 테스트 중인 구성 요소(컴포넌트)를 건너뛰어 정보가 흐를 수 있게 하는 측면 채널과 같습니다.

  • 기타리스트를 테스트할 때, 당신은 그의 음표는 고치지만(Clean), 나머지 밴드는 엉망인 버전(Corrupted)으로 둡니다.
  • 이때 기타리스트의 "깨끗한" 음표는 드러머의 "엉망인" 리듬과 섞이려고 시도합니다.
  • 모델은 복잡하고 비선형적이기 때문에(마치 혼란스러운 즉흥 연주 세션처럼), 결과는 단순히 "기타리스트 + 드러머"가 아닙니다. 그것은 두 요소가 충돌하며 발생하는 기묘하고 예측 불가능한 충돌입니다.

논문은 당신이 얻는 점수가 사실 다음 두 가지의 혼합물임을 증명합니다:

  1. PIE (Pure Indirect Effect, 순수 간접 효과): 기타리스트가 단독으로 얼마나 잘하는가.
  2. INT (Interaction Effect, 상호작용 효과): 기타리스트의 연주가 나머지 밴드에 얼마나 의존하는가.

함정: 표준 테스트(NIE)는 이 둘의 합계를 알려주지만, 어떤 것이 무엇인지 구분해주지는 않습니다.

세 가지 시나리오 (논문이 발견한 것들)

저자들은 이 현상을 IOI(Indirect Object Identification, 간접 목적어 식별)라는 유명한 AI 작업(예: "John gave the book to Mary"라는 문장에서 누가 누구에게 무엇을 했는지 맞히는 작업)을 통해 테스트했습니다. 그들은 이 "상호작용"이 순위를 망치는 세 가지 방식을 발견했습니다.

1. "백업 플랜" (숨겨진 영웅들)

  • 상황: 메인 기타리스트가 솔로를 연주하고 있는데, 똑같은 음표를 연주하는 백업 기타리스트가 있는 경우를 상상해 보세요.
  • 결함: 당신이 백업 기타리스트만 단독으로 테스트할 때, 메인 기타리스트는 여전히 엉망인 버전을 연주하고 있습니다. 백업 기타리스트가 이를 바로잡으려 노력하지만, 메인 기타리스트의 나쁜 리듬이 백업의 시도를 망쳐버립니다.
  • 결과: 백업 기타리스트는 낮은 NIE 점수를 받게 됩니다(상호작용이 부정적이기 때문). 테스트는 "이 음악가는 쓸모없다!"라고 말합니다.
  • 현실: 백업 기타리스트는 실제로 매우 중요합니다. 메인 기타리스트를 제거하면 백업이 상황을 살려내기 때문입니다. 하지만 표준 테스트는 "팀워크"를 고려하지 않기 때문에 이들의 가치를 숨겨버립니다.

2. "컨텍스트 전문가" (조용한 파트너)

  • 상황: 드러머가 특정 비트를 연주할 때만 특정 음표를 연주하는 음악가를 상상해 보세요.
  • 결함: 당신이 이 음악가를 단독으로 테스트할 때, 드러머는 잘못된 비트를 연주하고 있습니다. 따라서 음악가의 특별한 음표는 조건이 충족되지 않아 발동되지 않습니다.
  • 결과: 이 음악가는 0점의 점수를 받습니다. 테스트는 "이 음악가는 아무것도 하지 않는다"라고 말합니다.
  • 현실: 이 음악가는 필수적이지만, 오직 나머지 밴드가 제대로 작동할 때만 빛을 발합니다. 표준 테스트는 이들이 빛날 수 있는 맥락(context)으로부터 이들을 격리시키기 때문에 이들을 완전히 놓치게 됩니다 됩니다.

3. "사보타주 요원" (해로운 플레이어)

  • 상황: 어떤 음악가가 노래를 망치는 나쁜 음표를 연주하지만, 나머지 밴드가 이를 해결하는 특별한 "노이즈 캔슬링" 기술을 가지고 있는 경우를 상상해 보세요.
  • 결함: 당신이 이 음악가를 단독으로 테스트할 때, 나머지 밴드는 이미 엉망인 상태이므로 노이즈 캔슬링 기술을 사용할 수 없습니다. 결국 이 음악가의 나쁜 음표는 노래를 완전히 파괴합니다.
  • 결과: 이 음악가는 매우 큰 음수의 점수를 받습니다.
  • 현실: 이 음악가는 사실 다른 요소들이 그 나쁜 음표를 상쇄하도록 설계된 복잡한 시스템의 일부입니다. 테스트는 이 균형이 아닌, 오직 파괴적인 결과만을 포착합니다.

이것이 왜 중요한가? (결론 및 시사점)

논문은 세 가지 주요 포인트를 제시합니다:

  1. 순위가 틀렸다: 만약 AI 구성 요소의 순위를 표준 점수(NIE)로 매긴다면, 당신은 "백업" 영웅들과 "컨텍스트 전문가"들을 놓치게 될 것입니다. 당신은 AI가 특정 방식으로 작동한다고 생각하겠지만, 실제로는 왜곡된 그림을 보고 있는 것입니다.
  2. 이는 버그가 아니라 기능이다: 저자들은 이러한 상호작용을 제거하기 위해 수학을 "수정"하려 하기보다, 이를 측정해야 한다고 주장합니다.
    • 만약 상호작용 점수가 **음수(-)**라면, 그것은 "백업" 역할을 의미합니다 (다른 것들이 실패할 때 도움을 줌).
    • 만약 상호작용 점수가 **양수(+)**라면, 그것은 "컨텍스트 전문가"를 의미합니다 (작동하기 위해 타인의 도움이 필요함).
  3. "프롬프트" 문제: 논문은 이러한 상호작용 점수가 사용하는 특정 문장(프롬프트)에 따라 크게 변한다는 것을 보여줍니다. 문장을 약간만 바꿔도 "백업"이 더 이상 백업이 아니게 될 수도 있고, "전문가"가 작동을 멈출 수도 있습니다. 이는 왜 AI 회로 연구들이 일관되지 않은 결과를 보이는지를 설명해 줍니다.

결론

이 논문은 활성화 패칭(표준 도구)이 퍼즐 조각 하나를 고립시켜 보는 것과 같다고 결론짓습니다. 당신은 조각의 모양은 볼 수 있지만, 그것이 이웃 조각들과 어떻게 맞물리는지는 볼 수 없습니다.

"상호작용 효과(INT)"는 바로 그 빠져 있는 정보입니다. 이것은 복잡한 AI 모델에서 어떤 구성 요소도 홀로 작동하지 않는다는 사실을 알려줍니다. AI가 어떻게 생각하는지 진정으로 이해하려면, "이 부분은 무엇을 하는가?"라고 묻는 것을 멈추고, "나머지 모델이 X를 하고 있을 때, 이 부분은 무엇을 하는가?"라고 물어야 합니다.

저자들은 이러한 상호작용을 계산하는 새로운 방법을 제공하여, 연구자들이 이전에는 보이지 않았던 "백업" 메커니즘과 "컨텍스트 전문가"를 찾아낼 수 있게 함으로써, 혼란스러운 데이터의 덩어리를 AI가 실제로 작동하는 방식에 대한 명확한 지도로 바꾸어 놓았습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →