← 최신 논문
🤖 AI

Ablation-Reversible Heads Don't Transfer: A Stress Test for Mechanistic Role Claims in Transformers

이 논문은 표준적인 필요성, 인코딩 및 복원 기준을 충족하는 헤드들이 프롬프트 간에 계산을 전이하는 데 종종 실패함을 입증함으로써 트랜스포머 어텐션 헤드에 대한 일반적인 기계론적 역할 주장의 타당성에 이의를 제기하며, 이를 통해 많은 그러한 헤드들이 특정 의미론적 계산을 수행하기보다는 단지 궤적을 안정화하거나 출력을 편향시킬 뿐이라는 것을 밝히기 위한 새로운 KID 프레임워크와 엄격한 테스트 파이프라인의 도입을 촉구한다.

원저자: Philip Quirke

게시일 2026-06-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Philip Quirke

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대하고 복잡한 오케스트라(거대 언어 모델)가 특정 곡(수학 문제 풀기 또는 질문에 답하기)을 연주하는 방식을 이해하려고 노력하고 있다고 상상해 보십시오. 오랫동안 연구자들은 특정 음악가(어텐션 헤드)를 지목하며 이렇게 말하려고 노력해 왔습니다. "아, 바로 바이올리니스트가 '덧셈'의 멜로디를 연주하고 있는 주인공입니다."

그들이 보통 사용하는 증명 방식은 세 단계로 이루어집니다:

  1. 음악가 침묵시키기: 만약 그 바이올리니스트를 음소거하면, 노래가 무너집니다. (필요성)
  2. 악보 읽기: 악보를 살펴보면, 그 바이올리니스트의 악보에 "덧셈"이라는 단어가 명확하게 적혀 있습니다. (선형 디코더 가능성)
  3. "되돌리기" 버튼: 바이올리니스트를 음소거한 직후, 그들의 녹음본을 다시 재생하면 노래가 완벽하게 복구됩니다. (절제 가역성)

만약 어떤 음악가가 이 세 가지 테스트를 모두 통과한다면, 연구자들은 전통적으로 다음과 같이 가정했습니다: "이 바이올리니스트가 바로 '덧셈'이라는 개념이다."

거대한 폭로: "가짜 전이(Fake Transfer)"

저자들인 필립 쿼키(Philip Quirke)와 팀은 훨씬 더 엄격한 테스트를 설정했습니다. 그들은 첫 세 가지 테스트를 통과한 그 "완벽한" 바이올리니스트들을 데려다가 다른 곡으로 옮겨보려고 시도했습니다.

당신에게 "덧셈"을 아주 잘 연주하는 바이올리니스트가 있다고 상상해 보십시오. 당신은 그들의 악보(뇌 상태)를 가져와서 "뺄셈"을 묻는 노래에 붙여넣으려고 합니다.

  • 기대치: 만약 그 바이올리니스트가 진정으로 덧셈의 개념이라면, 그 상태를 뺄셈 노래에 붙여넣었을 때 오케스트라가 뺄셈 대신 덧셈을 시도해야 합니다.
  • 현실: 작동하지 않았습니다. 오케스트라는 계속해서 뺄셈을 수행했습니다. 그 바이올리니스트의 "상태"는 새로운 맥락에서 덧셈의 개념을 전이시키지 못했습니다.

저자들은 세 가지 모델과 다섯 가지 유형의 작업(수학, 날짜, 비교 등)에 걸쳐, 어떤 음악가가 첫 세 가지 테스트를 통과할 때마다 네 번째이자 결정적인 테스트에서 실패했다는 사실을 발견했습니다. 그들은 필요했고, 그들의 악보는 "덧셈"처럼 보였지만, 새로운 맥락에서 오케스트라에게 덧셈을 가르칠 수는 없었습니다.

새로운 관점: KID (Knowing, Intent, Doing)

이 음악가들이 실제로 무엇을 하고 있는지 설명하기 위해, 저자들은 KID라고 불리는 새로운 사고방식을 도입합니다:

  1. Knowing (알기): 음악가는 오케스트라가 프롬프트가 무엇을 요구하는지 이해하도록 돕습니다. (예: "아, 이것은 역사 질문이 아니라 수학 문제구나.")
  2. Intent (의도): 음악가는 정확히 어떤 연산을 수행할지 결정하는 역할을 합니다 (예: "우리는 확실히 뺄셈이 아니라 덧셈을 하는 것이다"). 이것이 성배(holy grail)입니다. 논문은 그들이 실제로 이 "의도"를 보유한 음악가를 찾지 못했다고 주장합니다.
  3. Doing (하기): 음악가는 오케스트라가 답을 써 내려가는 것을 돕습니다. (예: "좋아, 답은 5니까, 그렇게 타이핑하자.")

그들이 실제로 발견한 것

"의도(Intent)"를 가진 음악가를 찾는 대신, 그들은 진짜인 것처럼 위장하고 있는 두 가지 다른 유형의 연주자들을 발견했습니다:

  • "궤적 안정기" (Knowing의 역할): 이 음악가들은 오케스트라가 경로에서 벗어나지 않도록 유지하는 지휘자와 같습니다. 만약 이들을 음소거하면, 오케스트라는 어떤 종류의 문제를 풀고 있는지 혼란에 빠집니다. 하지만 이들이 실제로 "덧셈" 스위치를 쥐고 있는 것은 아닙니다. 그들은 단지 "수학 문제"라는 분위기를 유지할 뿐입니다. 새로운 곡으로 옮겨 놓아도, 그들은 특정 수학 연산이 아니라 그 분위기만을 유지합니다.
  • "로짓 바이어스 헤드" (Doing의 역할): 이 음악가들은 정답인 "5"를 쓰는 것을 너무나 좋아하는 서기(scribe)와 같습니다. 이들을 음소거하면, 오케스트라는 "4"나 "6"을 쓸 수도 있습니다. 이들은 올바른 답을 얻는 데 필수적이지만, 수학에 대해 생각하는 것은 아닙니다.

"동일한 정답" 함정

논문은 이 가짜들을 잡아내기 위해 사용한 영리한 트릭인 **"동일 정답 제어(Same-Answer Control)"**를 강조합니다.

"2 + 2는 무엇인가?" (답: 4)라는 프롬프트가 있다고 가정해 봅시다.
"3 + 1은 무엇인가?" (답: 역시 4)라는 프롬프트에서 온 어떤 음악가의 "뇌 상태"를 가져옵니다.
그 상태를 "2 + 2" 프롬프트에 붙여넣었을 때, 오케스트라가 여전히 "4"라고 답한다면, 그것은 그 음악가가 "덧셈"의 개념을 전이시켰기 때문일까요?
아닙니다. 그것은 단지 그 음악가가 숫자 "4"에 집착하고 있기 때문입니다.

저자들은 많은 "성공적인" 전이들이 실제로는 계산(computation)이 아니라, 음악가들이 *정답 문자열(answer string)*에 익숙해져 있었던 결과임을 발견했습니다. 그들은 "덧셈을 하는 법"을 전이한 것이 아니라, "답이 4라는 것을 안다"는 것을 전이한 것이었습니다.

결론

논문은 AI의 "메커니즘"을 찾는 데 사용되는 표준 도구들이 속기 너무 쉽다고 결론짓습니다. 어떤 모델의 부분이 필요하고, 읽을 수 있으며, 가역적이라고 해서 그것이 우리가 생각하는 특정한 "의도"나 "개념"을 보유하고 있다는 뜻은 아닙니다.

  • 좋은 소식: 우리는 이제 더 나은 지도를 갖게 되었습니다. 우리는 단순히 밴드가 경로를 이탈하지 않게 유지하는 음악가(Knowing), 단순히 마지막 음을 써 내려가는 음악가(Doing), 그리고 실제로 멜로디를 결정하는 음악가(Intent)를 구분하는 방법을 알게 되었습니다.
  • 나쁜 소식: 테스트된 모델들에서, 명확하게 "의도"를 결정하는 음악가를 단 한 명도 찾을 수 없었습니다. AI의 "의사 결정" 부분은 너무 얇게 퍼져 있어서, 어떤 단일 바이올리니스트도 "덧셈"의 악보를 홀로 쥐고 있지 않을 수도 있습니다.

요약하자면: "되돌리기" 버튼만 믿지 마십시오. 만약 당신이 어떤 구성 요소의 상태를 새로운 상황으로 옮겨서 동일한 일을 하게 만들 수 없다면, 그것은 그 특정 작업의 "두뇌"가 아니라, 그저 매우 유능한 조수일 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →