Everything, Everywhere, All at Once: Is Mechanistic Interpretability Identifiable?
이 논문은 불리언 함수와 소규모 신경망에 대한 실험을 통해 고유한 설명은 체계적인 식별 불가능성으로 인해 종종 달성 불가능함을 입증함으로써 기계론적 해석 가능성의 식별 가능성을 조사하며, 이를 통해 엄격한 고유성이 유효한 AI 설명을 위해 반드시 필요한지에 대한 재평가를 촉구한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 특정 퍼즐을 완벽하게 풀 수 있는 매우 똑똑한 블랙박스 로봇이 있다고 상상해 보십시오. 당신은 이 로봇이 어떻게 그것을 해내는지 알고 싶습니다. 단순히 그것이 작동한다는 사실을 아는 것을 넘어, 그 마법을 만드는 아주 작은 톱니바퀴, 레버, 스위치들을 들여다보고 싶어 합니다. 이것이 바로 **기계적 해석 가능성(Mechanistic Interpretability)**의 목표입니다. 즉, 신경망(로봇의 뇌)을 역공학하여 그것이 어떻게 생각하는지에 대한 단순하고 인간이 읽을 수 있는 이야기를 찾아내는 것입니다.
이 논문은 매우 단순하면서도 심오한 질문을 던집니다. 만약 우리가 이 로봇의 내부를 들여다보고 작동 방식에 대한 이야기를 찾으려 한다면, 우리 모두가 똑같은 이야기를 발견하게 될까요? 아니면, 서로 다른 두 사람이 동일한 로봇을 보고, 동일한 규칙을 사용하여 조사하더라도, 완전히 다르지만 똑같이 타당한 두 가지 서로 다른 이야기를 내놓게 될까요?
저자들은 이렇게 말합니다. 아니요, 우리는 유일한 이야기를 보장받지 못합니다. 실제로 데이터에 완벽하게 부합하는 수십 개, 수백 개, 혹은 수천 개의 서로 다른 "이야기"가 존재하는 경우가 많습니다.
다음은 간단한 비유를 사용한 연구 결과의 요약입니다.
두 가지 조사 방법
이 논문은 연구자들이 이러한 이야기를 찾기 위해 시도하는 두 가지 주요 방식을 살펴봅니다.
"어디서, 무엇을" (탐정 접근법):
- 아이디어: 먼저, 로봇 내부에서 모든 핵심적인 역할을 수행하는 작은 뉴런 그룹(하나의 "회로")을 찾으려고 노력합니다. 일단 그 그룹을 찾으면, 그들이 어떤 논리를 사용하는지 추측합니다 (예: "아, 이 세 개의 뉴런은 AND 게이트처럼 작동하는구나").
- 문제점: 당신에게 거대한 도서관이 있다고 상상해 보십시오. 당신은 이야기를 들려주는 특정 페이지들을 찾고 싶어 합니다. 당신은 그 이야기를 완벽하게 전달하는 한 세트의 페이지들을 찾을 수도 있습니다. 하지만 그 첫 번째와는 완전히 다르지만, 여전히 이야기를 완벽하게 전달하는 또 다른 세트의 페이지들을 발견할 수도 있습니다. 이 논문은 단순한 작업에 대해, 완벽하게 임무를 수행할 수 있는 85개의 서로 다른 뉴런 그룹이 존재함을 발견했습니다. 단 하나의 "정답"인 톱니바퀴 그룹은 없습니다.
"무엇을, 어디서" (설계자 접근법):
- 아이디어: 먼저, 단순한 이야기나 알고리즘을 추측합니다 (예: "로봇은 OR 게이트를 사용하고 있을 거야"). 그런 다음, 그 이야기가 구현되고 있는 곳을 찾기 위해 로봇의 뇌를 스캔합니다.
- 문제점: 거대한 오케스트라에서 연주되는 특정 멜로디를 찾고 있다고 상상해 보십시오. 당신은 바이올린이 그 멜로디를 연주하고 있다는 것을 발견할 수도 있습니다. 하지만 곧 첼로도 동시에 정확히 같은 멜로디를 연주하고 있으며, 플루트도 마찬가지라는 것을 깨닫게 됩니다. 이 논문은 단 하나의 단순한 알고리즘에 대해서도, 그 알고리즘이 완벽하게 구현되는 로봇의 뇌 속 장소가 159곳이나 된다는 것을 발견했습니다.
"XOR" 실험
이를 증명하기 위해, 저자들은 XOR(두 버튼 중 하나만 눌렸을 때 불이 켜지지만, 둘 다 눌리면 꺼지는 것과 같은 논리 퍼즐)이라는 고전적인 논리 퍼즐을 풀도록 아주 작고 단순한 로봇을 훈련시켰습니다.
- 결과: 그들은 단 하나의 설명만을 찾은 것이 아닙니다. 그들은 수학적으로 완벽한 45,000개 이상의 서로 다른 설명들(회로와 이야기의 조합)을 발견했습니다.
- 비유: 이것은 "제빵사가 어떻게 이 완벽한 케이크를 만들었는가?"라고 묻는 것과 같습니다.
- 설명 A: "그녀는 X 그릇에 밀가루, 설탕, 달걀을 넣었습니다."
곡 설명 B: "그녀는 Y 그릇에 밀가루, 설탕, 달걀을 넣었습니다." - 설명 C: "그녀는 Z 그릇에 다른 재료들을 섞었습니다."
모두가 사실입니다. 케이크의 맛은 같지만, 당신이 지목하는 "메커니즘"은 매번 다릅니다.
- 설명 A: "그녀는 X 그릇에 밀가루, 설탕, 달걀을 넣었습니다."
이것이 왜 중요한가?
통계학에는 **식별 가능성(identifiability)**이라는 개념이 있습니다. 이는 데이터를 가지고 있다면, 그 데이터를 만들어낸 단 하나의 진정한 숫자 세트가 존재해야 함을 의미합니다. 이 논문은 AI 설명에 있어서 식별 가능성이 깨졌다고 주장합니다.
- "유일한 진실"이라는 신화: 우리는 깊이 파고들면 AI가 생각하는 '단 하나의 진정한 방식'을 찾을 수 있을 것이라고 흔히 가정합니다. 이 논문은 그 가정이 틀렸을 가능성이 높다고 말합니다. AI는 여러 방식으로 동시에 생각하고 있거나, 그 생각을 설명할 수 있는 여러 가지 서로 다른 방법이 모두 똑같이 옳을 수도 있습니다.
- 결과: 만약 두 명의 전문가에게 동일한 AI를 설명해 달라고 요청한다면, 그들은 완전히 다른 답변을 내놓을 수 있으며, 둘 다 현재의 과학적 규칙에 따라 옳을 수 있습니다.
결론: 우리는 무엇을 해야 하는가?
저자들은 "포기하라"고 말하는 것이 아닙니다. 대신 우리는 사고방식을 바꿔야 한다고 제안합니다.
- "단 하나의 진정한 이야기"를 찾는 것을 멈추십시오: 단 하나의 고유한 설명이 존재하지 않을 수도 있음을 받아들여야 할지도 모릅니다.
- 유용성에 집중하십시오: 설명이 유일한지는 중요하지 않을 수도 있습니다. 아마도 중요한 것은 그 설명이 AI가 다음에 무엇을 할지 예측하거나, 우리가 원하는 대로 AI를 조종하는 데 도움이 되는가 하는 점일 것입니다.
- 다양한 검증을 사용하십시오: 정말 확신이 필요하다면, 단 하나의 방법에만 의존해서는 안 됩니다. 다양한 테스트를 사용하여 그 설명이 모든 각도에서 유효한지 확인해야 합니다.
요약하자면: 이 논문은 AI의 사고방식에 대한 "지문"은 고유하지 않다고 주장합니다. 동일한 자물쇠를 열 수 있는 열쇠는 여러 개일 수 있고, 동일한 영역을 묘사할 수 있는 지도 또한 다양할 수 있습니다. 우리는 단 하나의 완벽한 지도를 기대하는 것을 멈추고, AI가 어떻게 작동하는지에 대한 "진실"이 여러 개의 유효하고 겹쳐진 이야기들의 집합일 수 있음을 받아들이기 시작해야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.