Explanation Multiplicity: Circuit-Level Interpretability Evidence Does Not Survive Defensible Analytic Variation
이 사전 등록된 연구는 AI 규제를 위한 기계론적 해석 가능성(mechanistic interpretability)의 증거가 정당한 분석적 변형 전반에 걸쳐 회로 발견 결과가 매우 불안정하고 구조적으로 분절되어 있어 준수 문서화에 신뢰할 수 없게 만듦으로써, 해당 증거가 적격성 표준을 충족하지 못함을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 친구에게 마술의 비밀을 설명하려고 한다고 상상해 보세요. 당신은 이렇게 말합니다. "마술사는 단순히 지팡이를 휘두른 게 아니야. 무대 아래에 숨겨진 특정한 레버를 사용한 거지." 하지만 친구가 이렇게 묻습니다. "그 레버를 어떻게 알아? 만약 내가 무대의 다른 부분을 살펴보거나, 다른 손전등을 사용하거나, 다른 마술사에게 확인해 달라고 하면 어떻게 될까?" 만약 당신의 설명이 찾는 방식에 따라 완전히 달라진다면, 그것을 정말 '사실'이라고 부를 수 있을까요? 이것이 인공지능(AI) 분야의 새로운 연구가 던지는 핵심적인 질문입니다.
'기계론적 해석 가능성(mechanistic interpretability)'이라는 분야에서 과학자들은 AI의 두뇌(유명한 GPT-2 모델 같은) 내부를 들여다보고, AI가 특정 행동을 하게 만드는 구체적인 '회로(circuit)'—즉, 연결된 미세한 네트워크—를 찾아내려 노력합니다. 이는 집의 불이 왜 켜졌는지 설명하기 위해 집 안의 정확한 전기 배선을 지도화하려는 것과 같습니다. 유럽 연합(EU)은 만약 AI가 고위험 결정(예: 대출 거절)을 내린다면, 그 기업은 AI가 어떻게 그런 결정을 내렸는지 설명하는 보고서를 제출해야 한다는 새로운 법안을 만들었습니다. 이를 수행하는 가장 명백한 방법은 AI의 내부 회로 지도를 제출하는 것입니다. 하지만 이 논문은 까다로운 질문을 던집니다. 만약 두 명의 똑똑한 전문가가 동일한 AI와 동일한 도구를 사용하더라도, 회로를 찾는 방식에서 약간의 합리적인 차이를 보인다면, 그들은 과연 '같은' 지도를 찾아낼까요? 아니면 완전히 다른 이야기를 만들어낼까요?
이 논문의 저자는 이 문제를 테스트하기 위해 거대한 '당신의 선택에 따라 이야기가 바뀌는(choose-your-own-adventure)' 실험을 설정했습니다. 그들은 AI를 단 한 번만 관찰한 것이 아니라, 무려 15,840번이나 관찰했습니다. 그들은 기존에 발표된 모든 도구의 모든 설정을 사용하여, AI를 분석하는 일곱 가지 서로 다른 방식을 격자 형태로 구성했습니다. 그리고 질문했습니다. "우리가 측정 지표, 시드(seed), 회로의 크기, 또는 테스트 방식을 바꾼다면, 우리가 AI의 뇌에 대해 말하는 이야기는 그대로 유지되는가?"
결과는 안타깝게도, 아주 강력한 "아니오"였습니다.
연구진이 실험을 수행했을 때, 그들은 증거가 믿기 힘들 정도로 취약하다는 것을 발견했습니다. 데이터를 분석할 수 있는 모든 다양한 방법 중에서, AI의 회로에 대한 이야기가 완전히 다른 버전으로 뒤집히는 경우가 **73.2%**에 달했습니다. 즉, 두 감사관이 동일한 AI와 동일한 도구를 사용하더라도 설정값을 약간만 다르게 한다면, 그들은 아마도 완전히 다른 보고서를 제출하게 될 것이라는 뜻입니다. 가장 중요한 선택 사항들을 엄격하게 표준화하여 최대한 통제하려 했을 때조차, 이 '뒤집힘' 비율은 **59.4%**로만 떨어졌습니다.
이것이 단순한 우연이 아님을 확인하기 위해, 그들은 발견된 회로들이 단지 다른 단어로 설명된 같은 대상인지 확인했습니다. 결과는 그렇지 않았습니다. 회로들은 구조적으로 거의 완전히 달랐으며(부품을 약 **4%**만 공유함), 기능적으로도 상관관계가 없었습니다. 이는 마치 한 감사관은 주방 배선도를 찾아냈고, 다른 감사관은 배관도를 찾아낸 뒤, 두 사람 모두 "이것이 이 집이 작동하는 비밀이다!"라고 주장하는 것과 같습니다.
또한 이 논문은 사용된 일곱 가지 주요 도구 중 하나가 테스트 중인 작업에 전혀 작동하지 않고 즉시 충돌(crash)했다는 사실도 발견했습니다. 게さらに, 잠재적인 설명 중 절반 이상이 테스트의 엄격한 규칙을 충족하지 못해 폐기되었습니다.
그렇다면 이것이 미래에 무엇을 의미할까요? 저자는 AI가 고장 났거나 우리가 AI를 이해할 수 없다고 말하는 것이 아닙니다. 현재 우리가 가진 '영수증(증거)'들이 정부 규제 기관에 제출할 준비가 되어 있지 않다는 점을 말하고 있습니다. 만약 당신이 오늘 판사에게 회로 지도를 건넨다면, 그리고 두 번째 판사가 동일한 도구를 사용하면서도 방식만 약간 다르게 사용한다면, 그 판사는 당신의 지도를 검토한 뒤 "이것은 올바른 설명이 아니다"라며 기각할 수도 있습니다. 이 연구는 우리가 이러한 AI 설명을 법정이나 안전 점검에서 신뢰하기 위해서는, 누가 손전등을 들고 있든 상관없이 지도가 안정적으로 유지되도록 만드는 방법을 먼저 찾아내야 한다고 제언합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.