Intrinsic Structure: Spectral Identifiability for Mechanistic Interpretability
이 논문은 모델의 쿱만 스펙트럼(Koopman spectrum)이 데이터로부터 회복 가능한 좌표 불변적이고 본질적인 지문임을 증명함으로써 기계론적 해석 가능성(mechanistic interpretability)을 위한 최초의 식별 가능성 정리(identifiability theorem)를 확립하며, 이를 통해 구조적 특성을 방법론적 인위적 산물과 구별하는 동시에 통계적으로 식별 가능한 특징과 인간이 읽을 수 있는 회로 사이의 근본적인 분리 현상을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
탐정의 딜레마: 기계 내부의 진실을 찾아서
당신은 거대한 블랙박스 공장 내부의 미스터리를 풀려는 탐정이라고 상상해 보십시오. 이 공장은 '뉴럴 네트워크' 또는 '트랜스포머'라고 불리는 인공지능의 일종입니다. 이 공장은 단어를 입력받아 답을 내놓지만, 정확히 어떻게 생각하는지는 아무도 모릅로습니다. 수년 동안 과학자들은 이 공장을 분해하여 그것을 작동시키는 작은 톱니바퀴와 레버, 즉 '회로(circuits)'를 찾아내기 위해 노력해 왔습니다. 그들은 '희소 오토인코더(sparse autoencoders)'와 같은 도구를 사용하는데, 이는 기본적으로 공장의 내부 신호들을 이해하기 쉬운 깔끔한 카테고리로 분류하려고 시도하는 정교한 분류 기계와 같습니다.
문제는 이 분류 기계들이 다소 신뢰할 수 없다는 점입니다. 만약 동일한 공장을 약간 다른 설정이나 시작점으로 분류기에 통과시킨다면, 완전히 다른 두 개의 '톱니바퀴' 목록을 얻을 수도 있습니다. 한 번은 기계가 시를 쓰는 비결이 특정 톱니바퀴라고 말하고, 다음번에는 전혀 다른 톱니바퀴라고 말할 수도 있습니다. 이로 인해 과학자들은 의문을 갖게 됩니다. 이 톱니바퀴들이 실제 공장의 부품인가, 아니면 분류기 자체가 만들어낸 환상인가? 만약 이 톱니바퀴들이 실재하지 않는다면, 이들을 기반으로 세워진 그 어떤 안전 규칙이나 과학적 이론도 모래 위에 지어진 것과 다름없을 것입니다. 이 논문은 근본적인 질문을 던집니다: 우리가 사용하는 도구가 무엇이든 상관없이, 실재하며 변하지 않는 공장의 '지문(fingerprint)'을 찾을 수 있을까?
논문의 핵심 아이디어: 공장의 변하지 않는 지문
"내재적 구조: 기계적 해석 가능성을 위한 스펙트럼 식별성(Intrinsic Structure: Spectral Identifiability for Mechanistic Interpretability)"이라는 제목의 이 논문은 이러한 AI 공장을 들여다보는 새로운 방법을 제안합니다. 신호를 깔끔한 더미로 분류하려고 시도하는 대신, 저자들은 AI의 사고 과정을 하나의 **동역학계(dynamical system)**로 취급합니다. 이는 쉽게 말해 AI의 레이어들을 시간이 흐름에 따라 펼쳐지는 영화처럼 본다는 것을 의미합니다. 그들은 **코프만 연산자(Koopman operator)**라는 수학적 도구를 사용하여, 이 복잡하고 비선형적인 움직임이 단순하고 직선적인 움직임이 되는 더 높은 차원으로 이 영화를 끌어올립니다.
이렇게 생각해 보십시오. 롤러코스터의 경로를 설명하려고 한다고 가정해 봅시다. 롤러코스터는 뒤틀리고, 회전하고, 루프를 그리며 움직이기 때문에 예측하기 어렵습니다. 하지만 만약 당신이 하늘 위의 특별한 각도에서 롤러코스터를 마법처럼 볼 수 있다면, 그것이 사실은 단순히 직선 궤도를 따라 움직이고 있다는 것을 알게 될지도 모릅니다. '코프만 스펙트럼(Koopman spectrum)'은 그 직선 궤도의 고유한 서명(signature)입니다. 저자들은 수학적으로 이 서명이 **좌표 불변량(coordinate-free invariant)**임을 증명했습니다. 쉬운 말로 하면, 이것은 도구를 사용하여 측정하는 방식이 아니라 AI 공장 자체의 속성이라는 뜻입니다. 당신이 관점을 어떻게 회전시키거나 사전을 어떻게 바꾸더라도, '스펙트럼'(궤도를 설명하는 숫자 목록)은 단순한 재배열을 제외하고는 정확히 동일하게 유지됩니다.
연구 결과: 진짜 손가락, 하지만 당신이 원했던 것은 아니다
연구팀은 이 이론을 GPT-2 small, Gemma-2-2B, Qwen3-8B-Base라는 세 가지 실제 AI 모델에 테스트했습니다. 그들은 AI의 내부 활동에서 수백만 개의 샘플을 수집하고 이 '스펙트럼'을 복구하려고 시도했습니다.
좋은 소식: 이론은 작동합니다. 가장 큰 모델인 Qwen3-8B-Base에서 스펙트럼은 −0.506 ± 0.031의 속도로 수렴했습니다. 이는 수학적 예측값인 −0.5(또는 M⁻¹/²)와 일치하며, 이는 데이터를 추가할수록 오차가 수학적 예측과 정확히 일치하는 속도로 줄어들었음을 의미합니다. 이는 누군가가 AI의 내부 구조의 특정 부분이 데이터로부터 보장된 오차 범위를 가지고 식별 가능하다는 것을 증명한 첫 사례입니다. 또한 그들은 이 스펙트럼이 얻을 수 있는 최상의 결과이며, 어떤 방법도 이 속도를 앞지를 수 없음을 증명했습니다.
나쁜 소식 (그리고 반전): '지문'은 실재하고 변하지 않지만, 결과적으로 읽기가 매우 어렵다는 것이 밝혀졌습니다. 저자들은 무엇이 식별 가능한가(스펙트럼)와 무엇이 가독성이 있는가(인간이 이해하기 쉬운 것) 사이에 '해리(dissociation)' 현상이 존재함을 발견했습니다.
- 그들은 이 새로운 '코프만 모드(Koopman modes)'가 **간접 목적어 식별(Indirect Object Identification, IOI)**이라는 유명한 AI 행동(예: AI가 "컵 안에 공이 있다" 대신 "상자 안에 공이 있다"라고 말하는 법을 배우는 것)을 설명할 수 있는지 테스트했습니다.
- 결과는 어떠했을까요? 새로운 모드들은 무작위 추측보다는 나았지만, 표준 주성분 분석(PCA)보다는 나빴습니다. 새로운 모드의 상위 8개 방향을 제거했을 때 행동의 **25%**만이 제거되었습니다. 반면, 표준 PCA의 상위 8개 방향을 제거했을 때는 행동의 **60%**가 제거되었습니다.
- 논문은 AI의 내부 수학이 '비정규적(non-normal)'이기 때문에(기술적으로는 복잡하고 뒤틀려 있다는 뜻), 가장 많은 정보를 담고 있는 방향(스펙트럼)이 가장 많은 분산을 담고 있는 방향(쉽게 보이는 패턴)과 같을 수 없음을 증명합니다.
이것이 미래에 의미하는 바
이 논문은 엄중하지만 중요한 깨달음으로 결론을 맺습니다: 식별 가능한 대상과 가독성이 있는 대상은 서로 다른 대상입니다.
우리는 이제 AI의 내부 역학에 대한 '지문'을 찾을 수 있다는 수학적 보증을 갖게 되었습니다. 이 지문은 실재하며 우리의 도구에 의해 만들어진 허상이 아닙니다. 그러나 이 지문은 인간이 이해할 수 있는 회로의 지도는 아닙니다. 이것은 "네, 이 모델의 이 부분은 실재한다"라고 말해주는 엄격하고 과학적인 인증서이지만, 그 부분이 무엇을 하고 있는지 인간이 쉽게 읽을 수 있는 방식으로 알려주지는 않습니다.
저자들은 또한 기존 방법(예: 희소 오토인코더)에서 나타나는 가변성이 단순히 코드의 버그가 아니라, 그 방법들이 사용하는 수학의 구조적 결과임을 보여주었습니다. 그들은 심지어 해결책을 제안했습니다. 사전(dictionary)이 '코프만 불변성'을 존중하도록 훈련 과정에 페널티를 추가하는 것입니다. 이를 시도했을 때, 스펙트럼은 41% 더 재현성이 높아졌지만, 사전 자체는 덜 안정적이 되었습니다.
요약하자면, 이 논문은 AI의 특정 부분이 실재한다는 것을 증명할 수 있는 수학적으로 견고한 새로운 도구를 우리에게 제공합니다. 하지만 동시에, 어떤 것이 실재하고 식별 가능하다 하더라도 그것이 반드시 우리가 이해하기 쉬운 것은 아니라는 경고를 보냅니다. '지문'은 존재하지만, 그것은 읽기 위해 새로운 종류의 사전을 필요로 하는 언어로 쓰여 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.