← 최신 논문
🤖 machine learning

When Are Two Networks the Same? Tensor Similarity for Mechanistic Interpretability

본 논문은 텐서 기반 신경망 간의 전역적 기능적 동등성을 효율적으로 검증하는 가중치 공간의 대칭성에 불변인 가중치 기반 척도인 '텐서 유사도'를 제시함으로써, 기계적 해석 가능성을 경험적 근사에서 해결된 대수적 문제로 전환한다.

원저자: ML Nissen Gonzalez, Melwina Albuquerque, Laurence Wroe, Jacob Meyer Cohen, Logan Riggs Smith, Thomas Dooms

게시일 2026-05-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: ML Nissen Gonzalez, Melwina Albuquerque, Laurence Wroe, Jacob Meyer Cohen, Logan Riggs Smith, Thomas Dooms

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

두 개의 외형이 똑같은 로봇이 있다고 상상해 보세요. 둘 다 걷고, 말하고, 수학 문제를 푸는 방식이 동일합니다. 하지만 로봇의 가슴을 열어보면 내부 기어 배열이 완전히 다릅니다. 하나는 기어가 수직으로 쌓여 있고, 다른 하나는 수평으로 퍼져 있습니다.

문제:
인공지능 (AI) 세계에서 과학자들은 이러한 로봇 (신경망) 이 어떻게 생각하는지 이해하려 합니다. 이를 '기계적 해석 가능성 (mechanistic interpretability)'이라고 부릅니다. 하지만 큰 골치가 아픈 문제가 있습니다. 서로 다른 내부 배열이 실제로 정확히 같은 일을 하고 있는지 어떻게 증명할 수 있을까요?

현재의 방법들은 로봇이 걷는 모습을 관찰하여 비교하는 것과 같습니다.

  • '행동' 테스트: 특정 경로에서 둘이 같은 방식으로 걷는다면, 우리는 그들이 동일하다고 가정합니다. 하지만 만약 한 로봇이 우리가 아직 걸어보지 않은 경로에서만 작동하는 비밀스러운 트릭을 가지고 있다면 어떻게 될까요? 우리는 그것을 놓치게 될 것입니다.
  • '설계도' 테스트: 만약 로봇 내부의 숫자 (설계도) 만을 비교한다면, 기어가 뒤집혀 있더라도 정확히 같은 일을 하더라도 서로 다르다고 말할 수 있습니다. 마치 방의 기능이 완전히 동일함에도 불구하고 한 집은 부엌이 왼쪽에 있고 다른 집은 오른쪽에 있다는 이유로 두 집이 다르다고 말하는 것과 같습니다.

해결책: "텐서 유사성 (Tensor Similarity)"
이 논문의 저자들은 이러한 로봇들을 비교하는 새로운 방법을 고안했습니다. 이를 텐서 유사성이라고 부릅니다.

이것을 다음과 같이 생각해 보세요: 설계도를 보거나 로봇이 걷는 모습을 관찰하는 대신, 로봇 수학의 본질을 바라보는 특별한 '마법 거울'을 사용합니다.

  1. '마법 거울' (대칭 불변성):
    점토로 만든 조각상이 있다고 상상해 보세요. 이를 찌그러뜨리거나, 늘이거나, 회전시킬 수 있지만, 여전히 같은 모양이라면 그것은 같은 조각상입니다. 현재의 방법들은 조각상을 회전시키면 혼란을 겪습니다. 저자들의 새로운 방법은 회전을 무시합니다. 오직 함수의 모양에만 관심을 가집니다. 두 로봇이 같은 수학을 수행한다면, 내부 숫자가 완전히 다르게 보이더라도 이 방법은 그들에게 완벽한 점수를 줍니다.

  2. '엑스레이' (데이터 불필요):
    대부분의 테스트는 로봇이 어떻게 답변하는지 보기 위해 수천 개의 질문을 로봇에게 입력해야 합니다. 이 새로운 방법은 질문이 전혀 필요하지 않습니다. 로봇의 내부 '뇌' (가중치) 를 살펴보고 수학적으로 답을 계산합니다. 환자에게 걷게 하지 않고도 뼈가 부러졌는지 알려주는 엑스레이와 같습니다.

  3. '특별한 로봇' (텐서 기반 모델):
    이 마법 거울을 작동시키기 위해 저자들은 '텐서 (특히 다선형 모델)'라는 약간 다른 종류의 점토로 로봇을 만들어야 했습니다. 이러한 로봇은 일반적인 AI 와 똑같이 작동하지만, 내부 수학 구조가 이 특별한 비교를 가능하게 합니다. 이는 일종의 트레이드오프입니다. 이 초정밀 비교 도구를 얻으려면 로봇을 특정 방식으로 만들어야 합니다.

그들이 발견한 것 (실험 결과):
팀은 이 새로운 도구를 네 가지 다른 시나리오에서 테스트했습니다.

  • '망각' 테스트: 그들은 로봇에게 04 번 숫자를 인식하게 한 후 59 번을 추가했습니다. 그 후 9 번을 잊게 하려고 했습니다. 기존 도구들은 로봇의 어떤 부분이 잊고 있는지 파악하지 못했습니다. 반면 새로운 도구는 9 번을 담당하는 특정 '기어'를 향해 레이저를 정확히 가리켜 기억 상실의 정확한 위치를 보여주었습니다.
  • '아하!' 순간 (그로킹): 때로 AI 는 오랫동안 고생한 후 갑자기 어떤 작업에 매우 능숙해집니다. 새로운 도구는 이것이 단순한 갑작스러운 도약이 아니라, 기존 도구들이 놓친 로봇 내부 기어의 느리고 지속적인 재배열임을 보여주었습니다.
  • '비밀 인사' (백도어): 그들은 로봇에 비밀 트리거를 심었습니다. "검은 다이아몬드를 보거든 9 라고 부르라." 로봇은 정상적인 이미지에서는 완벽하게 작동했으므로 표준 테스트는 문제가 없다고 판단했습니다. 하지만 새로운 도구는 내부 수학을 살펴봄으로써 검은 다이아몬드를 보지 않더라도 즉시 그 비밀 인사를 찾아냈습니다.
  • '언어' 테스트: 그들은 이 방법을 언어 모델 (텍스트를 작성하는 로봇) 에 적용했습니다. 새로운 도구는 로봇이 새로운 패턴을 학습함에 따라 명확하고 날카로운 변화를 보여주었지만, 다른 도구들은 흐릿한 혼란만 보였습니다.

결론:
이 논문은 AI 를 진정으로 이해하기 위해서는 숫자가 어떻게 배열되었는지나 우리가 어떤 데이터를 입력하는지에 속지 않는 내부 논리를 비교할 수 있는 방법이 필요하다고 주장합니다. 그들의 새로운 '텐서 유사성' 지표는 정확히 그 일을 수행하지만, 현재는 특정 유형의 AI 아키텍처 (텐서 기반 모델) 에서만 작동합니다. 이는 "이 두 개의 뇌가 같은가?"라는 messy 한 문제를 깔끔하고 해결 가능한 수학 문제로 바꿉니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →