← 최신 논문
🤖 AI

Actionable Interpretability Must Be Defined in Terms of Symmetries

이 논문은 실행 가능한 AI 해석 가능성이 네 가지 특정한 대칭성을 통해 공식적으로 정의되어야 한다고 주장하며, 이러한 대칭성은 추론, 정렬 및 안전 준수를 통합할 수 있는 확률적 시스템의 하위 부류로서 해석 가능한 모델의 엄격한 테스트, 설계 및 검증을 가능하게 한다.

원저자: Pietro Barbiero, Mateo Espinosa Zarlenga, Francesco Giannini, Alberto Termine, Filippo Bonchi, Mateja Jamnik, Giuseppe Marra

게시일 2026-06-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Pietro Barbiero, Mateo Espinosa Zarlenga, Francesco Giannini, Alberto Termine, Filippo Bonchi, Mateja Jamnik, Giuseppe Marra

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 문제: "'이해 가능하다'는 게 도대체 무슨 뜻인가?"

당신에게 날씨를 예측하는 로봇이 있다고 상상해 보세요. 이 로봇은 믿기지 않을 정도로 정확하지만, 왜 비가 올 것이라고 생각하는지 물으면 그저 "수학 때문입니다"라고만 답합니다. 당신은 그 수학을 이해할 수 없기에, 그 로봇을 신뢰할 수 없습니다.

수년 동안 연구자들은 "해석 가능한(interpretable)" AI(인간이 이해할 수 있는 AI)를 만들기 위해 노력해 왔습니다. 하지만 이 논문은 이 분야 전체가 망가졌다고 주장합니다. 왜일까요? 모두가 "이해 가능하다"는 말을 서로 다르게 정의하기 때문입니다. 어떤 이들은 그것이 "단순함"을 의미한다고 하고, 다른 이들은 "투명성"을, 또 다른 이들은 "설명 가능성"을 말합니다. 단 하나의 엄격한 규칙이 없기 때문에, 우리는 모델이 정말로 해석 가능한 것인지 아니면 그저 해석 가능한 척하는 것인지 실제로 테스트할 수 없습니다.

저자들은 이렇게 말합니다: 우리는 "대칭성(Symmetries)"에 기반한 새로운 규칙이 필요합니다.

물리학에서 "대칭성"이란 무언가를 변화시켜도(예를 들어 눈송이를 회전시켜도) 여전히 똑같이 보이는 것을 의미합니다. 저자들은 AI가 진정으로 해석 가능하려면, 우리가 보는 방식을 바꾸거나 보는 사람이 바뀌더라도 "동일하게"(또는 예측 가능하게) 유지되어야 한다고 주장합니다. 그들은 체크리스트 역할을 할 네 가지 특정 대칭성을 제안합니다. 만약 모델이 이 네 가지를 모두 통과한다면, 그것은 진정으로 해석 가능한 것입니다.


네 가지 대칭성 (네 가지 규칙)

이 규칙들을 AI가 인간의 언어를 사용하고 동일한 논리를 따르도록 보장하는 방법이라고 생각하세요.

1. 추론 등변성 (Inference Equivariance): "번역 테스트"

개념: AI의 출력을 인간의 언어로 번역했을 때, 인간은 AI가 말하기 전에 무엇을 말할지 예측할 수 있어야 합니다.
비유: 비밀 코드를 상상해 보세요. 만약 인간에게 "해독 반지(번역 도구)"가 있다면, 그 사람은 AI가 보내려는 메시지를 미리 추측할 수 있어야 합니다. 만약 번역 도구가 있음에도 불구하고 인간이 결과를 맞출 수 없다면, 그 AI는 해석 불가능한 것입니다.
논문의 주장: 이 규칙은 AI를 예측 가능하게 만듭니다. 만약 인간이 머릿속으로 AI의 사고 과정을 시뮬레이션할 수 없다면, 그 AI는 이 테스트에서 탈락합니다.

2. 정보 불변성 (Information Invariance): "쓰레기통 규칙"

개념: AI는 중요한 정보만을 유지하고 나머지는 버려야 합니다.
비유: 당신이 개를 식별하려고 한다고 상상해 보세요. 당신은 개가 네 다리와 털을 가졌다는 것을 알아야 합니다. 하지만 배경에 있는 주인 셔츠의 정확한 빨간색 색조까지 알 필요는 없습니다.
논문의 주장: 진정으로 해석 가능한 모델은 스마트한 필터처럼 작동합니다. 모델은 "노이즈"(무관한 픽셀이나 데이터)를 버리고 오직 "시그널"(결정에 필요한 특징)만을 유지합니다. 만약 모델이 모든 미세한 세부 사항을 다 가지고 있다면, 그것은 너무 복잡해서 이해할 수 없습니다.

3. 개념 폐쇄 불변성 (Concept-Closure Invariance): "어휘 일치"

개념: AI는 실제로 인간이 사용하고 이해하는 개념을 사용해야 합니다.
비유: AI가 "이 물체는 '글로프(Glorp)'입니다"라고 말한다고 상상해 보세요. 만약 "글로프"가 인간이 모르는 단어라면, 당신은 그것을 이해할 수 없습니다. 하지만 AI가 "이 물체는 '빨갛고' '둥급니다'"라고 말하고, 당신이 "빨갛다"와 "둥글다"가 무엇인지 안다면, 당신은 이해할 수 있습니다.
논문의 주장: AI의 내부 "개념"은 인간의 개념과 완벽하게 일치해야 합니다. 만약 AI가 인간의 아이디어와 매핑되지 않는 이상한 내부 라벨을 사용한다면, 이는 실패한 것입니다. 이는 AI가 단순히 비밀 코드를 사용하는 것이 아니라, 우리의 공유된 어휘를 사용하고 있음을 보장합니다.

4. 구조 불변성 (Structural Invariance): "멘탈 모델 일치"

개념: AI의 내부 논리는 인간이 생각하는 방식과 일치해야 합니다.
비유: 단순 덧셈만 이해하는 학생이 있다고 상상해 보세요. 만약 그 학생에게 복잡한 미적분 방정식을 보여준다면, 그 방정식이 "정답"일지라도 학생은 이해할 수 없습니다. 하지만 단순한 덧셈 문제를 보여준다면 이해할 수 있습니다.
논문의 주장: AI가 당신에게 해석 가능하다는 것은, 그 구조가 당신의 뇌에 적합할 때만 성립합니다. 만약 당신이 직선적인 논리로 생각하는 사람이라면, AI도 직선이어야 합니다. 만약 AI가 복잡한 수학의 엉킨 매듭 형태라면, 설령 그것이 똑똑할지라도 당신에게는 해석 불가능한 것입니다.


해결책: AI를 구축하기 위한 "레시피"

저자들은 단순히 문제점만 나열하는 것이 아니라, 이 테스트를 통과하는 AI를 만들기 위한 "레시피"(**범주(Category)**라고 불리는 수학적 프레임워크)를 제공합니다.

  • 스트링 다이어그램 (String Diagrams): 그들은 이 AI 모델들이 어떻게 구축되는지 보여주기 위해 (회로 기판 같은) 시각적 다이어그램을 사용합니다. 블랙박스 대신, 당신은 전선과 상자들을 볼 수 있습니다.
  • 마법의 재료: 이 네 가지 대칭성 규칙을 따르면, AI는 수학적으로 해석 가능성이 보장되는 "확률적 모델"이 됩니다.

이것이 왜 중요한가: "세 가지 마법의 기술"

일단 이러한 대칭성으로 구축된 AI를 갖게 되면, 일반적인 "블랙박스" AI에서는 불가능한 세 가지 강력한 "마법의 기술"을 수행할 수 있습니다.

  1. 정렬 (Alignment, 가르치기): AI의 개념이 인간의 개념과 일치함을 수학적으로 증명할 수 있습니다. 이는 AI의 사전이 당신의 사전과 같은지 확인하는 것과 같습니다.
  2. 개입 (Intervention, 조절하기): "내가 이 특정 개념을 바꾸면 어떻게 될까?"라고 물을 수 있고, AI는 그 결과를 알려줄 것입니다. 이는 기계의 노브를 돌려 정확히 어떤 일이 일어나는지 보는 것과 같습니다.
  3. 반사실적 추론 (Counterfactuals, 만약 ~했다면?): "만약 입력값이 달랐다면 어떤 일이 일어났을까?"라고 물을 수 있습니다. AI는 논리적으로 이 "가상 현실"을 시뮬레이션할 수 있습니다.

핵심 요약

이 논문은 우리가 "해석 가능성"이 무엇인지 추측하는 것을 멈춰야 한다고 주장합니다. 대신, 우리는 이 네 가지 엄격한 대칭성 규칙을 만족하는 AI를 만들어야 합니다. 만약 AI가 이 테스트를 통과한다면, 그것은 증명된 대로 이해 가능하고, 예측 가능하며, 안전하게 사용할 수 있습니다. 만약 통과하지 못한다면, 그것이 아무리 "설명 가능하다"고 주장하더라도 그것은 그저 블랙박스일 뿐입니다.

요약하자면: AI에게 스스로를 설명하라고 요구하지 마세요. 대신, 인간의 논리, 어휘, 정보 요구 사항에 맞춤으로써 그 구조 자체가 이해되도록 강제하는 AI를 만드세요.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →