← 최신 논문
🤖 machine learning

Learning Coherent Representations: A Topological Approach to Interpretability

이 논문은 신경 코딩에서 영감을 얻어 데이터와 특징 사이의 호환 가능한 위상 구조를 보장하기 위해 연속적인 특징-샘플 관계를 강제하는 기하학적 속성인 "코히런스(coherence)"를 소개하며, 이를 통해 Coh라고 불리는 새로운 미분 가능한 목적 함수를 통해 해석 가능한 표현을 달성한다.

원저자: Sigurd Gaukstad, Melvin Vaupel, Valdemar Kargård Olsen, Erik Hermansen, Benjamin Dunn

게시일 2026-06-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sigurd Gaukstad, Melvin Vaupel, Valdemar Kargård Olsen, Erik Hermansen, Benjamin Dunn

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

문제의 핵심: "흩어진" 뇌

당신에게 아주 똑똑한 로봇(심층 신경망)이 있고, 이 로봇이 사물을 인식하는 법을 배운다고 상상해 보세요. 보통 로봇이 학습할 때, 내부적으로 세상에 대한 은닉 지도를 만듭니다. 문제는 이 지도가 매우 무질서할 수 있다는 점입니다.

표준적인 로봇의 경우, 하나의 "뉴런"(로봇 내부의 작은 스위치)이 고양이, 자동차, 바나나를 동시에 활성화할 수도 있지만, 이는 오직 매우 특정한, 무작위적인 사례들에 대해서만 일어납니다. 마치 당신의 뇌에 있는 어떤 뉴런이 '화요일에 본 빨간 사과'에는 반응하지만, '그린 사과'나 '수요일에 본 빨간 사과'에는 반응하지 않는 것과 같습니다. 이 때문에 인간은 로봇이 실제로 무엇을 생각하고 있는지 이해하는 것이 불가능해집니다. 즉, 특징(features)들이 "비일관적(incoherent)"입니다. 즉, 흩어져 있고 기하학적인 의미를 갖지 못합니다.

영감의 원천: 뇌의 GPS

저자들은 실제 동물의 뇌가 어떻게 작동하는지 살펴보았습니다. 그들은 두 가지 유형의 세포를 연구했습니다:

  1. 격자 세포 (Grid Cells): 이 세포들은 GPS 격자처럼 작동합니다. 동물이 특정하고 연속적인 공간(예: 바닥의 타일 하나)에 있을 때 활성화됩니다.
  2. 머리 방향 세포 (Head Direction Cells): 이 세포들은 동물이 특정 방향(예: 북쪽)을 향하고 있을 때 활성화됩니다. 방향이 약간 바뀌더라도 동일한 세포가 여전히 활성화됩니다. 즉, 매끄럽고 연속적인 호(arc)를 형성합니다.

이러한 생물학적 세포들은 **일관성(coherent)**이 있습니다. 이들은 무작위로 발화하지 않고, 세상의 깔끔하고 연결된 덩어리들을 덮습니다. 어떤 세포들이 활성화되는지만 알면, 동물이 어디에 있는지 또는 어디를 보고 있는지 즉시 알 수 있습니다.

해결책: "일관성 (Coherence)"

이 논문은 다음과 같은 질문을 던집니다. 우리는 인공 로봇이 생물학적 뇌처럼 자신의 내부 지도를 조직하도록 가르칠 수 있을까?

저자들은 **일관성(Coherence)**이라는 개념을 도입합니다.

  • 비유: 도서관을 상상해 보세요.
    • 비일관적 (현재의 AI): "요리"에 관한 책이 요리 코너에도 있지만, "1990년대 역사" 코너와 "원예" 코너에도 무작위로 흩어져 있습니다. 요리 코너를 찾아가도 요리 책뿐만 아니라 무작위적인 역사 책들이 섞여 있습니다. 무질서합니다.
    • 일관적 (새로운 방법): 도서관이 정리되어 있어서 모든 "요리" 책은 깔끔하고 연속적인 줄에 배치되어 있습니다. 또한, 도서관의 모든 책은 각자에게 맞는 적절한 줄에서 발견됩니다. "요리" 줄은 하나의 단단한 블록이고, "역사" 줄 또한 하나의 단단한 블록입니다.

기술적인 용어로, 이 논문은 로봇의 내부 지도(행렬)가 다음을 만족할 때 **일관적(coherent)**이라고 정의합니다:

  1. 국소성 (Locality): 모든 샘플(예: 고양이 사진)은 흩어진 특징들이 아니라, 서로 "이웃"인 특징들을 활성화합니다.
  2. 커버링 (Covering): 모든 특징은 어떤 샘플에 의해 필요하며, 모든 샘플은 어떤 특징에 의해 잘 설명됩니다. 빠진 것이 없으며 낭비되는 것도 없습니다.

마법의 도구: 위상수학 (Topology)

그들은 지도가 얼마나 "깔끔한지" 어떻게 측정할까요? 그들은 **위상수학(Topology)**이라는 수학의 한 분야를 사용합니다.

  • 비유: 로봇의 데이터가 밀가루 반죽이라고 상상해 보세요.
    • 만약 데이터가 원(circle) 모양(고리 형태)을 이룬다면, 로봇의 내부 특징 또한 을 이루어야 합니다.
    • 만약 데이터가 두 개의 떨어진 **섬(islands)**을 이룬다면, 특징 또한 두 개의 을 이루어야 합니다.

저자들은 만약 로봇의 지도가 "일관적"이라면, 데이터의 모양과 특징의 모양이 완벽하게 일치한다는 것을 증명합니다. 데이터가 원이라면, 특징들은 그 원을 깔끔하고 연속적인 호(arc)로 나누어 덮어야 합니다. 흩어져 있을 수 없습니다. 이는 특징들이 실제 세상의 "모양"을 따르기 때문에 해석 가능하다는 것을 보장합니다.

새로운 규칙: COH

로봇이 이런 방식으로 학습하도록 강제하기 위해, 저자들은 COH라고 불리는 새로운 규칙(손실 함수)을 만들었습니다.

  • 기존 규칙 (희소성, Sparsity): "몇 개의 스위치만 켜라." 이는 "도서관에서 책을 몇 권만 사용하라"고 말하는 것과 같습니다. 하지만 그 몇 권의 책을 여전히 무작위로 흩어진 곳에 둘 수도 있습니다.
  • 새로운 규칙 (일관성, Coherence): "켜지는 스위치들은 서로 이웃이어야 한다." 이는 로봇이 관련된 것들을 함께 묶도록 강제합니다. 단순히 얼마나 많은 것이 활성화되느냐의 문제가 아니라, 어떤 것들이 활성화되느냐의 문제입니다. 그것들은 기하학적으로 연결되어 있어야 합니다.

테스트 내용

그들은 세 가지 대상으로 이를 테스트했습니다:

  1. 합성 원 (Synthetic Circles): 원 모양의 데이터를 로봇에게 주었습니다. 새로운 규칙을 가진 로봇은 특징 또한 완벽한 원의 형태를 띠도록 학습했습니다. 기존의 로봇은 흩어진 무질서한 형태를 학습했습니다.
  2. 회전된 숫자 (MNIST): 숫자를 다양한 각도로 회전시켜 보여주었습니다. 새로운 규칙은 로봇이 특정 각도(예: '똑바로 선 상태', '왼쪽으로 기울어진 상태')에 대응하는 특징을 학습하게 했습니다. 기존의 로봇은 이를 깔끔하게 수행하지 못했습니다.
  3. 언어 (BERT): 이를 언어 모델에 적용했습니다. 단순히 무작위 단어를 찾는 대신, 새로운 규칙은 단어들을 명확한 카테고리로 그룹화하는 특징을 찾아냈습니다: '연도'를 나타내는 특징(1990, 2005), '가족 구성원'을 나타내는 특징(어머니, 형제), 그리고 '방향'을 나타내는 특징(북, 남) 등이 그것입니다.

결론

이 논문은 단순히 로봇을 더 똑똑하게 만드는 것이 아니라, 로봇의 "사고 과정"을 읽을 수 있게 만듭니다. 관련된 것들이 서로 이웃하도록(일관성) 로봇의 내부 지도를 조직하도록 강제함으로써, 우리는 특정 특징을 보고 "아, 이 특징은 '연도'나 '회전된 각도'를 나타내는구나"라고 말할 수 있게 됩니다.

이는 로봇의 블랙박스를 모든 책이 올바른 통로에 있고, 그 통로 자체가 기하학적 의미를 갖는 도서관으로 탈바꿈시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →