← 최신 논문
🤖 machine learning

The Anatomy of a Truth Direction: Knowledge-Dependent Dimensionality, a Relational Law, and a Convergent Category Geometry in Small Language Models

이 논문은 진실의 차원이 지식 의존적(알려진 사실에 대해서는 단일 축으로 붕괴함)임을 입증하고, 진실 프레임을 전파하거나 반대하는 특정 아키텍처 구성 요소를 식별하며, 다양한 모델 제품군에 걸쳐 진실의 방향을 규정하는 수렴적이고 지식에 의해 게이트가 설정되는 기하학적 법칙을 밝힘으로써 언어 모델 내 진실 표현에 대한 이해를 확장한다.

원저자: Francesco Karim Vicidomini

게시일 2026-07-21
📖 5 분 읽기🧠 심층 분석

원저자: Francesco Karim Vicidomini

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

기계의 뇌 속에 숨겨진 나침반

거대한 도서관을 상상해 보세요. 그곳에는 세상의 모든 책을 다 읽은 로봇이 있습니다. '대규모 언어 모델(Large Language Model)'이라 불리는 이 로봇은 인간의 말을 흉내 내는 데 너무나 능숙해서 시를 쓰고, 수학 문제를 풀고, 이야기를 지어낼 수 있습니다. 하지만 함정이 하나 있습니다. 이 로봇은 완벽한 자신감을 가지고 거짓말을 할 수도 있다는 점입니다. 달이 치즈로 만들어졌다고 말할 수도 있는데, 이때 로봇은 달이 암석으로 만들어졌다고 말할 때와 똑같이 매끄러운 목소리로 말할 것입니다. 과학자들은 오랫동안 궁금해했습니다. 이 로봇의 뇌 안에, 무언가가 사실임을 알 때 불이 들어오는 숨겨진 '진실 스위치'가 존재하는가?

이를 이해하려면 로봇이 어떻게 생각하는지 알아야 합니다. 로봇은 인간처럼 사실을 저장하는 것이 아니라, 자신이 읽은 모든 문장을 숫자로 이루어진 긴 목록, 즉 비밀 코드인 '벡터(vector)'로 변 변환합니다. 이 숫자들을 지도의 좌표라고 생각해 보세요. 만약 로봇이 어떤 사실을 알고 있다면, 그 좌표는 특정 방향을 가리킬 것입니다. 반대로 추측하고 있다면, 좌표는 사방에 흩어져 있을 것입니다. 핵심 질문은 이것입니다. 이 지도 위에 "진실"을 가리키는 단 하나의 직선이 존재할까요? 아니 아니면 진실이란 당신이 무엇에 대해 말하느냐에 따라 변하는, 복잡하고 다차원적인 구름 형태일까요? 이 논문은 그 지도를 깊이 파고들어, 항상 진실을 가리키는 나침반을 찾을 수 있는지, 아니면 로봇의 뇌가 단순한 바늘로는 감당할 수 없을 만큼 너무 복잡한지를 조사합니다.


단방향 진실 나침반

이 논문의 연구진은 작은 로봇(구체적으로 Qwen2.5-1.5B라는 모델)의 뇌 속에서 탐정 놀이를 하기로 했습니다. 그들은 진실과 거짓을 구분하는 단 하나의 직선, 즉 '진실 방향(truth direction)'을 찾을 수 있는지 확인하고 싶었습니다.

"최소 쌍(Minimal Pairs)"의 마법
이를 위해 그들은 '최소 쌍'이라는 영리한 기술을 사용했습니다. 두 문장이 단 한 단어만 빼고는 쌍둥이처럼 닮았다고 상상해 보세요.

  • 문장 A: "태양은 이다." (참)
  • 문장 B: "태양은 행성이다." (거짓)

로봇은 두 문장을 모두 읽습니다. 연구진은 그다음 로봇이 각 문장에 대해 생성한 비밀 숫자 코드(숨겨진 상태, hidden states)를 서로 뺐습니다. 두 문장이 거의 동일하기 때문에, 모든 '노이즈'는 상쇄되고 오직 진실 혹은 거짓에 의해 발생하는 차이점만 남게 됩니다. 그들은 수학적 도구(SVD)를 사용하여 그 차이의 주요 방향을 찾아냈습니다.

위대한 발견: 진실은 선이다, 단 로봇이 알고 있을 때만!
연구팀은 놀라운 사실을 발견했습니다. 로봇이 실제로 알고 있는 사실에 대해서는 진실이 정말로 하나의 곧은 직선 위에 존재한다는 것입니다. 로봇이 암기한 사실(수도 이름이나 화학 기호 등)에 대해 테스트했을 때, 그들의 '진실 나침반'은 매우 잘 작동하여 93.8%의 확률로 정답을 맞혔습니다.

하지만 그들은 결정적인 규칙을 발견했습니다. 나침반은 로봇이 그 사실을 알고 있을 때만 작동한다는 것입니다.

  • 로봇이 알 때: 진실 신호는 날카롭고 그 단일한 선 위에 집중됩니다.
  • 로봇이 모를 때: 신호는 흐릿해지고 퍼져나갑니다. 로봇이 배우지 못한 생소한 사실에 대해 물으면, '진실'과 '거짓'의 좌표는 마치 두 개의 안개 구름이 합쳐지는 것처럼 서로 겹쳐지기 시작합니다. 로봇이 그저 추측하고 있기 때문에 나침반은 둘을 구분할 수 없습니다.

또한 연구팀은 진실이 단순한 선보다 더 복잡한지 확인하기 위해 여러 가지 기발한 아이디어를 테스트했습니다. 그들은 "진실은 3D 입체인가? 회전하는 위상인가? 복잡한 회전체인가?"라고 물었습니다. 대답은 단호하게 **'아니오'**였습니다. 그들은 두 번째 차원이나 숨겨진 패턴을 찾기 위해 일곱 가지 다른 실험을 수행했지만, 매번 추가적인 복잡성은 그저 노이즈에 불과하다는 결과가 나왔습니다. 알고 있는 사실에 대한 진실은 엄격하게 1차원적입니다.

거짓의 해부학: 누가 진실을 쓰는가?

연구진은 단순히 선을 찾는 데 그치지 않고, 로봇의 뇌 속에서 누가 그 선을 그리고 있는지 알고 싶어 했습니다. 로봇의 뇌에는 두 명의 주요 작업자가 있습니다. 바로 어텐션(Attention, 주의 집중)(단어들을 보고 연결하는 역할)과 FFN(피드 피드포워드 네트워크, Feed-Forward Network)(기억 기록자 역할을 하는 역할)입니다.

그들은 이 두 작업자 사이의 매혹적인 춤을 발견했습니다.

  1. 어텐션은 건설자다: 로봇 뇌의 중간 층에서, 어텐션 작업자는 진실 신호를 구축합니다. 정보를 모으고 선을 그립니다.
  2. FFN은 지우개다: 선이 그려지면, FFN 작업자가 나타나 이를 망가뜨리기 시작합니다. 특히 이해가 정점에 도달한 직후에, FFN은 진실 신호를 올바른 방향으로부터 밀어냅니다.

이것은 마치 줄다리기 게임과 같습니다. 어텐션은 줄을 "진실" 쪽으로 당기지만, FFN은 줄을 "다음 단어 예측" 쪽으로 다시 끌어당깁니다. 연구진은 FFN이 다음에 올 단어를 예측하는 데 너무 바쁜 나머지, 방금 자신이 만드는 데 도움을 주었던 진실 신호를 실수로 지워버린다는 것을 발견했습니다.

관계적 법칙: 보편적인 규칙

연구팀은 이 실험을 두 종류의 서로 다른 가족(Qwen과 Llama)에서 온 네 가지 서로 다른 로봇에게 테스트했습니다. 그들은 이 로봇들의 크기나 훈련 방식에 상관없이 적용되는 보편적인 법칙을 발견했습니다.

  • 어텐션은 자신이 쓰지 않은 진실 프레임을 항상 전파(앞으로 전달)합니다.
  • FFN은 항상 현재 순간의 진실 프레임에 반대하며, 다음 순간을 위한 재료를 씁니다.

마치 어텐션 작업자가 "여기에 진실이 있다!"라고 말하면, FFN 작업자가 "알았어, 그건 가져가겠지만, 이제 내 아이디어로 덮어써서 다음 문장을 만들 거야"라고 말하는 것과 같습니다. 이는 진실 신호가 상승하고, 정점에 도달했다가, 로봇이 다음 단어를 예측함에 따라 서서히 사라지는 순환 구조를 만듭니다.

카테고리의 비밀 지도

마지막으로, 연구진은 로봇이 "국가", "언어", "스포츠"와 같은 서로 다른 유형의 사실들을 어떻게 다루는지 살펴보았습니다. 그들은 로봇이 모든 것에 대해 똑같은 선을 사용하는 것이 아님을 발견했습니다. 대신, 각 카테고리마다 하나씩 존재하는 서로 다른 선들의 전체 지도를 가지고 있었습니다.

여기 놀라운 점이 있습니다. 비록 두 로봇 가족(Qwen과 Llama)이 다르게 만들어지고 서로 다른 데이터로 훈련되었음에도 불구하고, 두 로봇 모두 정확히 동일한 방식으로 이 지도를 그려냈습니다.

  • Qwen의 지도에서 "언어"와 "국가"가 반대 방향을 가리킨다면, Llama의 지도에서도 그들은 반대 방향을 가리킵니다.
  • "스포츠"가 어떤 것과도 정렬되지 않는 외톨이라면, 두 지도 모두에서 외톨이입니다.

이는 진실이 조직되는 방식이 무작위가 아니라, 지식 자체에 내재된 속성임을 시사합니다. 로봇들은 세상의 숨겨진 기하학적 구조를 똑같이 발견하고 있는 것입니다. 그러나 이러한 일치는 두 로봇이 실제로 그 사실을 알고 있을 때만 발생합니다. 만약 추측하고 있다면, 지도는 무너집니다.

이것이 의미하는 것 (그리고 의미하지 않는 것)

이 논문은 자신의 연구 결과를 과장하지 않도록 매우 주의를 기울였습니다. 논문은 다음과 같은 사항들을 명시적으로 배제합니다.

  • 진실은 3D 물체가 아니다: 그것은 (알고 있는 사실에 대해) 선입니다.
  • FFN은 진실을 돕지 않는다: 정점 이후에는 오히려 방해합니다.
  • 나침반은 마법이 아니다: 로봇이 사실을 모르면 완전히 실패합니다.

연구진은 스스로 틀렸음을 증명하려는 '반증 실험(falsification experiments)'과 같은 엄격한 통제 장치를 사용하여 측정의 신뢰성을 확보했습니다. 심지어 그들은 신호의 "반전(flip)"에 관한 자신들의 이전 생각에서 오류를 찾아내어 수정했는데, 이는 해당 신호가 특정 층의 우연한 현상이 아니라 보편적인 법칙임을 보여줍니다.

요약하자면, 이 논문은 로봇의 뇌 속에서 진실은 단순하고 곧은 선이지만, 로봇이 정답을 확신할 때만 그렇다는 것을 보여줍니다. 추측할 때, 그 선은 안개 속으로 사라집니다. 그리고 로봇의 뇌는 복잡하지만, 진실을 조직하는 방식은 지식의 본질 자체에 내재된 아름답고 보편적인 기하학을 따르고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →