← 최신 논문
💬 NLP

Causal Structure is Inducible but Functionally Decoupled: The Routing/Readout Boundary of a Typed Mechanism Library

이 논문은 타입 수준의 감독(type-level supervision)이 트랜스포머 내에서 증거 유형에 따라 인과적 라우팅을 조직하면서도 정답 출력과는 기능적으로 분리된, 이산적이고 감사 가능하며 비용이 들지 않는 "타입화된 메커니즘 라이브러리(typed mechanism library)"를 유도한다는 것을 입증하며, 이는 여러 모델 규모에 걸쳐 사전 등록된 기계 검증 가능 프로토콜을 통해 검증된 결과이다.

원저자: Xining Xun

게시일 2026-08-13
📖 5 분 읽기🧠 심층 분석

원저자: Xining Xun

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

AI의 숨겨진 배선반

거대하고 매우 똑똑한 로봇이 어떻게 생각하는지 이해하려고 노력한다고 상상해 보십시오. 오랫동안 과학자들은 "회로 기판 직관(circuit-board intuition)"이라는 단순한 개념 아래 연구를 진행해 왔습니다. 로봇의 뇌를 거대하고 복잡한 회로 기판이라고 생각해 보십시오. 만약 그 기판에서 특정 전선이나 아주 작은 스위치를 찾아낸다면, 그 스위치를 누르면 로봇의 행동이 즉각적으로 변해야 한다는 논리가 성립합니다. 만약 그 스위치가 "진실을 말하기"를 위한 것이라면, 스위치를 돌리면 로봇이 거짓말을 하게 되어야 합니다. 이 아이디어는 AI가 어떻게 작동하는지, 그리고 우리가 어떻게 AI의 기억을 수정하거나 편집할 수 있는지에 대한 많은 연구의 기초가 되었습니다.

하지만 로봇의 뇌가 회로 기판이 아니라면 어떨까요? 만약 그것이 마치 분주한 도서관과 같다면 어떨까요? 이 도서관에는 수천 권의 책(AI의 지식)과 매우 체계적인 분류 시스템(AI의 내부 구조)이 있습니다. 과학자들이 던지는 핵심 질문은 이것입니다. 이 분류 시스템이 실제로 로봇이 내놓는 답변을 결정하는 것일까요, 아니면 단순히 로봇이 책의 내용을 직접 쓰지 않고도 적절한 책을 찾을 수 있도록 돕는 화려한 인덱스(색인)에 불과한 것일까요? 만약 분류 시스템이 단지 인덱스일 뿐이라면, 인덱스 카드를 바꿈으로써 로봇을 "편집"하려는 시도는 로봇이 실제로 말하는 내용을 바꾸지 못할 수도 있습니다. 이 논문은 우리가 AI의 내부 구조를 미세하게 조정함으로써 진정으로 제어할 수 있는지, 아니면 그 구조가 그저 조용한 관찰자에 불과한지를 테스트하며 이 질문을 깊이 있게 파고듭니다.

정보를 정리하지만 말은 하지 않는 도서관

연구진은 이를 테스트하기 위해 특별한 종류의 AI 모델을 구축했습니다. 그들은 모델에게 "유형 메커니즘 라이브러리(typed mechanism library)"를 제공했는데, 이는 "누가 누구와 관계되어 있는지" 또는 "표시가 무엇을 의미하는지"와 같은 특정 유형의 사실들을 저장할 수 있는 600개의 구별되고 라벨이 붙은 서랍(또는 슬롯) 세트와 같습니다. 그들은 AI가 "게이팅 헤드(gating head)"를 사용하도록 훈련시켰는데, 이는 사서 역할을 합니다. AI가 질문을 받으면, 사서는 필요한 증거의 유형을 확인하고 질문을 올바른 서랍으로 보냅니다.

연구팀은 두 가지를 확인하고 싶었습니다. 첫째, AI가 실제로 정보를 유형에 따라 이 서랍들을 조직하는 법을 배우는가, 아니면 단순히 우연히 발생하는 현상인가? 둘째, 일단 AI가 이 서랍들을 정리하고 나면, 서랍의 내용을 바꾸는 것이 실제로 AI가 내놓는 답변을 바꾸는가?

조직화는 실재하지만, 주도권은 없다
연구 결과, AI에게 그렇게 하도록 가르치면 AI는 실제로 서랍을 완벽하게 조직하는 법을 배운다는 것을 발견했습니다. 만약 당신이 AI에게 "모든 '관계' 관련 사실은 A 서랍에 넣어라"라고 말하면, AI는 정확히 그대로 수행합니다. 이 조직화는 우연히 일어난 것이 아니라, 특정 훈련 신호에 의해 유도된 것이었습니다. 하지만 여기에는 놀라운 반전이 있습니다. AI가 이 완벽하고 조직된 도서관을 가지고 있음에도 불구하고, 도서관을 바꾸는 것은 답변을 바꾸지 못했습니다.

연구진은 라이브러리에 대해 150가지의 서로 다른 편집을 수행했습니다. 신호를 뒤집고, 엣지(edge)를 추가하고, 서랍 안의 정보를 교체했습니다. 결과는 어떠했을까요? AI의 최종 답변은 거의 변하지 않았습니다. 구체적으로는 0.00000034(또는 3.4 × 10⁻⁶) 미만이었습니다. 이를 체감하기 위해, 만약 답이 1에서 10 사이의 숫자였다면 그 변화는 너무 작아서 거의 보이지 않는 수준이었습니다. "사서"(라우팅 시스템)는 자신의 일을 완벽하게 수행하고 있었지만, "작가"(답변을 생성하는 부분)는 도서관의 변화를 무시하고 있었습니다. 라이브러리는 AI에게 어디를 찾아봐야 할지 알려주는 라우팅 인덱스 역할을 하지만, 실제 답변을 읽는 과정과는 **기능적으로 분리(functionally decoupled)**되어 있습니다.

"무효의 이동(Moving Null)"과 규모의 문제
이 논문은 또한 AI를 테스트하는 방식에 있어 까다로운 문제를 밝혀냈습니다. 연구진은 AI가 스스로를 조직하는 "기준점(baseline)" 혹은 "영점(zero point)"이 AI가 커짐에 따라 변한다는 것을 발견했습니다했습니다. 그들은 AI를 두 가지 크기로 테스트했습니다: 2,260만 개의 파라미터를 가진 작은 버전과 1억 2,500만 개의 파라미터를 가진 큰 버전입니다.

작은 크기에서는 서랍을 정리하도록 교육받지 않은 AI(비지도 제어 모델)가 아무런 조직화도 보여주지 않았습니다. 하지만 더 큰 크기에서는, 동일한 훈련되지 않은 AI가 스스로 약간의 조직화를 보이기 시작했습니다. 이는 "빈 상태"의 기준점이 모든 크기의 AI에 대해 동일하지 않음을 의미합니다. 만약 동일한 규칙을 사용하여 작은 AI와 큰 AI를 비교한다면, 규칙 자체가 이동했기 때문에 혼란을 겪을 수 있습니다. 저자는 이를 "무효의 이동(moving null)"이라고 부릅니다. 이를 해결하기 위해, 그들은 훈련된 AI를 동일한 크기의 새로운 미훈련 AI와 직접 비교하는 더 엄격한 테스트 방법을 만들어 비교가 공정하게 이루어지도록 했습니다.

제로 비용과 완벽한 가역성
이 라이브러리와 답변 사이의 기묘한 분리에도 불구하고, 이 시스템은 매우 잘 작동합니다. 이 라이브러리를 추가하는 것은 AI의 일반적인 지능 측면에서 아무런 비용을 발생시키지 않았습니다. 성능 차이는 0.0eta 82 nats(정보의 아주 작은 단위) 미만이었으며, 이는 사실상 제로에 가깝습니다. 또한, 이 라이브러리는 편집하기에 매우 안전합니다. 연구진은 변경을 가한 후 이를 다시 되돌릴 수 있었으며, 이는 **비트 단위의 가역성(bit-exact reversibility)**을 가졌음을 의미합니다. 즉, AI가 단순히 "비슷한" 버전이 아니라 정확히 원래의 상태로 돌아왔다는 것입니다. 연구진은 세 번의 서로 다른 훈련 실행 과정에서 250개의 단일 편집과 **1,000개의 중첩된 복구(stacked reverts)**를 테스트했으며, 이는 매번 실패 없이 완벽하게 작동했습니다.

이것이 미래에 갖는 의미

이 논문의 주요 결론은, 단순히 내부 부품을 편집함으로써 AI를 "고칠 수" 있다고 희망하는 이들에게 겸허한 교훈을 줍니다. 이 논문은 이러한 명시적 구조를 가진 경우, "회로 기판 직관"이 틀렸음을 시사합니다. 단지 스위치를 볼 수 있고 그것을 돌릴 수 있다고 해서 기계가 반응할 것이라는 뜻은 아닙니다. 이 특정 설정에서, AI의 내부 조직화는 정보를 찾는 데 도움을 주는 **유형 라우팅 인덱스(typed routing index)**이지만, 최종 출력을 구동하는 엔진은 아닙니다.

저자는 자신이 AI 행동을 편집하는 문제를 해결했다고 주장하지 않도록 매우 주의를 기울이고 있습니다. 사실, 그들의 결과는 이러한 특정 아키텍처에서 구조적 편집이 행동 변화로 이어지지 않는다는 것을 보여줍니다. "라이브러리"는 편집 가능한 상태(서랍 안의 카드를 바꿀 수 있음)이지만, 행동적으로 편집 가능한 것은 아닙니다(카드를 바꾼다고 해서 로봇이 들려주는 이야기가 바뀌지는 않음). 이 발견은 측정되었고, 재현되었으며, 다양한 규모에서 안정적으로 나타났습니다. 이는 우리가 이러한 시스템에서 무엇을 제어할 수 있고 무엇을 제어할 수 없는지에 대한 정밀한 경계를 제공합니다. 이는 복잡한 AI의 세계에서, 구조를 보는 것이 곧 결과를 제어하는 것과 같지는 않다는 점을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →