← 최신 논문
🤖 machine learning

Markovian Circuit Tracing for Transformer State Dynamic

본 논문은 합성 은닉 마르코프 모델 작업에서 트랜스포머 활성화가 거친 상태 전이 구조를 인코딩하며, 활성화 패칭을 통해 반사실 예측 정확도를 크게 향상시키는 상태 추상화를 가능하게 한다는 진단 프레임워크인 마르코프 회로 추적 (MCT) 을 소개합니다.

원저자: Abdullah X

게시일 2026-05-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Abdullah X

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

마술사가 트릭을 수행하는 모습을 상상해 보세요. 당신은 그들이 섞는 카드와 말하는 말 (가시적 방출) 을 보지만, 그들이 머릿속에 간직하고 있는 비밀스러운 순서 (은닉 상태) 는 볼 수 없습니다.

오랫동안 연구자들은 AI 모델 (트랜스포머와 같은) 이 내부의 기어와 전선을 관찰함으로써 어떻게 "생각"하는지 파악하려고 노력해 왔습니다. 이 논문은 **"마르코프 회로 추적" (MCT)**이라는 제목으로, 특히 AI 가 시퀀스에서 다음에 무엇이 발생할지 예측하려 할 때 마술사의 마음을 엿보는 새로운 방법을 제안합니다.

다음은 그들의 실험과 발견을 간단한 비유로 정리한 내용입니다.

1. 설정: 통제된 마술 쇼

AI 를 테스트하기 위해 연구자들은 셰익스피어 작품이나 뉴스 기사와 같은 실제 데이터를 사용하지 않았습니다. 대신 그들은 숨겨진 마르코프 모델 (HMM) 이라는 수학적 개념에 기반한 완벽하게 통제된 가상의 세계를 구축했습니다.

  • 게임: 토큰이 숨겨진 방들의 원형 주위를 이동하는 보드 게임을 상상해 보세요. 토큰이 어느 방에 있는지 볼 수는 없지만, 토큰이 이동할 때마다 색깔 있는 불빛이 깜빡이는 것을 볼 수 있습니다.
  • 규칙: 연구자들은 토큰이 방 사이를 어떻게 이동하는지, 불빛이 어떻게 깜빡이는지, 그리고 토큰이 정확히 다음에 무엇을 예측해야 하는지 알 수 있는 정확한 규칙을 알고 있습니다.
  • AI: 그들은 이 게임을 플레이하도록 작은 AI ("트랜스포머") 를 훈련시켰습니다. 이 AI 는 색깔 있는 불빛만 볼 수 있고 다음 불빛을 추측해야 합니다.

2. 문제: AI 가 실제로 "생각"하고 있는가?

AI 가 올바르게 추측할 때, 그것은 단순히 패턴을 암기하고 있는 것일 뿐인지, 아니면 실제로 숨겨진 방들의 내부 지도를 구축하고 있는 것일까요?

연구자들은 알고 싶어 했습니다: AI 의 내부 "뇌 활동" (활성화) 에 이러한 숨겨진 방들의 지도가 포함되어 있는가?

3. 방법: "마르코프 회로 추적" (MCT)

그들은 MCT 라는 진단 파이프라인을 만들었습니다. 이는 AI 의 거칠고 고차원적인 뇌 신호를 "방" (상태) 의 간단한 목록으로 변환하려는 번역기라고 생각하세요.

그들은 이 번역기를 네 가지 방식으로 테스트했습니다:

  1. 신념 확인: AI 가 각 방에 있을 확률을 알고 있는지 AI 의 마음을 읽을 수 있는가? (예: "내가 빨간 방에 있을 확률이 80% 인가?"라고 묻는 것과 같습니다.)
  2. 지도 확인: 우리가 AI 에게 특정 방에 있다고 생각하도록 강요하면, 실제로 그 방에 있는 것처럼 행동하는가?
  3. 전이 확인: AI 의 내부 상태가 게임의 규칙과 일치하는 방식으로 변하는가?
  4. "패칭" 테스트 (마술 트릭): 이것이 가장 중요한 부분입니다. 그들은 AI 의 내부 "상태" (번역기가 어느 방에 있다고 추측한 것) 를 가져와 게임 도중에 다른 상태로 교체했습니다.
    • 비유: AI 가 차를 운전하고 있다고 상상해 보세요. 운전 도중에 당신이 손을 넣어 운전자의 정신 지도를 "고속도로에 있다"에서 "도시에 있다"로 바꿔줍니다. 만약 AI 가 갑자기 도시에서 운전하듯 속도를 줄이고 방향을 꺾는다면, 그 내부 지도는 실재하고 유용했다는 것입니다.

4. 결과: 부분적 성공

결과는 "부분적이지만 일관된" 것이었습니다. 즉, AI 는 어떤 일은 잘했고 어떤 일은 poorly 했습니다.

  • AI 는 좋은 학생입니다: AI 는 게임을 매우 잘 배웠습니다. 완벽한 수학자가 할 수 있는 것처럼 다음 불빛을 거의 완벽하게 예측했습니다.
  • "지도"는 흐릿합니다: 연구자들이 AI 의 뇌 신호를 특정 "방"으로 번역하려 할 때, 그것은 완벽한 1 대 1 매칭이 아니었습니다.
    • 쉬운 게임 (불빛이 어느 방에 있는지 명확하게 보여주는 경우) 에서는 AI 의 내부 지도가 꽤 명확했습니다.
    • 어려운 게임 (불빛이 혼란스럽거나 방이 너무 많은 경우) 에서는 AI 의 내부 지도가 흐릿했습니다.
  • "패칭" 증명: 이것이 가장 큰 승리였습니다. 그들이 AI 에게 특정 내부 상태 (중심점) 를 사용하도록 강요했을 때, AI 의 행동은 수학이 예측한 대로 정확히 변했습니다.
    • 결과: AI 의 행동은 무작위 상태나 잘못된 상태를 사용할 때보다 "완벽한" 수학 목표에 훨씬 더 가까워졌습니다. 이는 AI 가 게임 규칙의 완벽한 복사본이 아니더라도 결정을 내리기 위해 특정 내부 구조를 사용하고 있음을 증명합니다.

5. 주요 시사점

이 논문은 트랜스포머가 시퀀스 문제를 해결할 때 내부 "상태" 요약을 구축한다고 결론지었지만, 이러한 요약은 정확한 라벨 (예: "나는 확실히 A 방에 있다") 이 아니라 확률적 신념 (예: "나는 A 방에 있을 가능성이 높다고 생각한다") 과 더 비슷하다고 말합니다.

언급된 주요 제한 사항:

  • 이는 작은 합성 모델가짜 게임을 플레이하는 것으로 테스트되었습니다.
  • 그들이 사용한 "번역기"는 단순했습니다.
  • 그들은 시를 쓰거나 질병을 진단하는 것과 같은 복잡한 실제 작업에 이것이 작동한다고 주장할 수 없습니다. 이 논문은 엄격하게 통제된 수학적 벤치마크에 대한 주장으로만 제한됩니다.

요약 비유

자동차가 운전하는 모습을 관찰함으로써 GPS 가 어떻게 작동하는지 파악하려고 한다고 상상해 보세요.

  • 옛 방식: 전선을 살펴보고 지도가 어떻게 저장되어 있는지 추측합니다.
  • 이 논문의 방식: 작은 완벽한 미로를 만듭니다. 자동차가 그것을 항해하는 것을 지켜봅니다. 그런 다음 자동차 안으로 손을 넣어 운전자의 정신 지도를 다른 것으로 교체합니다. 만약 자동차가 갑자기 오른쪽 대신 왼쪽으로 꺾는다면, 당신은 운전자가 지도를 사용하고 있다는 것을 확실히 알 수 있으며, 그 지도가 운전 방식에 어떻게 영향을 미치는지 성공적으로 파악한 것입니다.

이 논문은 말합니다: "우리는 완벽한 미로를 만들고, 지도를 교체했으며, 운전자가 지도를 사용하고 있음을 증명했습니다. 하지만 이것이 실제 고속도로 운전에도 적용되는지는 아직 모릅니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →