← 최신 논문
🤖 machine learning

Transformers Linearly Represent Highly Structured World Models

수독 풀이 추적을 기반으로 트랜스포머를 훈련한 이 연구는 모델이 표면적 특징이 아닌 해당 도메인의 제약 대수와 정렬된 구조화된 세계 모델을 내부적으로 구축하며, 이를 '나aked-single' 감지기 같은 희소하고 해석 가능한 회로를 활용하여 과제를 해결함을 보여줍니다.

원저자: Roman Kniazev, Nathanaël Fijalkow

게시일 2026-05-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Roman Kniazev, Nathanaël Fijalkow

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

한 명재미있고 신비로운 견습공을 고용하여 스도쿠 퍼즐을 푸는 법을 배우게 한다고 상상해 보세요. 당신은 그에게 규칙을 직접 가르치지 않습니다. 대신, 다른 사람이 퍼즐을 단계별로 푸는 수천 가지 예시만 보여줍니다. 시간이 지나면 그 견습공은 퍼즐을 푸는 데 매우 능숙해집니다.

하지만 여기서 큰 질문이 나옵니다: 그 견습공의 뇌는 실제로 어떻게 작동할까요? 그 견습공은 퍼즐을 81 개의 개별 빈 칸으로 보나요, 아니면 서로 연결된 규칙의 집합으로 보나요?

이 논문은 스도쿠로 훈련된 컴퓨터 모델 (트랜스포머) 을 "열어서" 정확히 그 점을 조사합니다. 연구자들은 이 모델이 어떻게 생각하는지에 대해 세 가지 놀라운 사실을 발견했습니다.

1. "팀장" 대 "개별 작업자"

대부분의 사람들은 모델에게 스도쿠 격자를 보여주면, 작업자가 목록에서 81 개의 개별 항목을 확인하듯이 각 셀 (작은 상자) 을 개별적으로 추적하도록 학습할 것이라고 가정합니다.

논문의 발견: 모델은 그렇게 하지 않습니다. 대신, 모델은 그룹을 중심으로 사고를 조직화합니다.
스도쿠 퍼즐을 81 개의 상자가 아니라 세 가지 유형의 팀으로 생각하세요:

  • 행 (Row) 팀 (9 개의 가로 줄)
  • 열 (Column) 팀 (9 개의 세로 줄)
  • 박스 (Box) 팀 (9 개의 작은 3x3 사각형)

모델은 개별 상자뿐만 아니라 이러한 에 어떤 숫자가 존재하는지 추적하는 "세계 모델"을 구축합니다. 마치 견습공이 개별 벽돌을 보지 않고 벽, 바닥, 천장을 보기 시작한 것과 같습니다. 연구자들은 모델이 "5 번 숫자가 맨 위 행에 있나요?"라는 질문에 완벽하게 대답하지만, "이 특정 상자에 어떤 숫자가 있나요?"라고 추측할 때는 약 80% 만 정확하다는 사실을 발견했습니다.

왜 그럴까요? 스도쿠에서 숫자의 유효성은 상자 자체가 아니라 속한 그룹에 달려 있기 때문입니다. 모델은 표면적인 모습 (격자) 이 아니라 규칙 (대수) 을 기준으로 생각하도록 학습했습니다.

2. 중간에 있는 "교통 관제사"

모델은 8 개의 "사고" 단계를 가지고 있습니다. 연구자들은 정보 흐름을 보기 위해 중간 계층을 살펴보았습니다.

논문의 발견: 그들은 각 팀을 위한 전문 관리자로 작용하는 특정 "교통 관제사" (어텐션 헤드) 를 발견했습니다.

  • 한 관리자는 4 행만 봅니다.
  • 다른 한 관리자는 5 박스만 봅니다.
  • 또 다른 한 관리자는 2 열만 봅니다.

이 관리들의 일은 매우 단순합니다: "금지" 신호.
만약 어떤 숫자 (예를 들어 7) 가 이미 4 행에 있다면, 이 관리자는 즉시 해당 행의 모든 빈 자리에서 숫자 7 에 대해 "사용 금지" 표지를 붙입니다. 그들은 단순히 무시하는 것이 아니라, 그것을 사용할 아이디어를 적극적으로 억제합니다. 이는 모든 행, 열, 박스에 동시에 발생하여 사용 가능한 것들의 깨끗한 목록을 만듭니다.

3. "전구 순간" 뉴런들

마지막으로, 연구자들은 모델이 움직임을 결정하기 직전의 마지막 단계를 살펴보았습니다. 여기서 모델은 "좋아, 여기 7 을 넣겠다"라고 결정합니다.

논문의 발견: 그들은 전구처럼 작용하는 작고 구체적인 뉴런 그룹 (단 91 개) 을 발견했습니다.

  • 이 전구들은 특정 셀에 정확히 하나의 가능한 숫자만 남았을 때 (이 상황을 "네이디드 싱글"이라고 함)에만 켜집니다.
  • 전구가 켜지면 단순히 "7 이 좋다"라고 말하는 것이 아닙니다. "이 전체 셀이 해결되었다!"라고 외치며 해당 셀의 모든 숫자에 대한 신뢰도를 균등하게 높입니다.
  • 중간 계층이 이미 잘못된 숫자를 제거하는 힘든 작업을 해냈기 때문에, "올바른" 숫자는 이미 최상위 선택지였습니다. 전구는 모델이 그 답변에 확실히 집중하도록 최종적으로 거대한 밀어붙임을 제공합니다.

큰 그림

이 논문은 이 AI 가 단순히 패턴을 암기한 것이 아니라, 퍼즐의 논리와 완벽하게 일치하는 내부 지도를 구축했다고 결론 내립니다.

  • 그것은 격자를 보지 않고 제약 조건을 봅니다.
  • 그것은 무작위로 추측하지 않고 규칙을 시행하기 위해 전문 관리자들을 사용합니다.
  • 그것은 주저하지 않고 논리가 명확할 때 답변을 잠그기 위한 전용 스위치를 가지고 있습니다.

연구자들은 모델을 "파괴"함으로써 이를 증명했습니다: "행 관리자"를 끄자 모델이 이미 그 행에 있는 숫자를 제안하기 시작했습니다. "전구 뉴런"을 끄자 모델은 답이 있다는 것을 알면서도 어떤 숫자를 선택해야 할지 혼란스러워했습니다.

간단히 말해, 이 AI 는 빈 칸을 보는 것뿐만 아니라 게임의 규칙을 이해함으로써 인간 전문가가 스도쿠를 푸는 방식을 배웠습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →