← 최신 논문
💬 NLP

Stories in Space: In-Context Learning Trajectories in Conceptual Belief Space

본 논문은 대규모 언어 모델이 저차원 구조화된 '개념적 신념 공간'을 탐색함으로써 맥내 학습을 수행하며, 여기서 신념 업데이트는 모델의 행동과 내부 표현 모두에 일관되게 반영되는 기하학적 궤적으로 나타나며 선형 개입을 통해 인과적으로 조작될 수 있음을 제안한다.

원저자: Eric Bigelow, Raphaël Sarfati, Daniel Wurgaft, Owen Lewis, Thomas McGrath, Jack Merullo, Atticus Geiger, Ekdeep Singh Lubana

게시일 2026-05-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Eric Bigelow, Raphaël Sarfati, Daniel Wurgaft, Owen Lewis, Thomas McGrath, Jack Merullo, Atticus Geiger, Ekdeep Singh Lubana

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델 (LLM) 을 단순히 사실을 암기하는 로봇이 아니라, 책을 소리 내어 읽어주는 이야기꾼으로 상상해 보십시오. 이야기꾼이 새로운 문장을 읽을 때마다, 그들은 줄거리, 등장인물의 감정, 장면의 분위기를 이해하는 방식이 변화합니다. 그들은 단순히 이야기를 "아는" 것이 아니라, 일어나고 있는 일에 대한 내부적인 "믿음"을 끊임없이 업데이트합니다.

이 논문은 **"Stories in Space"**라는 제목으로, 바로 그 이야기꾼이 어떻게 믿음을 업데이트하는지 정확히 매핑해 보려고 합니다. 저자들은 흥미로운 아이디어를 제시합니다: 모델의 변화하는 믿음은 "개념적 믿음 공간 (Conceptual Belief Space)"이라는 특정 저차원 지도를 따라 이동합니다.

간단한 비유를 사용하여 그들의 발견 사항을 다음과 같이 정리해 보겠습니다:

1. 믿음의 지도 (개념 공간)

모든 가능한 "감정"이나 "아이디어"가 특정 위치에 있는 거대하고 보이지 않는 3 차원 방을 상상해 보십시오.

  • 행복은 오른쪽 위 구석에 있을 수 있습니다.
  • 슬픔은 왼쪽 아래 구석에 있을 수 있습니다.
  • 분노는 그 어딘가에 있을 수 있습니다.

이 논문은 LLM 이 이야기를 읽을 때, 한 아이디어에서 다른 아이디어로 무작위로 점프하는 것이 아니라, 내부 상태가 이 지도를 가로지르는 **부드러운 경로 (궤적)**를 따라 이동한다고 제안합니다.

  • 비유: 이야기를 하이킹 코스로 생각하십시오. 주인공이 구덩이에 빠지면, 모델의 "믿음 마커"는 지도를 따라 "슬픔" 구역 쪽으로 미끄러져 내려갑니다. 영웅이 생물들을 구출하면, 마커는 다시 "행복" 쪽으로 미끄러져 올라갑니다. 이 논문은 이러한 경로가 혼란스럽지 않으며, 계곡을 흐르는 강처럼 구조화되고 예측 가능한 기하학을 따른다는 것을 발견했습니다.

2. 동전의 양면 (행동 vs 뇌)

연구자들은 모델을 두 가지 방식으로 살펴보았습니다:

  1. 행동: "지금 이 이야기가 얼마나 행복한가?"라고 물었을 때 모델이 말하는 것 (예: 10 점 만점에 7 점 부여).
  2. 내부 표현: 텍스트를 처리하는 동안 모델의 "뇌"(신경 활성화) 내부에서 실제로 일어나는 수학.

발견: 모델이 "행동 지도"(그것이 말하는 것) 에서 취하는 경로와 "뇌 지도"(그것이 생각하는 것) 에서 취하는 경로는 거의 동일합니다.

  • 비유: 그것은 인형을 보는 것과 같습니다. 이 논문은 인형을 당기는 실 (내부 수학) 과 인형의 실제 움직임 (출력) 이 완벽하게 동기화되어 있음을 발견했습니다. 만약 당신이 실을 볼 수 있다면, 인형이 다음에 어디로 움직일지 정확히 예측할 수 있고, 그 반대도 마찬가지입니다.

3. 선형 프로브로 마음 읽기

저자들은 "선형 프로브 (linear probe)"라는 도구를 사용했습니다. 이것은 간단한 번역기라고 생각하십시오.

  • 그들은 모델의 "뇌" 내부의 복잡하고 messy 한 수학을 임의의 순간에 살펴보고, 간단한 선형 방정식 (직선) 을 사용하여 이를 모델이 이야기의 감정에 대해 무엇을 믿는지 예측하는 것으로 번역할 수 있음을 보여주었습니다.
  • 결과: 이 번역기는 놀라울 정도로 잘 작동했습니다. 이는 모델의 "믿음"이 통과할 수 없는 블랙박스에 숨겨져 있는 것이 아니라, 모델의 내부 코드에 명확하게 적혀 있어 읽기를 기다리고 있다는 것을 의미합니다.

4. 이야기 조종하기 (리모컨)

이 논문의 가장 흥미로운 부분은 그들이 모델을 단순히 지켜본 것이 아니라, 조종했다는 것입니다.

  • 비유: 모델의 믿음 경로가 도로를 달리는 차라고 상상해 보십시오. 연구자들은 핸들 (내부 수학 조정) 을 잡아서 차를 "행복"과 같은 특정 목적지 쪽으로 강제로 돌릴 수 있음을 발견했습니다. 이는 이야기 텍스트가 자연스럽게 "슬픔" 쪽으로 향하고 있더라도 마찬가지였습니다.
  • 주의할 점 (조종의 기하학): 그들이 모델을 "슬픔" 쪽으로 조종했을 때, 단순히 더 슬퍼진 것이 아니라 약간 더 분노하고 덜 행복해졌습니다.
  • 이유: 그들의 "믿음 지도"에서 슬픔과 분노는 이웃이기 때문입니다. 모델을 슬픔 쪽으로 밀면 필연적으로 분노 쪽으로도 밀리게 됩니다. 이 논문은 모델이 이러한 조종에 의해 얼마나 "혼란"을 겪는지는 지도상에서 개념들이 얼마나 가까운지에 전적으로 달려있다고 발견했습니다. 두 개념이 지도상에서 멀리 떨어져 있으면, 하나를 조종해도 다른 하나에는 영향을 미치지 않습니다. 하지만 가까우면 서로 얽히게 됩니다.

주요 주장 요약

  1. 믿음에는 형태가 있습니다: LLM 이 이야기를 읽을 때, 변화하는 믿음은 저차원 기하학적 공간에서 부드럽고 구조화된 경로를 따라 이동합니다.
  2. 생각과 행동은 일치합니다: 모델의 내부 수학과 외부 답변은 이 지도에서 정확히 같은 경로를 따릅니다.
  3. 우리는 믿음을 읽고 쓸 수 있습니다: 우리는 모델의 내부 수학을 살펴보기만 해도 모델이 무엇을 믿는지 예측할 수 있으며, 그 수학을 살짝 밀어주어 모델의 믿음을 바꿀 수 있습니다.
  4. 기하학이 지배합니다: 모델이 변화 (조종) 에 반응하는 방식은 이 지도상에서 개념들 사이의 거리에 의해 결정됩니다. 지도상에서 "이웃"인 개념들은 서로 영향을 미치지만, 멀리 떨어진 개념들은 그렇지 않습니다.

요약하자면, 이 논문은 LLM 이 단순히 추측하는 것이 아니라, 구조화된 기하학적 개념 지형을 항해하고 있으며, 이제 우리는 그 지도를 보고 좌표를 읽을 뿐만 아니라 차량까지 운전할 수 있다고 주장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →