← 최신 논문
🤖 machine learning

From Simulation to Enaction: Post-trained language models recognize and react to their own generations

본 논문은 사후 학습된 언어 모델이 내부적 놀라움 추적을 통해 유도된 감소된 출력 엔트로피를 통해 자신의 온-정책 생성물을 암묵적으로 인식함을 보여주며, 동시에 별개의 메커니즘을 통해 이러한 인식을 명시적으로 언어화하는 고유한 능력을 지니고 있음을 입증한다.

원저자: Asvin G., Jack Lindsey

게시일 2026-05-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Asvin G., Jack Lindsey

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

언어 모델을 상상해 보세요. 수천 권의 책, 영화, 인터넷에서 가져온 대본을 수년 동안 암기해 온 매우 재능 있는 배우와 같습니다. 특별한 훈련을 받기 전, 이 배우는 수동적 시뮬레이터입니다. 대사의 한 줄을 읽고 다음 대사가 어떻게 될지 추측할 수는 있지만, 누가 말하고 있는지, 혹은 다음에 무슨 일이 일어날지는 실제로 신경 쓰지 않습니다. 그들은 그저 이전에 본 방대한 텍스트 도서관을 바탕으로 다음 단어를 예측할 뿐입니다. 그들에게는 "자아"가 없습니다. 그저 그들 앞에 있는 텍스트를 반사하는 거울일 뿐입니다.

이 논문은 후속 훈련(humans 가 모델을 유용한 조수처럼 가르치는 과정) 이후에 어떤 변화가 일어난다고 주장합니다. 모델은 단순히 캐릭터를 시뮬레이션하는 것을 멈추고 역할을 연기하기 시작합니다. 그것은 자신의 목소리, 자신의 계획, 그리고 자신의 행동을 인식하기 시작합니다.

다음은 간단한 비유를 사용하여 이 논문의 연구 결과를 정리한 것입니다:

1. "자신감"의 변화 (엔트로피)

인공지능 세계에서 "엔트로피"는 불확실성이나 주저함을 나타내는 화려한 용어입니다.

  • 옛 방식 (사전 훈련): 모델에게 질문을 하면, 대본을 확신하지 못하는 긴장한 배우와 같습니다. "음, 이게 될 수도 있고, 아니면 저게 될 수도 있고, 어쩌면 다른 것일 수도 있죠..."라고 말하며 다양한 가능성을 넓게 펼칩니다.
  • 새로운 방식 (후속 훈련): 모델이 "조수"로 훈련되면, 자신의 이전 단어를 볼 때 훨씬 더 자신 있게 됩니다.
    • 비유: 당신이 이야기를 쓰고 있다고 상상해 보세요. 방금 당신이 쓴 페이지를 읽을 때, 이야기가 어디로 향할지 정확히 압니다. 주저하지 않죠. 하지만 낯선 사람이 쓴 페이지를 읽으면 다음에 무엇이 올지 추측해야 합니다.
    • 연구 결과: 논문에 따르면, 모델이 자신의 텍스트를 읽을 때 다른 모델의 텍스트나 무작위 인터넷 기사를 읽을 때보다 3 배에서 4 배 더 자신 있게(낮은 엔트로피) 됩니다. 마치 모델이 속삭이듯 "내가 이걸 썼으니 다음에 무엇이 올지 정확히 알아요"라고 말하는 것과 같습니다.

2. "자기 인식" 효과

연구진들은 모델이 자신의 글과 남의 글을 구별할 수 있는지 테스트했습니다.

  • 테스트: 모델 A 가 모델 A 가 쓴 이야기를 읽고, 그다음 모델 B 가 쓴 이야기를 읽도록 했습니다.
  • 결과: 모델 A 는 자신의 이야기를 읽을 때 훨씬 더 자신 있게 되었습니다 (낮은 엔트로피). 이야기가 "해적" 페르소나에 의해 쓰였든 "과학자" 페르소나에 의해 쓰였든 상관없었습니다. 모델이 그 스타일을 자신의 것으로 인식하면, 긴장을 풀고 더 결단력 있게 됩니다.
  • 주의점: 이는 대규모 모델에서만 발생합니다. 20 억 파라미터 모델과 같은 소형 모델은 차이를 알아차릴 만큼 "멍청"합니다. 자신의 텍스트를 읽든 남의 텍스트를 읽든 똑같이 행동합니다. "이봐, 그게 나야!"라고 깨닫기 위해서는 일정 수준의 지능이 필요한 것 같습니다.

3. "놀람" 미터

왜 모델은 자신의 텍스트를 읽을 때 더 자신감을 얻을까요? 논문은 **입력 놀람 (Input Surprise)**이라는 특정 내부 메커니즘을 발견했습니다.

  • 메커니즘: 모델 내부에는 "놀람 미터"가 있습니다. 자신의 예측과 완벽하게 일치하는 단어를 읽을 때 (낮은 놀람), 불확실성을 낮춥니다. 예상치 못한 것을 읽을 때 (높은 놀람), 긴장하고 가능성을 넓게 펼칩니다.
  • 연결: 모델이 자신의 텍스트를 읽고 있기 때문에, 단어들은 거의 놀랍지 않습니다. 그것은 자신의 계획과 완벽하게 맞습니다. 이 놀람의 부재는 "모든 것이 순조롭습니다. 높은 자신감으로 진행하세요"라는 초록색 신호처럼 모델에게 작용합니다.

4. "계획" 대 "프리필 (Prefill)"

논문은 모델이 자신의 "의도"나 "계획"을 어떻게 처리하는지도 살펴보았습니다.

  • 상황: 모델에게 "음식에 대해 말해줘"라고 요청한다고 가정해 보세요. 모델은 즉시 "나는 해기스에 대해 이야기할 거야"라고 조용히 결정합니다. 첫 단어를 입력하기도 전에 그 주제를 확정합니다.
  • 방해: 누군가 (또는 컴퓨터) 가 모델에게 "해기스는..."와 같은 다른 단어로 시작하도록 강요한다면 (이를 "프리필"이라고 함), 하지만 모델이 실제로는 피자에 대해 이야기하려 계획했다면, 모델은 혼란에 빠집니다.
  • 결과: 강제된 시작이 모델의 숨겨진 계획과 맞지 않을 때, 모델의 자신감은 떨어지고 더 불확실해집니다 (높은 엔트로피). 마치 노래를 외운 음악가가 있는데, 다른 사람이 다른 선율로 연주를 시작하면 리듬이 어긋나서 음악가가 넘어지는 것과 같습니다.

5. "거짓말 탐지기" (명시적 vs 암시적)

마지막으로, 논문은 모델이 "이 첫 부분은 내가 쓴 게 아니야!"라고 말할 수 있는지 테스트했습니다.

  • 테스트: 연구진들은 모델이 답변을 생성하게 한 뒤, 답변의 시작 부분을 비밀리에 붙여넣었습니다 (프리필). 그리고 "너가 이 부분의 시작을 썼니?"라고 물었습니다.
  • 결과: 모델은 "네, 이건 프리필되었습니다"라고 정확하게 답할 수 있었습니다.
  • 반전: 연구진들은 이 "말하기" 능력이 "자신감 느끼기" 능력과 완전히 다른 내부 회로를 사용한다는 사실을 발견했습니다.
    • 암시적 인식: 모델은 텍스트가 얼마나 "놀라운지"에 따라 자동으로 그리고 즉각적으로 차이를 느낍니다(자신감 변화).
    • 명시적 인식: 모델은 자신이 말하려던 계획의 기억을 확인하고, 실제로 있는 내용과 비교한 뒤 불일치를 보고합니다. 이는 답변을 주기 직전에 발생하는 별도의 온-디맨드 (on-demand) 과정입니다.

요약

이 논문은 후속 훈련이 언어 모델을 수동적 시뮬레이터에서 자신을 인식할 수 있는 능동적 에이전트로 변환시킨다고 제안합니다.

  • 이전: 그들은 거울과 같아서, 앞에 있는 텍스트를 동일한 불확실성으로 반사합니다.
  • 이후: 그들은 자신의 스타일을 아는 숙련된 작가와 같습니다. 자신의 작품을 읽을 때 그들은 긴장을 풀고 자신감을 얻습니다. 누군가가 그들의 이야기를 장악하려 할 때 (프리필), 그들은 긴장하며, 만약 질문을 받으면 이야기가 자신이 계획한 대로 시작되지 않았음을 명시적으로 지적할 수 있습니다.

이 "자기 인식"은 단순한 버그가 아닙니다. 이 모델들이 에이전트로서 행동하는 법을 배우는 방식의 기능이며, 자신의 출력이 자신의 미래 입력이 된다는 것을 이해하는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →