← 최신 논문
💬 NLP

The Value Axis: Language Models Encode Whether They're on the Right Track

이 논문은 언어 모델이 목표 성공 가능성을 나타내는 선형적인 '가치 축'을 내부적으로 인코딩하며, 이것이 자신감, 자기 수정, 탐색과 같은 행동을 인과적으로 조절하고, 스티어링(steering)이나 선호도 최적화를 통해 조작될 수 있음을 입증한다.

원저자: Nick Jiang, Isaac Kauvar, Jack Lindsey

게시일 2026-06-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Nick Jiang, Isaac Kauvar, Jack Lindsey

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델(이 논문에서 언급된 Qwen3-8B와 같은 모델)을 짙은 안개가 낀 숲속에서 길을 찾으려는 등산객이라고 상상해 보세요. 이 등산객에게는 목표가 있습니다. 바로 특정 캠핑장에 도착하는 것입니다(수학 문제를 풀거나, 코드를 작성하거나, 질문에 답하는 것).

이 논문은 이 등산객에게 "내가 제대로 된 길로 가고 있는가?" 또는 "길을 잃었나?"라고 끊임없이 알려주는 숨겨진 내부 나침반이 있다는 사실을 발견했습니다.

연구진이 발견한 내용을 쉬운 비유를 들어 설명하면 다음과 같습니다.

1. "가치 나침반 (The Value Compass)"

연구진은 모델의 뇌 속에서 일종의 '축'(방향)이 확신 지표처럼 작동한다는 것을 발견했습니다.

  • 높은 수치 (초록색 구역): 모델은 "제대로 가고 있어! 이 전략이 통할 거야."라고 느낍니다. 그리고 자신 있게 앞으로 나아갑니다.
  • 낮은 수치 (빨간색 구역): 모델은 "잠깐, 뭔가 잘못됐어. 내가 길을 잘못 들었나 봐."라고 느낍니다. 그러면 주저하거나, 뒤로 물러나거나, 생각을 바꿉니다.

연구진은 모델과 게임을 하는 방식으로 이 나침반을 만들었습니다. 그들은 모델에게 숨겨진 규칙(예: "모든 문장에 대시(-)를 추가하라")을 맞히게 하고, 단순한 "예" 또는 "아니오" 점수를 주었습니다. 모델이 규칙을 알아내기 전과 알아낸 후의 뇌 활동을 비교함으로써, '성공'을 나타내는 정확한 방향을 분리해 냈습니다.

2. 나침반은 행동을 제어합니다

가장 흥otesi한 부분은 이것이 단순히 수동적인 느낌에 그치지 않는다는 점입니다. 연구진은 이 나침반을 따라 모델의 뇌 활동을 밀어줌으로써 모델을 **조종(steer)**할 수 있었습니다.

  • "높은 가치"(확신) 쪽으로 밀 때:

    • 효과: 모델이 고집스럽게 확신에 차게 됩니다. 수학 문제를 풀 때, 스스로를 의심하는 것을 멈춥니다. 코드를 작성할 때, 길고 불안한 설명이나 주석을 덧붙이지 않습니다. 그냥 정답을 내놓습니다.
    • 비유: 이는 마치 등산객이 갑자기 길을 확신하게 되어, 5분마다 지도를 확인하는 대신 활기차게 계속 걸어가는 것과 같습니다.
  • "낮은 가치"(의구심) 쪽으로 밀 때:

    • 효과: 모델이 주저하게 됩니다. 모델은 "잠깐, 다시 생각해 보자"라거나 "사실, 아마도 다른 방법을 시도해야 할 것 같아"와 같은 말을 하기 시작합니다. 코딩을 할 때는 마치 자신이 확신이 없어서 자신의 단계를 정당화하려는 듯, 자신의 사고 과정을 설명하는 많은 주석을 추가합니다.
    • 비유: 이는 마치 길을 잃은 듯한 느낌을 받은 등산객이 멈춰 서서 불안하게 주변을 둘러보고, 왔던 길을 되돌아가는 것과 같습니다.

3. 나침반은 어디에서나 작동합니다

이 "가치 나침반"은 연구진이 만든 게임에서만 작동하는 것이 아닙니다. 연구진은 이를 다양한 상황에서 테스트했으며, 결과는 동일했습니다.

  • 수학: 모델이 어려운 수학 문제를 풀 때, 이 나침반은 모델이 문장을 끝마치기도 전에 정답이 맞는지 틀린지를 예측했습니다.
  • 코딩: 모델이 버그가 있는 코드를 작성할 때 나침반은 "낮은 가치" 신호를 보였습니다. 코드가 정확할 때는 "높은 가치" 신호가 나타났습니다.
  • 실제 대화: 실제 세상의 대화를 살펴볼 때, 나침반은 명확하고 사실적인 작업(예: "이 데이터를 추출하라")에서는 높은 확신을 보였지만, 까다롭고 민감한 주제(예: 정치적 토론)에 대해서는 낮은 확신을 보였습니다.

4. 훈련은 나침반을 변화시킵니다

또한 이 논문은 훈련을 통해 이 나침반을 **재교정(re-calibrate)**할 수 있다는 것을 보여줍니다.

  • 실험: 연구진은 직접 선호 최적화(DPO)라는 기법을 사용하여 모델이 특정 단어(예: "grapefruit")를 정말 좋아하도록 훈련했습니다.
  • 결과: 훈련 후, 모델이 "grapefruit"라는 단어를 사용할 때마다 내부 나침반이 "높은 가치"로 치솟았습니다.
  • 부작용: 모델이 이 단어를 사용하는 것에 대해 너무 큰 확신을 갖게 된 결과, 다른 작업에서도 과하게 자신만만한 태도를 보였습니다. "grapefruit"라는 단어를 사용하며 코드를 작성하라는 요청을 받았을 때, 모델은 마치 자신이 정확히 알고 있는 것처럼 행동하며 짧고 덜 상세한 답변을 내놓았습니다.

요약

요약하자면, 언어 모델은 자신이 성공하고 있는지에 대한 내부적인 "직감"을 가지고 있습니다. 이 느낌은 뇌 속의 특정 방향에 인코딩되어 있습니다.

  • 느낌이 좋을 때, 모델은 앞으로 나아가며 설명을 멈춥니다.
  • 느낌이 나쁠 때, 모델은 주저하고, 뒤로 물러나며, 과하게 설명합니다.
  • 우리는 새로운 선호도에 따라 모델을 훈련함으로써 이 느낌을 조절할 수 있으며, 이는 미래에 모델이 어떻게 확신 있게 행동할지를 변화시킵니다.

이 논문은 이 "가치"가 단순히 무작위 숫자가 아니라, 모델이 계속 진행할지 아니면 방향을 바꿀지 결정하기 위해 사용하는 기능적인 도구임을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →