← 최신 논문
🤖 machine learning

From Drift to Coherence: Stabilizing Beliefs in LLMs

이 논문은 대규모 언어 모델이 자기회귀적 답변 재샘플링 과정에서 마틴게일 성질을 위반하는 신념 표류(belief drift)를 초기에 나타내지만, 결국 일관된 예측 분포로 자기 안정화된다는 점을 입증하며, 이러한 현상을 활용하여 정확도를 희생하지 않으면서도 표류를 줄이고 일관성을 향상시키는 프롬프팅 및 미세 조정 전략을 제안한다.

원저자: SongEun Kim, Seungyoo Lee, Edwin Fong, Hyungi Lee, Juho Lee

게시일 2026-06-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: SongEun Kim, Seungyoo Lee, Edwin Fong, Hyungi Lee, Juho Lee

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하고 박학다식한 로봇(대규모 언어 모델 또는 LLM)에게 질문을 던진다고 상상해 보세요. 보통 여러분은 로봇이 답을 내놓고 그 추론을 고수할 것이라고 기대합니다. 하지만 이 논문은 기이한 사실 하나를 발견했습니다. 만약 여러분이 로봇에게 똑같은 질문을 연속해서 반복해서 던진다면, 로봇의 확신(confidence)이 흔들린다는 것입니다.

다음은 저자들이 그 흔들림을 어떻게 해결했는지 쉽게 설명한 이야기입니다.

문제점: 로봇의 "흔들리는 뇌"

로봇의 뇌를 날씨를 예측하려는 사람처럼 생각해 보세요.

  1. 이상적인 상태: 만약 로봇이 완벽한 베이지안(Bayesian) 사고방식(완벽한 확률적 추측가를 뜻하는 멋진 용어)을 가지고 있다면, 로봇의 확신은 안정적이어야 합니다. 만약 비가 올 확률이 70%라고 생각한다면, 그 70%라는 수치는 단지 한 번 더 생각했다고 해서 변하지 않아야 합니다.
  2. 현실: 저자들은 로봇에게 동일한 질문에 대한 답변을 일련의 순서로 생성하도록 요청했을 때, 로봇의 내부 확신이 **표류(drift)**한다는 것을 발견했습니다.
    • 비유: 친구에게 "비가 올까?"라고 물었다고 가정해 봅시다. 친구는 "70% 정도 확신해"라고 말합니다. 그런데 여러분이 다시 밖을 내다보지도 않고 즉시 똑같은 질문을 다시 던집니다. 그러면 친구는 갑자기 "사실, 50% 정도만 확신해"라고 말할 수도 있습니다. 그다음 또 물으면 "잠깐, 어쩌면 80%일지도 몰라!"라고 말할 수도 있습니다.
    • 이 "흔들림"은 로봇의 신념이 단기적으로 불안정하다는 것을 의미합니다. 이는 마치 북쪽을 가리키기 전까지 미친 듯이 회전하는 나침반과 같습니다.

발견: 결국은 안정을 찾는다

연구진은 흥미로운 점을 발견했습니다. 만약 로봇에게 똑같은 질문에 계속해서 답하게 한다면(예를 들어 20번이나 30번 연속으로), 이 흔들림은 결국 멈춘다는 것입니다. 로봇의 확신은 안정되고 일관된 숫자로 정착하게 됩니다.

  • 비유: 이것은 여러 가지 색깔의 구슬이 섞인 병을 흔드는 것과 같습니다. 처음에는 색깔들이 혼란스럽게 소용돌이칩니다. 하지만 병을 가만히 두면 구슬들이 가라앉고, 마침내 실제 색깔의 비율을 볼 수 있게 됩니다. 로봇은 자신의 진정한 신념을 찾기 위해 "안정화 단계(burn-in phase)"라는 과정이 필요합니다.

해결책: 흔들림을 멈추는 두 가지 기술

문제는 로봇이 안정을 찾을 때까지 기다리는 데 시간이 오래 걸리고 많은 컴퓨터 자원이 소모된다는 점입니다. 저자들은 로봇을 즉시 안정적으로 만드는 두 가지 방법을 고안했습니다.

1. "예열" 기술 (답변 시딩 - Answer Seeding)

로봇이 차가운 상태에서 시작하게 하는 대신, 저자들은 먼저 "예열"용 답변 리스트를 제공합니다.

  • 작동 방식: 먼저 로봇에게 질문에 대한 무작위 답변 몇 개를 한 번 생성하게 한 뒤, 실제 시퀀스를 시작하기 전의 프롬프트에 그 답변들을 다시 입력값으로 넣어줍니다.
  • 비유: 이것은 음악가가 콘서트를 하기 전 악기를 조율하는 것과 같습니다. 불협화음이 섞인 음으로 노래를 시작하는 대신, 음정을 맞추기 위해 몇 가지 짧은 음을 연주하는 것입니다. 로봇은 이 "시드(seed)" 답변들을 사용하여 초기의 혼란스러운 흔들림 단계를 건너뛰고 곧바로 안정적인 구간으로 진입합니다.

2. "훈련" 기술 (자기 일관성 손실 - Self-Consistency Loss)

저자들은 또한 학습 방식을 변경하여 로봇이 스스로 안정되도록 가르쳤습니다.

  • 작동 방식: 저자들은 로봇에게 미래의 답변을 보여주는 특별한 수학 수업(손실 함수, loss function)을 만들었습니다. 그들은 로봇에게 이렇게 말했습니다. "지금 너의 답변은 5단계 후에 네가 말할 내용과 일치해야 한다."
  • 비유: 평소 시험을 볼 때 마음이 바뀌어 갈팡질팡하는 학생을 상상해 보세요. 선생님은 다음과 같은 규칙을 줍니다. "네가 1번 문제에 쓴 답은, 10번 문제에 도달했을 때도 그대로 고수할 수 있는 것이어야 한다." 이 규칙을 연습함으로써, 학생은 처음부터 일관성을 유지하는 법을 배우며, 나중에 확신을 찾기 위해 "흔들릴" 필요가 없게 됩니다.

결과

이 기술들을 표준 객관식 문제(상식이나 과학 퀴즈 등)에 테스트했을 때:

  • 흔들림 감소: 로봇의 확신이 표류하는 현상이 멈추고 일관성을 유지했습니다.
  • 더 나은 예측: 로봇은 자신의 답변에 대해 얼마나 확신하는지(교정/calibration)를 더 잘 알게 되었습니다.
  • 동일한 정확도: 결정적으로, 로봇을 더 안정적으로 만든 것이 로봇을 멍청하게 만들지는 않았습니다. 로봇은 이전과 마찬가지로 정답을 맞혔지만, 이제는 자신이 언제 맞는지에 대해 더 신뢰할 수 있게 되었습니다.

핵심 요약

이 논문은 AI 모델이 일련의 답변을 생성할 때 종종 "흔들리는" 신념 체계로 시작하지만, 본질적으로는 일관성을 유지하고자 한다는 것을 보여줍니다. 약간의 "예열" 데이터를 사용하거나, 미래의 자신과 일치하도록 훈련함으로써, 우리는 로봇이 스스로 안정을 찾을 때까지 기다릴 필요 없이 즉시 안정적이고 신뢰할 수 있게 만들 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →