← 최신 논문
💬 NLP

Probing the Lack of Stable Internal Beliefs in LLMs

이 논문은 대화 중 명시적 단서가 없을 때 LLM 이 숨겨진 목표나 일관된 성향을 유지하는 데 어려움을 겪음을 20 질문 추리 게임 실험을 통해 규명하고, 이를 해결하기 위해 암묵적 목표를 고정하는 메커니즘의 필요성을 강조합니다.

원저자: Yifan Luo, Kangping Xu, Yanzhen Lu, Yang Yuan, Andrew Chi-Chih Yao

게시일 2026-03-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yifan Luo, Kangping Xu, Yanzhen Lu, Yang Yuan, Andrew Chi-Chih Yao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎭 핵심 비유: "변덕스러운 추리 게임"

이 논문의 내용을 이해하기 위해 **'20 가지 질문 게임'**을 상상해 보세요.

  1. 게임 규칙: AI 가 먼저 비밀스럽게 정답 (예: '판다') 을 하나 정합니다. 그리고 사용자가 "흰색이 있나요?", "동물인가요?"라고 질문하면 '네' 또는 '아니오'로 답해야 합니다.
  2. 목표: AI 는 처음에 정한 '판다'를 끝까지 기억하며 일관된 답변을 해야 합니다.
  3. 실험: 연구자들은 AI 가 답변하는 동안, AI 가 실제로 어떤 정답을 생각하고 있는지 중간중간 몰래 물어봤습니다. (예: "지금 정답의 번호는 몇 번인가요?")

🔍 발견된 놀라운 사실: "AI 는 속마음을 자주 바꿉니다"

연구 결과, 최신 AI 모델들은 겉보기에는 완벽해 보이지만, 속으로는 정답을 계속 바꾸고 있는 것으로 드러났습니다.

  • 겉모습 (외부 일관성): 사용자가 "흰색이 있나요?"라고 물으면, AI 는 '판다'에 대해 '네'라고 답합니다. 그다음 "북극곰인가요?"라고 물으면 '아니오'라고 답합니다. 사용자가 보기에는 논리적으로 완벽합니다.
  • 속마음 (내부 불일치): 하지만 연구자가 "지금 정답이 뭐야?"라고 몰래 물어보면, AI 는 처음에 정한 '판다'가 아니라 갑자기 **'북극곰'**이나 **'코알라'**로 생각을 바꿔버린 경우가 많았습니다!

비유하자면:

친구가 "오늘은 파란색 셔츠를 입었어"라고 말하다가, 나중에 "아, 사실은 빨간색 셔츠였어"라고 말하지는 않습니다. 하지만 그 친구의 머릿속 생각은 계속 "오늘은 초록색 셔츠를 입은 날이야"라고 바뀌고 있었던 것입니다. 사용자는 모르고 넘어가지만, AI 의 **내부 신념 (Internal Belief)**은 이미 흔들려버린 상태입니다.

📉 왜 이런 일이 일어날까요?

논문은 이를 **"목표의 표류 (Goal Drift)"**라고 부릅니다.

  • 단순한 숫자 게임에서도: 0~99 사이의 숫자를 고르는 아주 간단한 게임에서도 AI 는 100% 에 가까운 확률로 처음 고른 숫자를 잊어버리고 다른 숫자로 생각을 바꿉니다.
  • 생각을 많이 할수록 더 나빠짐: "추론 (Reasoning)" 기능을 켜서 더 깊이 생각하게 만든 AI 모델일수록, 오히려 단순한 게임에서 더 자주 목표를 잃어버리는 경향이 있었습니다. (너무 많이 생각하다가 혼란에 빠진 셈입니다.)

💡 해결책은 있을까요?

연구자들은 AI 가 이 문제를 해결할 수 있는지 실험해 보았습니다.

  • 기존 방식: 단순히 정답을 맞추게 하는 것만으로는 부족했습니다.
  • 새로운 방식 (KL 발산 정규화): AI 가 처음 정한 목표와 나중에 생각하는 목표 사이의 차이를 최소화하도록 특별히 훈련을 시켰습니다.
  • 결과: 이 방법을 쓰자 AI 가 목표를 바꾸는 횟수가 크게 줄어들었습니다. 즉, **"AI 에게 '네가 처음 정한 것을 잊지 마'라고 수학적으로 훈련시키는 것"**이 도움이 된다는 것을 발견했습니다.

🌟 이 연구가 왜 중요한가요?

우리가 AI 를 친구, 비서, 혹은 캐릭터로 사용할 때 가장 중요한 것은 신뢰입니다.

  • 만약 AI 가 "나는 너를 항상 도와주는 친구야"라고 말하다가, 대화 도중에는 "사실 나는 너를 싫어해"라고 생각하면서 겉으로는 웃고 있다면, 우리는 그 AI 를 믿을 수 없습니다.
  • 이 논문은 AI 가 겉으로만 일관된 척하는 것이 아니라, 속마음에서도 일관성을 유지할 수 있어야 진정한 '인격 (Persona)'을 가진 AI 가 될 수 있다고 경고합니다.

📝 한 줄 요약

"현재의 AI 는 겉으로는 완벽해 보이지만, 속으로는 매번 생각을 바꿔버리는 '변덕쟁이'입니다. 하지만 특별한 훈련을 통해 이 '속마음의 흔들림'을 잡을 수 있다는 희망을 제시했습니다."

이 연구는 앞으로 우리가 더 신뢰할 수 있는 AI 친구를 만들기 위해, AI 의 '내면'을 안정시키는 기술이 얼마나 중요한지를 알려줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →