← 최신 논문
💬 NLP

Using Reinforcement Learning to Train Large Language Models to Explain Human Decisions

이 논문은 결과 기반 보상을 활용한 강화 학습을 사용하여 사전 학습된 대규모 언어 모델을 미세 조정함으로써, 해당 모델들이 높은 예측 정확도를 달성하는 동시에 인간의 위험한 선택에 대해 해석 가능한 자연어 설명을 생성하는 이중 목적의 인지 모델로서 기능할 수 있음을 입증한다.

원저자: Jian-Qiao Zhu, Hanbo Xie, Dilip Arumugam, Robert C. Wilson, Thomas L. Griffiths

게시일 2026-02-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jian-Qiao Zhu, Hanbo Xie, Dilip Arumugam, Robert C. Wilson, Thomas L. Griffiths

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: AI에게 "생각하며 말하기" 가르치기

당신에게 아주 똑똑한 학생(거대 언어 모델, 즉 LLM)이 있다고 상상해 보세요. 이 학생은 당신이 다음에 무엇을 할지 맞히는 데 굉장히 능숙합니다. 어려운 수학 문제를 보여주면 보통 정답을 잘 맞히죠. 하지만 만약 그 정답을 어떻게 얻었는지 물어본다면, 그저 "그냥 알았어요"라고 답하거나, 앞뒤가 잘 맞지 않는 모호한 설명을 늘어놓을 수도 있습니다.

심리학의 세계에서 과학자들은 단순히 행동을 예측하는 것(인간 행동 예측)을 넘어, 사람들이 왜 그런 선택을 하는지(인지적 메커니즘 밝히기)까지 설명할 수 있는 모델을 원합니다.

이 논문은 다음과 같은 질문을 던집니다: AI가 인간의 결정을 예측할 뿐만 아니라, 실제로 인간 심리학을 설명할 수 있는 방식으로 "생각하며 말하기(Think Aloud)"를 하도록 가르칠 수 있을까?

실험: "위험한 선택" 게임

이를 테스트하기 위해 연구진은 "위험한 선택(risky choice)"이라는 고전적인 심리학 게임을 사용했습니다. 당신에게 두 가지 옵션이 주어졌다고 상상해 보세요:

  • 옵션 A: 확실하게 27달러를 받습니다.
  • 옵션 B: 92달러를 받을 확률은 10%, 25달러를 받을 확률은 90%입니다.

대부분의 사람들은 안전한 선택과 위험한 도박 사이에서 고민해야 합니다. 연구진은 이러한 선택을 내린 수천 명의 실제 인간 데이터를 담은 방대한 데이터셋을 활용했습니다. 그들은 AI가 옵션을 보고 "70%의 사람들은 옵션 A를 선택하고, 30%는 옵션 B를 선택할 것이다"라고 말하도록 훈련시키고 싶었습니다.

세 가지 훈련 방법

연구진은 이 과업을 가르치기 위해 세 가지 다른 코칭 스타일을 시도했습니다:

  1. "암기꾼" (표준 훈련): AI에게 수천 개의 질문과 정답 쌍을 보여주었습니다. AI는 패턴을 복제하는 법을 배웠습니다. 정답 비율을 맞히는 데는 능숙해졌지만, 그런지는 배우지 못했습니다. 이는 마치 정답지는 외웠지만 수학 풀이 과정은 설명하지 못하는 학생과 같습니다.
  2. "가려진 암기꾼" (켄타우로스 방식): 첫 번째 방법의 정교한 버전으로, AI가 텍스트의 나머지 부분은 무시하고 정답에 포함된 숫자들에만 집중하도록 강제하는 방식입니다. 이 역시 예측은 잘 수행했지만, 여전히 좋은 설명을 생성하지는 못했습니다.
  3. "점수판을 든 코치" (강화 학습 - RL): 이 방식이 바로 주인공입니다. 여기서 AI는 최종 답변을 내놓기 에 "사고의 사슬(Chain of Thought, 단계별 추론 과정)"을 작성할 수 있도록 허용되었습니다.
    • 반전: AI는 단순히 정답을 맞혔다고 점수를 받는 것이 아니었습니다. AI의 최종 예측이 실제 인간의 행동과 얼마나 일치하느냐에 따라 점수를 받았습니다.
    • 결과: 점수를 얻기 위해, AI는 심리학자처럼 "생각"해야 한다는 것을 깨달았습니다. AI는 "사람들은 위험 회피 성향이 있다"라거나 "그들은 기대값을 계산한다"와 같은 글을 쓰기 시작했습니다. 게임에서 이기기 위해(인간의 데이터와 일치시키기 위해) 노력하는 과정에서, AI는 의도치 않게 인간이 따르는 심리적 규칙을 말로 표현하는 법을 배운 것입니다.

결과: AI가 심리학자가 되다

연구진은 "점수판을 든 코치(RL)" 방식이 두 가지 이유에서 혁신적이라는 것을 발견했습니다.

  1. 예측력이 뛰어남: 다른 방법들과 마찬가지로 인간이 무엇을 선택할지 예측하는 데 매우 뛰어났습니다.
  2. 설명력이 뛰어남: "생각하며 말하기" 부분(사고의 사슬)은 실제로 수준 높은 심리학적 설명이었습니다.
    • 비유: 다른 방법들이 "비가 올 것입니다"라고 말하는 날씨 앱이라면, RL 방식은 "저기압이 고기압과 충돌하여 저기압을 형성하기 때문에 비가 올 것입니다"라고 말하는 기상 캐스터와 같습니다.
    • AI는 위험 회피(Risk Aversion) (사람들은 손실을 싫어함), 기대값(Expected Value) (확률에 따른 수학적 계산), 확실성 효과(Certainty Effect) (사람들은 확실한 승리를 좋아함)와 같은 실제 심리학 개념들을 사용하기 시작했습니다.

"똑똑함"의 요구 조건

하지만 제약 사항이 있었습니다. 연구진은 이 "코치" 방식을 더 작고 약한 AI 모델에도 적용해 보았습니다.

  • 비유: 복잡한 전략을 유아와 대학생에게 각각 가르친다고 상상해 보세요. 유아(작은 모델)는 코치가 있어도 수학이나 전략을 이해하지 못했습니다. 그저 혼란스러워하며 잘못된 답을 내놓을 뿐이었습니다.
  • 발견: "코치" 방식은 기본 AI가 이미 그 개념들을 이해할 만큼 충분히 똑똑할 때만 작동했습니다. 만약 AI가 애초에 "기대값"이 무엇인지 이해할 만큼 똑똑하지 않다면, 그것을 설명하도록 훈련할 수 없습니다.

"모양 변형" 테스트

AI가 단순히 암기한 문구를 읊는 것이 아님을 증명하기 위해, 연구진은 게임의 규칙을 바꾸었습니다. 실제 인간 데이터 대신, 오직 수학(기대값)만을 따지는 로봇이 생성한 데이터를 AI에게 입력했습니다.

  • 결과: AI는 즉시 자신의 "사고 방식"을 바꿨습니다. 인간의 두려움이나 위험 회피에 대해 말하는 것을 멈추고, 순수하게 수학과 논리에 대해서만 말하기 시작했습니다.
  • 시사점: 이는 AI가 단순히 대본을 복사하는 것이 아니라, 훈련받고 있는 데이터에 맞춰 자신의 추론을 실제로 조정하고 있다는 것을 증축했습니다. AI는 자신이 플레이하고 있는 특정 게임의 규칙을 진정으로 "학습"하고 있었던 것입니다.

요약

이 논문은 똑똑한 AI를 보상 시스템(비디오 게임 점수와 같은)을 사용하여 인간의 행동을 예측하도록 훈련하면, AI가 자연스럽게 인간이 사용하는 심리적 규칙을 사용하여 "생각하며 말하기"를 시작한다는 것을 보여줍니다. 이는 AI를 단순한 예측가에서 우리가 왜 그런 선택을 하는지 설명할 수 있는 모델로 탈바꿈시킵니다. 다만, 이는 AI가 해당 개념을 이해할 수 있을 만큼 이미 충분히 똑똑할 때만 가능합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →