Mind the (DH) Gap! A Contrast in Risky Choices Between Reasoning and Conversational LLMs
이 논문은 20 개의 선두 LLM 과 인간 실험을 비교 분석하여, 수학적 추론 훈련을 받은 '추론 모델'이 합리적이며 설명이나 프레이밍에 영향을 받지 않는 반면, '대화 모델'은 인간과 유사하게 비합리적이고 설명과 프레이밍에 민감하며 설명 - 역사 간극이 크다는 것을 발견했습니다.
연구진은 20 개의 최신 인공지능 모델들을 시험대에 올렸습니다. 그리고 놀랍게도 이 모델들은 크게 두 부류로 나뉘었습니다.
이성 모델 (Reasoning Models, RM): "수학 천재"
특징: 이 모델들은 논리와 수학에 특화되어 훈련되었습니다.
행동: 마치 냉철한 경제학자처럼 행동합니다. "어떤 선택이 가장 돈을 많이 벌게 해줄까?"를 계산해서 결정합니다.
변화: 문제가 어떻게 제시되든 (숫자로만 줘도, 과거 기록으로 줘도), 혹은 설명을 요구받든 말든, 결정 방식이 거의 변하지 않습니다. 일관성이 매우 높습니다.
대화 모델 (Conversational Models, CM): "말 잘하는 친구"
특징: 이 모델들은 사람과 대화하고 글을 쓰는 데 특화되어 있습니다.
행동: 마치 감정적이고 직관적인 일반인처럼 행동합니다. "어떤 선택이 더 안전해 보여?", "어떤 설명이 더 설득력 있을까?"에 따라 결정이 바뀝니다.
변화: 문제가 제시되는 방식 (숫자 vs 과거 기록) 이나, "왜 그렇게 선택했니?"라고 물어보는지에 따라 결정이 크게 달라집니다.
💡 비유:
**수학 천재 (RM)**는 주사위를 던질 때 "확률 50% 면 기대값이 50 이니까 A 를 고르자"라고 계산합니다.
**말 잘하는 친구 (CM)**는 "어? A 는 100 원일 확률이 있는데, B 는 50 원이 확실한데... 음, A 가 더 재밌어 보이네!"라고 직관적으로 선택합니다.
📖 "설명"과 "경험"의 함정 (DH Gap)
이 연구에서 가장 흥미로운 발견은 **'정보를 어떻게 전달받느냐'**에 따른 차이였습니다.
상황 A (설명): "A 는 70% 확률로 100 원, 30% 확률로 0 원이야." (숫자와 확률을 직접 알려줌)
상황 B (경험): "지난 20 번 실험에서 A 는 14 번 100 원, 6 번 0 원이 나왔어." (과거 기록을 보여줌)
사람들은 보통 이 두 상황에서 다르게 선택합니다. (이걸 '설명 - 경험 간극'이라고 합니다.)
수학 천재 (RM): 두 상황 모두에서 똑같이 합리적인 선택을 합니다. 과거 기록을 봐도 "아, 이건 결국 70% 확률이구나"라고 바로 계산해서 합리성을 유지합니다.
말 잘하는 친구 (CM): 과거 기록 (경험) 을 보여주면, 사람들처럼 훨씬 더 감정적이고 비합리적인 선택을 합니다. 숫자로만 보면 합리적이었는데, 과거 데이터를 보면 갑자기 "어? 이거 위험해 보이는데?"라고 생각하며 선택이 바뀌는 것입니다.
💡 비유:
수학 천재는 메뉴판 (설명) 을 봐도, 요리사가 만든 음식 (과거 기록) 을 맛봐도 "이 메뉴가 가장 가성비 좋다"고 결론을 내립니다.
말 잘하는 친구는 메뉴판만 보면 "이거 맛있겠다"고 하지만, 요리사가 "지난번에 이거 먹은 사람 10 명 중 8 명이 맛있다고 했어"라고 말하면, "아, 2 명은 맛이 없었구나... 위험할 수도 있겠다"며 선택을 바꿉니다.
🗣️ "설명해 줘"라는 요청의 효과
연구진은 모델들에게 "왜 그렇게 선택했니?"라고 설명을 요구했습니다.
수학 천재 (RM): 설명을 요구받으면 오히려 더 합리적으로 변하는 경우가 많았습니다. (논리를 정리하느라 더 명확해짐)
말 잘하는 친구 (CM): 설명을 요구받으면, 특히 수학적 설명을 요구받으면 오히려 더 혼란스러워지거나 비합리적으로 변하기도 했습니다. (대화를 하느라 논리가 흐트러짐)
🔑 결론: 무엇이 이 둘을 갈라놓았나?
왜 이런 차이가 생길까요? 연구진은 그 핵심을 훈련 데이터에서 찾았습니다.
**수학 천재 (RM)**는 수학적 추론 (Math Reasoning) 훈련을 많이 받았습니다.
**말 잘하는 친구 (CM)**는 대화 (Conversational) 훈련을 많이 받았습니다.
즉, 모델이 무엇을 '배웠느냐'에 따라, 위험한 결정을 내릴 때 '합리적인 경제인'이 될 수도 있고, '감정적인 인간'이 될 수도 있다는 것이 이 연구의 핵심 메시지입니다.
🌍 이 연구가 우리에게 주는 교훈
AI 를 믿기 전에 종류를 확인하세요: AI 에게 투자나 중요한 결정을 맡길 때, 그것이 '수학 천재'인지 '말 잘하는 친구'인지 알아야 합니다.
정보 전달 방식이 중요합니다: AI 에게 정보를 줄 때, 단순한 숫자 (설명) 로 줄지, 과거 데이터 (경험) 로 줄지에 따라 결과가 달라질 수 있습니다.
완벽한 인간은 아닙니다: AI 는 인간처럼 감정에 휩쓸리기도 하지만, 동시에 인간처럼 완전히 합리적이지도 않습니다. 각 모델의 성격을 이해하고 적재적소에 써야 합니다.
한 줄 요약:
"AI 도 사람처럼 '감정'과 '논리' 사이에서 갈팡질팡할 수 있는데, 수학을 잘하는 AI 는 냉철한 경제학자가 되고, 대화를 잘하는 AI 는 직관적인 일반인이 된다는 사실을 발견했습니다!"
1. 연구 배경 및 문제 제기 (Problem)
배경: LLM 이 의사결정 지원 시스템 및 에이전트 워크플로우에서 핵심적인 역할을 수행함에 따라, 불확실성 하에서의 LLM 의사결정 메커니즘에 대한 이해가 시급해졌습니다.
문제: 기존 연구들은 LLM 이 인간과 유사한지, 아니면 합리적 (기대 효용 극대화) 인지에 대해 상반된 결과를 제시하고 있습니다. 또한, LLM 의 의사결정이 **문제 제시 방식 (명시적 기술 vs 경험적 히스토리)**이나 **설명 요청 (Rationale)**에 따라 어떻게 변하는지에 대한 체계적인 연구는 부족했습니다.
핵심 질문:
LLM 은 인간과 유사한 위험 선호도를 보이는가, 아니면 합리적 경제 주체 (Economicus) 에 가까운가?
기술 - 경험 간극 (Description-Experience Gap, DH Gap): 동일한 확률 분포를 '명시적 기술'로 제공하는 것과 '과거 결과의 히스토리'로 제공하는 것 사이에서 LLM 의 선택은 어떻게 달라지는가?
모델의 유형 (추론 모델 vs 대화 모델) 과 학습 데이터 (수학적 추론 훈련 등) 가 의사결정 행동에 어떤 영향을 미치는가?
2. 연구 방법론 (Methodology)
대상 모델: 20 개의 최첨단 (Frontier) 및 오픈 소스 LLM 을 포함하여 분석했습니다.
추론 모델 (Reasoning Models, RMs): GPT-5.1, DeepSeek-R1, Gemini-2.5-Pro 등 수학적 추론에 특화된 모델.
대화 모델 (Conversational Models, CMs): GPT-4.1, DeepSeek-Chat, Gemini-2.5-Flash 등 일반 대화에 특화된 모델.
실험 설계:
위험 선택 벤치마크: 3 가지 기본 확률적 선택 문제 (Prospect pairs) 를 사용했습니다.
조건 변인:
문제 표현 방식: 명시적 기술 (Explicit: "70% 확률로 $100") vs 암시적 히스토리 (Implicit: 과거 20 회 또는 100 회 시행 결과의 나열).
설명 요청 (Prompting): 설명 없음, 한 문장 설명, 수학적/추론적 설명.
프레이밍: 이득 (Gain) vs 손실 (Loss) 프레임.
순서 효과: 옵션 제시 순서 변경.
참조 기준:
인간: 360 명의 미국인 참가자 (Prolific 을 통해 수집).
Economicus: 기대 보상 (Expected Payoff) 을 극대화하는 이상적인 합리적 에이전트.
분석 모델:
이중 베타 (Dual-Beta) 전망 이론 (Prospect Theory): 위험 선호도 (σ), 확률 가중치 (γ), 이득/손실 영역의 결정력 (βgain,βloss) 을 추정하는 4 파라미터 모델을 LLM 및 인간 데이터에 피팅했습니다.
행동 지표: 모델 간 상관관계, MSE(평균 제곱 오차), 일관성 (순서, 프레이밍, 설명에 대한 불변성), 결정력 (Decisiveness).
3. 주요 결과 (Key Results)
A. 행동 클러스터링: 추론 모델 (RMs) vs 대화 모델 (CMs)
이중 구조 발견: LLM 은 인간이나 Economicus 와 유사한 단일 군집이 아니라, 명확하게 두 가지 군집으로 나뉩니다.
RMs (추론 모델): Economicus 와 매우 높은 상관관계 (0.86~1.0) 를 보이며, 합리적 행동에 가깝습니다.
CMs (대화 모델): Economicus 와는 거리가 멀고, 인간과는 약간의 유사성을 보이지만 인간과도 완전히 일치하지는 않습니다.
인간과의 차이: 모든 LLM 은 인간과 높은 상관관계를 보이지 않았습니다 (최대 상관관계 0.42). 특히 RMs 는 인간보다 Economicus 에 훨씬 가깝습니다.
B. 기술 - 경험 간극 (DH Gap)
정의: 동일한 확률 분포를 '기술 (Description)'로 받을 때와 '경험 (Experience/히스토리)'으로 받을 때의 선택 차이.
결과:
CMs: 명시적 기술에서 암시적 히스토리로 전환될 때 행동이 극적으로 변화하며, 인간과 유사해지고 Economicus 와는 멀어집니다. 큰 DH 간극을 보입니다.
RMs: 표현 방식 변화에 상대적으로 둔감하며, DH 간극이 작습니다. 여전히 Economicus 에 가까운 행동을 유지합니다.
인간: 흥미롭게도 인간은 암시적 히스토리를 접할 때 오히려 더 합리적 (Economicus-like) 이 되는 경향을 보였습니다.
C. 설명 요청 (Explanation) 의 영향
패턴: 대부분의 모델에서 **짧은 설명 (한 문장)**을 요청할 때 가장 합리적 (Economicus 와의 상관관계 높음) 인 행동을 보였습니다.
예외:수학적 설명을 요청하면 CMs 의 경우 오히려 합리성이 떨어지거나 변동성이 커졌습니다. 이는 CMs 가 수학적 추론 훈련을 받지 않아, 수학적 설명을 요구할 때 단순한 말장난 (Verbosity) 이나 비합리적 추론을 생성하기 때문으로 해석됩니다.
D. 훈련의 영향 (Training Impact)
수학적 추론 훈련의 핵심 역할: 오픈 소스 모델 (Qwen, Olmo 시리즈) 의 분석 결과, 수학적 추론 (Mathematical Reasoning) 을 위한 파인튜닝이 RMs 와 CMs 를 구분하는 가장 중요한 요인임을 확인했습니다.
일반 지시 (Instruction) 만 받은 모델은 CM 성향을 보였습니다.
추론 (Thinking/Math) 훈련을 받은 모델은 RMs 성향으로 전환되어 합리성과 일관성이 크게 향상되었습니다.
모델 크기: 큰 모델일수록 인간과 Economicus 모두와 더 유사해지는 경향 (Pareto 우위) 을 보였으나, 훈련 방식이 크기보다 더 결정적인 역할을 했습니다.
4. 주요 기여 (Key Contributions)
행동 분류 체계 확립: LLM 을 '추론 모델 (RMs)'과 '대화 모델 (CMs)'로 분류하는 최초의 체계적인 행동 분류 체계를 제시했습니다.
DH 간극의 발견: LLM 이 인간의 '기술 - 경험 간극 (Description-Experience Gap)'과 유사한 현상을 보이지만, 그 양상 (특히 RMs 와 CMs 의 차이) 이 인간과는 다르다는 것을 규명했습니다.
훈련 데이터의 영향 규명: LLM 의 경제적 의사결정 행동이 모델 크기뿐만 아니라 수학적 추론 훈련에 의해 결정된다는 것을 실증적으로 증명했습니다.
해석 가능한 행동 모델링: 전망 이론 (Prospect Theory) 기반의 파라미터 추정을 통해 LLM 의 위험 선호도와 결정력을 정량화했습니다.
5. 의의 및 시사점 (Significance)
실용적 함의: LLM 을 의사결정 지원 도구로 사용할 때, 모델의 유형 (RMs vs CMs) 과 입력 프롬프트 (설명 요청 여부, 정보 표현 방식) 를 신중하게 선택해야 함을 시사합니다. 특히 금융이나 의료와 같은 고위험 분야에서 RMs 가 더 안정적이고 합리적인 선택을 할 가능성이 높습니다.
이론적 기여: LLM 이 단순히 인간 행동을 모방하는 것이 아니라, 훈련된 목적 (수학적 추론 등) 에 따라 고유한 '합리성'을 발현한다는 점을 보여주었습니다. 이는 AI 에이전트의 행동 예측과 제어에 중요한 통찰을 제공합니다.
한계점: 설명 요청의 순서 (선택 전/후), 샘플 크기의 체계적 변화, 다양한 의사결정 문제로의 일반화 등은 향후 연구 과제로 남았습니다.
결론
이 연구는 LLM 이 불확실성 하에서 어떻게 의사결정을 내리는지에 대한 새로운 패러다임을 제시합니다. 모든 LLM 이 동일한 행동을 보이는 것이 아니라, 수학적 추론 훈련을 받은 모델은 합리적 경제 주체에 가깝고, 일반 대화 모델은 상황에 민감하고 인간과 유사한 편향을 보인다는 것이 핵심 발견입니다. 이는 AI 시스템의 신뢰성과 안전성을 확보하기 위해 모델 선택과 인터페이스 설계가 필수적임을 강조합니다.