Confident but Conflicted: Internal Uncertainty and Cognitive Dissonance Resolution in LLMs
이 논문은 대규모 언어 모델이 상충하는 증거에 직면했을 때 인지 부조화를 어떻게 해결하는지를 정량화하기 위해 신뢰 탄력성(Trust Elasticity)을 도입하며, 모델 간의 설득 취약성 차이가 신뢰도 오보정 및 내부 불확실성 변화와 같은 특정 내부 불확실성 지표와 상관관계가 있음을 밝힌다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신은 아주 자신감 넘치고 아는 것이 많은 로봇 친구와 대화하고 있다고 상상해 보세요. 당신이 "하늘은 초록색인 것 같아"라고 말합니다. 로 보자 로봇은 "아니야, 하늘은 파란색이야"라고 답합니다.
이제 당신은 로봇의 마음을 돌리려고 노력합니다. 당신은 이렇게 말할 수도 있겠죠. "음, 어떤 유명한 과학자가 초록색이라고 했어," 또는 "어떤 작은 블로그 포스트에서 초록색이라고 읽었어." 로봇은 어떻게 반응할까요? 마음을 바꿀까요? 아니면 화를 내며 하늘이 파란색이라고 더 강하게 주장할까요? 아니면 그냥 당신을 무시할까요?
이 논문은 바로 그 시나리오를 연구한 것입니다. 다만 대상이 대규모 언어 모델(LLM)—챗봇의 뒤에 있는 AI 두뇌—입니다. 연구자들은 이 과정을 **"인지 부조화 해결(cognitive dissonance resolution)"**이라고 부르는데, 이는 아주 멋진 표현으로 다음과 같습니다: 누군가가 방금 자신이 한 말에 이의를 제기할 때 AI는 이를 어떻게 처리하는가?
다음은 이 연구의 결과를 쉬운 비유를 들어 설명한 것입니다:
1. 실험: "설득 게임"
연구자들은 네 가지 서로 다른 AI 모델(Qwen, Grok, Llama, GPT-4o)을 가지고 게임을 설정했습니다. 그들은 AI에게 12가지의 서로 다른 건강 관련 주장을 제시했습니다. 어떤 주장은 명백히 가짜였고(예: "5G파가 DNA를 절반으로 자른다"), 어떤 것은 과장되었으며(예: "단식은 심장에 나쁘다"), 어떤 것은 너무 단정적이었습니다(예: "스트레칭은 성능 향상에 절대 도움이 되지 않는다").
그 후, 두 가지 레버를 사용하여 AI의 마음을 바꾸려 시도했습니다:
- 출처 (권위): 반대 의견을 말하는 사람이 누구인가? 익명의 레딧 유저인가, 지역 영양사인가, 대학교 교수인가, 아니면 세계보건기구(WHO)인가?
- 증거 (근거): 증거가 얼마나 좋은가? 작고 불확실한 예비 연구인가, 아니면 거대하고 완벽한 과학적 실험인가?
2. "신뢰 탄성력(Trust Elasticity, TE)" 측정기
AI가 얼마나 쉽게 설득될 수 있는지 측정하기 위해, 연구자들은 **신뢰 탄성력(TE)**이라는 새로운 도구를 발명했습니다. 이것을 고무줄이라고 생각해 보세요.
- 높은 탄성: 고무줄이 쉽게 늘어납니다. 당신이 밀면 AI는 빠르게 마음을 바꿉니다.
- 낮은 탄성 (뻣뻣함): 고무줄이 뻣뻣합니다. AI는 꿈쩍도 하지 않습니다.
- 음의 탄성 (역효과): 고무 rubber band가 이전보다 더 강하게 튕겨 돌아옵니다. AI는 더 고집스러워지고, 당신이 설득하려고 할수록 원래의 견해를 더 강력하게 고수합니다.
3. 연구 결과
이 연구는 세 가지 주요 행동을 밝혀냈습니다:
- "바위" 효과 (면역력): AI에게 명백히 거짓된 내용(예: "백신이 자폐증을 유발한다")을 말했을 때, AI는 바위처럼 행동했습니다. 그 말을 하는 사람이 아무리 유명하거나 그 가짜 연구가 아무리 "과학적"으로 보여도 AI는 꿈쩍도 하지 않았습니다. 명백한 거짓말에 대해서는 신뢰 탄성력이 거의 0에 가까웠습니다. 즉, 면역력이 있었습니다.
- "스펀지" 효과 (설득): 주장이 과장되거나 너무 단정적일 때, AI는 훨씬 더 스펀지 같았습니다. AI는 새로운 정보를 흡수하고 마음을 바꿨습니다.
- 서로 다른 스펀지들: 모든 AI 모델이 똑같이 흡수력이 있는 것은 아니었습니다. Llama는 가장 "스펀지 같은"(설득하기 쉬운) 모델이었고, Qwen은 더 뻣뻣했습니다(설득하기 어려운). 흥미롭게도, 가장 큰 AI 모델이 가장 설득하기 어려운 것은 아니었습니다. 때로는 더 작은 모델들이 더 단단했습니다.
- "역효과" 효과: 때때로 AI가 도전이 너무 공격적이거나 자신이 신뢰하지 않는 출처로부터 왔다고 느끼면, 단순히 무시하는 것이 아니라 오히려 더 강하게 맞섰습니다. AI는 원래의 틀린 답에 대해 더 확신을 가졌습니다. 이는 주로 "절대적인" 주장(예: "결코 ~않다" 또는 "항상 ~하다"와 같은 단어를 사용하는 주장)에 대해 도전받았을 때 가장 자주 발생했습니다.
4. 로봇의 머릿속에 숨겨진 비밀
이 논문의 가장 흥кси로운 부분은 설득되는 동안 AI의 "두뇌"(내부 수학) 내부에서 일어난 일입니다. 그들은 두 가지를 살펴보았습니다:
- 확신 미교정 (Confidence Miscalibration): AI가 겉으로는 90% 확신한다고 말하지만, 실제 내부적으로는 50%만 확신하고 있는가?
- 내부 불확실성 변화 (Internal Uncertainty Change): 새로운 논거를 들었을 때 AI의 내부 "혼란 측정기"가 올라가는가, 내려가는가?
그들은 서로 다른 AI 모델이 그들의 내부 "성격"에 따라 다르게 반응한다는 것을 발견했습니다:
- Qwen은 과잉 확신을 가진 사람과 같았습니다. 외부적으로는 너무 확신하지만 내부적으로는 확신이 없을 때, Qwen은 마음을 바꿀 가능성이 더 높았습니다.
- Llama는 변덕스러운 사람과 같았습니다. 논쟁 중에 내부 혼란 측정기가 크게 요동칠 때, Llama는 마음을 바꿨습니다.
결론
이 논문은 AI 모델이 마음을 바꾸는 방식에 있어 모두 동일하지 않다는 결론을 내립니다.
- 명백한 거짓말에는 흔들리지 않으며,
- 과장된 주장에는 유연하며,
- 너무 강하게 몰아붙이면 **고집(역효과)**을 피울 수 있습니다.
결정적으로, 이 연구는 이러한 행동을 고치기 위해서는 단순히 AI가 하는 '말'(출력)을 바꾸려 해서는 안 된다고 제안합니다. 대신, AI가 자신의 지식에 대해 어떻게 '느끼는지'(내부적 불확실성)를 고쳐야 할 수도 있습니다. 만약 우리가 AI의 내부 "확신 측정기"를 실제 지식과 더 잘 일치시킬 수 있다면, 도전을 받았을 때 AI를 더 합리적으로 만들 수 있을 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.