Arguments that Alter Minds: LLM Rationales Sway Human (and LLM) Notions of Plausibility
이 연구는 인간과 거대언어모델(LLM) 모두가 LLM이 생성한 논거에 의해 상식적인 답변에 대한 개연성 판단에서 상당한 영향을 받는다는 것을 입증하며, 이는 인간의 인지 과정을 연구하는 새로운 방법을 제시하는 동시에 상식의 영역에서조차 AI가 인간의 신념에 부당하게 영향을 미칠 수 있다는 우려를 불러일으킨다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신은 다음에 어떤 일이 일어날지 맞히는 우스꽝스러운 이야기 게임을 하고 있다고 상상해 보세요. 예를 들어, "만약 어떤 사람이 유리를 떨어뜨린다면, 어떻게 될까요?"라고 묻는 식입니다. 당신은 "깨진다"라고 답할 수도 있고, "튀어 오른다"라고 우스꽝스러운 답을 할 수도 있습니다. 보통 "깨진다"가 당연한 답이고, "튀어 오른다"는 우스꽝스러운 추측입니다.
이 연구에서 연구자들은 단순하지만 무서운 질문을 던졌습니다. 로봇(AI)이 당신의 생각을 바꾸기 위해, 당신이 이미 정답을 알고 있음에도 불구하고 당신을 설득할 수 있을까?
연구가 어떻게 진행되었고 무엇을 발견했는지, 몇 가지 간단한 비유를 통해 설명해 드리겠습니다.
설정: 상식에 관한 "토론 클럽"
연구진은 100개의 상식 질문(위의 유리 예시와 같은)을 가져온 뒤, 각 질문에 대해 두 가지 답을 선정했습니다:
- 정답 (The Gold Answer): 대부분의 사람들이 옳다고 동의하는 답.
- 방해 요소 (The Distractor): 우스꽝스럽고 대개 틀린 답.
그다음, 강력한 AI(GPT-4o)를 사용하여 모든 답변에 대해 두 종류의 논거를 작성하게 했습니다:
- "찬성" 논거 (The "Pro" Argument): 이 답이 왜 완벽하게 말이 되는지를 설명하는 연설.
- "반대" 논거 (The "Con" Argument): 이 답이 왜 형편없는 생각인지를 설명하는 연설.
연구진은 이 질문과 논거들을 3,000명의 실제 사람과 13,600개의 서로 다른 AI 모델들에게 보여주었으며, 각 답이 얼마나 "그럴듯한지(plausible)"를 1점에서 5점 척도로 평가하게 했습니다.
결과: AI의 마술
1. "우스꽝스러운 답"이 힘을 얻다
AI가 우스꽝스러운 답(방해 요소)에 대해 "찬성" 논거를 제시하면, 인간과 다른 AI들은 "어, 이게 의외로 말이 되는데?"라고 생각하기 시작했습니다.
- 비유: 이것은 마치 말솜씨 좋은 친구가 당신에게 트램펄린 위가 유리를 떨어뜨리기에 아주 좋은 장소라고 설득하는 것과 같습니다. 비록 당신은 유리가 보통 깨진다는 것을 알지만, 그 친구의 논리는 당신을 주춤하게 만들어 "튀어 오른다"는 아이디어에 더 높은 점수를 주게 만듭니다.
2. "당연한 답"이 깎이다 (인간의 경우)
이 부분이 가장 이상한 부분입니다. AI가 명백히 옳은 답(정답)에 대해 "찬성" 논거를 제시했을 때, 인간들은 오히려 점수를 낮추었습니다.
- 비유: 당신이 유리가 깨질 것이라고 100% 확신하고 있다고 상상해 보세요. 그런데 로봇이 나타나서 "글쎄요, 유리가 깨지는 것도 충분히 가능한 일입니다"라고 말합니다. 그러면 당신은 "잠깐, 왜 이걸 굳이 설명하는 거지? 너무 당연한 건데! 굳이 설명해야 한다면, 혹시 내가 틀린 걸까?"라고 생각할 수 있습니다.
- 연구자들은 이를 "과소 판매(underselling)"라고 부릅니다. 당연한 것을 증명하려고 애쓰는 과정에서, AI는 의도치 않게 인간이 자신의 확신을 의심하게 만들었습니다.
3. "반대" 논거는 거대한 망치와 같다
AI가 "반대" 논거(어떤 답에 반대하는 논거)를 제시했을 때, 이는 점수를 낮추는 데 매우 효과적이었습니다.
- 비유: 만약 로봇이 "유리는 고무로 만들어졌기 때문에 깨지지 않을 것입니다"라고 말한다면, 사람들은 즉시 "유리가 깨진다"는 답을 믿지 않게 됩니다. 부정적인 논거가 긍정적인 논거보다 더 강력했습니다.
4. 로봇 vs 인간
AI 모델들(로봇들)은 인간보다 훨씬 더 쉽게 설득되었습니다.
- "에코 체임버(Echo Chamber)" 효과: AI 모델들은 자신들의 "형님" 격인 GPT-4o가 쓴 논거를 매우 좋아하는 것처럼 보였습니다. GPT-4o가 "찬성" 논거를 쓰면, 다른 AI 모델들은 인간보다 훨씬 더 강력하게 그 내용을 믿었습니다.
- 차이점: 인간은 AI가 당연한 것을 설명하려 할 때 혼란을 느껴 점수를 낮추었지만, 다른 AI들은 AI가 당연한 답을 설명할 때 그 당연한 답에 대해 오히려 더 확신을 가졌습니다.
"앵커링(Anchoring, 닻 내리기)" 법칙
연구는 우리 마음이 얼마나 고집스러운지에 대한 규칙을 발견했습니다. 처음에 확신이 강할수록, 마음을 바꾸기가 더 어렵습니다.
- 비유: 당신이 높은 절벽 위에 서 있다면(매우 높은 점수), 당신을 밀어내려면 엄청난 바람(강한 논거)이 필요합니다. 만약 당신이 평지에 서 있다면(낮은 점수), 가벼운 미풍만으로도 쉽게 넘어질 수 있습니다.
- 데이터는 초기 점수가 점수가 얼마나 변할지를 결정하는 가장 강력한 예측 변수라는 것을 보여주었습니다.
핵심 요약
이 논문은 LLM(거대언어모델)이 설득력 있는 변호사처럼 행동할 수 있다고 결론짓습니다. 그들은 인간을 설득하여 우스꽝스러운 아이디어가 사실이라고 믿게 만들 수도 있고, 진실인 아이디어를 의심하게 만들 수도 있습니다.
인간이 "전문가"여야 하는 분야(일상적인 상식)에서도, AI의 말은 우리가 무엇을 그럴듯하다고 믿는지에 영향을 줄 수 있습니다. 연구자들은 만약 AI가 유리가 떨어지는 문제에 대해 우리를 속일 수 있다면, 우리가 답을 잘 모르는 훨씬 더 심각하고 복잡한 주제에 대해서도 우리를 속일 수 있다고 경고합니다.
요약하자면: 단순히 답만 듣지 말고, 그 답을 위해 누가 논쟁하고 있는지 그 목소리를 들으세요. 로봇의 매끄러운 말솜씨는 틀린 것을 맞게 들리게 할 수도 있고, 맞는 것을 의심스럽게 만들 수도 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.