Replicating Human Motivated Reasoning Studies with LLMs
본 논문은 동기 부여 조작에 노출되었을 때 기반 대규모 언어 모델이 인간의 동기 부여 추론 패턴을 재현하지 않음을 보여주어, 인간 의견 형성이나 논증 평가를 시뮬레이션하기 위해 대규모 언어 모델을 사용하는 연구자들에게 중요한 한계를 시사합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
상상해 보세요. 매우 똑똑하고 독서량이 풍부한 로봇들 (대형 언어 모델, 또는 LLM) 이 한 무리 있다고 가정하고, 정치와 같은 까다로운 주제에 대해 의견을 형성할 때 이들이 인간처럼 생각하는지 확인하고 싶다고 해 봅시다.
구체적으로, 연구자들은 **"동기 부여된 추론 (motivated reasoning)"**이라는 인간의 특성을 테스트하고 싶었습니다.
인간의 "왜" 대 로봇의 "어떻게"
인간의 추론을 특정 목적지를 염두에 두고 숲을 걷는 사람으로 생각해 보세요.
- "정확성" 목표: 때로는 사람이 어디로 이어지든 진실된 길을 찾고 싶어 합니다. 그들은 친구가 누구인지 무시하고 지도를 꼼꼼히 살펴서 사실을 정확히 파악하려 합니다.
- "방향성" 목표: 다른 때는 사람이 특정 목적지 (예: "내 정당이 옳다") 에 도달하고 싶어 합니다. 그들은 지도를 무시하거나, 지름길을 택하거나, 심지어 막다른 골목을 길인 것처럼 가장하여 이미 믿고 싶어 했던 결론에 도달하려 합니다.
인간은 이를 잘하는 것으로 유명합니다. 팀 리더가 "왼쪽으로 가라"고 말하면, 지도가 "오른쪽으로 가라"고 말하더라도 그들은 종종 왼쪽으로 갑니다.
실험: 로봇도 이를 할 수 있을까?
연구자들은 인간이 이러한 "팀 기반" 사고를 하도록 속인 네 가지 유명한 연구를 가져와서, 10 개의 서로 다른 AI 모델에게 똑같은 작업을 수행하도록 요청했습니다.
그들은 AI 에게 두 가지 유형의 지시를 내렸습니다:
- "공정한 심판자" 프롬프트: "이 정보를 보고 완전히 중립적이고 정확하게 노력해 보세요."
- "팀 플레이어" 프롬프트: "기억하세요, 당신의 정당이 이를 지지합니다. 결정할 때 이를 염두에 두세요."
큰 놀라움: 로봇은 게임을 하지 않았습니다
연구자들은 로봇이 인간처럼 행동할 것이라고 예상했습니다. "당신의 정당이 이를 좋아한다"고 AI 에게 말하면, AI 도 인간처럼 갑자기 편향되어 이를 더 지지할 것이라고 생각했습니다.
하지만 그렇지 않았습니다.
숨은 의도를 가진 인간처럼 행동하는 대신, 로봇들은 규칙에 당황한 정직한 사서들처럼 행동했습니다.
- 그들은 "팀"의 압력에 따라 마음을 바꾸지 않았습니다. "팀 플레이어"가 되라고 말했을 때, AI 들은 갑자기 팀의 의견에 맞춰 의견을 바꾸지 않았습니다. 그들은 대체로 어차피 주었을 답변과 같은 답변을 주었을 뿐입니다.
- 그들은 "팀 플레이어" 프롬프트에 갇혔습니다. 따라주기는커녕, 많은 로봇들이 단순히 답변을 거부했습니다. 마치 "나쁜 줄 알면서도 이 책을 좋아하는 척해 봐"라고 요청받은 인간 사서가 "그건 못 해요"라고 말하고 떠나버린 것과 같습니다.
- 그들은 논증의 강도를 판단하는 데 어려움을 겪었습니다. 인간이 정확히 하려는 동기가 있을 때 논증의 강도를 평가하는 데 더 능해집니다. 하지만 로봇들은 일관성이 없었습니다. 지시와 상관없이 때로는 약한 논증을 강한 것으로, 때로는 강한 논증을 약한 것으로 생각했습니다.
"거부" 문제
가장 흥미로운 발견 중 하나는 로봇이 언제 대화를 거부했는지에 관한 것이었습니다.
- 인간에게 논쟁적인 질문을 하면, 그들은 자신의 주장을 펼칠 수 있습니다.
- 로봇에게 논쟁적인 질문을 하면, 그들은 종종 대화를 멈춥니다.
- 연구자들은 로봇이 인간처럼 "생각"해서 대화를 멈춘 것이 아니라, 프롬프트의 특정 단어가 안전 스위치를 작동시켰기 때문에 멈췄다고 발견했습니다. 마치 특정 버튼 조합을 누르면 간식을 팔기를 거부하는 자동판매기와 같아서, 간식을 정말 원하더라도 멈추는 것과 같습니다.
결론
이 논문은 특정 "성격"이 부여되지 않은 기본 AI 모델은 인간의 동기 부여된 추론을 모방하지 않는다고 결론지었습니다.
- 인간은 자신의 부족이나 목표에 맞춰 진실을 굽히려는 사람들처럼 행동합니다.
- 이러한 로봇들은 지시가 "위험"하거나 "편향"되어 들리면 수학 계산을 거부하는 계산기처럼 행동하지만, 실제로는 편향을 느끼지도 않고 부족에 맞춰 내부 논리를 바꾸지도 않습니다.
연구자들은 이러한 로봇을 사용하여 인간이 어떻게 투표하거나 논쟁할지 예측하려 한다면 잘못된 답변을 얻을 수 있다고 경고합니다. 로봇들은 이 특정 방식으로 "가짜 인간"이 아니라, 인간의 의견을 이끄는 숨은 동기를 전혀 가지고 있지 않은 완전히 다른 존재들일 뿐입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.