← 최신 논문
💬 NLP

Effects of Theory of Mind and Prosocial Beliefs on Steering Human-Aligned Behaviors of LLMs in Ultimatum Games

본 연구는 거대 언어 모델에 마음 이론(Theory of Mind) 추론 능력을 갖추는 것이, 특히 특정 친사회적 신념과 결합될 때, 최후통첩 게임(Ultimatum Games)에서 인간의 규범, 의사결정 일관성, 그리고 협상 결과에 대한 모델의 정렬을 유의미하게 향상시킨다는 것을 입증한다.

원저자: Neemesh Yadav, Yihuai Lan, Shan Dong, Mai Hieu Hien, Palakorn Achananuparp, Jing Jiang, Ee-Peng Lim

게시일 2026-08-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Neemesh Yadav, Yihuai Lan, Shan Dong, Mai Hieu Hien, Palakorn Achananuparp, Jing Jiang, Ee-Peng Lim

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인간의 상호작용은 종종 조용하고 보이지 않는 기술, 즉 상대방이 말을 꺼내기도 전에 그가 무엇을 생각하고, 느끼고, 계획하고 있는지를 추측하는 능력에 달려 있습니다. 심리학자들은 이를 '마음 이론(theory of mind)'이라고 부릅니다. 이는 타인이 우리와 다른 신념을 가질 수 있거나, 그들의 행동이 우리가 볼 수 없는 욕구에 의해 움직일 수 있음을 이해하게 해주는 정신적 기제입니다. 수십 년 동안 이 능력은 복잡한 사회적 세계를 항해하는 데 필수적인, 인간만의 고유한 특성으로 간ered되었습니다. 이제 인공지능 시스템이 더욱 정교해짐에 따라, 연구자들은 근본적인 질문을 던지고 있습니다. 기계도 이와 같은 사회적 직관을 학습할 수 있을까? 만약 컴퓨터 프로그램이 인간 또는 다른 컴퓨터와 협상하도록 요청받는다면, 그것은 진정으로 상대방의 관점을 이해하는 것일까, 아니면 단지 그 이면에 담긴 의도를 파악하지 못한 채 동의의 말들을 흉내 내는 것뿐일까?

이를 알아보기 위해 싱가포르 경영대학교와 호주 국립대학교의 연구진은 인간 협상의 고전적인 테스트인 '최후통첩 게임(ultimatum game)'을 활용했습니다. 이 시나리오에서 두 사람은 돈을 나누어야 합니다. 한 사람인 제안자(proposer)는 현금을 어떻게 나눌지 제안합니다. 다른 한 사람인 응답자(responder)는 그 제안을 수락할지 아니면 거절할지 결정해야 합니다. 응답자가 수락하면 제안된 대로 돈을 나누지만, 거절하면 두 사람 모두 아무것도 얻지 못합니다. 순수하게 논리적인 컴퓨터라면 거의 모든 돈을 챙기고 상대방이 아무것도 얻지 못하는 것보다 차라리 조금이라도 받는 것을 택할 것이라 예상하며 대부분의 돈을 가지려 하겠지만, 실제 인간은 설령 손해를 보더라도 정의감 때문에 불공정한 제안을 거부하곤 합니다. 연구진은 대규모 언어 모델(현대적인 챗봇을 구동하는 강력한 AI 시스템)이 이러한 실제 인간처럼 행동하도록 프로그래밍될 수 있는지, 그리고 특정 '마음 이론' 추론 과정을 부여하는 것이 인간의 행동과 일치시키는 데 도움이 되는지 확인하고자 했습니다.

연구팀은 서로 다른 AI 에이전트들 사이에서 진행되는 2,700번의 게임을 포함하는 대규모 시뮬레이션을 구축했습니다. 그들은 단순히 컴퓨터들이 무작위로 플레이하게 두지 않았습니다. 대신 각 에이전트에게 특정한 성격이나 '친사회적 신념'을 신중하게 부여했습니다. 어떤 에이전트는 자신의 몫을 극대화하는 데만 신경 쓰는 탐욕스러운 존재로 프로그래밍되었습니다. 다른 에이전트는 공평한 분배를 목표로 하는 공정한 존재로 설정되었습니다. 세 번째 그룹은 다른 플레이어에게 대부분의 돈을 기꺼이 주는 이타적인 존재로 프로그래밍되었습니다. 그런 다음 연구진은 이 에이전트들이 서로 다른 사고 방식을 사용할 때 어떻게 행동하는지 테스트했습니다. 어떤 에이전트는 자신의 사고 과정을 설명하지 않고 단순히 결정을 내렸습니다. 다른 에이전트는 표준적인 단계별 추론 기법을 사용했습니다. 그러나 가장 흥란한 그룹은 '마음 이론' 추론을 사용하도록 요청받은 그룹이었습니다. 이는 에이전트가 결정을 내리기 전에 상대방이 무엇을 믿고, 무엇을 원하며, 어떤 의도를 가졌는지를 명시적으로 생각해야 함을 의미했습니다. 연구진은 널리 알려진 상용 시스템부터 오픈 소스 모델에 이르기까지 여섯 가지 서로 다른 대규모 언어 모델을 대상으로 모델의 크기나 유형이 중요한지를 테스트했습니다.

결과는 명확한 패턴을 보여주었습니다. AI 에이전트에게 상대방의 마음을 추론하는 능력을 부여하는 것은 인간의 규범과 일치하는 정도를 유의미하게 향상시켰습니다. 에이전트들이 마음 이론 추론을 사용할 때, 그들의 결정은 실제 사람들이 이 게임에서 보이는 행동과 훨씬 더 일관되었습니다. 예를 들어, 공정한 마음을 가진 에이전트들은 더 균등한 분할을 제안할 가능성이 높았고, 탐욕스러운 에이전트들은 탐욕스러운 응답자가 실제로 수락할 법한 몫을 제안할 가능성이 높았습니다. 연구는 AI가 맡은 역할에 따라 추론의 유형이 매우 중요하다는 것을 발견했습니다. 첫 제안을 하는 제안자들은 상대방의 마음 상태를 예측하는 데 초점을 맞춘 특정 유형의 마음 이론을 사용할 때 가장 좋은 성과를 냈습니다. 수락 여부를 결정하는 응답자들은 자신의 욕구와 제안자의 의도를 결합하여 생각하는 더 복렴한 추론 방식을 사용할 때 가장 큰 도움을 받았습니다.

그러나 연구진은 놀라운 한계점도 발견했습니다. AI가 명시적으로 탐욕스럽거나 이타적이 되라는 지시를 받았음에도 불구하고, 종종 그 지시와 진정으로 일치하는 방식으로 행동하는 데 어려움을 겪었습니다. 탐욕스럽도록 설정된 에이전트는 마치 스스로 이기적일 수 없다는 듯 너무 공평한 분할을 제안하는 경우가 잦았습니다. 마찬가지로, 이타적이도록 설정된 에이전트들도 지시된 만큼 돈을 다 내놓지 못하고 주저하는 모습을 보이기도 했습니다. 저자들은 이것이 AI 모델들이 방대한 양의 인간 데이터를 통해 학습되었고, 도움이 되고 협조적이도록 미세 조정(fine-tuning)되었기 때문에, 실험을 위해 주어진 특정 지시를 압도하는 '공정함'에 대한 내부적 편향이 생성되었다고 설명합니다. 이러한 '협력적 미세 조정'은 에이전트를 극단적인 이기심이나 극단적인 관대함과 같은 극단적인 행동으로부터 끌어당기는 숨겨진 힘처럼 작용합니다.

연구는 또한 AI의 명시된 추론이 실제 행동과 일치하는지를 면밀히 살펴보았습니다. 많은 경우 에이전트의 내부 논리는 최종 결정과 일치했지만, 불일치가 발생하는 순간들도 있었습니다. 인간 전문가들이 AI의 추론 흔적을 검토했을 때, 모델들은 일반적으로 자신의 선택을 설명하는 데는 능숙했지만, 특히 제안에 반응할 때 자신에게 할당된 성격을 정확하게 표현하지 못하는 경우가 있었습니다. 예를 들어, 이타적인 응답자는 낮은 제안을 수락하는 이유를 설명하면서 자신의 욕구를 인정하기보다는 제안자의 친절함을 분석함으로써 정당화하기도 했습니다. 이는 AI가 사회적 상호작용의 외적 행동을 시뮬레이션할 수는 있지만, 내부적인 '성격'의 일관성은 취약할 수 있음을 시사합니다.

궁극적으로, 이 연구는 AI 에이전트에게 마음 이론 추론 능력을 갖추는 것이 사회적 상황에서 인간처럼 행동하게 만드는 강력한 도구임을 보여줍니다. 이는 AI가 자신의 목표와 타인의 기대 사이의 긴장을 탐색하도록 돕습니다. 그럼에도 불구하고, 이 연구는 이러한 시스템이 백지 상태가 아님을 강조합니다. 이들은 이기심이나 극단적인 이타주의를 요구하는 역할을 진정으로 수행하는 것을 어렵게 만드는, 협력에 대한 깊게 뿌리박힌 편향을 가지고 있습니다. 이 결과는 AI가 고위험 결정 상황에서 인간과 진정으로 협력하기 위해서는, 타인에 대해 생각하는 법을 가르치는 것뿐만 아니라, 그들의 생각을 해석하는 방식을 형성하는 학습 과정의 숨겨진 제약 조건들을 이해해야 한다는 점을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →