Triadic Werewolf: A Jester Role for Multi-Hop Theory of Mind in LLMs
이 논문은 역전된 인센티브를 가진 조커(Jester) 진영을 특징으로 하는 멀티 홉 마음 이론(Theory-of-Mind) 벤치마크인 "트라이아딕 웨어울프(Triadic Werewolf)" 게임을 소개하며, 이를 통해 현재의 거대 언어 모델들이 자기 학습 메커니즘에도 불구하고 진정한 의심과 의도적인 기만을 구분하는 데 실패하며 복잡한 삼자 전략적 추론에서 어떻게 어려움을 겪는지 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
핵심 아이디어: "두 팀"의 습관 깨기
당신이 마피아 게임(또는 웨어울프)을 하고 있다고 상상해 보세요. 보통은 두 팀이 있습니다: 시민(착한 편)과 웨어울프(나쁜 편). 시민들은 누가 웨어울프인지 찾아내려 노력하고, 웨어울프는 정체를 숨기려 합니다.
이 설정에서 누군가 이상하거나 수상하게 행동하면, 시민들은 보통 그 사람을 투표로 탈락시킵니다. 이는 아주 단순한 규칙입니다: 수상함 = 나쁨.
이 논문의 연구자들은 한 가지 질문을 던졌습니다: AI 모델(LLM)은 정말로 다른 플레이어가 무엇을 생각하는지 '생각'하고 있는 것일까, 아니면 단순히 단순한 규칙을 따르고 있는 것일까?
이를 알아내기 위해, 그들은 이 게임에 세 번째의 까다로운 캐릭터를 추가했습니다: 바로 **조커(Jester)**입니다.
새로운 캐릭터: 조커
조커는 매우 기묘한 목표를 가진 역할입니다: 조커는 오직 시민들이 자신을 투표로 탈락시켰을 때만 승리합니다.
조커를 '해고당하고 싶어 하는 수상한 배우'라고 생각해 보세요.
- 시민들은 웨어울프를 해고하고 싶어 합니다.
- 웨어울프는 숨어서 시민들을 해고하고 싶어 합니다.
- 조커는 너무 수상하게 행동해서 시민들이 자신을 해고하게 만들고 싶어 합니다.
이것은 "삼각 관계(Triadic)"의 문제를 만듭니다. 이제 플레이어가 수상하게 보이면, 시민들은 훨씬 더 어려운 질문을 던져야 합니다:
"이 사람은 웨어울프(그래서 투표로 내쫓아야 하는 사람)인가, 아니면 조커(투표로 내쫓으면 내가 지게 되므로 내쫓으면 안 되는 사람)인가?"
실험: AI의 두뇌 테스트하기
연구진은 세 가지 강력한 AI 모델(GPT-4.1, DeepSeek-V3.1, Llama-3.3-70B)을 사용하여 60번의 게임을 진행했습니다. 그들은 조커가 더 똑똑해지기 위해 이전 게임의 노트를 읽을 수 있는 "자기 학습" 기능을 넣기도 하고 빼기도 하며 실험했습니다.
연구 결과는 다음과 같습니다 (비유를 통해 설명합니다):
1. "치트키" 문제 (단서 충분성)
기존의 두 팀 게임에서 AI는 단순히 "수상한" 행동을 찾는 것만으로도 이길 수 있었습니다. 이는 마치 정답지를 외운 학생과 같습니다: 선생님이 인상을 쓰면, 답이 틀린 것이다.
- 결과: 조커가 추가되자 AI 모델들은 실패했습니다. 그들은 "수상함 = 나쁨"이라는 규칙을 멈추지 못했습니다.
- 조커의 승리: AI가 계속해서 "수상한" 조커를 투표로 몰아냈기 때문에, 조커는 게임의 **60~70%**를 승리했습니다. AI는 수상함을 포착하는 데 너무 유능해서, 역설적으로 조커가 이기는 것을 도와버렸습니다.
2. 웨어울프들의 자폭
웨어울프(실제 나쁜 놈들)는 조커가 투표로 탈락하면 자신들도 패배하기 때문에, 조커가 탈락하지 않도록 보호해야 했습니다.
- 결과: AI 웨어울프들은 이 일을 엉망으로 했습니다. **60~70%**의 게임에서 AI 웨어울프들은 첫날에 조커를 쫓아내기로 투표했습니다.
- 비유: 이는 마치 스파이 팀이 자신들의 이중 스파이를 해고하는 것과 같습니다. 이중 스파이가 "너무 수상하게" 행동했다는 이유로, 그를 해고하는 것이 적을 돕는 길이라는 사실을 깨닫지 못한 채 투표를 한 것입니다. AI는 이 연결 고리를 찾지 못했습니다: 수상한 사람 + 조거의 목표 = 투표하면 안 됨.
3. "자기 학습" 루프
연구진은 조커가 이전 게임에서 배운 교훈이 담긴 "치트 시트(요약본)"를 읽을 수 있게 했습니다.
- DeepSeek-V3.1: 이 모델이 가장 똑똑했습니다. 이 모델은 "너무 수상하지 않으면서도" 수상하게 행동하는 법을 배웠습니다. 즉, 웨어울프들에게 들키지 않으면서도 시민들을 속여야 한다는 것을 깨달았습니다. 덕분에 승률이 크게 높아졌습니다.
- GPT-4.1: 이 모델은 이미 "수상함"을 포착하는 능력이 너무 뛰어나서 치트 시트가 별 도움이 되지 않았습니다. 오히려 이미 단순한 규칙의 "천장"에 도달해 있었기 때문에 성능이 약간 떨어지기도 했습니다.
- Llama-3.3: 조금 개선되었지만, DeepSeek만큼은 아니었습니다.
심층 분석: AI는 실제로 무엇을 생각하고 있었나?
연구진은 AI 조커들이 스스로에게 쓴 "노트"를 살펴보고 그들이 어떻게 생각하는지 측정했습니다. 그들은 "마음 이론(Theory of Mind, 타인의 마음을 이해하는 능력)"을 세 단계로 측정했습니다:
- 레벨 1: "나는 이상하게 행동해야 해." (단순함)
- 레벨 2: "나는 시민들이 나를 웨어울프라고 생각하도록 이상하게 행동해야 해." (더 나음)
- 레벨 3: "나는 시민들에게는 웨어울프처럼 보이되, 웨어울프들에게는 웨어울프처럼 보이지 않아야 해. 그래야 그들이 나를 보호할 테니까." (복잡함)
발견 사항: 오직 DeepSeek-V3.1만이 일관되게 레벨 3에 도달했습니다. 이 모델은 두 가지 서로 다른 역할을 동시에 수행해야 한다는 점을 이해했습니다: 시민들에게는 "나쁜 놈"으로, 웨어울프들에게는 "평범한 사람"으로 보이는 것 말입니다. 다른 모델들은 대부분 레벨 1이나 2에 머물렀습니다.
결론
이 논문은 현재의 AI 모델들이 패턴(예: "수상한 행동")을 포착하는 데는 매우 뛰어나지만, **멀티 홉 추론(multi-hop reasoning)**에는 어려움을 겪는다고 결론짓습니다.
- 단순한 비유: "앉아"라고 하면 앉도록 훈련된 강아지를 상상해 보세요. 당신이 간식을 들고 "앉아"라고 하면 강아지는 앉습니다. 하지만 당신이 "기다려"라는 의미를 가진 다른 간식을 들고 "앉아"라고 한다면, 강아지는 혼란에 빠질 것입니다.
- 논문의 주장: AI 모델들은 바로 그 강아지와 같습니다. 그들은 "수상함"을 보면 즉시 "탈락"을 선택합니다. 이 특정 게임에서는 "수상함"이 "투표로 내쫓음(웨어울프일 경우)"을 의미할 수도 있고, "유지(조커일 경우)"를 의미할 수도 있다는 사실을 깨닫지 못합니다.
연구진은 AI가 진정한 "마음 이론"을 가지고 있는지 테스트하려면, 단순히 두 팀이 대립하는 게임이 아니라 세 가지의 경쟁하는 목표(이 조커 게임처럼)가 있는 게임이 필요하다고 주장합니다. 현재의 "두 팀" 방식의 게임은 AI가 상대방의 숨겨진 의도를 진정으로 이해하지 않고도 단순한 규칙을 따르는 것만으로 승리할 수 있기 때문에 너무 쉽습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.