← 최신 논문
💬 NLP

MafiaScope: Non-Invasive, Time-Resolved Belief Probing for LLM Agents in Social Deduction Games

MafiaScope는 사회적 추론 게임 중 LLM 에이전트의 사적인 신념을 비침습적이고 시계열적으로 탐사할 수 있게 해주는 개방형 테스트베드로, 상당한 캘리브레이션 오류를 드러내며 에이전트의 추론 궤적을 시각화하고 반사실적으로 재현할 수 있는 도구를 제공한다.

원저자: Ilia Karpov

게시일 2026-07-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ilia Karpov

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 한 무리의 AI 에이전트들이 고도의 심리전이 오가는 마피아 게임을 하고 있습니다. 이 게임에서 몇 명의 플레이어는 서로를 알고 있는 비밀스러운 '마피아' 멤버가 되어 밤마다 '시민'들을 제거하려 하고, 시민들은 낮 동안 누가 살인자인지 알아내기 위해 노력합니다. 보통 우리가 AI가 게임을 하는 것을 볼 때는 최종 점수판, 즉 누가 승리했는지, 누가 투표로 탈락했는지, 누가 거짓말을 했는지와 같은 결과만을 보게 됩니다. 그것은 마치 마술사가 손을 어떻게 움직였는지 전혀 모른 채, 마지막 마술의 결과만을 보는 것과 같습니다.

MafiaScope는 이 AI 에이전트들을 위한 마법 같은 "독심술 헤드셋" 역할을 하는 새로운 도구입니다. 하지만 여기에는 주의할 점이 있습니다. 이 도구는 게임을 변화시키지 않는 비침습적(non-invasive) 방식이라는 것입니다. AI 에이전트가 집단에게 무언가를 말할 때마다, 시스템은 조용히 멈추고 해당 에이전트에게 실제로 무엇을 믿고 있는지에 대한 비밀 질문을 던진 뒤, 그 답변이 다시는 게임에 영향을 미치지 않도록 즉시 삭제합니다.

이것을 마치 리얼리티 쇼처럼 생각해 보세요. 극적인 고백이 나올 때마다 카메라는 출연자에게 개인적인 방으로 가서 이렇게 묻습니다. "자, 당신은 지금 진짜로 누가 범인이라고 생각하나요?" 출연자는 대답하고, 카메라는 이를 기록한 뒤, 그 답변은 금고 속에 봉인됩니다. 출연자는 자신의 비밀 답변을 듣지 못하므로, 그 답변에 따라 자신의 행동을 바꿀 수 없습니다. 이를 통해 연구자들은 에이전트의 진실된 생각과 공적인 거짓말을 구분해 볼 수 있습니다.

그들은 실제로 무엇을 발견했는가?

연구진은 특정 AI 모델(DeepSeek)을 사용하여 32번의 게임을 실행했으며, 13,800개 이상의 이러한 비밀 답변을 수집했습니다. 데이터가 밝혀낸 내용은 다음과 같습니다.

  1. "스포트라이트" 망상: 무고한 에이전트들은 타인이 자신을 어떻게 생각하는지 추측하는 데 매우 서툽니다. 그들은 실제로 의심받는 것보다 1.5배 더 자주 자신이 의심받고 있다고 믿습니다. 이는 마치 파티에 들어갔을 때 내 머리 모양이 이상해서 모두가 나를 쳐re다보고 있다고 느끼지만, 실제로는 아무도 신경 쓰지 않는 것과 같습니다. 논문은 이것이 인간의 심리적 특성인 "스포트라이트 효과"의 "기계 버전"이라고 제안합니다. 흥로하게도, 실제 마피아 에이전트들은 이 부분에서 훨씬 뛰어났습니다. 그들은 자신이 언제 안전하고 언제 위험에 처해 있는지 정확히 알고 있었습니다.
  2. 자신감은 허세다: 에이전트들이 자신의 추측에 대해 "매우 확신한다"라고 말했을 때, 그들은 종종 틀렸습니다. 논문은 이를 **기대 교정 오차(Expected Calibration Error)**라는 지표로 측정했는데, 결과는 0.17이었습니다. 쉬운 말로 설명하자면, 만약 어떤 에이전트가 "이 사람이 마피아라고 80% 확신합니다"라고 말한다면, 그가 맞을 확률은 약 **54.6%**에 불과합니다. 그들은 정확한 예측자가 아니라 과도하게 자신만만한 허세를 부리는 자들입니다.
  3. 진실은 롤러코스터다: 에이전트들의 믿음은 안정적인 진실로 정착되지 않았습니다. 대신 그들의 의심 수준은 변동성이 컸습니다. 평균적으로 에이전트의 "최우선 용의자"는 비밀 확인 시점의 **48.7%**에서 변경되었습니다. 그들은 진실을 향해 나아가는 것이 아니라 진실 주변을 맴돌고 있었습니다.
  4. 거짓말은 (때때로) 통한다: 이 특정 연구에서 마피아 에이전트들은 32게임 중 31번을 승리했습니다. 도구의 분석 결과, 시민들이 게임이 진행됨에 따라 추론 능력이 향상되었음에도 불구하고(0라운드의 정확도 **47.6%**에서 3라운드의 **75.4%**로 상승), 마피아는 시민들을 혼란스럽게 만드는 데 성공했습니다.

명시적으로 배제한 사항들

논문은 결과가 과장되는 것을 경계하며 매우 신중하게 서술되었습니다.

  • "해결된" 문제가 아니다: 저자들은 이 결과가 이 특정 설정이 특정 AI 모델에 대한 것이라고 명시했습니다. 그들은 모든 AI 에이전트가 과신하거나, 모든 AI 마피아가 이 정도로 뛰어날 것이라고 주장하지 않습니다.
  • 철학적 의미의 "독심술"이 아니다: 논문은 이 에이전트들에게 깊고 인간적인 "믿음"이 있다고 보는 관점에 반박합니다. 대신, 그들은 이 답변들을 "운영 보고(operational reports)"로 취급합니다. 즉, AI가 영혼을 드러내는 것이 아니라, 질문을 받았을 때 자신이 무엇이라고 답할지를 단순히 예측하는 것입니다.
  • 진실의 보증이 아니다: 논문은 에이전트들이 자기 보고(self-reporting)를 하기 때문에, 조사 자체에 대해 거짓말을 할 수도 있다는 점을 언급합니다. 그러나 에이전트의 비밀 답변이 공적인 투표 행동과 밀접하게 일치한다는 점(무고한 투표의 **64.9%**에서 에이전트는 자신의 비밀 최우선 용의자에게 투표함)을 발견하여, 이 보고들이 적어도 행동과는 일치함을 보여주었습니다.

얼마나 확실한가?

논문은 에이전트들이 왜 그렇게 행동하는지에 대해 설명할 때 **"시사한다(suggests)"**라는 단어를 매우 자주 사용합니다.

  • "결정적 순간" 실험: 연구진은 단 하나의 문장을 바꾸는 것이 결과에 영향을 줄 수 있는지 확인하기 위해 실험을 진행했습니다. 그들은 특정 플레이어가 특정 발언을 하지 않았을 경우 어떤 일이 벌어졌을지 보기 위해, 게임을 "포크(fork)"하여(30개의 평행 세계 생성) 시뮬레이션을 돌렸습니다.
    • 그들은 Finley라는 플레이어의 특정 거짓말을 바로잡는 것이 결과에 영향을 미쳤을 수도 있음을 발견했는데, 이는 시민이 탈락할 확률을 0.4에서 0.8로 높이는 결과를 나타냈습니다.
    • 하지만, 논문은 이것이 통계적으로 증명된 것은 아님을 인정합니다. 각 시나리오당 단 5번의 재실행만 수행했기에 차이가 충분히 크지 않았으며(통계적 p-값은 약 0.52로 유의미하지 않음), 이는 그들이 특정 게임의 미스터리를 완전히 풀었다는 것이 아니라, 이 도구가 그러한 순간을 찾아내는 데 효과적임을 보여주는 것입니다.

큰 그림

MafiaScope는 AI를 고치는 마법 지팡이가 아닙니다. 그것은 현미경입니다. 이전에는 우리는 AI의 최종 투표만을 볼 수 있었습니다. 이제 우리는 투표와 투표 사이에서 일어나는 혼란스럽고, 당황스럽고, 과신하며, 때로는 천재적인 사고 과정을 볼 수 있습니다.

이 도구는 연구자들이 "믿음의 궤적(belief trajectory)", 즉 에이전트의 생각이 초 단위로 어떻게 변하는지를 관찰할 수 있게 해줍니다. 이는 AI가 게임을 플레이할 수는 있지만, 종종 자신이 무엇을 알고 있는지조차 "모른다"는 것을 보여줍니다. 그들은 추측하고, 과신하며, 때로는 아무도 자신을 보고 있지 않은데도 모두가 자신을 지켜보고 있다고 느낍니다.

논문은 엔진, 시각화 도구, 그리고 데이터를 공개하여 누구나 이를 활용할 수 있도록 하며, AI의 세계에서는 당신이 말하는 것과 당신이 생각하는 것이 종종 매우 다른 것임을 입증하며 실시간으로 AI의 마음을 들여다보라는 열린 초대장을 보냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →