← 최신 논문
💬 NLP

Theory of Mind and Persuasion Beyond Conversation: Assessing the Capacity of LLMs to Induce Belief States via Planning and Action

이 논문은 대규모 언어 모델이 대화가 아닌 행동을 통해 특정 믿음 상태를 유도하는 능력을 얼마나 잘 수행하는지 평가하기 위해 비대화형 계획 마음 이론(NCP-ToM) 프레임워크를 도입하며, GPT-5가 이러한 과업의 성공률 측면에서 인간보다 뛰어난 성능을 보이지만 맥락 전반에 걸친 견고함은 여전히 부족하며, 인간과 마찬가지로 참인 믿음보다 거짓인 믿음을 유도하는 데 더 어려움을 겪는다는 점을 밝히고 있다.

원저자: Ben Slater, Matteo G. Mecattaf, Lucy G. Cheke, John Burden, Winnie Street

게시일 2026-07-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ben Slater, Matteo G. Mecattaf, Lucy G. Cheke, John Burden, Winnie Street

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: "침묵의 인형술사" 테스트

당신이 체스 게임을 하고 있다고 상상해 보세요. 하지만 체스 기물을 움직여 상대방의 킹을 잡는 것이 아니라, 단 한 마디의 말도 없이 상대방이 사실이 아닌 것을 '믿게' 만들거나, 사실인 것을 '알게' 만드는 것이 당신의 목표입니다. 당신은 상대방에게 말을 걸 수 없습니다. 오직 보드 위의 물건을 옮기거나 상자 안에 무언가를 숨길 수 있을 뿐입니다.

이 논문은 AI(대규모 언어 모델 또는 LLM)를 테스트하는 새로운 방법인 NCP-ToM(비대화형 계획 이론적 마음)을 소개합니다.

  • 이론적 마음 (Theory of Mind, ToM): 이는 다른 사람이 무엇을 생각하거나 믿고 있는지 이해하는 인간의 능력입니다.
  • 비대화형 (Non-Conversational): AI는 채팅을 하거나, 설득하거나, 설명할 수 없습니다. AI는 오직 행동을 통해 타인의 믿음을 변화시켜야 합니다.

연구진은 AI 에이전트가 "침묵의 인형술사"처럼 행동하여, 단순히 물건을 옮기는 것만으로도 다른 캐릭터들이 특정한 믿음을 갖도록 세상을 배치할 수 있는지 확인하고자 했습니다.

설정: 디지털 버전의 "숨바꼭질"

이를 테스트하기 위해 연구진은 고전적인 심리학 테스트인 샐리-앤(Sally-Anne) 테스트를 기반으로 한 디지털 놀이터를 구축했습니다.

  • 고전적 테스트: 원래 버전에서는 샐리가 바구니에 구슬을 넣고 떠나는 영상을 봅니다. 그 후 앤이 구슬을 상자로 옮깁니다. 당신은 "샐리는 구슬이 어디에 있다고 생각할까요?"라는 질문을 받습니다 (정답은 바구니입니다. 샐리는 이동 과정을 보지 못했기 때문입니다). 이것은 질문과 답변(Q&A) 테스트입니다. 당신은 그저 보고 추측할 뿐입니다.
  • 새로운 테스트 (NCP-ExploreToM): 이 논문에서 AI는 단순히 관찰하는 것이 아니라, 게임 속에 직접 들어갑니다. AI에게는 *"구슬이 실제로 상자 안에 있더라도, 샐리가 구슬이 바구니에 있다고 믿게 만드세요"*와 같은 목표가 주어집니다.
  • AI의 임무: AI는 이를 실현하기 위한 단계들을 찾아내야 합니다. AI는 다음과 같은 과정을 거쳐야 할 수도 있습니다:
    1. 샐리를 방 밖으로 이동시킨다.
    2. 구슬을 상자로 옮긴다.
    3. 샐리가 교체 장면을 보지 못하도록 샐리를 방 밖에 머물게 한다.
    4. 샐리를 다시 불러온다.

AI가 이를 올바르게 수행하면, 샐리는 "틀린 믿음"(구슬이 바구니에 있다고 생각함)을 갖게 됩니다. 만약 AI가 실패하면, 샐리는 교체 장면을 보고 진실을 알게 될 것입니다.

누가 게임을 했나요?

연구진은 다음 그룹을 테스트했습니다:

  1. 6개의 최상위 AI 모델: GPT-5, Gemini 2.5 Pro 및 다양한 버전의 Claude를 포함합니다.
  2. 40명의 인간 참가자: 컴퓨터로 동일한 게임을 플레이하는 실제 사람들입니다.

연구진은 다양한 난이도, 다양한 장소(병원, 호텔, 결혼식장 등), 그리고 다양한 목표 유형(사람이 진실을 믿게 하거나 거짓을 믿게 하는 것)을 가진 **600개의 서로 다른 시나리오(태스크)**를 실행했습니다.

결과: 스코어보드

두 플레이어를 비교했을 때 다음과 같은 결과가 나타났습니다.

1. "틀린 믿음" 챌린지는 어렵습니다
인간과 마찬가지로, AI 모델들도 누군가에게 틀린 믿음(사실이 아닌 것을 믿게 함)을 심어주는 것이 옳은 믿음(진실을 알게 함)을 주는 것보다 훨씬 어렵다는 것을 발견했습니다.

  • 비유: 누군가에게 고양이 사진을 보여주어 고양이가 있다는 것을 알게 하는 것(옳은 믿음)은, 고양이를 숨기고 개라고 믿게 만드는 것(틀린 믿음)보다 쉽습니다.
  • 이것이 중요한 이유: 논문은 이를 "긍정적인 신호"라고 언급합니다. 이는 AI가 기만적인 작업(속이기)보다는 도움이 되는 작업(가르치기, 보조하기)에 더 적합할 수 있음을 시사합니다.

2. "GPT-5"의 놀라운 성과
최신 모델인 GPT-5는 슈퍼스타였습니다.

  • GPT-5는 약 **80%**의 태스크를 해결했습니다.
  • GPT-5는 실제로 인간 참가자보다 더 높은 성적을 거둔 유일한 모델이었습니다.
  • 하지만, 인간은 더 일관적이었습니다. AI의 성능은 "설정"(예: 정부 건물에서는 잘했지만, 결혼식장 시나리오에서는 성적이 떨어짐)에 따라 크게 요동쳤습니다. 인간은 설정에 관계없이 꾸준했습니다.

3. "계획(Planning)"의 격차
연구진은 두 가지 테스트 방식을 비교했습니다:

  • "퀴즈" (Q&A): "여기 이야기가 있습니다. 샐리는 무엇이라고 생각하나요?"
  • "행동" (Agentic): "여기 목표가 있습니다. 실행하세요."

보통 사람들은 "행동" 테스트가 "퀴즈"보다 훨씬 어렵다고 가정합니다. 대부분의 AI 모델에게는 이것이 사실이었습니다. 하지만 GPT-5의 경우, 이 격차가 사라졌습니다. GPT-5는 "행동" 테스트에서도 "퀴즈" 테스트와 거의 대등한 성적을 보였습니다. 이는 가장 똑똑한 모델들에게는 실제로 계획을 세우는 것이 단순히 그것에 대해 이야기하는 것만큼이나 쉬워지고 있음을 시사합니다.

4. 복잡성이 성능을 저하시킵니다
태스크가 더 복잡해질수록(여러 명의 믿음을 동시에 추적해야 하거나, 세 명의 사람에게 각각 다른 것을 믿게 해야 하는 경우), 모든 참가자의 점수가 낮아졌습니다. 이는 마치 여러 개의 공을 저글링하는 것과 같아서, 결국 하나를 떨어뜨리게 됩니다.

이것이 의미하는 바는 무엇인가요? (논문에 근거함)

논문은 발견된 사실에 엄격히 기초하여 다음과 같은 핵심 결론을 내립니다:

  • AI는 "침묵의 설득"에 능숙해지고 있습니다: 현대의 AI는 한 마디 말 없이도 물리적 행동의 순서를 계획하여 다른 캐릭터의 믿음을 변화시킬 수 있습니다.
  • 안전 점검: AI가 "틀린 믿음"(기만)보다 "옳은 믿음"을 다루는 데 어려움을 겪는다는 점은 안전 측면에서 좋은 소식입니다. 이는 AI가 자연스럽게 행동을 통해 거짓말을 하거나 조종하려는 경향이 없음을 시사하지만, 요청받을 경우 충분히 가능하다는 점도 보여줍니다.
  • "맥락(Context)" 문제: AI는 여전히 다소 취약합니다. 이야기를 "병원"에서 "결혼식"으로 바꾸면 AI는 혼란을 느낄 수 있습니다. 인간은 이러한 변화에도 혼란을 겪지 않습니다.
  • "퀴즈"의 함정: 우리는 AI가 이야기에 대한 질문에 답을 잘한다고 해서, 그 이야기를 직접 "실행"하는 것도 잘할 것이라고 가정해서는 안 됩니다. 가장 뛰어난 모델들(GPT-5와 같은)의 경우, "퀴즈가 행동보다 쉽다"는 기존의 규칙이 더 이상 유효하지 않을 수 있습니다.

결론

이 논문은 AI가 질문에 답하는 "챗봇"에서 현실을 형성하기 위해 계획하고 행동하는 "에이전트"로 진화하고 있음을 보여줍니다. 가장 똑똑한 AI는 현재 이러한 특정 논리 퍼즐에서 인간을 능가할 수 있지만, 여다면 다양한 실제 상황에서 일관성을 유지하는 인간의 능력은 여전히 부족합니다. 연구진은 AI가 유용한 조수로서 멋진 능력을 갖추고 있는 것은 맞지만, 동시에 과거의 평가 방식(단순히 질문을 던지는 것)만으로는 AI의 안전성을 평가하기에 충분하지 않을 수 있으므로 주의가 필요하다고 경고합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →