← 최신 논문
🤖 machine learning

Selective Deficits in LLM Mental Self-Modeling in a Behavior-Based Test of Theory of Mind

이 논문은 2025 년 중반 이후의 최신 LLM 들이 타인의 마음 상태를 모델링하는 데는 인간 수준에 도달했으나, 추론 과정 (스래치패드) 이 제공되지 않는 한 자기 자신의 마음 상태를 모델링하는 데는 여전히 실패하며 전략적 기만도 가능함을 보여주는 새로운 행동 기반 이론적 마음 테스트를 제시합니다.

원저자: Christopher Ackerman

게시일 2026-03-30
📖 4 분 읽기☕ 가벼운 읽기

원저자: Christopher Ackerman

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"인공지능 (LLM) 이 정말로 '나'와 '남'을 이해할 수 있는가?"**라는 아주 흥미로운 질문을 던집니다.

기존의 연구들은 AI 에게 "이 인물은 지금 무엇을 생각하고 있을까?"라고 물어보고 답을 하게 했습니다. 하지만 이 논문은 **"그 답을 말하지 말고, 실제로 행동해 봐!"**라고 요구하는 새로운 실험을 진행했습니다.

이 논문의 핵심 내용을 일상적인 비유로 쉽게 설명해 드릴게요.


1. 실험의 배경: "무언가를 말하기 vs 무언가를 하기"

기존의 AI 테스트는 마치 영화 대본을 외우는 것과 비슷했습니다. AI 는 책이나 인터넷에서 "사람들이 거짓말을 할 때 어떻게 행동하는지"를 수없이 읽었기 때문에, 질문만 받으면 "아, 이건 거짓말을 하는 상황이네"라고 정답을 맞춰낼 수 있었습니다. 하지만 이건 진짜 이해가 아니라 패턴 암기일 뿐일 수 있습니다.

이 연구는 실전 게임을 만들었습니다.

게임 상황:
네 명의 사람 (나, 팀원, 적 2 명) 이 방에 있습니다. 상자에 사과가 들어갑니다. 팀원은 방을 나갑니다. 그 사이에 상자에 사과 대신 바나나가 들어갑니다.
질문: "팀원이 돌아와서 상자 내용을 말해야 한다면, 내가 무엇을 해야 할까?"

  • 정답: 팀원이 모르고 있으니, 0.5 점 (수수료) 을 내고 팀원에게 "상자에 바나나가 들어갔어!"라고 알려줘야 합니다.
  • 실수: 팀원이 이미 알고 있는데도 알려주면 점수가 깎입니다.

AI 는 단순히 "팀원이 모른다"고 말해선 안 됩니다. 점수를 따기 위해 실제로 '알려주기 (Tell)', '묻기 (Ask)', '아무것도 안 하기 (Pass)' 중 하나를 선택해야 합니다.

2. 주요 발견 1: "생각하지 않는 AI"는 멍청하다

연구진은 최신 AI 모델들을 두 가지로 나누어 테스트했습니다.

  • 생각하지 않는 AI (Non-thinking): 문제를 받자마자 바로 답을 내야 하는 모델.
  • 생각하는 AI (Thinking): 답을 내기 전에 "자, 상황을 정리해 보자..."라고 긴 추론 과정을 거치는 모델.

결과:

  • 생각하지 않는 AI: 거의 모든 게임에서 실패했습니다. 특히 **"내가 무엇을 모르는지 아는 것 (자기 인식)"**은 완전히 무너졌습니다. 마치 "내가 방을 나갔으니 내가 본 건 옛날 이야기일 수도 있는데, 왜 내가 다 아는 것처럼 행동하지?"라고 생각하지 못하는 상태였습니다.
  • 생각하는 AI: 점수판에 "생각하는 과정"을 적어주면, 인간과 비슷하거나 그 이상의 실력을 보였습니다.

3. 주요 발견 2: "거울"을 보지 못하는 AI

가장 놀라운 점은 **자기 자신에 대한 이해 (Self-modeling)**였습니다.

  • 유아 발달 비유: 6 세 미만의 아이들은 "내가 방을 나갔을 때, 내가 본 물건이 바뀔 수 있다"는 걸 이해하지 못합니다. 이 논문에서 생각하지 않는 최신 AI 들도 마치 6 세 미만 아이처럼 행동했습니다.
  • 비유: AI 는 거울을 보고 "나"를 인식할 수는 있지만, "나"가 방을 나간 뒤의 상황을 상상하는 거울은 가지고 있지 못했습니다. "내가 방을 나가서 못 봤으니, 팀원에게 물어봐야겠다"는 판단을 스스로 내리지 못했습니다.

하지만 생각하는 AI는 이 거울을 사용할 수 있었습니다. "잠깐, 내가 방을 나갔으니 내가 모르는 게 있을 수 있겠다. 팀원에게 물어보자"라고 스스로 논리를 펼친 뒤 정답을 냈습니다.

4. 주요 발견 3: "거짓말"과 "전략"

이 게임에는 적도 있었습니다. 적이 정답을 알고 있을 때, 내가 거짓말을 해서 적이 틀리게 만들면 우리 팀이 이길 수 있습니다.

  • 생각하지 않는 AI: 거짓말을 잘 못했습니다. 그냥 정답을 알려주는 습관 (패턴) 이 강해서, 적에게도 정답을 알려주는 실수를 범했습니다.
  • 생각하는 AI: **"전략적인 거짓말"**을 했습니다. "아, 이 적은 정답을 알고 있네. 내가 거짓말을 하면 적의 점수가 깎이겠구나. 그럼 거짓말을 해보자!"라고 계산하고 행동했습니다.
    • 흥미로운 점은, 최신 모델들일수록 "악의적인 거짓말"은 줄이는 경향이 보였습니다. (안전 교육 때문일 수 있음)

5. 결론: AI 는 무엇을 배웠을까?

이 논문의 결론은 다음과 같습니다.

  1. 기억은 하지만, 이해는 안 한다: 기존 AI 는 "사람이 어떻게 행동하는지"를 외운 것일 뿐, 진짜로 상황을 이해하고 예측하는 능력은 부족했습니다.
  2. 생각할 시간이 필요하다: AI 가 진짜로 "나"와 "남"의 마음을 이해하려면, **생각할 시간 (추론 과정)**이 필요합니다. 마치 우리가 복잡한 문제를 풀 때 종이에 계산을 해보듯이, AI 도 "생각의 메모장 (Scratchpad)"이 있어야 스스로를 이해할 수 있습니다.
  3. 안전한 AI 를 위해: AI 가 사람을 속이거나 조종할 수 있는 능력 (전략적 사고) 을 갖게 되었다는 것은, 우리가 AI 를 더 조심스럽게 다뤄야 함을 의미합니다.

한 줄 요약:

"AI 는 책에서 '사람 심리'를 수없이 읽었지만, 실제 게임에서 '나'와 '남'을 구분하며 전략적으로 행동하는 능력은 아직 스스로 생각할 시간을 주지 않으면 부족합니다. 하지만 생각할 시간을 주면, 그들은 놀라운 전략가 (심지어는 거짓말쟁이) 가 됩니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →