← 최신 논문
💻 computer science

Language Models Might Not Understand You: Evaluating Theory of Mind via Story Prompting

본 논문은 대규모 언어 모델을 평가하기 위해 새로운 오염 없는 스토리 프롬프트를 생성하는 프로그래밍 가능한 프레임워크인 StorySim 을 소개하며, 이러한 모델들이 일반적으로 이론적 마음 과정보다는 세계 모델링에서 더 잘 수행하며 종종 심층적 추론보다는 휴리스틱에 의존한다는 사실을 밝혀냅니다.

원저자: Nathaniel Getachew, Abulhair Saparov

게시일 2026-04-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Nathaniel Getachew, Abulhair Saparov

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇이 인간의 생각을 어떻게 이해하는지 가르치려 한다고 상상해 보세요. 당신은 로봇이 그 사람의 생각이 틀리더라도 다른 사람이 무엇을 생각하고 있는지 파악할 수 있는지 알고 싶습니다. 이 능력을 **마음 이론 (Theory of Mind, ToM)**이라고 합니다.

오랫동안 과학자들은 로봇 (대형 언어 모델 또는 LLM) 을 테스트하기 위해 "サリー와 앤 (Sally-Anne)"이라는 고전적인 어린이 이야기를 사용해 왔습니다. 이 이야기에서サリー는 장난감을 숨기고 방을 떠난 후, 앤이 장난감을 옮깁니다.サリー가 돌아왔을 때, 그녀는 어디를 볼까요? 인간은サリー가 장난감이 이동한 사실을 모른다는 이유로 원래 장소에서 찾을 것이라고 압니다. 하지만 이야기를 아주 조금만 변형하면, 이러한 로봇들은 종종 혼란을 겪으며, 이는 그들이 캐릭터들의 마음을 진정으로 이해하기보다는 이야기를 단순히 암기하고 있을 가능성을 시사합니다.

이를 해결하기 위해 이 논문의 저자들은 StorySim이라는 새로운 도구를 개발했습니다. StorySim 을 이야기를 위한 프로그래밍 가능한 레고 세트라고 생각하세요.

레고 세트 (StorySim)

연구자들은 이야기를 손으로 쓰거나 다른 AI 에게 쓰게 하는 대신 (이는 로봇이 이미 본 내용을 실수로 복사할 수 있음), "스토리보드 (Storyboard)"를 사용합니다.

  • 스토리보드: 이는 엄격한 청사진입니다. "1 분에 캐릭터 A 가 1 번 방에 들어오고, 2 분에 캐릭터 B 가 2 번 방에 들어온다"고 명시합니다. 이는 누가 무엇을 언제 보는지를 정확히 통제합니다.
  • 빌더 (Builder): 시스템은 나머지 이야기를 자동으로 채워 넣으며 규칙이 결코 위반되지 않도록 합니다. 이러한 청사진을 바탕으로 처음부터 이야기를 구축하기 때문에 로봇들은 이전에 본 적이 없는 이야기들입니다. 마치 매번 플레이할 때마다 완전히 새로운 퍼즐을 만드는 것과 같습니다.

테스트: 마음 대 지도

연구자들은 이 레고 세트를 사용하여 다양한 AI 모델에 세 가지 유형의 테스트를 수행했습니다.

  1. "마음" 테스트 (마음 이론): 그들은 "앤이 어디에 있다고 생각하나요?"라고 물었습니다. 이에 답하기 위해 로봇은 실제 사실을 무시하고 대신 앤이 본 것과 그가 믿는 것을 추적해야 합니다.
  2. "지도" 테스트 (세계 모델링): 그들은 "앤은 실제로 어디로 갔나요?"라고 물었습니다. 이는 단순히 로봇이 이야기의 사실을 기억하고 지도 위의 움직이는 물체를 추적하는 것과 같습니다.
  3. "사물" 테스트: 그들은 동일한 "지도" 질문을 했지만, 사람 대신 이야기의 주체가 무생물 (예: 이동하는 공) 이 되도록 했습니다. 이는 로봇이 사람과 사물을 다르게 대우하는지 확인하는 것입니다.

발견된 점

결과는 수학 시험에서 만점을 받은 학생이 논리 퍼즐에 어려움을 겪는다는 사실을 발견한 것처럼 다소 놀라웠습니다.

  • 로봇은 마음보다 지도에 더 능숙함: 대부분의 AI 모델은 캐릭터가 무엇이라고 생각했는지 추측하는 것 (마음 이론) 보다, 사물이 실제로 어디로 갔는지 추적하는 것 (세계 모델링) 에서 훨씬 더 뛰어났습니다. 그들은 줄거리를 따라갈 수는 있었지만, 캐릭터의 입장이 되어 생각하는 데는 어려움을 겪었습니다.
  • 사람 대 사물: 로봇은 사물보다 사람의 움직임을 추적하는 데 약간 더 능숙했습니다. 모델들이 인간 대화로 훈련되었기 때문에 인간 캐릭터에 더 많은 주의를 기울이도록 "프라이밍 (primed)"된 것으로 보입니다.
  • "최근성" 함정: 연구자들은 로봇이 단순히 마지막으로 누군가를 본 장소를 추측함으로써 속이고 있는지 우려했습니다. 이를 테스트하기 위해 이야기 속의 "거짓말"이 오래전에 일어난 사건이 되도록 만들었습니다. 놀랍게도 로봇들은 예상보다 이 단순한 "최신 사건 추측" 속임수에 덜 걸렸습니다.
  • "첫 만남" 습관: 로봇이 "마음" 테스트에서 틀렸을 때, 그들은 종종 특정 실수를 범했습니다. 그들이 마지막으로 서로를 본 곳이 아니라, 캐릭터들이 처음 만난 장소를 추측한 것입니다. 마치 첫 수업 날은 기억하지만 어제 일어난 일은 잊어버리는 학생과 같습니다.

큰 그림

이 논문은 현대 AI 가 추론 능력에서 점점 더 똑똑해지고 있지만, 여전히 타인의 "정신 상태"를 진정으로 이해하는 데는 어려움을 겪고 있다고 결론 내립니다. AI 는 이야기의 사건을 완벽하게 따라갈 수는 있지만, 캐릭터가 무엇을 생각하고 있는지 (특히 그 생각이 틀린 경우) 상상하라고 요청받으면 종종 실패합니다.

저자들은 로봇에게 최종 성적을 주기 위해 StorySim 을 만든 것이 아니라, 과거 답변을 암기하여 속일 수 없는 공평하고 새로운 테스트를 제공하기 위해 만들었습니다. 그들은 이 도구가 미래 연구자들이 단순히 사실을 암기하는 것이 아니라 인간의 관점을 진정으로 이해할 수 있는 AI 를 구축하는 데 도움이 되기를 바랍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →