← 최신 논문
🤖 AI

EnactToM: An Evolving Benchmark for Functional Theory of Mind in Embodied Agents

본 논문은 현재 최첨단 AI 모델들이 문자 그대로의 믿음 질문에는 탁월한 성능을 보이지만 복잡하고 부분적으로 관측 가능한 환경에서 암묵적 믿음을 기반으로 행동하는 데 필요한 기능적 마음 이론에서는 완전히 실패(성공률 0.0%)한다는 치명적인 격차를 드러내는 300 개의 구체화된 다중 에이전트 작업으로 구성된 엄격하게 검증되고 진화하는 벤치마크인 EnactToM 을 소개합니다.

원저자: Gurusha Juneja, Dylan Lu, Saaket Agashe, Parth Diwane, Edward Gunn, Jayanth Srinivasa, Gaowen Liu, William Yang Wang, Yali Du, Xin Eric Wang

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Gurusha Juneja, Dylan Lu, Saaket Agashe, Parth Diwane, Edward Gunn, Jayanth Srinivasa, Gaowen Liu, William Yang Wang, Yali Du, Xin Eric Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

친구와 거대한 다층 건물에서 "숨바꼭질" 게임을 한다고 상상해 보세요. 하지만 약간의 변형이 있습니다. 두 사람 모두 무전기 를 가지고 있지만 신호가 약해 몇 마디만 말할 수 있고, 친구가 무엇을 보고 있는지 볼 수 없습니다. 당신은 보물의 위치를 알고 있지만 친구는 모릅니다. 친구는 열쇠의 위치를 알고 있지만 당신은 모릅니다. 이 게임에서 승리하려면 친구가 당신에게 무엇을 알고 있다고 생각하는지, 그리고 그들이 무엇을 알아내야 하는지를 단순히 정답을 외치는 것이 아니라 파악해야 합니다.

이것이 논문에서 설명한 새로운 AI 에이전트 테스트인 EnactToM의 핵심 과제입니다.

다음은 논문을 쉬운 용어로 정리한 내용입니다:

1. 문제: "말하기" 대 "행동하기"

현재의 AI 모델들은 타인의 생각에 대해 말하는 데는 뛰어납니다. "당신의 파트너가 냉장고가 열려 있는지 알고 있나요?"라고 AI 에게 물으면 보통 올바르게 답할 수 있습니다. 논문은 이를 **문자적 마음 이론 (Literal Theory of Mind)**이라고 부릅니다. 이는 게임을 완벽하게 묘사할 수 있는 관전자의 역할과 같습니다.

그러나 AI 가 실제로 게임 안에 있어 그 지식을 바탕으로 행동해야 할 때는 종종 실패합니다. 이것이 **기능적 마음 이론 (Functional Theory of Mind)**입니다. 논문은 AI 가 파트너가 무엇을 알고 있는지 말할 수 있다고 해서, 그 정보를 활용해 협력하는 방법을 알고 있는 것은 아니라고 주장합니다.

비유: 요리를 완벽하게 설명할 수 있는 요리사 (문자적) 가 있지만, 이미 가스불이 켜져 있다는 사실을 깨닫지 못해 수프를 태워버리는 경우 (기능적) 를 상상해 보세요. AI 는 파트너의 정신 상태를 설명할 수는 있지만, 그 파트너와 행동을 조율하는 데는 실패합니다.

2. 해결책: 새로운 AI "체육관" (EnactToM)

연구진은 EnactToM이라는 새로운 테스트 장을 구축했습니다. 이는 AI 에이전트들이 그릇을 테이블에 올리거나 냉장고를 여는 것과 같은 가사 작업을 함께 완료해야 하는 3 차원 가상 주택과 같습니다.

  • 설정: 에이전트들은 서로 다른 방에 있습니다 (부분 관측 가능성). 오직 자신만 아는 비밀 단서 (개인 정보) 를 가지고 있습니다. 짧은 텍스트 메시지 만 보낼 수 있습니다 (제한된 의사소통).
  • 목표: 상대방이 무엇을 알고 있는지 파악하고 그에 따라 행동을 조정하여 작업을 완료해야 합니다.
  • "진화하는" 변형: 이는 정적인 테스트가 아닙니다. AI 모델이 더 똑똑해져서 쉬운 레벨을 통과하면, 시스템은 AI 가 방금 실패한 지점을 기반으로 더 어렵고 교묘한 퍼즐을 자동으로 생성합니다. 마치 플레이할수록 더 어려워지는 비디오 게임처럼, 테스트가 지루해지지 않도록 보장합니다.

3. 구축 방법 ("로봇 건축가")

모든 테스트를 인간이 작성하는 것은 (영원히 걸릴 것이므로) 대신 자율 코딩 에이전트(로봇 프로그래머) 를 사용해 테스트를 구축했습니다.

  • 이 로봇은 게임 규칙을 작성합니다.
  • 그런 다음 "심사 위원회"(다른 두 개의 AI) 와 규칙을 검토하여 게임이 공정하고, 해결 가능하며, 실제로 팀워크를 요구하는지 확인합니다.
  • 모든 비밀을 아는 상태에서 "시범 라운드"를 진행합니다. 만약 AI 가 이때도 실패하면, 그 테스트는 정신적인 문제가 아니라 물리적으로 너무 어렵기 때문에 폐기됩니다.
  • AI 가 시범 라운드는 통과하지만 비밀이 숨겨진 실제 라운드에서는 실패하면, 그 테스트는 유지됩니다. 이는 AI 가 물체를 찾을 수 없어서가 아니라 팀워크 부족으로 실패했음을 증명합니다.

4. 결과: "말하기 - 행동하기" 간극

연구진은 현재 이용 가능한 가장 똑똑한 AI 모델 일곱 개를 테스트했습니다. 결과는 극명했습니다:

  • 말하기: 파트너가 무엇을 알고 있는지 단순히 보고하라고 요청했을 때, AI 들은 나쁘지 않게 약 **45%**의 정답률을 보였습니다.
  • 행동하기: 실제로 작업을 완료하기 위해 협력하라고 요청했을 때, **모든 모델이 가장 어려운 버전의 테스트에서 0%**를 기록했습니다. 그들은 신뢰할 수 있게 조율하지 못했습니다.

판결: AI 들은 탁상 전술가 (게임을 분석하는 데는 뛰어남) 로는 훌륭하지만, 실제 경기장 선수 (플레이를 실행하는 데는 형편없음) 로는 형편없습니다.

5. 왜 실패하는가? (5 가지 붕괴 요인)

연구진은 실패 사례를 면밀히 조사하여 AI 팀워크가 무너지는 다섯 가지 구체적인 방식을 발견했습니다:

  1. 정보 withheld: AI 는 중요한 사실을 알고 있지만 파트너에게 알려주는 것을 너무 늦게 기다려 파트너가 실수를 하게 만듭니다.
  2. 연쇄 고장: AI 는 물리적 작업 (냉장고 열기) 을 수행하지만 파트너에게 알리는 것을 잊어, 파트너가 작업이 완료되었는지 모르게 합니다.
  3. 사보타주: 에이전트들이 각자의 사적인 목표를 가진 작업에서 때로는 실수로 (또는 고의로) 파트너의 행동이 공유 목표에 어떻게 영향을 미치는지 이해하지 못해 공유 목표를 망칩니다.
  4. 잘못된 메시지: 제한된 "텍스트 메시지"를 잘못된 사람이나 중요하지 않은 세부 사항에 낭비합니다.
  5. 한계 무시: 잠긴 방에 들어가는 것처럼 파트너에게 불가능한 일을 요청합니다.

요약

이 논문은 AI 에이전트들이 단순히 그것에 대해 말하는 것이 아니라 물리적 세계에서 실제로 함께 일할 수 있는지 테스트하는 동적이고 진화하는 벤치마크인 EnactToM을 소개합니다. 연구 결과는 엄청난 간극을 보여줍니다: 오늘날 가장 진보된 AI 모델들은 파트너의 생각을 설명할 수는 있지만, 그 지식을 활용해 행동을 조율하는 데는 신뢰할 수 없습니다. 논문은 AI 가 인간과 진정으로 협력하려면 단순히 신념을 "보고"하는 것을 넘어 그것을 기반으로 "행동"하는 단계로 넘어가야 한다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →