Beyond Sally-Anne: Evaluating Theory of Mind in LLMs using Epistemic Schelling Points
이 논문은 대규모 언어 모델의 기능적 마음 이론(Theory of Mind) 및 인식적 추적 능력에서 나타나는 상당한 격차를 드러내는 새로운 대화 기반 벤치마크인 인식적 비대칭 셸링 태스크(Epistemic Asymmetry Schelling Task, EAST)를 소개하며, 이를 통해 최첨단 모델들이 전통적인 정적 테스트에서는 높은 성능을 보임에도 불구하고 역동적인 사회적 협력에는 어려움을 겪는다는 점을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신과 친구가 문자 메시지로 고도의 심리전이 담긴 "비밀 단어" 게임을 하고 있다고 상상해 보세요. 서로 대화할 수는 없지만, 네 개의 단어 목록 중에서 반드시 똑같은 단어를 골라야 승리합니다. 반전은, 여러분 각자에게 비밀스러운 "페르소나"(예: 재단사 또는 외과의사)가 주어지며, 상대방이 당신에 대해 무엇을 알고 있는지를 바탕으로 상대가 어떤 단어를 고를지 예측해야 한다는 것입니다.
이 설정은 구글의 연구진들이 거대 언어 모델(LLM)—챗봇의 두뇌 역할을 하는 초지능형 AI—이 실제로 다른 사람의 생각을 "생각"할 수 있는지 확인하기 위해 설계한 새로운 연구의 배경입니다. 이러한 능력을 **마음 이론(Theory of Mind)**이라고 부릅니다.
기존 방식: "샐리-앤"의 함정
오랫동안 과학자들은 "샐리-앤 과제"라는 고전적인 수수께끼를 통해 AI의 마음 이론을 테스트해 왔습니다. 이는 마치 동화책 퀴즈와 같습니다: "샐리가 공을 상자에 넣고 떠났습니다. 앤이 그것을 바구니로 옮겼습니다. 샐리는 어디를 찾아볼까요?"
연구진들은 이 오래된 방식이 플레이어가 이미 패턴을 외워버린 비디오 게임의 보스와 같다고 주장합니다. AI 모델들은 인터넷의 방대한 텍ек스트로 학습되었기 때문에, 이 정확한 수수께끼를 이미 수백만 번 접했을 가능성이 높습니다. 그들은 샐리가 앤과 다른 관점을 가지고 있다는 것을 진정으로 이해해서가 아니라, 단순히 이야기의 패턴에 따라 답을 추측하는 것일 수 있습니다. 이는 마치 영화에서 들은 문구를 앵무새처럼 반복하는 것과 같습니다. 말은 유창하게 들리지만, 단어의 의미는 전혀 모르는 상태인 것이죠.
새로운 게임: EAST ("마음 읽기" 협력 게임)
이를 해결하기 위해 연구팀은 EAST(Epistemic Asymmetry Schelling Task, 인식적 비대칭 셸링 과제)라는 새로운 게임을 발명했습니다. 단순한 동화 퀴즈가 아닌, 실시간 협력 도전 과제입니다.
게임 방식은 다음과 같습니다:
- 설정: 두 명의 AI 에이전트가 짝을 이룹니다. 각자 비밀 직업(예: "맞춤 양복 재단사" 또는 "일반 외과의사")을 부여받습니다.
- 목록: 네 개의 단어가 제시됩니다. 두 단어는 각자의 직업에 특화된 단어이고(예: 재단사의 경우 "직물", 외과의사의 경우 "메스"), 한 단어는 두 직업 모두에 걸쳐 있는 혼합 단어이며(예: "스티치/바느질"), 나머지 한 단어는 무작위 단어입니다(예: "자전거").
- 목표: 대화 없이 동일한 단어를 골라야 합니다.
- 반전: "누가 무엇을 아는지"에 대한 규칙이 변합니다.
- 대칭(Symmetric): 두 명 모두 서로의 직업을 알고 있습니다.
- 비대칭(Asymmetric): 한 명은 상대의 직업을 알지만, 다른 한 명은 첫 번째 사람의 직업을 모릅니다.
- 무지(Zero Knowledge): 둘 다 서로의 직업을 모릅니다.
승리하기 위해서 AI는 까다로운 작업을 수행해야 합니다: 자신의 "최애" 단어를 억제하고, 상대방이 가진 정보(혹은 정보의 부재)를 고려하여 상대방이 무엇을 생각하고 있는지를 예측해야 합니다.
게임이 밝혀낸 것
연구진이 14개의 서로 다른 AI 모델(10억 개의 파라미터를 가진 작은 모델부터 최첨단 "프런티어" 모델까지)을 대상으로 이 게임을 실행했을 때, 결과는 다소 냉혹한 현실을 보여주었습니다.
1. "거대" 모델만이 해낼 수 있었다
가장 크고 발전된 모델들(Gemini 1.5 Pro와 같은 프런티어급 모델)만이 일관되게 승리할 수 있었습니다. 이들은 까다로운 "비대칭" 및 "무지" 라운드를 성공적으로 통과했습니다. 반면, 더 작은 규모의 모델들은 대부분 실패했습니다. 그들은 이 게임을 단순한 단어 연상 테스트처럼 취급하여, 자신의 직업과 관련된 단어를 고르고 운 좋게 맞기를 바랄 뿐이었습니다.
2. "마음 읽기" 오류
연구진은 AI의 "두뇌"(추론 단계)를 들여다보며 왜 실패했는지 조사했습니다. 그 과정에서 **인식 추적 오류(Epistemic Tracking Errors)**라는 특정 유형의 오류를 발견했습니다.
친구가 점심으로 무엇을 먹을지 추측한다고 상상해 보세요. 당신은 친구가 피자를 좋아한다는 것을 압니다. 하지만 당신은 또한 친구가 당신이 피자를 좋아한다는 사실을 모른다는 것도 알고 있습니다. 만약 당신이 단지 당신이 피자를 좋아하기 때문에 "피자"를 선택한다면, 당신은 실수를 한 것입니다. 친구가 당신의 취향을 모른다는 사실을 망각한 것이죠.
AI 모델들도 똑같은 실수를 저질렀습니다. 그들은 종종 자신의 사적인 지식을 상대방이 알고 있는 지식과 혼동했습니다.
- 비대칭 라운드에서, 상대방의 직업을 알고 있던 AI는 상대방이 자신의 직업에 대해 "눈이 멀어 있다"는 사실을 깨닫지 못했습니다. 즉, 상대방이 자신의 비밀 정체를 추측할 것이라고 생각하여 자신의 정체에 기반한 단어를 골랐습니다.
- 무지 라운드에서, 모델들은 "공백" 상태를 감당하지 못했습니다. 그들은 둘 다 아무런 단서가 없는 상황을 상상하지 못했고, 그저 자신이 가장 좋아하는 단어를 집어 들었습니다.
3. "생각하며 말하기" 기법
연구진은 AI에게 "단계별로 생각하라"(Chain-of-Thought)고 요청하여 도움을 주는 실험을 했습니다. 가장 똑똑한 모델들의 경우, 이 방법이 AI가 무작위로 추측하는 대신 실제 논리를 사용하도록 도왔습니다. 하지만 성능이 낮은 모델들에게는 단순히 생각하라고 요구하는 것조차 문제를 해결해주지 못했습니다. 그들은 여전히 누가 무엇을 알고 있는지에 대해 혼란을 겪었습니다.
결론
이 논문은 AI 모델들이 질문에 답하는 능력은 매우 뛰어나지만, **강건한 사회적 추론(robust social reasoning)**에는 여전히 어려움을 겪고 있음을 시사합니다. AI는 사회적 상호작용의 '언어'를 흉내 낼 수는 있지만, 타인의 정신 상태를 진정으로 추적하는 데는 자주 실패합니다. 특히 "누가 무엇을 아는지"에 대한 규칙이 복잡해질 때 더욱 그렇습니다.
저자들은 AI가 "고장 났다"거나 결코 인간을 이해할 수 없을 것이라고 말하는 것이 아닙니다. 현재로서 "내가 아는 것"과 "네가 아는 것" 사이의 명확한 정신적 경계를 유지하는 능력이 주요한 병목 구간이라는 점을 지적하고 있습니다. AI가 자신의 비밀을 타인에게 투영하는 습관을 확실히 버릴 수 있게 되기 전까지는, 복잡하고 예측 불가능한 실제 인간의 대화 세계에 투입되기에는 아직 준비가 부족할 수 있습니다.
요약하자면, AI는 게임을 플레이할 만큼 똑똑하지만, 세상 전체가 자신의 머릿속에 들어있다고 생각하는 습관을 버리는 법을 여전히 배우고 있는 중입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.