Do we carry the false belief that LLMs have a theory of mind?
거대 언어 모델이 마음 이론 평가에서 종종 높은 점수를 달성함에도 불구하고, 본 연구는 이들이 진정으로 정신 상태를 추적하기보다는 비용 효율적인 휴리스틱에 의존하고 있음을 밝히며, 이는 이들이 견고한 마음 이론 능력이 결여되어 있음을 나타낸다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인간은 사회적 세계를 탐색할 수 있게 해주는 독특한 인지적 초능력을 지니고 있습니다. 그것은 다른 사람들도 자신만의 생각, 신념, 욕구로 가득 찬 마음을 가지고 있으며, 그것이 우리와 다를 수 있다는 것을 이해하는 능력입니다. 심리학자들은 이 능력을 '마음 이론(theory of mind)'이라고 부릅니다. 이는 친구가 물건을 마지막으로 보았던 곳에서 그것을 찾고 있을 것이라는 사실을, 비록 우리는 그 물건이 이미 다른 곳으로 옮겨졌다는 것을 알고 있음에도 불구하고 깨닫게 해주는 정신적 기제입니다. 이 기술은 단순히 영리함에 관한 것이 아니라, 공감, 의사소통, 그리고 협력의 토대가 됩니다. 수십 년 동안 연구자들은 아이들이 이 능력을 발달시켰는지 테스트하기 위해, 종종 샐리와 앤이라는 이름의 두 캐릭터가 등장하는 간단한 이야기를 사용해 왔습니다. 이야기에서 샐리는 바구니에 장난감을 숨기고 방을 떠납니다. 그녀가 없는 동안, 앤은 장난감을 상자로 옮깁니다. 샐리가 돌아왔을 때, 질문은 간단합니다. 샐리는 자신의 장난감을 어디에서 찾을까요? 마음 이론이 발달한 아이는 샐리가 장난감을 바구니에서 찾을 것이라는 점을 알고 있습니다. 왜냐하면 그것이 장난감이 있다고 그녀가 믿는 곳이기 때문이며, 실제로는 이제 상자에 들어있음에도 불구하고 말입니다.
최근 우리의 일상생활에 새로운 종류의 지능이 등장했습니다. 바로 대규모 언어 모델입니다. 이들은 방대한 양의 텍м을 학습하여 인간의 대화를 모방하듯 유창하게 글을 쓰고, 채팅하며, 문제를 해결할 수 있는 컴퓨터 프로그램입니다. 이 모델들은 복잡한 주제를 논할 수 있고 문맥을 이해하는 것처럼 보이기 때문에, 많은 연구자와 관찰자들은 이들 또한 마음 이론을 가지고 있는 것은 아닌지 궁금해하기 시작했습니다. 만약 기계가 허구의 캐릭터가 믿는 바를 정확하게 예측할 수 있다면, 그것은 진정으로 믿음이라는 개념을 이해하는 것일까요, 아니면 단지 이전에 본 패턴에 기반하여 추측하는 것일까요? 이러한 도구들이 우리의 사회적, 전문적 삶에 통합됨에 따라, 이들이 진정한 사회적 파트너인지 아니면 그저 매우 정교한 흉내쟁이인지를 결정해야 할 시급한 필요성이 생겨났습니다.
최근 한 연구는 가장 발전된 다섯 가지 언어 모델을 고전적인 샐리-앤 시나리오와 그 몇 가지 변형을 통해 테스트하여 이 질문에 답하고자 했습니다. 니콜라스 그리펜(Nicholas Griffen)이 이끄는 파리 시립 대학교 연구진은 단순히 모델들에게 표준적인 질문을 던지는 대신, 단순한 암기가 아닌 진정한 추론을 요구하는 이야기의 미묘한 세부 사항들을 처리할 수 있는지 확인하기 위해 일련의 도전 과제들을 설계했습니다. 그들은 GPT-5.5 Luna, Claude Sonnet 5, Gemini 3.1 Pro, Grok 4.5, Mistral Medium 3.5를 포함한 주요 기업들의 모델들을 테스트했습니다. 결과의 공정성을 보장하기 위해, 연구진은 각 테스트마다 이름, 물건, 구체적인 세부 사항을 변경하여 모델들이 학습 데이터에서 이전 답변을 단순히 회상할 수 없도록 새롭고 독특한 버전의 이야기를 만들었습니다. 또한, 캐릭터가 장난감을 볼 수 있도록 용기를 투명하게 만들거나, 장난감이 놓인 위치를 묘사하는 단어를 바꾸는 등의 까다로운 반전을 도입하여, 모델들이 새로운 시각적 또는 언어적 정보에 따라 추론을 조정할 수 있는지 테스트했습니다.
결과는 어떤 영역에서는 매우 유능하지만 근본적으로 제한적인 시스템의 모습을 보여주었습니다. 모델들에게 표준 버전의 이야기를 주었을 때, 대부분 거의 매번 정답을 맞히며 놀라운 성과를 보였습니다. 실제로 모든 유형의 질문에 걸쳐 평균을 냈을 때, 모델들은 무작위 확률보다 훨씬 높은 점수를 기록했습니다. 최고 성적을 거둔 Gemini 3.1 Pro는 전체적으로 84퍼센트의 확률로 정답을 맞혔습니다. 이러한 성공은 이 모델들이 읽은 방대한 텍스트로부터 '오해(false belief)' 과제의 일반적인 패턴을 학습했음을 시示합니다. 그들은 이야기의 구조를 인식하고 교과서적인 시나리오에서 인간이 줄 법한 답변을 제공할 수 있습니다.
그러나 연구는 이러한 성공이 매우 취약하다는 것을 드러냈습니다. 연구진이 상식이나 시각적 정보를 통합해야 하는 변형된 상황을 도입했을 때, 성능은 급격히 떨어졌습니다. 한 변형 사례에서, 이야기는 용기가 투명하다고 묘사했는데, 이는 방으로 돌아온 캐릭터가 실제로 장난감을 볼 수 있음을 의미합니다. 현실 세계의 상황이라면, 사람은 캐릭터가 장난감을 볼 수 있기 때문에 더 이상 잘못된 믿음을 갖지 않는다는 것, 즉 진실을 알고 있다는 것을 이해할 것입니다. 그러나 모델들은 대체로 이러한 연결 고리를 만드는 데 실패했습니다. 오직 Gemini 3.1 Pro만이 이러한 질문 중 절반 이상을 맞혔습니다. 다른 모델들은 캐릭터가 여전히 예전의 빈 장소를 찾을 것이라고 주장하며, 캐릭터가 장난감을 볼 수 있다는 사실을 무시했습니다.
연구진이 장난감의 위치를 설명하는 전치사를 바꿨을 때 어려움은 더욱 두드러졌습니다. 표준적인 이야기에서 장난감은 상자 "안에(in)" 놓입니다. 테스트에서 연구진은 장난감이 상자 "위에(on)" 또는 양동이 "아래에(underneath)" 놓여 있다고 설명했습니다. 장난감이 상자 내부가 아닌 상자 위에 놓여 있기 때문에 눈에 보인다는 점이 암시되었을 때, 모든 모델이 완전히 실패하여 해당 질문에서 0퍼센트를 기록했습니다. 그들은 물체의 가시성이 대상의 마음 상태을 변화시킨다는 것을 추론하지 못했습니다. 마찬가지로, 이야기에 캐릭터가 장난감이 옮겨진 위치를 명시적으로 들었거나, 한 캐릭터가 다른 캐릭터가 무엇을 할 것이라고 생각하는지에 대해 물었을 때도 모델들은 비틀거렸습니다. 그들은 이야기가 전개됨에 따라 캐릭터의 정신 상태를 동적으로 추적하기보다는 단순하고 경직된 패턴을 따르는 경우가 많았습니다.
연구진은 또한 모델들이 캐릭터의 성별을 어떻게 다루는지 살펴보았습니다. 그들은 모델들이 이야기 속 두 캐릭터가 같은 성별일 때 성적이 약간 더 좋고, 성별이 다를 때 약간 더 나쁘다는 것을 발견했습니다. 이는 모델들이 각 개인의 역할과 행동을 진정으로 이해하기보다는, 누가 누구인지 추적하기 위한 지름길로 성별을 사용하고 있음을 시사합니다. 두 명의 캐릭터가 같은 성별을 사용하여 그 지름길이 제거되었을 때, 모델들은 역설적으로 사건의 순서에 더 의존하게 되었고, 이는 정답을 맞힐 확률을 높이는 데 도움이 되었습니다. 이는 그들의 추론이 인간의 추론만큼 견고하지 않음을 나타내는데, 인간의 추론은 상황을 이해하기 위해 그러한 피상적인 단서에 의존하지 않기 때문입니다.
이 연구의 핵심적인 발견은 이러한 언어 모델들이 인간처럼 마음 이론 테스트의 정답을 흉내 낼 수는 있지만, 인간이 하는 방식대로 정신 상태를 이해하는 근본적인 능력은 갖추고 있지 않다는 것입니다. 그들은 캐릭터가 무엇을 보고, 무엇을 알고, 무엇을 믿는지 사이의 연결 고리를 만드는 데 어려움을 겪습니다. 모델들은 자신이 소비한 데이터의 가장 흔한 패턴을 바탕으로 답을 추측하는 '휴리스틱(heuristics)', 즉 정신적 지름길을 사용하는 것으로 보입니다. 이야기가 표준 패턴에서 벗어나 시각적 세부 사항을 추가하거나 공간적 관계를 바꿀 때, 그 지름길들은 실패했습니다. 연구진은 이것이 모델들이 텍스트만을 학습했기 때문이라고 제안합니다. 그들은 장난감이 옮겨지는 것을 본 적도 없고, 무언가를 찾는 느낌을 경험해 본 적도 없으며, 자신의 눈에 의존하여 지식을 업데이트해야 했던 적도 없습니다. 이러한 체화된 경험 없이는, 현실과 다른 믿음이라는 개념을 진정으로 파악할 수 없습니다.
궁극적으로, 이 연구는 기계가 인간처럼 말할 수 있다고 해서 인간처럼 생각한다고 가정하는 것에 대해 경고를 보냅니다. 모델들은 마음 이론을 가진 것처럼 보이는 답변을 만들어낼 수 있지만, 지각과 믿음에 대한 진정한 이해를 요구하는 시나리오로 테스트했을 때 그 한계를 드러냅니다. 그들은 읽은 내용을 반복하는 데는 뛰어나지만, 인간이 복잡한 사회적 세계를 항해할 수 있게 해주는 유연한 상식적 추론 능력은 아직 갖추지 못했습니다. 이러한 도구들이 점점 더 흔해짐에 따라, 그들의 겉보기 지능은 그들이 소비한 데이터의 반영일 뿐, 그들 스스로의 마음이 발달했다는 신호가 아님을 기억하는 것이 중요합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.