Developmental Trajectories of Situation Modeling and Mentalizing in Transformer Language Models
이 논문은 발달적 관점을 채택하여, 거대 언어 모델이 규모 확장과 사후 학습을 통해 결국 틀린 믿음 과제 수행 능력과 상황 모델링 능력을 습득하게 되지만, 이러한 정신화 능력은 비사실적 동사와 같은 언어적 단서에 취약하고 불안정한 상태로 남아 있음을 입증하며, 이는 강건한 평가를 위한 스트레스 테스트와 발달적 분석의 필요성을 강조한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 마술사가 상자에서 모자로 공을 옮기는 마술을 보고 있다고 상상해 보세요. 마술을 지켜본 아이는 공이 모자 안에 있다는 것을 알고 있습니다. 하지만 그 움직임을 보지 못한 다른 사람이 공이 어디에 있느냐는 질문을 받는다면, 그 사람은 여전히 공이 상자 안에 있다고 생각할 것입니다.
이것은 심리학자들이 '마음 이론(mentalizing)'이라고 부르는 것의 핵심입니다. 즉, 다른 사람들은 자신만의 생각과 믿음을 가지고 있으며, 그것이 현실과 다르거나 자신의 것과 다를 수 있다는 점을 이해하는 능력입니다.
이 논문은 간단한 질문을 던집니다. AI 언어 모델(우리가 대화하는 것과 같은 모델)이 실제로 이 마술의 원리를 이해하고 있는 것일까요, 아니면 그저 추측하고 있는 것일까요?
이를 알아내기 위해 연구자들은 단순히 AI의 최종 답변만을 살펴보지 않았습니다. 대신, 마치 어린아이처럼 AI가 훈련의 첫날부터 최종적으로 다듬어진 버전이 되기까지 어떻게 "성장"하는지를 관찰했습니다. 그들은 발달적 접근 방식을 사용하여 AI의 기술이 시간이 흐름에 따라 어떻게 변하는지 추적했습니다.
다음은 연구 결과의 이야기이며, 일상적인 비유를 통해 설명합니다.
1. 성공을 위한 "두 가지 재료" 레시피
연구진은 두 가지 서로 다른 AI 모델 계열을 테스트했습니다. 하나는 방대한 양의 책을 읽은 Olmo2이고, 다른 하나는 훨씬 적은 양의 도서관 데이터를 읽은 Pythia입니다.
연구진은 AI가 "마술(틀린 믿음 과제, False Belief Task)"을 잘 수행하기 위해서는 두 가지가 동시에 필요하다는 것을 발견했습니다.
- 거대한 뇌 크기: 모델의 규모가 커야 합니다.
- 많은 독서량: 엄청난 양의 텍스트를 읽어야 합니다.
비유: 이것은 케이크를 굽는 것과 같습니다. 만약 거대한 오븐(큰 모델)은 있지만 밀가루(충분한 훈련 데이터)가 없다면 케이크를 구울 수 없습니다. 반대로 밀가루는 충분하지만 아주 작은 토스터 오븐(작은 모델)만 있다면 역시 케이크를 구울 수 없습니다. 진짜 이해하는 것처럼 보이는 결과를 얻으려면 큰 오븐과 밀가루가 모두 필요합니다.
2. "늦깎이 천재"
AI는 이 기술을 초기에 배우지 못했습니다. 수백만 페이지를 읽은 후에도 AI는 여전히 무작위로 추측할 뿐이었습니다. AI가 이미 문법과 사실들을 익힌 아주 늦은 단계에 이르러서야 비로소 이 "마술"을 제대로 맞히기 시작했습니다.
비유: 어떤 학생이 사전 내용을 통째로 외우고 완벽한 문장을 쓰는 법을 배우기 위해 수년을 보낸다고 상상해 보세요. 그 모든 것을 마스터한 후에야 비로소 그 학생은 이야기 속 인물이 왜 거짓말을 하는지 그 '이유'를 이해하기 시작합니다. "마음을 이해하는" 기술은 AI의 교육 과정에서 매우 늦게 도착했습니다.
3. "취약한" 이해력
여기서 까다로운 문제가 발생합니다. AI의 믿음을 이해하는 능력은 매우 취약했습니다. 그것은 마치 살짝만 불어도 무너지는 카드 집과 같았습니다.
연구진은 질문에서 단 한 단어만 바꾸더라도(예를 들어, "데이브는 공이 상자에 있다고 생각한다"와 같이 '생각한다'라는 단어를 사용했을 때), 이야기가 단순하더라도 AI가 혼란을 겪는다는 것을 발견했습니다.
비유: 어떤 학생이 수학 문제를 완벽하게 풀 수 있다고 가정해 봅시다. 하지만 그 문제를 특정 글꼴로 써주면 정답을 맞히지만, 글꼴을 약간만 바꿔도 갑자기 수학을 하는 법을 잊어버리는 것과 같습니다. AI는 등장인물의 마음을 진정으로 "생각"하고 있는 것이 아니라, '생각한다'와 같은 특정 단어들에 마치 마법의 트리거(방아쇠)처럼 반응하고 있었던 것입니다.
4. "장면 구축가" vs "마음 읽기"
연구진은 AI가 '상황 모델(Situation Model)'을 구축할 수 있는지 또한 테스트했습니다. 이는 멋진 말로 표현하자면, *AI가 이야기의 기본 사실들을 기억할 수 있는가?*를 묻는 것입니다. (예: "누가 공을 옮겼는가?", "공은 어디로 갔는가?")
발견 내용:
- AI는 마음(믿음)을 이해하는 법을 배우기 전에 사실(장면)을 기억하는 법을 먼저 아주 잘 익혔습니다.
- 하지만 AI의 사실에 대한 기억은 또한 엉망이었습니다. 실제로 공을 옮긴 사람(행위자)에 대해 물었을 때, AI는 자주 혼란을 겪었습니다. "마음 읽기" 테스트에서는 성공적으로 추측했음에도 불구하고, 누가 무엇을 했는지에 대해 뒤섞어 버리는 모습을 보였습니다.
비유: 탐정이 도난당한 자동차가 정확히 어디에 주차되어 있었는지(사실) 말할 수 있고, 도둑이 자동차에 대해 어떻게 생각했는지(마음) 추측할 수 있다고 해봅시다. 하지만 만약 누군가 그 탐정에게 "실제로 차를 훔친 사람이 누구인가요?"라고 묻는다면, 탐정은 혼란에 빠져 엉뚱한 사람을 가리킬 것입니다. AI의 내부적인 이야기 지도는 부분적으로 고장 난 상태였습니다. 조각들은 볼 수 있었지만, 그것들을 하나의 일관된 전체로 결합하지는 못했던 것입니다.
결론
이 논문은 거대하고 잘 훈련된 AI 모델들이 인간의 믿음을 이해하는 것처럼 보이는 테스트를 통과할 수는 있지만, 이 능력은 다음과 같다고 결론짓습니다:
- 늦게 도착함: 이를 발전시키기 위해서는 엄청난 양의 훈련이 필요합니다.
- 취약함: 단어의 미세한 변화에도 쉽게 무너집니다.
- 불일치함: 이야기의 사실에 대한 AI의 이해와 등장인물의 마음에 대한 이해가 항상 완벽하게 일치하지는 않습니다.
핵째: AI는 반드시 인간과 같은 방식으로 타인의 마음을 "생각"하고 있는 것은 아닙니다. 대신, 학습된 패턴과 지름길들의 집합을 사용하고 있는 것으로 보입니다. 이는 마치 적절한 타이밍에 적절한 말을 할 줄 아는 앵무새와 같습니다. 하지만 그 말 뒤에 숨겨진 깊은 의미는 완전히 파악하지 못했을 수도 있습니다. 연구진은 AI가 정말로 "똑똑한지" 알기 위해서는 단순히 최종 점수만을 보는 것이 아니라, 시간이 흐름에 따라 어떻게 학습하는지를 관찰하고 엄격하게 스트레스 테스트를 해야 한다고 제안합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.