Language Models Can Resolve Reference Compositionally, But It's Not Their Native Strength: The Case of the Personal Relation Task
이 논문은 거대 언어 모델이 인간과 비교했을 때 개인적 관계에 대한 구조적이고 내포적인 해석에는 뛰어나지만, 지시적이고 외연적인 과업에서는 성능이 떨어진다는 점을 입증하며, 이는 참조적 접지(referential grounding)의 결여가 인간과 같은 언어 이해를 달성하는 데 있어 결정적인 한계임을 시사한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 앰버(Amber), 브라이언(Bryan), 크리스티나(Christina), 데이나(Dana)라는 여섯 명의 사람들이 얽혀 있는 거대하고 복잡한 가계도가 있다고 상상해 보세요. 이들은 '친구', '적', '부모', '자녀'와 같은 관계로 연결되어 있습니다.
이제 누군가가 이 가계도에 대해 까다로운 질문을 던집니다.
"앰버의 부모님의 친구는 누구인가?"
이 논문은 이 질문에 답하는 데 누가 더 뛰어난지를 두고 인간과 AI 언어 모델(LLM) 사이의 헤드 투 헤드 경쟁을 다룹니다. 하지만 여기에는 반전이 있습니다. 연구진은 참가자들에게 문제를 해결하는 두 가지 완전히 다른 방식을 요청했습니다.
문제를 푸는 두 가지 방법
"그 사람이 누구야?" 게임 (외연적 과업 - Extensional Task):
- 목표: 이름만 말하면 됩니다.
- 정답: "펠리시아(Felicia)."
- 테스트 내용: 지도를 따라가서 특정 목적지를 찾을 수 있는가? 이것은 지도를 보고 가고자 하는 도시를 손가락으로 가리키는 것과 같습니다.
"어떻게 가?" 게임 (내포적 과업 - Intensional Task):
- 목표: 이름을 말하는 대신, 그 사람을 찾는 레시피나 공식을 작성해야 합니다.
- 정답:
friend(parent(Amber)) - 테스트 내용: 문장의 구조를 이해하고 단계를 써 내려갈 수 있는가? 이것은 실제로 운전을 하는 대신, 운전하는 법에 대한 길 안내를 글로 쓰는 것과 같습니다.
놀라운 결과: 인간과 AI는 정반대입니다
연구진은 인간과 AI가 완전히 다른 것에 능숙하다는 것을 발견했습니다. 이는 마치 인간 항해사와 초고속 번역기를 비교하는 것과 같습니다.
인간은 항해사입니다:
"그 사람이 누구인가?"라는 질문을 받았을 때, 인간은 매우 뛰어났습니다(정확도 83%). 인간은 가계도를 보고 연결 고리를 따라가며 적절한 사람을 찾아낼 수 있었습니다.
하지만 "레시피"(friend(parent(Amber)))를 작성하라는 요청을 받았을 때, 인간은 어려움을 겪었습니다(정확도 71%). 이는 마치 운전을 아주 잘하는 운전자가 갑자기 운전법에 대한 교과서를 써야 하는데, 쓰는 규칙을 잊어버린 것과 같습니다.AI는 초고속 번역기입니다:
"레시피"를 작성하는 문제에서 AI는 놀라웠습니다(정확도 95%). AI는 이 질문을 언어 퍼즐처럼 다루었습니다. "앰버의 부모님의 친구"라는 문장을 보고 단순히 단어들을 공식 형태로 재배열했습니다. 이는 프랑스어를 영어로 바꾸는 데는 완벽하지만, 정작 프랑스에 가본 적은 없는 번역가와 같습니다.
하지만 "그 사람이 누구인가?"라는 질문에는 혼란을 겪었습니다(정확도 80%). AI는 가계도를 실제로 사용하여 특정 인물을 찾는 데 어려움을 겪었습니다. 공식은 알았지만, 그 공식을 따라 목적지에 도달하지는 못했습니다.
왜 이런 일이 발생할까요?
논문은 그 이유를 간단하게 제시합니다: 기술을 배운 곳의 차이입니다.
- 인간은 현실 세계와 상호작용하며 언어를 배웁니다. 우리는 '친구'나 '부모'가 무엇인지 실제로 만나봤기 때문에 그것을 압니다. 우리는 현실에 뿌리를 두고 있습니다(grounded). 그래서 특정 인물(누구인지)을 찾는 것이 자연스럽습니다.
- AI는 오직 텍스트로부터만 학습합니다. AI는 앰버라는 이름을 가진 사람을 만난 적이 없습니다. 단지 친구나 부모에 관한 수백만 개의 문장을 보았을 뿐입니다. AI는 단어의 패턴을 포착하고 재배열하는 데 전문가이지만, 탐색할 수 있는 '실제 세계'의 지도는 가지고 있지 않습니다. 이는 세상의 모든 요리책을 읽었지만, 정작 음식을 만들어 본 적도 맛본 적도 없는 요리사와 같습니다.
"추상적" 반전
연구진은 "앰버"와 같은 이름 대신 "h"나 "x"와 같은 무작위 문자를 사용하는 더 어려운 버전도 시도했습니다.
- 인간은 이를 매우 힘들어했습니다. 무작위 문자로 된 레시피를 파악하는 것은 매우 어려웠습니다.
- AI는 레시피 부분에서는 여전히 괜찮았지만, 사람을 찾는 데 있어서는 매우 형편없는 모습을 보였습니다.
시사점
결론적으로, AI는 기호를 조작하고 공식을 쓰는 것(내포적 과업)에는 믿을 수 없을 정도로 똑똑하지만, 그 기호를 사용하여 실제 세계의 답을 찾는 것(외연적 과업)에는 아직 인간만큼 뛰어나지 않습니다.
저자들은 AI가 인간처럼 언어를 진정으로 이해하기 위해서는 단순히 책을 읽는 것 이상의 것, 즉 우리처럼 현실 세계에 "뿌리 내리는(grounded)" 과정이 필요하다고 주장합니다. 그때까지 AI는 아이디어의 탁월한 번역가일 뿐, 현실의 완벽한 항해사는 아닙니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.