Can LLMs interpret figurative language as humans do?: surface-level vs representational similarity
대규모 언어 모델들은 대화의 표면적 해석에 있어서는 인간과 일치하지만, 관용구, 속어, 비꼬기(sarcasm)와 같이 맥락 의존적이고 사회-화용론적인 비유적 언어를 처리할 때는 표현적 수준에서 인간과 크게 괴리를 보이며, 테스트된 모델들 중에서는 GPT-4가 인간의 패턴에 가장 근접한 근사치를 보여준다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 인간의 농담, 비꼬는 말투(사카즘), 그리고 속어(슬랭)를 이해하는 법을 가르치고 있다고 상상해 보세요. 당신은 로봇에게 "이 음식 진짜 대박이야(This food is gas)"라는 문장을 보여주며, "이게 웃겨?" 또는 "이게 긍정적인 표현이야?"라고 묻습니다.
텍사스 A&M 대학교 연구진의 새로운 연구는 까다로운 질문을 던집니다. 만약 로봇이 인간과 똑같은 대답을 내놓는다면, 그것은 정말로 인간과 똑같은 방식으로 '생각'하고 있는 것일까요?
다음은 그들의 연구 결과를 일상적인 비유를 들어 설명한 내용입니다.
실험: "맛 테스트"
연구진은 거대한 맛 테스트를 준비했습니다. 다만 아이스크림 대신 240개의 서로 다른 문장을 사용했습니다. 이 문장들은 언어의 여섯 가지 '풍미'를 다룹니다:
- 관습적 언어 (Conventional): 일반적인 문장 (예: "개가 밖에 있다").
- 관용구 (Idiomatic): 단어의 의미가 문자 그대로의 의미와 다른 구절 (예: "Bite the bullet" - 어려움을 무릅쓰다).
- 감정적 언어 (Emotional): 감정이 가득 담긴 문장.
- 유머 (Funny): 농담과 말장난.
- 비꼬기 (Sarcastic): 실제 의도와 반대로 말하기.
- Z세대 속어 (Gen Z Slang): 현대 인터넷 용어 (예: "This food is gas" - 이 음식 진짜 최고야).
연구진은 211명의 인간과 네 가지 서로 다른 AI 모델(GPT-4, Llama, Mistral 포함)에게 모든 문장에 대해 "이것은 긍정적인가?" 또는 "이것은 우려스러운가?"와 같은 40가지 질문을 던졌으며, 답변은 1점에서 10점 사이의 척도로 기록되었습니다.
두 가지 비교 방식: "점수" vs "지도"
연구진은 결과를 두 가지 매우 다른 방식으로 살펴보았습니다.
1. 표면적 유사성 (점수판)
이것은 축구 경기의 최종 점수를 보는 것과 같습니다. 만약 AI가 농담에 대해 "8/10"이라고 답하고 인간도 "8/10"이라고 답한다면, 겉보기에는 두 존재가 일치하는 것처럼 보입니다.
- 발견: 이 단계에서 AI 모델들, 특히 가장 똑똑한 GPT-4는 매우 인간처럼 보였습니다. 그들은 대부분의 문장에서 인간과 유사한 점수를 주었습니다. 마치 한 팀인 것처럼 보였습니다.
2. 표상적 유사성 (지도)
이것은 더 깊은 부분입니다. 상상해 보세요, 당신과 친구가 모두 도시의 지도를 그리고 있습니다.
- 인간의 지도: 당신은 "피자 가게"가 "공원" 바로 옆에 있고, "학교"는 "공동묘지"와 멀리 떨어져 있다는 것을 압د합니다. 당신의 지도는 세상을 이해하는 방식에 기반한 특정한 '구조'를 가지고 있습니다.
- AI의 지도: AI 역시 "피자 가게"와 "공원"을 가깝게 배치할 수 있지만, 그 이유는 다를 수 있습니다. 아마도 AI는 두 장소가 실제 생활에서 어떻게 기능하는지가 아니라, 둘 다 "장소(place)"라는 단어를 포함하고 있기 때문에 가깝다고 생각할 수도 있습니다.
연구진은 **표상 유사성 분석(Representational Similarity Analysis, RSA)**이라는 수학적 도구를 사용하여 이 '지도'의 구조를 비교했습니다. 단순히 점수가 일치하는지를 확인한 것이 아니라, 문장들 사이의 '관계'가 동일한지를 확인한 것입니다.
거대한 폭로: "가짜(Imposter)" 효과
그들이 발견한 사실은 다음과 같습니다.
- 표면은 기만적이다: AI 모델들은 인간의 '점수'를 흉내 내는 데 매우 뛰어났습니다. "이것이 비꼬는 표현인가요?"라고 물으면, AI는 인간처럼 "네"라고 답하곤 했습니다.
- 지도는 다르다: 하지만 연구진이 근본적인 '지도'를 살펴보았을 때, AI와 인간은 실제로 상당히 멀리 떨어져 있었습니다. AI는 인간과 다르게 문장의 의미를 조직하고 있었습니다.
비유하자면:
AI를 아주 재능 있는 앵무새라고 생각해보세요.
- 당신이 앵무새에게 "이 문장이 웃겨?"라고 물으면, 앵무새는 인간처럼 완벽하게 "네"라고 말할 수 있습니다.
- 하지만 앵무새는 농담을 실제로 '이해'하는 것이 아닙니다. 단지 사람들이 특정한 단어 패턴을 들었을 때 보통 "네"라고 대답한다는 것을 알고 있을 뿐입니다.
- 반면, 인간은 사회적 맥락, 어조, 그리고 숨겨 된 의미를 이해하기 때문에 농담을 이해합니다.
"풍미"별 결과
연구는 AI의 "앵무새 기술"이 어떤 유형의 언어에서 더 잘 작동하는지 찾아냈습니다.
- 감정적 및 관습적 문장: AI의 지도는 인간의 지도와 어느 정도 유사했습니다. "나는 슬프다"가 부정적이라는 것을 추측하는 것이 "식물을 다 죽여버릴 정도로 신나"가 왜 웃긴지 추측하는 것보다 쉽기 때문입니다.
- 관용구, 비꼬기, 속어: 이 부분이 바로 AI가 "지도 테스트"에서 실패한 지점입니다.
- 관용구: 인간이 "Break a leg(행운을 빌어)"라고 들을 때, 그것이 "행운을 빈다"는 뜻임을 알지만, AI는 종종 "부러뜨리다"와 "다리"라는 글자 그대로의 단어 때문에 혼란을 겪으며 이를 "행운"이라는 개념에 올바르게 연결하지 못했습니다.
- 비꼬기와 속어: 이것들은 사회적 맥락과 공유된 인간 경험(Z세대 속어 등)에 크게 의존합니다. AI의 내부 지도는 이러한 부분에서 인간의 지도와 매우 달랐습니다. 이는 마치 AI가 단어는 같게 말하지만, 실제로는 전혀 다른 언어를 말하고 있는 것과 같았습니다.
"거대한 뇌" vs "작은 뇌"
연구는 다양한 AI 모델을 비교했습니다.
- GPT-4: 이것은 "거대한 뇌"였습니다. 인간과 가장 유사한 지도를 가졌지만, 여전히 완벽한 일치는 아니었습니다. 인간에 가장 가까웠지만, 여전히 격차가 존재했습니다.
- 더 작은 모델들 (Llama, Mistral): 이들은 훨씬 더 멀리 떨어져 있었습니다. 그들의 지도는 인간과 매우 달랐으며, 특히 비꼬기나 속어 같은 까다로운 부분에서 그러했습니다.
결론
이 논문은 AI가 인간과 같은 답을 내놓는다고 해서, 그것이 인간과 같은 방식으로 언어를 이해한다는 것을 의미하지는 않는다고 결론짓습니다.
AI는 패턴 매칭(점수판 흉내 내기)에는 탁월하지만, 인간이 가진 깊은 사회적, 맥락적 "접지(grounding)"가 부족합니다. AI는 자신만의 독특한 방식으로 의미를 조직하며, 이는 단순한 작업에는 잘 작동하지만 언어가 까다롭거나, 감정적이거나, 문화적으로 특수한 경우에는 무너집니다.
요약하자면: AI는 대사를 완벽하게 읊을 수 있는 매우 유능한 배우이지만, 반드시 그 뒤에 숨겨진 감정을 느끼는 것은 아닙니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.