Why are language models less surprised than humans? Testing the Parse Multiplicity Mismatch Hypothesis
본 논문은 언어 모델이 구문적 모호성에서 인간의 처리 난이도를 과소평가하는 원인이 인간보다 더 많은 동시 구문 분석을 유지할 수 있는 능력에 기인한다는 가설을 검증하지만, 구문 분석의 다중성을 줄이는 것이 예측된 가든패스 효과를 증가시키기는 하나 인간의 읽기 시간 차이의 크기를 완전히 설명하지는 못한다는 사실을 발견한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
이야기를 읽다가 갑자기 뇌를 속이는 문장을 마주친다고 상상해 보세요. 이를 '가든 패스 (garden path)' 문장이라고 부릅니다.
예를 들어 보겠습니다: "The girl fed the lamb was upset because she asked for beef."
먼저 "The girl fed the lamb"를 읽을 때, 뇌는 자연스럽게 소녀가 먹이를 주는 주체라고 가정합니다. 이것이 가장 일반적인 이해 방식입니다. 하지만 'was'라는 단어를 만나면 갑자기 뇌가 자신이 틀렸음을 깨닫습니다. 이 문장의 실제 의미는 소녀가 먹이를 받은 것 (누군가 그녀에게 먹이를 줌) 이며, 그녀가 소고기를 요청했기 때문에 화가 났다는 것입니다. 이런 혼란과 재독의 순간은 시간이 걸립니다. 심리학자들은 이를 '가든 패스 효과'라고 부릅니다.
큰 질문
과학자들은 다음 단어를 예측하는 데 매우 뛰어난 '언어 모델 (Language Models)'이라는 강력한 컴퓨터 프로그램을 개발했습니다 (이 텍스트를 작성하는 프로그램도 그중 하나입니다). '서프라이설 이론 (Surprisal Theory)'이라는 가설은 단어를 예측하기 어려울수록 인간이 그 단어를 읽는 데 더 많은 시간이 걸린다고 제안합니다.
문제는 무엇일까요? 과학자들이 이러한 컴퓨터를 가든 패스 문장으로 테스트했을 때, 컴퓨터들은 너무 차분했습니다. 그 속임수에 놀란 정도가 충분하지 않았습니다. 컴퓨터는 혼란이 미미할 것이라고 예측했지만, 인간은 실제로 거대한 정신적 '비틀거림'을 경험합니다.
가설: '손전등' 이론
이 논문의 저자들은 궁금해했습니다: 왜 컴퓨터들은 그렇게 차분한 걸까?
그들은 컴퓨터가 너무 똑똑하기 때문일 것이라고 추측했습니다. 컴퓨터가 "The girl fed the lamb"를 읽을 때, 한 번에 수십 가지 다른 해석을 머릿속에 동시에 들고 있을 수 있습니다. "아마도 소녀가 양에게 먹이를 주고 있겠지. 아니면 양이 소녀에게 먹이를 주고 있겠지. 아니면 다른 종류의 양일 수도 있겠지."라고 생각하며 모든 가능성을 동시에 살펴보기 때문에, 'was'라는 단어는 충격으로 느껴지지 않습니다. 그저 이미 고려 중이던 여러 옵션 중 하나일 뿐입니다.
반면 인간은 어두운 방의 손전등과 같을 수 있습니다. 우리는 한 번에 하나 또는 두 개의 경로만 비출 수 있습니다. 우리는 '소녀가 먹이를 주고 있다'는 아이디어에 몰입합니다. 'was'를 만나면 우리의 손전등은 잘못된 방향을 가리키고 있으며, 우리는 돌아서서 새로운 경로를 찾아야 합니다. 그 회전에는 시간과 노력이 듭니다.
저자들은 이를 **'구문 분석 다중성 불일치 가설 (Parse Multiplicity Mismatch Hypothesis)'**이라고 명명했습니다. 간단히 말해: 컴퓨터는 한 번에 너무 많은 가능성을 보기 때문에 놀라움이 적지만, 인간은 오직 하나만 선택하도록 강요받기 때문입니다.
실험: 손전등 빛을 줄이기
이를 검증하기 위해 연구자들은 정확히 몇 개의 '경로'를 살펴볼지 지시할 수 있는 특수한 유형의 컴퓨터 모델을 사용했습니다. 그들은 다양한 설정으로 가든 패스 문장을 모델에 통과시켰습니다:
- 높은 다중성 (High Multiplicity): 컴퓨터가 한 번에 1,000 가지 다른 해석을 살펴봅니다 (매우 밝고 넓은 손전등과 같습니다).
- 낮은 다중성 (Low Multiplicity): 컴퓨터가 1 개 또는 2 개의 해석만 보도록 강요받습니다 (어둡고 좁은 손전등과 같습니다).
결과
- 부분적으로 옳았습니다: 컴퓨터가 더 적은 경로 (더 좁은 손전등) 를 보도록 강요했을 때, 실제로 더 놀랐습니다. 컴퓨터 예측의 '비틀거림'이 더 커졌습니다.
- 하지만 대부분은 틀렸습니다: 컴퓨터가 인간처럼 하나의 경로 (틀린 경로) 만 보도록 강요받았을 때도, 컴퓨터의 놀라움은 인간의 반응에 비해 여전히 미미했습니다.
컴퓨터의 '비틀거림'은 여전히 인간의 비틀거림보다 약 40 배나 작았습니다.
결론
이 논문은 단순히 컴퓨터를 '바보'처럼 만들거나 더 적은 옵션을 보게 하는 것만으로는 문제를 해결할 수 없다고 결론 내립니다. 컴퓨터와 인간이 언어를 처리하는 방식 사이의 간격은 한 번에 머릿속에 얼마나 많은 아이디어를 담을 수 있는지로만 설명하기에는 너무 큽니다.
저자들은 인간의 뇌에는 컴퓨터가 갖지 않은 추가적인 단계가 있을 수 있다고 제안합니다. 즉, 특정 '재분석 (re-analysis)' 메커니즘입니다. 인간이 막히면 단순히 조금 놀라는 것이 아니라, 기존의 이해를 적극적으로 해체하고 새로운 것을 다시 구축합니다. 현재의 컴퓨터 모델은 제한을 받더라도 그런 '해체하고 다시 구축하기' 버튼을 가지고 있지 않은 듯합니다. 그들은 단순히 계속 추측할 뿐이며, 너무 쉽게 추측합니다.
한 줄 요약
연구자들은 컴퓨터가 까다로운 문장에 덜 놀라는 이유가 '너무 많이 생각하기' (너무 많은 아이디어를 보유하기) 때문인지 확인해 보려 했습니다. 그들은 컴퓨터를 '덜 생각하게' 강요했을지라도, 컴퓨터는 여전히 인간에 비해 훨씬 차분하다는 사실을 발견했습니다. 이는 인간과 컴퓨터의 독서 방식 차이는 우리가 얼마나 많은 아이디어를 동시에 다룰 수 있는지에 관한 것이 아니라, 잘못되었을 때 어떻게 대처하는지에 관한 더 깊은 무언가에 기인한다는 것을 의미합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.