Surprisal from Larger Transformer-based Language Models Predicts fMRI Data More Poorly
본 연구는 더 큰 트랜스포머 기반 언어 모델이 인간의 문장 처리 난이도를 덜 정확하게 예측한다는 역비례 관계가 읽기 시간뿐만 아니라 fMRI 데이터에도 적용된다는 것을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 인간의 뇌가 언어를 어떻게 처리하는지 이해하려고 노력하고 있다고 상상해 보세요. 수년 동안 과학자들은 사람이 단어를 이해하는 데 얼마나 많은 노력이 드는지 추측하기 위해 **"서프라이절(surprisal, 놀람 정도)"**이라는 개념을 사용해 왔습니다. 서프라이절을 "충격 측정기"라고 생각하면 쉽습니다. 만약 당신이 조용한 도서관에 관한 이야기를 읽고 있는데 갑자기 문장에 "악어"라는 단어가 등장한다면, 당신의 뇌는 큰 충격(높은 서프라이절)을 받게 됩니다. 왜냐로 예상치 못한 단어이기 때문입니다. 반면 "책"이라는 단어를 본다면, 예상했던 것이기에 충격이 없습니다(낮은 서프라이절).
오랫동안 연구자들은 컴퓨터 언어 모델(초고성능 AI와 같은)이 더 크고 똑똑할수록, 사람이 문장을 읽는 데 걸리는 시간이나 뇌의 반응을 예측하는 능력이 더 뛰어날 것이라고 믿었습니다.
거대한 반전
이 논문은 그 생각을 완전히 뒤집습니다. 연구진은 더 크고 강력한 AI 모델일수록 오히려 인간의 뇌가 언어에 어떻게 반응하는지를 예측하는 데 더 서툴다는 사실을 발견했습니다.
이들이 이 사실을 어떻게 알아냈는지, 몇 가지 쉬운 비유를 통해 설명해 드리겠습니다.
"전문가" 대 "인간"
비가 올지 예측하려는 두 명의 기상 예보가가 있다고 상상해 보세요.
- 예보가 A는 작고 단순한 모델입니다. 비가 오는 것을 몇 번 본 적이 있으며, 꽤 괜찮게 예측합니다.
- 예보가 B는 역사상의 모든 기상 보고서를 학습한 거대하고 초고성능인 컴퓨터 모델입니다. 이 모델은 매우 똑똑하며 실제 기상 패턴을 거의 완벽하게 예측합니다.
연구진은 인간의 행동(사람이 단어에 의해 얼마나 놀라는가와 같은)을 예측하는 데 있어서는 예보가 B가 예보가 A보다 오히려 정확도가 떨어진다는 것을 발견했습니다.
왜 그럴까요? 이 초지능 AI는 희귀한 단어들을 너무나 완벽하게 예측하도록 학습되었기 때문에, 더 이상 그 단어들에 대해 놀라지 않게 되었기 때문입니다. 하지만 인간은 여전히 희귀한 단어에 놀랍니다. AI는 자신의 일을 너무 "완벽하게" 수행하게 되어, 일반적인 인간의 뇌가 실제로 작동하는 방식과는 동떨어지게 된 것입니다. 이는 마치 체스 그랜드마스터가 게임의 모든 수를 완벽하게 예측할 수 있지만, 초보자가 저지를 법한 "실수"는 예측하지 못해 초보자의 다음 수를 맞히지 못하는 것과 같습니다.
실험: 두 가지 다른 뇌
이것이 단순히 우연이 아님을 증명하기 위해, 연구진은 단순히 읽기 속도를 측정하는 대신 뇌 스캔(fMRI 데이터)을 사용하여 이 이론을 테스트했습니다. 그들은 이 "더 커질수록 더 나빠진다"는 규칙이 실제 인간의 뇌 활동에도 적용되는지 확인하고 싶었습니다.
연구진은 다양한 크기(작은 것부터 거대한 것까지)를 가진 17개의 서로 다른 AI 모델을 사용했으며, 사람들이 이야기를 듣거나 문장을 읽는 동안 뇌가 스캔되는 두 그룹의 사람들을 대상으로 테스트했습니다.
- "자연스러운 이야기" 테스트: 사람들은 자연스러운 이야기를 듣는 동안 뇌가 스캔되었습니다.
- "페레이라(Pereira)" 테스트: 사람들은 짧은 구절을 읽는 동안 뇌가 스캔되었습니다.
결과:
두 테스트 모두에서 동일한 패턴이 나타났습니다. AI 모델이 커지고 똑똑해질수록, 인간의 뇌 반응과 일치하는 능력은 오히려 악화되었습니다. 가장 큰 모델들이 인간의 뇌가 어떻게 반응할지를 예측하는 데 가장 서툴렀습니다.
이것이 왜 중요한가 (논문에 따르면)
논문은 이 "역 스케일링(inverse scaling, 모델이 커질수록 예측력이 떨어지는 현상)"이 단순히 사람들이 읽는 속도와 관련된 특이한 현상이 아니라고 결론짓습니다. 이는 뇌의 실제 전기적 활동에서도 발생합니다.
저자들은 이 거대 모델들이 너무 많은 데이터를 학습했기 때문에, 희귀한 단어들을 너무 잘 예측하게 되어 인간에 비해 "놀람" 수준이 너무 낮아졌다고 제안합니다.
핵심 요약:
만약 당신이 인간의 뇌가 언어를 어떻게 처리하는지 이해하고 싶다면, 반드시 가장 크고 비싼 AI가 필요하지는 않을 수도 있습니다. 사실, 약간 더 작고 덜 "완벽한" 모델이 우리 뇌가 작동하는 방식을 더 잘 반영하는 거울이 될 수 있습니다.
참고: 이 논문은 자신의 연구 결과가 이러한 특정 언어 모델과 뇌 데이터셋에 국한됨을 엄격히 밝히고 있습니다. 이 결과가 다른 언어, 임상 진단 또는 미래의 AI 응용 분야에 적용된다고 주장하는 것이 아닙니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.