From Exposure to Expectation: Frequency, Surprisal, and Language Across Development in Spanish
이 연구는 누적 어휘 빈도가 아이들이 스페인어 단어를 습득하는 시기를 예측하는 강력한 예측 변수인 반면, 문맥적 놀라움(contextual surprisal)은 주로 성인의 순간적인 독해 처리 어려움을 설명한다는 점을 입증하며, 이는 이러한 요인들이 언어 발달의 서로 다른 단계에 걸쳐 뚜렷하게 다른 역할을 수행함을 시사한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
언어는 우리 삶을 관통하며 흐르는 강과 같아서, 영아기의 옹알이로부터 성인의 빠르고 복잡한 대화에 이르기까지 우리를 실어 나릅니다. 수십 년 동안 과학자들은 이 강이 우리의 정신을 어떻게 형성하는지 이해하기 위해 노력하며, 두 가지 뚜렷하면서도 연관된 질문을 던져왔습니다. 첫 번째 질문은 시작에 관한 것입니다. 왜 아이들은 "강아지"나 "우유"와 같은 단어는 일찍 배우는 반면, "정의"나 "속삭임"과 같은 단어는 훨씬 늦게 배우는가 하는 점입니다. 두 번째 질문은 여정에 관한 것입니다. 일단 단어를 알고 나면, 왜 어떤 경우에는 읽거나 듣기가 쉽고, 다른 경우에는 단어 자체가 변하지 않았음에도 불구하고 마치 걸려 넘어지는 것처럼 느껴지는가 하는 점입니다.
이 질문들에 답하기 위해 연구자들은 흔히 우리가 듣는 언어 속에 숨겨진 두 가지 종류의 통계적 단서들을 살펴봅니다. 한 가지 단서는 빈도(frequency)로, 이는 아이가 일상생활에서 특정 단어를 얼마나 자주 듣는지를 단순히 나타낸 수치입니다. 단어가 더 자주 등장할수록 그 단어는 더 친숙해집니다. 다른 단서는 놀라움(surprise)의 척도입니다. 문장에서 다음 단어를 기다리고 있는 상황을 상상해 보십시오. 만약 문장이 특정 단어를 예상하게 만든다면, 그 단어는 예측 가능합니다. 만약 문장이 다른 것을 기대하게 만들었는데 전혀 다른 단어가 나타난다면, 그 단어는 높은 "놀라움" 값을 가집니다. 현대 과학의 세계에서 연구자들은 거대 언어 모델(large language models)이라고 알려진 강력한 컴퓨터 프로그램을 사용하여 이 놀라움을 계산합니다. 이 프로그램들은 방대한 양의 텍스트를 학습하여 문장 속의 다음 단어를 놀라울 정도로 정확하게 예측할 수 있으며, 이를 통해 과학자들은 주어진 맥락에서 특정 단어가 얼마나 예상 밖인지를 정확하게 측정할 수 있습니다.
오랫동안 사람들은 이 두 가지 단서, 즉 우리가 단어를 얼마나 자주 듣는지와 그것이 얼마나 놀라운지가 우리가 아이의 첫 어휘를 배우든 성인이 소설을 읽든 동일한 방식으로 작용한다고 가정해 왔습니다. 언어 학습과 처리의 규칙이 전반적으로 동일하게 적용된다는 생각이었습니다. 그러나 나바라 대학교의 프란시스코 포르틸로 로페즈(Francisco Portillo López)의 새로운 연구는 이러한 가설에 도전합니다. 스페인어를 두 가지 다른 관점에서 조사한 이 연구는, 단어를 배우는 규칙이 이미 알고 있는 단어를 처리하는 규칙과는 근본적으로 다르다는 점을 시사합니다.
연구자는 언어의 가장 초기 단계에 집중하여 225개의 흔한 스페인어 명사에 초점을 맞추어 조사를 시작했습니다. 그는 컴퓨터의 놀라움 척도가 왜 어떤 단어는 일찍 배우고 어떤 단어는 늦게 배우는지를 설명하는 데 도움이 될 수 있는지 알고 싶었습니다. 이를 위해 그는 양육자가 어린 아이들에게 말할 때 나타나는 '아동 지향 언어(child-directed speech)' 데이터에 해당 단어들이 얼마나 자주 등장하는지를 수집했습니다. 또한, 그는 세 가지 서로 다른 컴퓨터 모델을 사용하여 각 단어가 나타나는 맥락을 바탕으로 놀라움 값을 계산했습니다. 결과는 명확하고 일관적이었습니다. 단어의 빈도는 아이가 언제 그 단어를 배우는지를 예측하는 강력한 지표였습니다. 아이의 환경에 자주 등장하는 단어일수록 훨씬 더 일찍 학습되었습니다. 반면, 놀라움의 척도는 거의 도움이 되지 않았습니다. 컴퓨터가 특정 문맥에서 단어가 얼마나 예상 밖인지를 계산했음에도 불구하고, 그 정보는 아이가 왜 특정 시점에 그 단어를 배웠는지를 설명해주지 못했습니다. 단지 그 단어가 얼마나 자주 들렸는가라는 단순한 사실을 고려했을 때보다 더 나은 설명을 제공하지 못했습니다.
이것이 단순히 컴퓨터가 단어를 예측하는 방식의 특이한 현상이 아님을 확인하기 위해, 연구자는 컴퓨터를 다양한 방식으로 테스트했습니다. 그는 모든 단어가 동일한 단순한 구조 안에 놓이는 표준화된 문장 틀을 사용하기도 했고, 부모와 아이 사이의 실제 자연스러운 대화를 사용하기도 했습니다. 두 경우 모두 패턴은 유지되었습니다. 문맥이 특정 단어를 얼마나 잘 예측하는지를 측정하도록 설계된 컴퓨터의 놀라움 감각은 초기 단어 학습의 시기를 결정하는 데 별 영향을 미치지 않는 것으로 보였습니다. 아이가 새로운 단어를 습득하는 시기를 확실하게 예측할 수 있는 유일한 요소는 그 단어를 이전에 얼마나 많이 접했는가였습니다. 이 발견은 언어 학습이 순간순절의 예측 문제를 푸는 과정이라기보다는, 반복과 누적된 노출이 주요 동력이 된다는 관점을 뒷받침합니다.
연구의 초점이 아이에서 성인으로 옮겨가면서 이야기는 급격한 전환점을 맞이합니다. 연구의 두 번째 부분에서 그는 성인 스페인어 화자들이 텍스트를 읽는 방식을 조사했습니다. 사람들이 페이지 위의 단어를 정확히 어디를 얼마나 오래 바라보는지 카메라로 기록하는 안구 추적(eye-tracking) 연구 데이터를 사용하여, 그는 동일한 컴퓨터 모델의 놀라움 척도를 테스트했습니다. 이번에는 결과가 완전히 달랐습니다. 성인 독자의 경우, 놀라움의 척도는 사람들이 단어에서 멈추는 시간을 예측하는 강력하고 신뢰할 수 있는 지표였습니다. 앞선 단어들로 인해 예측 가능성이 낮아질 때, 성인들은 단어를 보는 데 더 많은 시간을 할애했는데, 이는 예상치 못한 입력을 처리하기 위해 뇌가 더 열심히 작동하고 있음을 나타냅니다. 이 효과는 단어의 빈도나 길이를 고려한 후에도 여전히 강력하게 유지되었습니다. 숙련된 독서가 이루어지는 성인의 세계에서 단어의 놀라움 값은 매우 중요합니다.
이 두 가지 발견의 대비는 언어가 작동하는 방식에 있어 중대한 차이를 드러냅니다. 기초부터 어휘를 쌓아가는 아이에게는, 단어에 대한 노출의 양 자체가 기억을 공고히 하는 핵심입니다. 단어가 나타나는 맥락은 아이가 그 단어를 여러 번 들었다는 사실보다 덜 중요합니다. 그것은 마치 아이가 돌멩이를 모으는 것과 같아서, 특정 돌멩이를 집어 드는 횟수가 많아질수록 그 돌멩이가 더 친숙해지는 것과 같습니다. 그러나 성인의 경우, 마음은 이미 이러한 돌멩이들로 가득 차 있으며, 그것들은 거대한 네트워크로 조직되어 있습니다. 성인이 글을 읽을 때, 그들은 다음에 무엇이 올지에 대해 끊임없이 예측을 합니다. 만약 텍스트가 그 예측을 깨뜨린다면, 뇌는 마찰을 감지하고 눈은 그 불일치를 해결하기 위해 속도를 늦춥니다.
이러한 구별은 언어를 연구하는 데 사용되는 컴퓨터 모델이 실패하고 있는 것이 아니라, 관찰되는 생애 단계에 따라 인간 경험의 서로 다른 측면을 포착하고 있음을 시사합니다. 아이가 단어를 배우는 시기를 예측하는 데는 거의 쓸모없는 수학적 척도인 '놀라움'이, 성인이 단어를 읽는 방식을 이해하는 데는 필수적입니다. 이는 뇌가 언어를 다루기 위해 단일하고 정적인 방법을 사용하는 것이 아님을 의미합니다. 대신, 우리는 발전함에 따라 통계적 단서의 중요성이 변화합니다. 초기에는 뇌가 경험의 축적에 의존합니다. 이후 견고한 체계가 갖춰지면, 뇌는 즉각적인 맥락과 그 맥락이 생성하는 기대치에 매우 민감해집니다.
또한 이 연구는 우리가 인공지능을 평가하는 방식에 대해 경고의 메시지를 던집니다. 컴퓨터 프로그램은 성인의 읽기 패턴을 훌륭하게 흉내 내어 인간의 언어를 완벽하게 모델링하는 것처럼 보일 수 있습니다. 하지만 이 동일한 프로그램은 아이가 실제로 어떻게 학습하는지의 메커니즘을 포착하는 데는 실패할 수 있습니다. 만약 우리가 이 모델들을 오직 성인의 행동에 대해서만 테스트한다면, 우리는 그것들이 발달하는 정신의 학습 과정을 반영하지 못한다는 사실을 놓칠 수 있습니다. 이 연구는 언어를 진정으로 이해하기 위해서는 아이와 성인을 모두 살펴보아야 하며, 플레이어가 성장함에 따라 게임의 규칙이 변한다는 점을 인식해야 한다고 제안합니다. 노출에서 기대로 이어지는 여정은 동일한 요인이 모든 단계에 적용되는 직선 경로가 아닙니다. 그것은 빈도의 무게와 예측의 힘이 이동하며, 우리가 말하고 읽는 법을 배우는 이야기의 서로 다른 장들을 정의하는 경로입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.