Children, but not language models, show accelerating returns in word learning
이 논문은 아이들이 새로운 언어적 경험을 할 때마다 점점 더 효율적으로 변하며 단어 학습에서 가속되는 수익을 보이는 반면, 언어 모델은 아동 지향적 발화로 학습하더라도 스케일링 법칙과 일치하는 일정한 비례적 수익만을 보여준다는 점을 밝히고 있다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인간의 언어는 느리고 비틀거리는 시작과 함께 출발한다. 생후 첫 1년 동안 아이는 익숙한 사람이나 사물의 이름에 불과한 아주 적은 수의 단어만을 배울 수도 있다. 그러다 놀라운 일이 일어난다. 학습의 속도가 극적으로 변하는 것이다. 몇 년이라는 짧은 시간 안에, 그 아이는 수백 개의 단어를 습득하며 단순한 명칭에서 복잡한 문장으로 넘어가는 속도가 마치 마법처럼 빨라진다. 수십 년 동안 과학자들은 이 폭발적인 성장의 메커니즘을 이해하기 위해 노력해 왔다. 그들은 그 비밀이 아이들이 매일 듣는 단어의 흐름을 어떻게 처리하느냐에 있다고 오랫동안 의심해 왔다. 지배적인 생각은 학습이 꾸준하고 선형적인 과정이라는 것이었다. 즉, 아이가 더 많은 말을 들을수록 일정한 속도로 더 많이 배운다는 것이다. 만약 이것이 사실이라면, 아이의 어휘는 물이 양동이에 일정한 속도로 뚝뚝 떨어지며 채워지는 것처럼 성장할 것이다.
최근 몇 년 사이, 언어 모델이라고 불리는 강력한 컴퓨터 프로그램들이 이 과정을 연구하는 새로운 방법으로 등장했다. 이 시스템들은 방대한 양의 텍스트를 통해 훈련되며, 문장에서 다음에 올 단어를 예측하는 법을 배운다. 이 모델들은 특정 양의 데이터로 훈련될 수 있기 때문에, 연구자들은 이를 활용해 학습이 어떻게 작동하는지에 대한 이론들을 테스트할 수 있다. 그러나 당혹스러운 격차가 발견되었다. 기초적인 수준의 언어 기술에 도달하기 위해서조차, 이 컴퓨터 모델들은 수조 개의 단어가 담긴 훈련 데이터를 필요로 한다. 반면, 인간 아이는 불과 수백만 개의 단어를 들은 후 첫 수천 개의 단어를 습득한다. 이 거대한 데이터 요구량의 차이는 인간과 기계가 근본적으로 다른 방식으로 학습하고 있음을 시사하지만, 지금까지는 그 차이가 시간에 따라 정확히 어떻게 나타나는지에 대한 명확한 수학적 설명이 없었다.
한 연구자가 이 차이를 직접 측정하기 위해 나섰다. 그는 어휘 성장에 초점을 맞추어, 아이들이 시간이 지남에 따라 특정 단어를 어떻게 배우는지 추적하고 그 패턴을 컴퓨터 모델이 동일한 단어를 배우는 방식과 비교했다. 연구자는 부모가 아이의 연령별 발화 가능 단어를 보고한 상세한 기록을 사용하여 수천 명의 아이들로부터 데이터를 수집했다. 또한, 컴퓨터가 유아에게 전달되는 것과 같은 종류의 입력을 받도록 아이를 대상으로 한 대화 녹음본으로 컴퓨터 모델을 훈련시켰다. 이 두 집단을 나란히 분석함으로써, 연구자는 학습이 꾸준한 축적 과정이라는 기존의 관점이 인간에게는 틀렸다는 것을 발견했다.
연구 결과, 아이들은 일정한 속도로 배우지 않는다는 것이 밝혀졌다. 대신, 그들의 학습 능력은 가속화된다. 처음에 아이는 어떤 단어를 말하기 위해 그 단어를 수백 번 들어야 할 수도 있다. 하지만 아이가 성장하고 어휘가 확장됨에 따라, 새로운 단어를 배우기 위해 필요한 노출 횟수는 훨씬 줄어든다. 유아는 "책(book)"이라는 단어를 말하기 전까지 수천 번 들을 수도 있지만, 미취학 아동은 동물원에서 "아이벡스(ibex)"라는 단어를 단 몇 번만 듣고도 다음 날 바로 반복할 수 있다. 연구자는 이러한 가속화가 실재하며 측정 가능한 현상임을 발견했다. 아이가 나이가 들수록, 새로운 언어적 경험 하나하나의 가치는 더욱 높아진다. 그들은 이전의 한 시간보다 현재의 한 시간 동안 더 많은 대화를 통해 더 많은 것을 배운다. 컴퓨터 모델들은 아이를 대상으로 한 대화 데이터를 사용해 훈련되었음에도 불구하고, 이러한 가속화를 보여주지 않았다. 그들은 이미 알고 있는 양과 상관없이 새로운 단어를 배우기 위해 동일한 양의 데이터를 필요로 하며, 일정하고 변하지 않는 속도로 학습했다.
이러한 차이는 왜 컴퓨터 모델보다 적은 데이터만으로도 아이들이 유창한 화자가 될 수 있는지를 설명해 준다. 컴퓨터 모델은 '수익 체감(constant returns)'의 원리에 따라 작동한다. 즉, 새로운 단어를 배울 때마다 동일한 양의 훈련 데이터가 비용으로 발생한다. 그러나 아이들은 '수익 체증(increasing returns)'을 얻는다. 연구자는 이 가속화가 단순히 부모가 아이가 자람에 따라 말하는 방식이 변했기 때문인지, 아니면 아이의 학습 능력 자체의 내부적 변화인지 테스트했다. 데이터는 후자임을 시사했다. 아이들의 뇌는 들리는 소리로부터 의미를 추출하는 능력이 향상되는 것처럼 보였는데, 아마도 이미 알고 있는 단어들을 활용해 새로운 단어를 파악하는 법을 배우기 때문인 것으로 보인다.
이 연구 결과는 언어 학습이 단순히 시간이 지남에 따라 증거를 축적하는 문제라는 생각을 뒤흔든다. 대신, 그 과정은 역동적이다. 연구자는 각 새로운 단어의 "가치"가 연령에 따라 증가하는 모델이 실제 아이들의 데이터를 완벽하게 설명하는 반면, 가치가 일정하게 유지되는 모델은 그렇지 않다는 것을 보여주었다. 이러한 가속화는 단순한 세부 사항이 아니라, 인간과 기계 학습 사이의 근본적인 차이다. 컴퓨터 모델들도 결국 단어들을 배웠지만, 인간 아이가 가진 것과는 다른 경직성을 띠며 학습했다. 이 연구는 인간 언어의 비밀이 우리가 받는 데이터의 양에만 있는 것이 아니라, 성장함에 따라 그 데이터를 사용하는 우리의 능력이 어떻게 개선되는지에 있다는 통찰을 제공한다. 이는 인간의 인지 과정을 이해하고, 언젠가 아이처럼 효율적으로 학습할 수 있는 인공 시스템을 구축하는 데 있어 새로운 방향을 제시한다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.