Left-Branching Transformers Excel at Right-Branching Languages: Data Shapes Word Order Preferences in Language Models
이 논문은 디코더 전용 언어 모델의 어순 편향이 내재적인 구조적 선호도가 아니라 학습 데이터에 의해 유도되는 것이며, 모델이 데이터의 풍부함과 품질로 인해 자연어에서 우측 분기형 SVO 구조를 선호하게 됨으로써 전 세계적인 어순 다양성을 감소시킬 위험을 제기한다는 점을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
언어는 단순히 단어들의 집합이 아닙니다. 그것은 의미를 만들기 위해 그 단어들이 어떻게 배열되어야 하는지에 대한 일련의 규칙입니다. 어떤 언어에서는 주어 뒤에 동사와 목적어가 오기도 합니다(예: "The cat ate the fish"). 다른 언어에서는 동사가 먼저 오거나, 목적어가 주어보다 먼저 오기도 합니다. 이러한 배열을 '어순'이라고 하며, 이는 인간의 언어가 서로 달라지는 가장 근본적인 방식 중 하나입니다. 수십 년 동안 언어학자들은 인류가 언어를 어떻게 배우고 처리하는지 이해하기 위해 이러한 패턴을 연구해 왔으며, 모든 사람에게 적용될 수 있는 보편적 규칙을 찾아왔습니다. 오늘날, 인공지능이라는 새로운 종류의 학습자가 이 분야에 등장했습니다. '언어 모델'이라 불리는 이 컴퓨터 프로그램들은 방대한 양의 텍스트를 학습하여 인간과 유사한 문장을 생성할 수 있습니다. 여기서 중요한 질문이 생겨났습니다. 이 기계들은 인간이 언어를 배우는 방식으로 배우는 것일까요, 아니면 단어가 배치되어야 하는 방식에 대해 자신들만의 숨겨진 선호도를 발달시키는 것일까요?
연구팀은 이 질문에 답하기 위해 이 모델들이 서로 다른 어순을 어떻게 다루는지 테스트하는 실험을 설계했습니다. 그들은 두 가지 매우 다른 유형의 데이터를 사용하여 통제된 실험을 구축했습니다. 첫째, 그들은 수백 개의 인공 언어를 만들었습니다. 이것들은 사람들이 사용하는 실제 언어가 아니라, 특정 특징을 분리하기 위해 설계된 수학적 구조물이었습니다. 형용사가 명사 앞에 오는지 뒤에 오는지, 혹은 동사가 문장의 시작 부분에 오는지 끝부분에 오는지와 같이 오직 한 가지 요소만 변하는 언어를 상상해 보십시오. 문화적 맥락, 불규칙한 문법, 지저지고 복잡한 데이터와 같은 실제 인간 언어의 복잡성을 제거함으로써, 연구자들은 컴퓨터 모델이 특정 구조를 선호하는 내재된 성향을 가지고 있는지 확인할 수 있었습니다. 그 후, 연구진은 이 결과를 영어, 스페인어부터 일본어, 스와힐리어에 이르기까지 전 세계의 실제 자연어와 비교했습니다.
연구 결과, 이 모델들이 어떻게 행동하는지에 대해 놀라운 차이가 드러났습니다. 연구진이 인공 언어로 모델을 학습시켰을 때, 컴퓨터는 수식어가 핵심 단어보다 앞서 나오는 특정 구조, 즉 언어학자들이 '좌측 분지형(left-branching)'이라 부르는 패턴을 일관되게 선호했습니다. 이 선호도는 문장의 기본 어순과 상관없이 나타날 정도로 강력했습니다. 그러나 이러한 선호도는 우리가 알고 있는 인간의 언어 학습 방식과는 일치하지 않았습니다. 인간은 일관성을 선호하는 경향이 있습니다. 즉, 어떤 언어가 동사를 끝에 둔다면, 인간은 보통 다른 문장 구성 요소들도 유사한 패턴을 따를 것이라고 기대합니다. 인공 언어 실험은 모델들이 인간의 논리나 세상의 언어들에서 발견되는 통계적 패턴을 따르는 것이 아님을 보여주었습니다. 대신, 모델들은 단순히 자신들의 특정 구조(architecture)가 처리하기에 더 쉬운 구조를 선호하는 것처럼 보였으며, 이는 실제 세계의 언어 규칙과는 독립적으로 존재하는 편향이었습니다.
하지만 연구진이 실제 세계의 데이터를 사용하자 이야기는 완전히 바뀌었습니다. 모델을 자연어로 학습시켰을 때, 언어당 약 5메가바이트 정도의 적은 텍st만을 제공했을 때는 어떤 특정 어순에 대해서도 뚜렷한 선호도를 보이지 않았습니다. 모델들은 다양한 배열에 대해 똑같이 능숙했습니다. 그러나 연구진이 학습 데이터의 양을 약 1,000메가바이트 정도로 훨씬 더 큰 규모로 늘리자, 뚜렷한 패턴이 나타나기 시작했습니다. 모델들은 주어가 동사 앞에 오고, 동사가 목적체 앞에 오는 방식, 즉 영어 나 중국어와 같은 '주어-동사-목체(SVO)' 어순을 선호하기 시작했습니다. 흥-미롭게도, 동사가 뒤에 오는 방식(주어-목적어-동사)이 전 세계 언어들 사이에서 실제로 더 흔함에도 불구하고, 이 선호도는 더 많은 데이터를 볼수록 더욱 강해졌습니다.
연구진은 왜 이런 변화가 일어나는지 조사했습니다. 그들은 SVO 선호가 컴퓨터 구조가 본래 해당 어순을 더 잘 이해하기 때문이 아니라는 것을 발견했습니다. 대신, 이 선호도는 전적으로 모델에게 입력된 데이터에 의해 주도되었습니다. 인터넷이나 디지털 도서관에서 가장 널리 이용 가능한 언어들, 즉 '고자원(high-resource)' 언어들은 압도적으로 SVO 구조를 띱니다. 모델들이 이러한 특정 언어들로부터 막대한 양의 텍스트를 학습했기 때문에, 모델들은 그 구조를 우선시하도록 학습된 것입니다. 연구진이 가용 데이터가 매우 적은 언어로 학습된 모델들을 살펴보았을 때, SVO의 우위는 사라졌습니다. 이는 모델들이 보편적인 진리를 발견하고 있는 것이 아니라, 단지 자신들이 접근할 수 있는 정보의 불균형을 반영하고 있음을 시사합니다.
이 발견은 언어 기술의 미래에 중요한 시사점을 던져줍니다. 만약 이러한 모델들이 덜 흔하거나 다른 어순을 가진 언어를 번역하고, 글을 쓰고, 소통하는 데 점점 더 많이 사용된다면, 모델들이 해당 언어들을 SVO 구조로 미묘하게 밀어붙일 위험이 있습니다. 모델들은 많은 언어가 뉘앙스, 초점 또는 감정을 표현하기 위해 의존하는 자연스럽고 유연한 어순을 사용하거나 이해하는 것을 어렵게 만들 수 있습니다. 이 연구는 컴퓨터의 내부 설계가 약간의 편향을 가질 수는 있지만, 모델이 소비하는 데이터가 그 행동을 형성하는 지배적인 힘이라는 것을 보여줍니다. 이러한 도구들이 더욱 널리 보급됨에 따라, 우리가 모델이 학습할 데이터를 어떻게 큐레이션하고 선택하느냐가 인간 언어의 풍부한 다양성을 보존할 것인지, 아니면 점차 하나의 균일한 패턴으로 매끄럽게 다듬어버릴 것인지를 결정하게 될 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.