← 최신 논문
💻 computer science

GLeMM: A large-scale multilingual dataset for morphological research

이 논문은 단어 형성에서의 형태-의미 관계에 대한 데이터 기반 연구와 계산적 테스트를 가능하게 하도록 설계된, 7개의 유럽 언어를 다루는 대규모의 완전 자동화된 다국어 파생 형태론 데이터셋인 GLeMM을 소개한다.

원저자: Nabil Hathout, Basilio Calderone, Fiammetta Namer, Franck Sajous

게시일 2026-09-25
📖 5 분 읽기🧠 심층 분석

원저자: Nabil Hathout, Basilio Calderone, Fiammetta Namer, Franck Sajous

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

언어는 단어들이 끊임없이 진화하며 분화하고 병합하여 새로운 의미를 만들어내는 살아있는 체계입니다. 우리가 "happy"를 "happiness"로, 또는 "teach"를 "teacher"로 바꾸는 과정은 파생(derivation)이라고 불리는 작업에 참여하는 것입니다. 이것이 바로 인간이 단순한 뿌리로부터 복잡한 개념을 만들어내며 어휘를 확장하는 방식입니다. 수십 년 동안 언어학자들은 왜 어떤 단어들은 예측 가능한 방식으로 변하는 반면, 다른 단어들은 자신만의 독특한 규칙을 따르는 것처럼 보이는지 질문하며 이러한 연결 고리를 지도화하려고 노력해 왔습니다. 그들은 한 언어가 새로운 단어를 만드는 방식이 서로 다른 문화권에서도 동일한지, 아니면 모든 언어가 자신만의 비밀스러운 논리를 가지고 있는지 궁금해했습니다. 최근까지 이 질문들에 답하는 것은 전문가의 직관과 소수의 엄선된 예시 목록에 의존하는 것을 의미했습니다. 그것은 마치 단 하나의 구름만을 관찰함으로써 날씨를 이해하려는 것과 같았습니다. 패턴은 느낄 수 있겠지만, 폭풍우는 놓치게 되는 것입니다.

연구진은 이제 이 과정을 연구하는 방식을 바꾸기 위해 거대한 디지털 도서관을 구축했습니다. 그들은 GLeMM이라 불리는 자원을 만들었는데, 이는 대규모 다국어 단어 형성 데이터 모음(large-scale multilingual collection of word-formation data)을 뜻합니다. 소수의 목록에 의존하는 대신, 그들은 일곱 개의 유럽 언어인 영어, 프랑스어, 독일어, 이탈리아어, 폴란드어, 러시아어, 스페인어에 걸쳐 약 120만 개의 연관 단어 쌍에 대한 정보를 수집했습니다. 목표는 추측을 넘어 방대한 양의 데이터가 언어가 성장하는 진정한 구조를 드러내도록 하는 것이었습니다. 이러한 연결을 찾는 과정을 자동화함으로써, 연구진은 이전에는 보이지 않았던 패턴을 포착하여, 우리가 새로운 단어를 만들 때 형태와 의미가 어떻게 상호작용하는지에 대한 더 명확한 그림을 제시할 수 있었습니다.

연구진은 직접 앉아서 모든 단어의 연결 관계를 수동으로 기록하지 않았습니다. 대신, 그들은 누구나 편집할 수 있는 자유 온라인 사전인 위키낱말사전(Wiktionary)을 활용했습니다. 그들은 사람들이 단어의 정의를 쓸 때 종종 그 단어들이 어떻게 연관되어 있는지에 대한 단서를 포함한다는 점을 깨달았습니다. 예를 들어, "spryness"의 정의가 "spry함의 속성(the property of being spry)"이라고 되어 있다면, "spry"라는 단어가 설명 안에 바로 들어 있습니다. 연구팀은 수백만 개의 이러한 정의들을 스캔하여, 한 단어가 다른 단어를 사용하여 정의되는 단어 쌍을 찾는 컴퓨터 방법을 개발했습니다. 그런 다음 그들은 두 단어가 공통된 뿌리를 공유하는 등 서로 연관되어 있을 만큼 유사해 보이는지 확인했습니다. 이후 이 발견들을 다른 연관 단어 목록들과 교차 검증함으로써, 무작위적인 일치는 걸러내고 일관되고 반복되는 패턴을 보여주는 쌍들만을 남겼습니다. 이를 통해 그들은 "-ness"와 같은 단순한 접미사부터 접두사와 다단계 변화를 포함하는 더 복잡한 변화에 이르기까지, 각 언어의 방대한 단어 가족 네트워크를 구축할 수 있었습니다.

그들이 발견한 사실은 언어가 작동하는 방식에 대한 기존의 오랜 생각들에 도전합니다. 오랫동안 많은 언어학자들은 단어 가족이 모든 단어가 서로 직접 연결된 완전한 그물망과 같다고 믿었습니다. 만약 당신에게 "travel(여행하다)", "traveler(여행자)", "traveling(여행 중)"이라는 단어가 있다면, 이론적으로 이들은 모두 완벽한 삼각형 형태로 연결되어 있다고 보았습니다. 그러나 GLeMM의 데이터는 이것이 실제로는 거의 일어나지 않는 일임을 시사합니다. 방대한 데이터셋에서 대부분의 단어 가족은 완벽한 그물망이 아닙니다. 대신, 그것들은 중심 허브에서 바퀴살이 뻗어 나가는 모양을 띠며, 새로운 단어들이 주요 뿌리로부터 뻗어 나오지만 반드시 서로 다시 연결되지는 않습니다. 연구진은 오직 아주 적은 비율의 단어 그룹만이 이러한 완벽한 삼각형을 형성한다는 것을 발견했습니다. 실제로 삼각형을 형성할 수 있는 이론적인 단어 쌍 100개당, 실제로 그렇게 되는 경우는 손에 꼽을 정도였습니다. 이는 우리가 단어를 만드는 방식이 이전에 생각했던 것보다 더 방향성이 있고 계층적이며, 상호 연결된 혼란스러운 그물망이라기보다는 기본 단어에서 파생어로 흐르는 명확한 흐름을 가지고 있음을 시사합니다.

또한 이 연구는 서로 다른 언어들이 동일한 개념을 어떻게 다루는지에 대해서도 빛을 비추었습니다. 일곱 언어 모두 새로운 단어를 만들어내지만, 그 도구와 빈도는 서로 다릅니다. 예를 들어, 연구진은 "무언가를 다시 하는 것(doing something again)"이라는 개념을 어떻게 표현하는지 살펴보았습니다. 프랑스어의 경우, 동사에 접두사를 붙여 동작을 반대로 만드는 특정 패턴을 발견했으며, 이는 원래의 동작을 반영하는 완전히 새로운 단어 가족을 만들어냅니다. 영어에도 유사한 패턴이 존재하지만 덜 균일합니다. 데이터셋은 단어 형성의 근본적인 논리는 공유되지만, 구체적인 규칙은 상당히 다양하다는 것을 보여주었습니다. 어떤 언어는 새로운 단어를 만들기 위해 기존의 두 단어를 결합하는 것을 선호하는 반면, 다른 언어는 단일 단어에 작은 어미를 붙이는 것을 선호합니다. 연구진은 또한 일부 단어 형성이 "역방향"이라는 것을 발견했습니다. 때때로 짧은 단어가 긴 단어로부터 파생되기도 하는데, 이는 짧은 단어가 뿌리가 되어야 할 것처럼 보임에도 불구하고 발생하는 현상입니다. 데이터는 이러한 역방향 패턴이 표준적인 방향보다 훨씬 적게 발생한다는 것을 보여줌으로써 연구진이 이를 예외적인 규칙으로 식별할 수 있게 해주었습니다.

프로젝트의 엄청난 규모에도 불구하고, 연구진은 자신들의 자원이 완벽하지는 않다는 점을 주의 깊게 언급합니다. 데이터가 공개 사전로부터 자동으로 수집되었기 때문에, 일부 오류와 불일치가 포함될 수 있습니다. 연관되어 보이는 일부 단어 쌍이 실제로는 그렇지 않을 수도 있고, 일부 정의가 약간 틀릴 수도 있습니다. 하지만 수집된 양이 워낙 방대하기 때문에 이러한 오류들이 전체적인 그림을 왜곡할 정도로 심각하지는 않습니다. 연구진은 영어와 프랑스어 섹션의 단어 쌍 정확도가 90% 이상으로 매우 높다고 추정합니다. 이 자원은 추가적인 조사를 위한 출발점으로 설계되었으며, 다른 과학자들이 방대한 양의 실제 데이터를 바탕으로 자신의 이론을 테스트할 수 있는 장소입니다. 이것은 언어의 미스터리에 대한 최종적인 해답은 아니지만, 우리가 단어 형성의 풍경을 이전에는 불가능했던 명확함으로 볼 수 있게 해주는 강력한 새로운 도구입니다.

GLeMM의 탄생은 언어를 연구하는 방식의 전환, 즉 소수의 선별된 사례에서 방대한 데이터 기반 탐구로의 이동을 의미합니다. 사전을 수백만 개의 관계가 담긴 살아있는 말뭉치(corpus)로 취급함으로써, 연구진은 인간의 언어 속에 숨겨진 구조에 대한 창을 열었습니다. 그들은 언어가 다양하지만, 측정 가능하고 관찰 가능한 특정한 구조적 원칙을 따르고 있음을 보여주었습니다. 연구 결과는 우리가 단어를 만드는 방식이 무작위적인 습관의 집합이 아니라, 명확한 패턴과 예외, 그리고 뚜렷한 방향성을 가진 구조화된 체계임을 시사합니다. 연구진이 더 많은 언어를 포함하도록 이 작업을 확장하고 방법을 정교화할 계획을 세움에 따라, 이 자원은 인간 정신이 소리로부터 의미를 창조하는 능력을 더 깊이 이해하게 해줄 것을 약속합니다. 이는 우리가 내뱉는 모든 새로운 단어가 거대하고 상호 연결된 역사의 일부임을 상기시켜 주며, 이제 처음으로 우리는 그 전체 영토를 볼 수 있을 만큼 충분히 큰 지도를 갖게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →