← 最新の論文
💻 computer science

GLeMM: A large-scale multilingual dataset for morphological research

本論文は、語形成における形態と意味の関係に関するデータ駆動型研究および計算機的検証を可能にするために設計された、7つの欧州言語を網羅する大規模かつ完全自動化された多言語派生形態論データセットであるGLeMMを紹介するものである。

原著者: Nabil Hathout, Basilio Calderone, Fiammetta Namer, Franck Sajous

公開日 2026-09-25
📖 1 分で読めます☕ さくっと読める

原著者: Nabil Hathout, Basilio Calderone, Fiammetta Namer, Franck Sajous

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

言語は、言葉が絶えず進化し、分裂し、融合して新しい意味を生み出していく、生きたシステムです。「happy」を「happiness」に、「teach」を「teacher」に変えるとき、私たちは「派生」と呼ばれるプロセスに従っています。これこそが、人間が単純な語根から複雑な概念を作り出し、語彙を拡張する方法なのです。何十年もの間、言語学者はこれらのつながりをマッピングしようと試みてきました。なぜ一部の言葉は予測可能な方法で変化する一方で、他の言葉は独自のルールに従っているように見えるのか、という問いを投げかけてきました。彼らは、言語が新しい言葉を作る仕組みは異なる文化間でも同じなのか、それともそれぞれの言語が独自の秘密の論理を持っているのかと考えてきました。最近まで、これらの問いに答えることは、専門家の直感や、厳選された小さな例のリストに頼ることを意味していました。それは、たった一つの雲を観察することで天気を理解しようとするようなものでした。パターンを察知することはできても、嵐を見逃してしまうのです。

研究チームは、このプロセスを研究する方法を変えるために、大規模なデジタル・ライブラリを構築しました。彼らは、GLeMM(Large-scale Multilingual collection of Word-formation data:大規模多言語単語形成データ集)と呼ばれるリソースを作成しました。小さなリストに頼る代わりに、彼らは7つのヨーロッパ言語(英語、フランス語、ドイツ語、イタリア語、ポーランド語、ロシア語、スペイン語)にわたる、約120万組の関連する単語の情報を収集しました。その目的は、推測を超え、膨大なデータの量によって、言語がどのように成長するかという真の構造を明らかにすることでした。これらのつながりを見つけるプロセスを自動化することで、研究者たちは以前は見えなかったパターンを目の当たりにし、新しい言葉を作る際に形態と意味がどのように相互作用するかについて、より鮮明な全体像を提示することができました。

研究者たちは、一つひとつの単語のつながりを手作業で書き留めるために座っていたわけではありません。代わりに、彼らは誰でも編集できる自由なオンライン辞書である「Wiktionary(ウィクショナリー)」を利用しました。彼らは、人々が書く言葉の定義には、しばしばその言葉がどのように関連しているかについてのヒントが含まれていることに気づきました。例えば、「spryness(活発さ)」の定義が「spry(活発な)であるという性質」となっている場合、その説明の中に「spry」という言葉がそのまま存在しています。チームは、何百万ものこれらの定義をスキャンし、一方が他方を用いて定義されている単語のペアを探し出すコンピュータの手法を開発しました。そして、それら2つの単語が、共通の語根を共有しているなど、関連していると言えるほど似ているかどうかをチェックしました。これらの発見を他の関連語リストと照合することで、ランダムな一致を排除し、一貫した繰り返しのパターンを示すペアのみを保持しました。これにより、単純な接尾辞「-ness」から、接頭辞や複数のステップを伴うより複雑な変化に至るまで、各言語の広大な単語ファミリーのネットワークを構築することができたのです。

彼らの発見は、言語の仕組みに関する長年の考え方に疑問を投げかけています。長い間、多くの言語学者は、単語ファミリーとは完全な網(ウェブ)のようなものであり、家族内のすべての単語が他のすべての単語と直接つながっていると考えてきました。もし「travel(旅行する)」、「traveler(旅行者)」、「traveling(旅行すること)」という言葉があれば、理論上はこれらが完璧な三角形として等しく結びついていると考えられていました。しかし、GLeMMのデータは、そのようなケースは極めて稀であることを示唆しています。この膨大なデータセットにおいて、ほとんどの単語ファミリーは完璧な網ではありません。むしろ、中心となるハブからスポークが伸びているような形をしており、新しい言葉は主要な語根から枝分かれしていきますが、必ずしも互いに再びつながるわけではありません。研究者たちは、完璧な三角形を形成しうる単語のペアのうち、実際にそれを形成するのはごくわずかな割合であることを見出しました。実際、三角形を形成しうる理論上の100組のペアに対して、実際に形成しているのはほんの一握りに過ぎません。このことは、私たちの言葉の構築方法が、以前考えられていたような混沌とした相互接続のウェブではなく、より方向的で階層的なものであり、基本となる言葉から派生語へと向かう明確な流れがあることを示唆しています。

また、この研究は、異なる言語が同じ概念をどのように扱うかについても光を当てました。例えば、研究者たちは「何かを再び行う」という概念をどのように表現するかを調査しました。フランス語では、動詞に接頭辞を加えて動作を逆転させ、元の言葉を反映した新しい単語のファミリーを作り出す特定のパターンが見つかりました。英語にも同様のパターンは存在しますが、それほど一様ではありません。データセットは、単語形成の根底にある論理は共通しているものの、具体的なルールは大きく異なることを示しました。ある言語は既存の2つの言葉を組み合わせて新しいものを作ることを好む一方で、別の言語は単一の言葉に小さな語尾を付けることを好むかもしれません。研究者たちはまた、いくつかの単語形成が「逆」であることも発見しました。時には、短い言葉が長い言葉から派生している場合があり、見た目上はその短い言葉が語根であるべきように見えても、実際にはそうではないことがあります。データは、これらの逆方向のパターンが標準的な方向よりもはるかに頻度が低いことを示すことで、それらを例外として特定することを可能にしました。

プロジェクトの規模は膨大ですが、研究者たちは自分たちのリソースが完璧ではないことも慎重に述べています。データは公開辞書から自動的に収集されたため、エラーや不整合が含まれています。関連しているように見える単語のペアが実際にはそうでない場合もあり、定義がわずかに的外れな場合もあります。しかし、コレクションの規模があまりに大きいため、これらのエラーは全体像を歪めるほどの影響を与えないほど稀なものです。研究者たちは、単語ペアの正確性は非常に高く、英語とフランス語のセクションにおける接続の90パーセント以上が正しいと推定しています。このリソースは、さらなる調査のための出発点として設計されており、他の科学者が膨大な現実世界のデータに対して自身の理論を検証できる場所となるものです。これは言語の謎に対する最終的な答えではありませんが、以前は不可能だった明晰さをもって、単語形成の景観を見渡すことができる強力な新しいツールなのです。

GLeMMの作成は、小規模で精選された例から、大規模でデータ駆動型の探索へと、言語研究の方法を転換させることを意味します。辞書を数百万の関連性を持つ生きたコーパスとして扱うことで、研究者たちは人間の話し言葉の隠れた構造への窓を開きました。彼らは、言語は多様である一方で、測定可能で観察可能な特定の構造的原理に従っていることを示しました。彼らの発見は、私たちが言葉を作る方法は、ランダムな習慣の集まりではなく、明確なパターン、例外、そして明確な方向性を持った構造化されたシステムであることを示唆しています。研究者たちがこの研究をさらに多くの言語へと拡大し、手法を洗練させていく計画を進める中で、このリソースは、音から意味を作り出す人間の精神の能力についての理解を深めることを約束しています。それは、私たちが発するあらゆる新しい言葉が、広大で相互に連結した歴史の一部であることを思い出させ、そして今、初めて、私たちはその全領域を見渡すのに十分な大きさを持つ地図を手にしているのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →