Targum - A Multilingual New Testament Translation Corpus
本論文は、既存の語料庫が言語の幅広さを優先するあまり深みに欠けていた課題を解決するため、英語・フランス語・イタリア語・ポーランド語・スペイン語の 5 言語にわたる 651 件の新約聖書翻訳(334 件が独自)を収集・標準化し、翻訳史の定量分析における柔軟な多段階研究を可能にする「Targum」と呼ばれる多言語コーパスを提案するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
この論文は、**「タルグム(Targum)」という新しいデータベースについて紹介しています。これを一言で言うと、「聖書の新約聖書(キリスト教の聖典)の翻訳版を、5 つの言語で『これまでにないほど深く』集めた、巨大な図書館」**のようなものです。
専門用語を避け、日常の例えを使ってわかりやすく解説します。
1. なぜこの「図書館」が必要なの?
これまでのデジタル化された聖書データは、「たくさんの言語(1000 語以上)を少しだけ集めること」に重点を置いていました。まるで**「世界各国の料理を、1 品ずつだけ集めたカタログ」**のような状態です。
しかし、研究者たちは「特定の国の料理(例えばイタリア料理)の歴史や、同じ料理のレシピが時代とともにどう変わってきたか」を詳しく知りたいと思っていました。そこで、**「5 つの主要な言語(英語、フランス語、イタリア語、ポーランド語、スペイン語)に絞って、それぞれの料理のレシピを何百種類も集めた」**のがこの「タルグム」です。
- 従来: 1000 人の料理人から、1 人につき 1 品ずつ。
- タルグム: 5 人の料理人から、それぞれ 30〜200 品ずつ集めた。
- これにより、同じ言語内での「翻訳の深さ」を 2.4 倍〜5 倍も増やしました。
2. この図書館のすごいところ:整理整頓の魔法
聖書の翻訳には、同じ本でも「1769 年版」「1989 年改訂版」「カトリック版」「プロテスタント版」など、無数のバリエーションがあります。インターネット上には、同じ本が名前を変えて何回もアップロードされていることもあります。
タルグムは、このカオスな状態を**「魔法の整理術」**で整理しました。
- 正体を見抜く: 「これは『王様版(KJV)』の 1769 年版だ」「これはその孫バージョンの『新王様版』だ」と、AI ではなく人間が徹底的に調査して、それぞれの正体を特定しました。
- 重複を許す: 通常、同じ本が 2 つあれば「ゴミ」ですが、ここでは**「あえて重複を消さず、すべて保存」**します。なぜなら、研究者によっては「同じ本の 2 つの異なるコピーを比較したい」というニーズがあるからです。
- ラベル貼り: 各本に「いつ出版されたか」「誰が著作権を持っているか」「どの出版社のものか」という詳細なラベルを貼りました。
3. 何ができるの?(研究の例え)
このデータベースを使うと、以下のような面白いことがわかります。
- マイクロ分析(顕微鏡で見る):
「王様版(KJV)」という翻訳が、300 年間でどのように言葉を変えていったかを、一語一語追跡できます。まるで**「同じ家族のアルバムを何世代もさかのぼって、顔の形がどう変わってきたかを見る」**ようなものです。 - マクロ分析(望遠鏡で見る):
「フランス語の聖書は、他の言語に比べて文章が長いのか?」「現代の翻訳は、昔の翻訳より言葉の選び方が多様になっているか?」といった大きな傾向を、統計的に分析できます。- 発見: 調査の結果、フランス語の翻訳は他の言語より少し長く、ポーランド語は少し短い傾向があることがわかりました。これは翻訳者の好みというより、言語自体の性質(フランス語は冠詞が多い、ポーランド語は文法が複雑で短い言葉で済むなど)によるものだそうです。
4. 名前の由来
「タルグム」という名前は、古代のアラム語で「翻訳」を意味する言葉に由来します。古代のタルグムは、単に文字を置き換えるだけでなく、**「聴衆にわかりやすく説明するために、原文を少し膨らませて翻訳する」**という伝統がありました。
このプロジェクトも、**「単なるデータ集めではなく、翻訳の歴史や文化を深く理解するために、多様なバリエーションを網羅する」**という精神を同じくしています。
5. 注意点と未来
- 著作権への配慮: 古い本は誰でも見られますが、新しい本は著作権があるため、全文を公開せず、研究目的で申請すれば見られるようにするなど、ルールを守っています。
- デジタルの偏り: この図書館は「インターネットにある本」を集めたものなので、ネットにない古い本は入っていません。これは「デジタル時代の聖書史」を記録したものと言えます。
- 未来: 今後はドイツ語やポルトガル語など、他の言語も追加していく予定です。
まとめ
この論文は、**「聖書の翻訳という巨大なパズルを、特定の言語に絞って、何百ピースも集めて、そのピースのつながりや変化を詳しく分析できる新しいツールを作った」**という報告です。
AI が文章を翻訳する時代において、逆に**「人間がどのように文章を翻訳し、時代とともにどう変化してきたか」**を、AI ではなく人間が研究するための、非常に価値ある「宝の地図」が完成したのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。