← 最新の論文
💻 computer science

Sense-Augmented Corpus for Sanskrit-English Machine Translation: Corpus Construction, Model Fine-Tuning, and Evaluation

本論文は、LLMとカスタム・センス・インベントリを用いて意味拡張されたパラレルコーパスを構築することにより、サンスクリット語・英語間機械翻訳における語彙的曖昧性の課題に対処し、語の意味情報を明示的に組み込むことが異なるモデルアーキテクチャ間で翻訳品質を大幅に向上させることを実証するものである。

原著者: Anagha Pradeep, Sriram Krishnan, Ketaki Shetye, Bassam Adnan, Radhika Mamidi

公開日 2026-09-01
📖 1 分で読めます☕ さくっと読める

原著者: Anagha Pradeep, Sriram Krishnan, Ketaki Shetye, Bassam Adnan, Radhika Mamidi

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

言語は単なる言葉の集まりではありません。それは、ある言葉がどのような仲間と共にいるかによって意味が変化する、生きたシステムです。言語学において、一つの単語が多くの異なる役割をこなすことはあり、これは「多義性(polysemy)」として知られています。人間の読者にとって、文脈はガイドとして機能し、その言葉が物理的な物体を指しているのか、抽象的な概念なのか、あるいは動作を指しているのかを瞬時に明確にします。しかし、コンピュータにとってこの作業は極めて困難な課題です。機械はこれらの異なる意味を区別することに苦労することが多く、その結果、文法的には正しくても、意味論的には混乱した翻訳を生み出してしまいます。この問題は、一つの用語が数世紀にわたる微細なニュлоンスを運び、デジタルリソースが乏しいサンスクリット語のような古代言語において特に深刻です。機械が意図された意味を把握できなかった場合、その翻訳の結果は原文の真髄を失い、深遠な哲学的記述を無意味な文字列へと変えてしまうことがあります。

IIITハイデラバードと中央サンスクリット大学の研究者たちは、翻訳を試みる前に、機械に特定の単語の意味に細心の注意を払うよう教えることで、この課題に取り組んできました。彼らの研究は、サンスクリット語から英語への翻訳のための新しい種類の学習データの作成に焦点を当てています。単にサンスクリット語の文章とそれに対応する英語のペアをコンピュータに投入するのではなく、チームはこれらのペアを、文中のすべての単語の正確な意味を特定する明示的なラベルで強化しました。彼らは強力な人工知能ツールを「デジタル辞書編纂者」として活用し、各サンスクリット語の文章を読み、膨大な辞書からあらゆる単語の正しい定義を選択させました。これは、まるで人間の学者が行う作業のようです。このプロセスにより、「意味拡張型(sense-augmented)」コーパス、つまりコンピュータが単に言葉を見せられるだけでなく、その文脈における言葉の正確な意味までをも伝えられるデータセットが誕生しました。

チームは、特化した翻訳エンジンや汎用的な大規模言語モデルを含む、いくつかの異なる翻訳モデルを用いてこの手法をテストしました。まず、彼らは追加の学習を行わない状態、すなわち「ゼロショット推論」において、これらのモデルがどのように機能するかを確認しました。予想通り、モデルは苦戦し、翻訳は断片的になったり、原文の要点を見失ったりすることが頻発しました。例えば、戦士が恐怖に駆られて逃走する場面を翻訳する際、基本的なモデルは「山岳要塞」を意味する言葉を単に「森」と翻訳してしまうことがあり、元の叙事詩の重要なイメージを見落としてしまいます。その後、研究者が標準的な対訳文を用いてこれらのモデルをファインチューニングすると、翻訳は大幅に改善され、より一貫性と流暢さを持つようになりました。しかし、最も劇的な品質の向上は、この新しい意味拡張データを用いてモデルを訓練したときに起こりました。

結果は、明示的な意味情報を提供することが、テストされたすべてのモデルにおいて翻訳の質を一貫して向上させることを示しました。機械は、適切な状況に対して適切な言葉を選ぶ能力が格段に向上しました。ある具体的なケースでは、意味拡張データで訓練されたモデルは「大軍(large army)」というフレーズを正しく「軍隊(army)」と翻訳しましたが、標準的なデータのみで訓練された同じモデルは、それを「布(cloth)」と誤って翻訳しており、場面の意味を完全に変えてしまうミスを犯していました。また別の例では、「政党(party)」または「原因(cause)」を意味する言葉において、強化されたモデルは人々の一団を指す「政党(party)」を正しく選びましたが、標準モデルは文脈に合わない「原因(cause)」を選びました。これらの改善は単なる微調整ではなく、モデルがテキストを理解する方法における根本的な転換を意味しており、以前は失敗の原因となっていた曖昧さを解消することを可能にしました。

この研究はまた、この手法が、もともと翻訳用に設計されていない汎用人工知能モデルに対しても有効であることを明らかにしました。特定の言語ペアに対して苦戦することが多い一般的なモデルであっても、意味拡張データで訓練されることで、専用の翻訳エンジンに匹敵する性能レベルに到達することができました。これは、より優れた翻訳の鍵が、単にデータの量にあるのではなく、意味論的に豊かなデータにあることを示唆しています。研究者たちは、モデルがより文脈に即した選択を行うことを学習し、翻訳においてフレーズの繰り返しや無意味な生成といった一般的なエラーを効果的に減少させていることを見出しました。この強化されたデータセットの作成には多大な計算能力と時間を要しましたが、その見返りは、言葉の曖昧さを明示的に解消するように機械を教えることが、単に正確であるだけでなく、元の言語の精神に忠実な翻訳につながるという明確な実証となりました。

この研究は、機械翻訳におけるあらゆる問題を解決したと主張しているわけでも、現在の方法が完璧であると示唆しているわけでもありません。研究者たちは、彼らの意味インベントリ(語彙目録)が非常に詳細であったため、モデルが非常に似通った意味の間で選択を行うことが時として困難になったと指摘しています。また、プロセスが計算コストの高いものであり、初期の意味割り当てにおけるエラーが最終的な翻訳に影響を与える可能性があることも認めています。しかし、これらの知見は、特にデータが乏しい低リソース言語において、有望な道筋を提示しています。明示的な意味情報が、人間の理解と機械による処理の間の溝を埋めることができることを示すことで、本研究は、コンピュータがいかにして人間の言語の複雑で層状になった意味と対話できるかを向上させるための設計図を提供しています。究極の目標は、単に言葉を翻訳することではなく、話し手の正確な意図とニュواンスを伝えることであり、それは注意深い意味認識に基づいた訓練によってのみ達成される理解のレベルを必要とするのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →