An Investigation of Translationese in the Generations of Multilingual Large Language Models
本論文は、5つの言語における言語的特徴を分析し、多言語大規模言語モデル(MLLM)による生成物を非翻訳および人間による執筆のベースラインと比較することによって、MLLMが人間による翻訳テキストに類似した「翻訳調(translationese)」を生み出すかどうかを調査するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
人が母国語ではない言語で話したり書いたりするとき、その言葉にはしばしば、微細で目に見えない指紋が刻まれることがある。文構造がわずかに硬く感じられたり、言葉の選択が技術的には正しいものの現地の人々には滅多に使われないものであったり、あるいは母国語の影響を露呈させるような形でフレーズが配置されたりすることがある。言語学者はこの現象を「翻訳調(translationese)」と呼んでいる。それは、テキストが翻訳に成功した後であっても、元の言語の残響として立ち現れるものである。数十年にわたり、この概念は人間の翻訳において研究されてきた。そこでは、翻訳という行為がいかに言語の質感を変えてしまうのかを学者が分析してきた。しかし今日、人工知能の分野において、新たな問いが浮上している。数十の言語で流暢に執筆できる強力なコンピュータシステムである大規模言語モデルが、ますます一般的になっている。これらの機械は、表面上は完璧に見えるテキストを生成することができるが、研究者たちは、彼らが書いている言語で真に思考しているのか、それとも最終的な出力を出す前に、おそらく英語であると思われる支配的な内部言語から密かにすべてを翻訳しているのではないかと考え始めている。もしそうであれば、彼らの出力には、人間の翻訳者が残すのと同様の隠れた翻訳の指紋が刻まれているはずである。
ある研究チームは、これらの人工知能モデルによって生成されたテキストを、あたかも翻訳されたものとして扱うことで、この可能性を調査することに着手した。彼らは、機械が特定の言語で直接書くように求められたとしても、翻訳されたかのような響きを持つテキストを生成しているのではないかを知りたかったのである。そのために、彼らは英語、ドイツ語、スペイン語、ギリシャ語、パシュトー語の5つの異なる言語でテキストサンプルを集めた。彼らは、ネイティブスピーカーによって自然に書かれたテキスト、人間によって真に翻訳されたテキスト、そして利用可能な最も高度な2つのAIモデルによって生成されたテキストという、3つの明確に異なるタイプを含む膨大なコレクションを作成した。また、AIが対象言語で直接書く場合と比較するために、AIが英語で書き、別のコンピュータプログラムがそれを対象言語に翻訳したという第4のタイプも加えた。そして研究者たちは、翻訳調特有のパターンを認識するように訓練された洗練されたコンピュータプログラムを使用した。このプログラムは、数千もの人間の文章と人間の翻訳例を用いて学習しており、ネイティブスピーカーと翻訳者を分かつ微妙な統計的差異を見つけ出すことを学んでいたのである。
結果は明確なパターンを明らかにした。AIモデルが英語で書いたとき、そのテキストが翻訳されたと判定されることはほとんどなく、彼らが支配的な言語において自然に動作していることが示唆された。しかし、モデルが他の言語に切り替えると、状況は一変した。ドイツ語とスペイン語において、AI生成テキストは強い翻訳調の兆候を示した。コンピュータプログラムは、ドイツ語のテキストの大部分と、スペイン語のテキストの多くが、翻訳特有のマーカーを持っていると特定した。これは、モデルがこれらの言語で直接書くよう促されている場合でも、内部プロセスにおいて翻訳に似たプロセス、おそらく最初に英語で思考してから変換するというプロセスに依存している可能性があることを示唆している。この影響は、モデルが選ぶ特定の単語を見たときにさらに顕著になった。AIは、人間が犯しがちな最も明白で不器用な間違いは避ける傾向にあるものの、一般的な単語の微妙な分布については依然として苦戦していることが分かった。例えば、ドイツ語において、モデルは翻訳されたテキストと一致するパターンで特定の一般的な接続詞を使用していた一方で、スペイン語では、「the」のような冠詞をネイティブスピーカーよりもはるかに少ない頻度で使用していた。
興味深いことに、この「翻訳」効果の程度は、言語自体に大きく依存していた。モデルは、利用可能なデジタルリソースが少ないギリシャ語やパシュトー語において、ドイツ語やスペイン語よりも優れたパフォーマンスを示した。これらの低リソース言語において、AI生成テキストは翻訳されたと判定される可能性が低かった。研究者たちは、これはドイツ語やスペイン語のトレーニングデータには既存の翻訳された素材が膨大に含まれており、モデルが単にそれを模倣しているからではないかと示唆している。対照的に、ギリシャ語やパシュトー語のトレーニングデータには翻訳されたコンテンツが少なく、モデルが利用可能なネイティブの構造により多く依存せざるを得ない可能性がある。研究チームはまた、人間の読者にテキストの小さなサンプルを判断させた。驚いたことに、人間はコンピュータプログラムが容易に見つけた翻訳調を、しばしば検出することができなかった。人間は主に奇妙な言葉選びや奇妙な組み合わせに気づいたが、コンピュータは単語がどのように配置されているかという、より深い統計的な変化を検出した。これは、AIが最も明白な誤りを隠すことはできても、その文章の根底にある構造が、ネイティブとしての流暢さの欠如を露呈させていることを示している。
この研究は、これらの強力な言語モデルが、英語以外の言語において、真にネイティブな方法でテキストを生成しているわけではないと結論づけている。むしろ、彼らの出力はしばしば翻訳の隠れた署名を帯びており、その内部処理が依然として英語にアンカーされている(固定されている)ことを示唆している。これは、モデルが失敗していることを意味するのではない。彼らはしばしば非常に効果的で有用である。しかし、これは彼らの学習と動作における根本的な限界を明らかにしている。彼らは多くの言語の表面レベルを習得しているようでありながら、推論においては依然として中央の英語ベースの枠組みに依存しているようである。研究者たちは、この発見が、なぜこれらのモデルが文化的なニュアンスや、英語以外の言語の自然な流れに苦戦することがあるのかを説明する助けになると述べている。これらの隠れた指紋を特定することで、本研究は、単なる正確さを超えて、機械が模倣しようとしている声の真の自然さを評価するという、機械生成テキストの真の質を測定する新しい方法を提供している。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。