← 最新の論文
💬 NLP

Apples to Apples? Towards Comparable Crosslingual Language Model Evaluation

本論文は、広く用いられているクロスリンガル言語モデル評価のための正規化された指標が、トークン化や正書法の違いに起因するバイアスを導入していることを示し、意味的に等価なシーケンスに対する文レベルの負の対数尤度が、言語間でモデルを比較するためのより一貫性があり公平な代替案であることを提案する。

原著者: Xiulin Yang, Ethan Gotlieb Wilcox, Catherine Arnett

公開日 2026-08-27
📖 1 分で読めます☕ さくっと読める

原著者: Xiulin Yang, Ethan Gotlieb Wilcox, Catherine Arnett

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

急速に進化する人工知能の世界において、コンピュータは数十の人間言語で話し、書くことを学びつつあります。言語モデルとして知られるこれらのデジタルな精神は、文の中で次にどの単語が来るかを予測するために、膨大なテキストのライブラリを用いて訓練されています。これらのシステムがより強力になるにつれ、研究者たちは重大な課題に直面しています。それは、あるモデルが特定の言語に真に長けているのか、それとも単にその言語がコンピュータ上に書き記されている方法に長けているだけなのかを、どうすれば判断できるのかという問題です。これに答えるために、科学者たちは、モデルがいかに効率的に生の文字や記号を処理できるかではなく、テキストの意味をいかに理解しているかを測定しなければなりません。問題は、この理解を測定するために現在使用されているツールが、しばしば隠れた罠を含んでいることです。それらは、単語に含まれる文字数、使用される特定のスクリプト(文字体系)、あるいはコンピュータが文章を処理するために文章を小さな断片へと分解する方法によって、偏ってしまう可能性があるのです。もしこれらのツールにバイアスがあれば、モデルの実際の知能によるのではなく、データの取り扱いにおける技術的な癖によって、ある言語では非常に優秀に見え、別の言語では不器用に見えてしまうかもしれません。これは、世界中の多様な言語に対して、人工知能がいかに優れた性能を発揮しているかを公平に比較することを、ほぼ不可能にしています。

ジョージタウン大学とEleutherAIの研究チームは、これらのモデルを判定するために使用されるツールそのものをテストすることで、この謎を解こうと試みました。彼らは、10の異なる言語のうち、それぞれ1つの言語のみで訓練された50の独立したコンピュータモデルを用いた制御実験を構築しました。公平なテストを確実にするため、彼らはパラレルデータ(異なる言語で全く同じ意味を表すテキスト)を用いてこれらのモデルを訓練しました。そして、この分野で一般的に用いられている6つの異なる測定方法を用いて、これらのモデルをテストしました。これらの手法の中には、モデルが文章を理解するために使用する微細な構成要素、すなわち「トークン」の総数を数えるものもあります。また、デジタルストレージの単位である「バイト」の数や、画面上の個々の「文字」の数を数えるものもあります。研究者たちはまた、テキストの長さによってその困難さを割り算することなく、モデルが文全体を予測する際にかける総体的な困難さを単純に合算する手法についてもテストを行いました。

結果は、これらの測定方法がどのように機能しているかについて、驚くべき事実を明らかにしました。モデルのパフォーマンスをトークン、バイト、または文字数で割る手法は、異なる言語を比較する際に極めて欠陥があることが判明しました。これらの指標は、同じ概念を表現するために自然に少ない文字数やバイト数を使用する言語(中国語など)を有利にし、一方で、より長い記号のシーケンスを必要とする言語を不利にする傾向がありました。一つの顕著な例として、英語のみで訓練されたモデルが、これらの欠陥のある手法で測定された際、ロシア語において英語よりも「優れた」パフォーマンスを示すことが示されました。これは、単にコンピュータがロシア語のテキストをより多くの断片に分解したために、人工的にスコアを下げてしまったことが原因でした。この現象は、モデルがロシア語を一度も見たことがなく、実際にはロシア語に対して低い性能しか発揮していなかったにもかかわらず発生しました。この研究は、これらの普及している指標が、モデルの実際の知能や理解を測定しているのではなく、単にコンピュータがテキストを読み取る際に設定されたエンジニアリング上の選択を反映しているに過ぎないことを示しました。

対照的に、文全体の困難さを長さで割ることなく合算した手法が、唯一の公平なアプローチであることが証明されました。研究者が「文レベルの負の対数尤度(sentence-level negative log-likelihood)」と呼ぶこの測定法は、モデルがテキスト全体の意味を理解するために注ぐ全エネルギーに着目しました。この手法は、文字やデジタルストレージの観点からのテキストの長さに基づいてスコアを正規化しようとしなかったため、スクリプトやコンピュータの語彙サイズに関わらず安定していました。研究者がこの手法を大規模な実世界の多言語モデルに対してテストしたところ、モデルがどの言語を最もよく学習したかを正しく特定できたのは、この指標のみであり、既知の訓練データの構成と一致していました。他の手法は、引き続き、テキストが保存され処理される際の技術的な詳細によって歪められたランキングを生み出し続けました。

研究者たちはまた、同じ意味が異なる方法で表現された場合に、これらの測定値が一貫性を保つかどうかも調査しました。その結果、一部の指標は、どの翻訳や言い換えが使用されるかによって激しく変動する一方で、文レベルの手法は安定していることが分かりました。これは、他の手法の見た目上の安定性が、真の信頼性の兆候ではなく、表面的な詳細に対する感度によって作られた錯覚であることを示唆しています。本研究は、人工知能が異なる文化や言語においてどのように機能しているかを真に理解するためには、トークン、バイト、または文字を数える指標に依存することをやめなければならないと結論付けています。代わりに、テキストの総体的な意味を尊重する尺度を用いるべきであり、それによって評価が、デジタル表現の癖ではなく、モデルの実際の学習を反映するようにしなければなりません。この転換は、人々がどのような言語を話すかにかかわらず、真に公平で効果的なシステムを構築するために不可欠です。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →