← 最新の論文
💬 NLP

The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance

本論文は、ベンチマーク問題の意味を維持したまま言い換えることが、LLMにおいていかに大幅な双方向の性能変動を引き起こすかを定量化するフレームドワークであるBenchDriftを紹介し、言い換えに対する感受性がモデルの強弱を問わず持続すること、およびその脆弱性は個々のモデルの弱点よりもむしろ特定の言い換えに起因していることを明らかにしている。

原著者: Shailja Thakur, Sungeun An, Chad DeLuca, Hima Patel

公開日 2026-08-13
📖 1 分で読めます☕ さくっと読める

原著者: Shailja Thakur, Sungeun An, Chad DeLuca, Hima Patel

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、才能ある人々が集まるショーの審査員になったと想像してください。ただし、あなたはパフォーマンスを見ているのではなく、パズルを解くロボットの能力を採点しています。人工知能の世界では、これらのパズルは「ベンチマーク」と呼ばれます。ベンチマークとは、コンピュータにとっての期末試験のような、標準化されたテストのことです。長年、科学者たちは、もしロボットがこのテストで高いスコアを獲得すれば、それは内容を真に理解しているのだと信じてきました。しかし、そこには落とし穴があります。テストにあるすべてのパズルが、たった一つの特定の方法で書かれているのです。それは、生徒に「2足す2は何ですか?」とだけ聞き、完璧なスコアを与えるようなものです。「2と2の和を教えてくれますか?」や「もしリンゴが2個あり、さらに2個見つけたら、全部で何個になりますか?」といった問いかけは一度も行われません。

この論文は、コンピュータがいかに人間の言葉を理解するかを研究する、自然言語処理(NLP)と呼ばれる科学の一角を掘り下げています。ここでの鍵となる考え方は、コンピュータは質問の「され方」に対して驚くほど敏感であるということです。人間が、先生が変な訛りで話したり、紛らわしい文章構造を使ったりすると混乱することがあるように、コンピュータも、たとえ数学や論理が全く同じであっても、言葉が変わるだけでつまずいてしまう可能性があるのです。なぜこれが重要なのでしょうか? もしロボットのスコアがテストの特定の言い回しに完全に依存しているとしたら、そのスコアがロボットの本当の賢さを物語っているとは到底信頼できないからです。それは単に、特定の謎解きに対して正しい答えを推測するのが上手いだけであり、問題そのものを解いているわけではないのかもしれません。

IBMの研究者たちは、この「言い回しの効果」を調査するために、BenchDriftと名付けた新しいツールを開発しました。想像してみてください、答えを変えることなく、テストの問題を数十通りの異なる方法で書き換えることができる魔法のコピー機があるところを。同じ数学の問題を、丁寧な依頼として、劇的な物語として、箇ロ列表記として、あるいは一連の小さな質問として提示することができます。チームはBenchDriftを使用して、実際のテスト問題を以下の4つの「軸」に沿って書き換えました:言語的(言葉やスタイルを変える)、参照的(名前や数字を入れ替える)、語用論的(アーティストであるかのように振る舞うなど、トーンや設定を変える)、そして構造的(情報の構成方法を変える)です。

彼らは、小型から超大型まで、8種類の異なるAIモデルに対して、これらの書き換えられた質問を実行しました。そこで彼らが発見したのは、少し衝撃的な事実でした。彼らは「ドリフト(漂流)」と呼ばれる現象を発見したのです。時には、質問を書き換えることで、以前失敗した問題に対してロボットが正解に辿り着くこともありました(ポジティブ・ドリフト)。しかし多くの場合、質問を書き換えたことで、以前は正解できていた問題をロボットが間違えてしまうことがありました(ネガティブ・ドリフト)。

最も驚くべき発見は、ロボットが賢ければ賢いほど、より脆弱に見えるということでした。通常、最も高いスコアを獲得する強力なモデルほど、質問が言い換えられた際に失われる正解数が、獲得した数よりも多かったのです。それはまるで、トップクラスの学生たちが、先生の特定の問いかけ方に慣れすぎてしまい、少し異なる言い回しに対応できなくなってしまったかのようです。実際、最高のモデルにとって、単一のテストスコアはしばしば、その真の実力を過大評価したものとなっていました。研究者たちは、モデルの「ベストケース」のスコア(言い回しによって運良く正解できた場合)と、「ワーストケース」のスコア(言い回しによってつまずいた場合)の差が極めて大きいことを発見しました。その差は平均して74.7パーセントポイントにも及びます。例えば、元のテストで**93.4%のスコアを出したモデルが、質問をある方法で書き換えた途端に38.2%**まで急落したのです。

チームは、いくつかの安易な言い訳を排除しました。彼らは、ロボットが単に問題が難しくなったり長くなったりしたために失敗しているのではないことを証明しました。問題が短くなったり長くなったりしても、同じ程度のトラブルが発生したからです。また、ロボットが自分の答えに対して非常に自信を持っている(高い確率スコアを出している)場合でも、単純な言い換えによってその論理が崩れてしまうことも発見しました。これは、脆弱性が単にロボットが確信を持てていないことによるものではなく、ロボットが言葉の特定の形状に過度に依存していることを示唆しています。

さらに、研究者たちは、異なるモデルが同じタイプの書き換えに対して失敗する傾向があることにも気づきました。例えば、問題を一連の小さな明示的な質問に分解すること(構造的な変更)は、全体を通して最も多くの失敗を引き起こしましたが、単に余分なスペースを追加したりフォントを変えたりすることは、ほとんど影響を与えませんでした。これは、問題が特定のロボット固有のものではなく、これらのシステムが特定の種類の言語構造を扱う際の欠陥であることを意味しています。

結局のところ、この論文は、単一のベンチマークスコアは動いている車のスナップショットのようなものであると主張しています。それは車がまさにその瞬間にどこにいたかを教えてくれますが、その車がどれほど安定しているかは教えてくれません。研究者たちは、単に一つの数値を報告するのではなく、範囲を報告すべきだと提案しています。つまり、モデルが得られる最悪のスコア、最高のスコア、そして平均値です。これにより、そのAIが実際に何ができるのかという、より明確な全体像が得られます。彼らは、モデルの真の強さを信頼できる形で把握するためには、元のバージョンの問題だけでなく、同じ問題の多くの異なるバージョンに対してテストを行う必要があると結論付けました。もしこれを行わなければ、私たちは、単にテストの言い回しがたまたま上手くいっただけの、実は非常に脆いロボットを称賛してしまうことになるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →