← 最新の論文
🤖 machine learning

The Silent Hyperparameter: Quantifying the Impact of Inference Backends on LLM Reproducibility

本論文は、推論バックエンドの選択がシステムレベルの最適化によりLLMベンチマークスコアを最大16.6パーセントポイントまで大幅に変化させる、重要かつしばしば報告されないハイパーパラメータであることを明らかにし、再現性を確保するために推論スタックの報告を標準化するようコミュニティに促すものである。

原著者: David Pape, Jonathan Evertz, Lea Schönherr

公開日 2026-05-20
📖 1 分で読めます☕ さくっと読める

原著者: David Pape, Jonathan Evertz, Lea Schönherr

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

高リスクの料理コンテストで審査員になったと想像してください。あなたは 5 つの同一のレシピ(AI モデル)と、5 人の異なるシェフ(推論バックエンド)を持っています。レシピが同じなら、出来上がった料理の味も完全に同じになるはずです、よね?

この論文は、シェフがレシピと同じくらい重要であると主張しています。

大規模言語モデル(LLM)の世界では、研究者たちは通常「レシピ」(モデルの重みとトレーニング)に焦点を当てています。同じモデルに同じプロンプトを入力すれば、同じ答えが得られると仮定しています。しかし、この論文は、この仮定が破綻していることを明らかにしています。「シェフ」(モデルを実行するソフトウェアエンジン)は、料理の結果を完全に変えてしまう無言で目に見えない変数であり、時には素晴らしいレシピをまずい味にしたり、平凡なレシピを驚くほど美味しくしたりすることさえあります。

以下に、この論文が明らかにした内容を、シンプルな比喩を用いて解説します。

1. 「無言のハイパーパラメータ」

AI 研究において、「ハイパーパラメータ」とは、より良い結果を得るために調整する設定値(温度や速度など)のことです。著者たちは、推論バックエンド(vLLM、llama.cpp、Ollama などのソフトウェア)が、誰も話題にしない隠れたハイパーパラメータのように機能することを発見しました。

  • 比喩: 同じ本を 2 人が読む状況を想像してください。1 人は静かな図書館で読み、もう 1 人は揺れるジェットコースターに乗っている最中に読みます(高速で最適化されたエンジン)。本は同一であっても、ジェットコースターに乗っている人は単語を飛ばしたり、文を誤読したり、気が散ったりして、最終的には異なる物語を語るかもしれません。
  • 発見: 著者たちは、5 つの異なる「シェフ」(エンジン)を 5 つの異なる「レシピ」(モデル)でテストしました。その結果、単にエンジンを変更するだけで、モデルのテストスコアが最大 16.6 ポイント変動することがわかりました。これは極めて大きな変動であり、モデル自体が変わっていなくても、「平均的」なモデルを「世界チャンピオン」に、あるいはその逆に変えるのに十分な大きさです。

2. 会話における「バタフライ効果」

AI モデルは、1 語ずつテキストを生成します。エンジンが最初の 1 語でわずかな間違いを犯せば、会話全体が軌道から外れてしまいます。

  • 比喩: 「伝言ゲーム」を考えてみてください。1 番目の人が意図したのと少し異なる単語をささやけば、最後の人は全く異なるものを聞くことになります。
  • 発見: この論文は、これらのエンジンが答えの最初の数語でよく一致しないことを示しました。複雑な推論タスク(数学の問題を解くなど)において、あるエンジンは解答を正しく始めますが、別のエンジンは微小な誤りから始めます。その微小な誤りが連鎖し、エンジンが全く異なり、かつしばしば誤った思考連鎖を生成してしまうのです。

3. なぜこれが起こるのか?(厨房の秘密)

著者たちは、なぜシェフたちが異なる料理を作るのかを突き止めるためにコードを調査しました。その結果、主に 2 つの理由が見つかりました。

  • 理由 A: 隠れたデフォルト設定(「秘密のソース」): 一部のエンジンには、自動的にオンになる隠れた設定があります。
    • 例: あるエンジン(Ollama)は、リクエストしていない塩のひとつまみのように、プロンプトに密かに追加の「開始」トークンを追加します。別のエンジン(LMDeploy)は、単語の繰り返しに対して特定のペナルティを強制します。研究者たちがこれらの「秘密のソース」をオフにしたところ、スコアは再び跳ね上がり、エンジンが結果を操作していたことが証明されました。
  • 理由 B: 速度向上のトリック(「早送り」のバグ): AI を高速化するために、エンジニアは数学的なショートカット(計算のグループ化や低精度数学の使用など)を使用します。
    • 例: 長い数学の問題を解くと想像してください。1 人は電卓を使ってステップバイステップで解き、もう 1 人は数字をわずかに異なる方法で丸める超高速な暗算のトリックを使います。最終的な答えは通常似ていますが、時としてそのわずかな丸め誤差が結果を変えてしまいます。AI において、これらの「速度向上のトリック」は微小な浮動小数点誤差を引き起こし、それが蓄積して最終的な答えを変えてしまいます。

4. 研究における「目に見えない」問題

著者たちは、科学者たちがどの「シェフ」を使用したかを報告しているかどうかを確認するために、35,000 篇以上の研究論文を調査しました。

  • 発見: ほとんど誰もそれを報告していませんでした。まるで料理コンテストで、出場者が「秘密のレシピを使った」と言いながら、どのコンロで調理したかは拒否するのと同じです。
  • 結果: 研究者がエンジンを報告しないため、新しい「最先端(State-of-the-Art)」モデルが実際に優れているのか、それともたまたまスコアを押し上げる特定のエンジンでテストされたから運良くそう見えているだけなのかを判断できません。これにより、科学的進歩の検証が困難になっています。

5. セキュリティリスク

この論文はまた、安全性もテストしました。モデルに安全ルールを「突破」させよう(ジャイルブレイク)と問いかけました。

  • 発見: あるエンジンでは安全で危険な質問への回答を拒否するモデルが、別のエンジンでは突然脆弱になり、回答してしまうことがあります。「デプロイのギャップ」は、ラボで安全とテストされたモデルが、それを動かすソフトウェアが異なるだけで、現実世界では安全ではないことを意味します。

結論

著者たちは、AI 研究における新たな基準を呼びかけています:ソフトウェアエンジンを「目に見えないもの」として扱わないこと。

ケーキを焼く際に温度やオーブンの種類を報告するのと同じように、研究者は正確にどの推論エンジンを使用したかを報告しなければなりません。それまで、私たちが「リンゴとリンゴ」を比較しているのか、それとも「異なる包丁でスライスされたリンゴとリンゴ」を比較しているだけなのかを確信することはできません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →