← 最新の論文
🤖 AI

Who Thinks Best Depends on How Long You Let Them: Budget-Dependent Rankings in LLM Evaluation

本論文は、推論時のトークン予算の変化がモデルの性能と順位を著しく変化させ、非単調な挙動、ランキングの逆転、およびモデルの相補性を明らかにしていることを示すことで、大規模言語モデルのランキングが安定しているという仮定に異を唱え、予算条件付きの評価プロトコルを必要としている。

原著者: Rodrigo Guedes de Souza, Alison R. Panisson

公開日 2026-08-13
📖 1 分で読めます☕ さくっと読める

原著者: Rodrigo Guedes de Souza, Alison R. Panisson

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

巨大な図書館にいるところを想像してみてください。そこにある本は、大規模言語モデル(LLM)と呼ばれる超スマートなロボットたちによって書かれています。これらのロボットは、ほとんどすべての内容を読み、数学、科学、歴史に関する質問に答えることができます。長い間、人々が「最高の」ロボットを選ぼうとする際、単に質問を投げかけ、誰が一番早く正解にたどり着いたかだけを見てきました。彼らは、もしロボットAがテストBよりも優れていれば、どんな状況でも常に優れているはずだと考えていました。それはまるで、走る時間をどれくらい与えられたかを気にせずに、ゴールラインを最初に通過した者だけでレースを判定しているようなものでした。

しかし、ここにひねりがあります。これらのロボットは、決して瞬時に「思考」するわけではありません。彼らは、長い思考の連鎖のように、一単語ずつ答えを書き進めていきます。彼らがどれだけの言葉を書くことが許されるかという制限は、「トークン予算」と呼ばれます。これは、学生にテストを受ける時間を変えて与えるようなものです。ある学生は難しいパズルを解くために多くの時間を必要とするかもしれませんし、またある学生は時間がたっぷりありすぎると混乱して、考えすぎてしまうかもしれません。科学者たちの大きな疑問は、「最高の」ロボットは、思考時間を変えても依然として最高であり続けるのか? ということです。つまり、考える時間を長く設定した場合、勝者は変わってしまうのでしょうか? これこそが、研究者たちが本当に知りたかったことなのです。


「考えすぎ」の問題:なぜ時間は長ければ長いほど良いとは限らないのか

この研究において、研究者たちは4つの異なるAIモデルが、3つのトリッキーなテスト(小学校レベルの算数、競技レベルの数学、大学院レベルの科学)でどのようにパフォーマンスを発揮するかを確認するための大規模な実験を行いました。彼らは単にモデルを実行させたのではありません。特定の「思考量」(トークンで測定)に達した時点で、強制的に停止させたのです。彼らは、極めて少ない思考時間である64トークンから、膨大な思考時間である4,096トークンまで、7つの異なる制限を設定してテストを行いました。

そこで彼らが発見したのは、「単一の『最高』のモデル」という概念は神話である、ということでした。モデルのランキングは、与えられた時間に完全に依存して入れ替わり、変化したのです。

「考えすぎ」の驚き
ロボットに考える時間を増やしてあげれば、常に正解にたどり着けると思うかもしれません。しかし、研究者たちは奇妙な現象を発見しました。モデルに「より多くの」トークンを与えると、実際には正解を「間違えて」しまうことがあったのです。彼らはこれを「オーバーシンキング(考えすぎ)」と呼んでいます。

ある数学の問題の答えを知っている学生を想像してみてください。もし10分与えれば、彼らは正しく書き留めるでしょう。しかし、もし30分与えたら、彼らは自分自身に疑念を抱き始め、答えを変えてしまい、結局間違った答えに辿り着いてしまうかもしれません。研究では、これが問題の全質問に対して起こるのではなく、特定のロボットに特有の現象であることが分かりました。あるモデルを「考えすぎ」させて失敗させる質問が、別のモデルにとっては全く問題ないこともあります。それは、ある人がスピーチの準備に時間をかけすぎると緊張してしまう一方で、別の人はその時間があることで実力を発揮できる、という違いに似ています。

劇的なランキングの逆転
このため、レースの「勝者」は常に変わり続けました。

  • 易しい数学テスト(GSM8K)では、中程度の時間(256トークン)を与えられたとき、巨大なモデル(LLaMA-3.3 70B)がチャンピオンでした。しかし、モデルにさらに多くの時間(最大4,096トークン)を与えると、より小さなモデル(GPT-OSS 20B)がトップに立ち、そのまま君臨し続けました。
  • 最も難しい科学テスト(GPQA)では、時間が限られているとき(256–512トークン)は、最小のモデル(LLaMA-3 8B)が実は最強でした。しかし、時間が経過するにつれて、より大きなモデルが追いつき、最終的にはトップタイとなりました。

これは、もし今日、リーダーボードを見て「モデルXが最高である」と書かれていたとしても、その記述は特定の時間設定においてのみ真実であることを意味します。もし時間を変更すれば、モデルXは突然、最悪のモデルになるかもしれないのです。

「オラクル(神託)」の差:なぜスマートなスイッチが必要なのか
研究者たちはさらにこう問いかけました。「もし、あらゆる質問に対して完璧なモデルを魔法のように選ぶことができたら、どれほど成績が向上するだろうか?」 彼らは、理論上の「オラクル(完璧なセレクター)」を構築しました。これは、特定の質問と制限時間に対して、最適なモデルを選択するものです。

結果は衝撃的でした。難解な科学テストにおいて、この完璧なセレクターは、単一の最高モデルを走らせた場合よりも、27.8パーセントポイントも多くの正解を出すことができました。易しい数学テストにおいても、その差は顕著でした(最大16.9ポイント)。これは、単一のロボットがすべてにおいて優れているわけではないことを証明しています。時には小さなロボットが最適であり、時には大きなロボットが最適であり、時には彼らは皆間違えることもあるのです。

スマートなスイッチを作れるか?
チームは「ルーター」を構築しようと試みました。これは、質問と制限時間を見て、どのロボットが回答すべきかを判断するスマートなシステムです。

  • 同じ種類のテスト内での動作: 数学の問題で学習し、数学の問題でテストを行った場合、ルーターは非常にうまく機能しました。「制限時間」をヒントとして使うことで、適切なロボットを選ぶことができ、精度が1.6から5.7ポイント向上しました。
  • 異なるテスト間での動作: しかし、同じルーターを使って数学から科学の質問へと切り替えようとすると、ルーターは混乱してしまいました。数学で有効だった「制限時間」のヒントは、科学では通用しませんでした。実際、それらのヒントを使用することで、ドメインを切り替えた際の性能は1.2ポイント低下しました。これは、「与えられた時間」と「正解にたどり着くこと」の関係性が、科目ごとに異なっていることを示唆しています。

まとめ

この論文の教訓はシンプルですが、非常に強力です。それは、**「単一の『最高の』AIモデルなど存在しない」**ということです。「どのモデルが最高か?」という問いへの答えは、完全に「どれくらいの時間、彼らに考えさせるか」に依存します。

もしあなたが、AIにごくわずかな時間しか与えられないスマートフォンのアプリを作っているなら、小さくて速いモデルがあなたのチャンピオンになるでしょう。もしあなたが、AIに何時間も考えさせることを許容できるサーバーを運用しているなら、別のより大きなモデルが勝者となるかもしれません。モデルをランク付けする古いやり方――ただ一つの勝者を決める方法――は壊れています。代わりに、私たちはこう言うべきです。「モデルAは短い回答に最適であり、モデルBは長い回答に最適であり、そして時には、時間を与えすぎると、彼らは単に失敗してしまうこともある」と。

研究者たちは、将来、単一のスコアを報告するのではなく、異なる制限時間におけるパフォーマンスを報告すべきだと提案しています。そして、これらのモデルを効果的に活用したいのであれば、小さな素早い思考者を呼ぶべき時と、大きな遅い思考者を呼ぶべき時を知っているスマートなシステムが必要なのです。なぜなら、時計が動き出した瞬間に、勝者は変わってしまうからです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →