← 最新の論文
🤖 AI

How Inference Compute Shapes Frontier LLM Evaluation

本論文は、最先端のLLMの性能は推論時の計算予算および評価プロトコルに対して非常に敏感であることを示し、ベンチマークはモデルの潜在能力を過小評価する可能性のある制限的な固定予算に依存するのではなく、利用可能な計算量の関数として能力を報告すべきであると主張している。

原著者: Jessica McFadyen, Ole Jorgensen, Harry Coppock, Kevin Wei, Cozmin Ududec

公開日 2026-06-17
📖 1 分で読めます☕ さくっと読める

原著者: Jessica McFadyen, Ole Jorgensen, Harry Coppock, Kevin Wei, Cozmin Ududec

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、誰が最も優れた複雑な謎解きができるかを判断するために、優秀な探偵チームをテストしていると考えてください。かつては、「10分間の制限時間と、回答のチャンスは一度だけ」という厳しいルールを与えていたかもしれません。「この探偵は実力不足だ」と切り捨てるために。

しかし、この論文は、その方法が不公平であると主張しています。一部の探偵は、単にもっと時間が必要だったり、自分の間違いを確認するための二度目のチャンスや、最初の推測が間違っていたというヒントを必要としていただけかもしれないからです。もしそれらを与えていれば、彼らは完璧に謎を解いていたかもしれません。

研究者たちは、このアイデアを検証するために、世界で最も高度なAIモデル(「探偵」)を、プログラミング、高度な数学問題の解決、医療診断、サイバーセキュリティへのハッキングなど、非常に困難な7つの課題を用いてテストしました。

以下に、その結果を分かりやすく説明します。

1. 「制限時間」の罠

ほとんどのAIテストでは、モデルが使用できる「思考時間」(トークン)に厳格な制限を設けています。研究者たちは、多くの困難なタスクにおいて、この制限が、AIがちょうど答えに辿り着こうとしている瞬間に、思考を打ち切ってしまうことを発見しました。

  • 例え話: 数学のテストを受けている学生を想像してください。学生は解き方を知っていますが、先生が10分経ったところでテストを止めてしまいます。学生が不合格になるのは、数学ができないからではなく、時間が足りなかったからです。
  • 結果: 研究者がAIモデルに通常より多くの時間(最大30倍)を与えたところ、高度な数学やサイバーセキュリティのような難しいタスクにおいて、スコアが大幅に上昇しました。しかし、一部のタスク(特定のソフトウェアエンジニアリングの問題など)では、通常の制限時間内ですでに可能な限りの解決に至っていたため、時間を増やしてもあまり効果はありませんでした。

2. 「セカンドチャンス」の効果

研究者たちは、失敗した後にAIに再試行をさせた場合に何が起こるかもテストしました。

  • 例え話: ビデオゲームを想像してください。もし死んでしまったら、そのまま終了ですか? それとも、やり直して別の戦略を試すことができますか?
  • 結果: AIに「再試行」または「新しい回答の提出」を許可すると、ほぼすべてのテストでスコアが向上しました。
    • ヒントがある場合: 「その回答は間違っています。もう一度試してください」とAIに伝えられた場合、特に長く複雑なタスクにおいて、正しい解決策を見つける能力が大幅に向上しました。
    • ヒントがない場合: 正解か不正解かを知らされずに、自力で推測しなければならない場合でも、スコアは向上しましたが、それほど大きな改善は見られませんでした。
    • 注意点: いくつかのテストでは、AIは1回か2回の試行で正解に到達しました。しかし、別のテストでは、最終的に成功するまでに10回や15回の試行を必要としました。

3. 万能な解決策は存在しない

最も重要な発見は、異なる種類の問題には、異なる種類の「助け」が必要であるということです。

  • 例え話: あなたが道具箱を持っていると想像してください。ハンマーは釘には最適ですが、ネジには役に立ちません。あらゆるものに対してハンマーだけを使い、それがうまくいくと期待することはできません。
  • 結果:
    • サイバーセキュリティと数学: これらのタスクは、「より多くの時間」と「より多くの試行」を好みました。AIは作業を続けるほど、どんどん上手くなっていきました。
    • 医療診断: このタスクは、時間を増やしてもあまり改善しませんでした。AIはある一定の壁に突き当たり、それ以上考えても効果がない状態にあるようでした。
    • ソフトウェアエンジニアリング: これらのタスクは、時間を増やすことで少し改善しましたが、主に「何度もやり直すこと」を必要としていました。

4. 新しいモデルは異なる

研究者たちは、異なる年代のモデル(旧世代 vs 新世代)をテストしました。

  • 例え話: 旧世代のモデルを、多くの時間と多くのヒントを必要とする「新人探偵」だと考えてください。新世代のモデルは「ベテラン探偵」のようなものです。彼らはより難しい事件を解決でき、より信頼性が高いですが、必ずしも時間の使い方が速くなったわけではありません。
  • 結果: 新しいモデルは、単に時間の使い方が「速くなった」のではありません。代わりに、以下の点で進化しました。
    1. より困難なタスクの解放: 旧世代のモデルでは全く手が付けられなかった問題を解決できるようになりました。
    2. 信頼性の向上: 問題を解決した際、二度目の試行でミスをする確率が低くなりました。
    • 興味深いことに、最新のモデルは、最初から正解に辿り着くことが多いため、必ずしも多くの「セカンドチャンス」を必要としませんでした。

結論

この論文は、単一のテストにおける厳格な制限時間による一つのスコアだけで、AIの真の知能を判断することはできないと主張しています。

  • スコアはルールに依存する: AIのスコアは、どれだけの時間を与えるか、やり直しを許可するか、そして正解か不正解かを教えるかどうかによって変化します。
  • 推奨事項: 「モデルXのスコアは80%です」と言うのではなく、「モデルXは1分では80%ですが、10分では95%になります」と言うべきです。これにより、特に安全保障や政策決定において、システムの「最大潜在能力」を知る必要がある場合、AIが実際に何ができるのかという、より明確な全体像を示すことができます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →