← 最新の論文
🤖 AI

Frontier AI Forecasting Has a Measurement Problem: An Audit of Progress Evidence

本論文は、最先端AI予測の測定基盤を監査し、決定的なデータの欠落、ベンチマークの不一致、およびソースの集中が単純なトレンドに基づく予測を損なっていることを見出し、正当な予測には、透明なプロトコルとリンクを備えた、明示的かつバージョン管理された測定システムに基づいたものでなければならないと論じている。

原著者: Fabricio F Costa

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Fabricio F Costa

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

私たちは、人工知能の能力が天気予報のような精度で予測される時代に生きています。専門家たちは、コンピュータがいかに高速化しているか、どれほど多くのデータが投入されているか、そして標準化されたテストにおいてどの程度のパフォーマンスを発揮しているかを見て、機械がいつ人間レベルの推論に到達するか、あるいはそれを超えるかを推測しています。これらの予測は通常、特定のカレンダー上の日付という形をとっており、ある特定の年までに、AIが複雑な問題を解決したり、特定のタスクを実行したりできるようになることを示唆しています。その論理は単純明快に見えます。車の速度がどれくらいであるかを測定できれば、目的地にいつ到着するかを計算できるというものです。しかし、このアプローチには隠れた前提があります。それは、速度を測るために使われる「ものさし」が昨日と同じであり、かつ、すべての車に対してスピードメーターが正しく機能しているという前提です。

ファブリシオ・F・コスタによる新しい分析は、この前提に異議を唱えています。この論文は、AIの未来を予測することが不可能であると主張しているのではなく、むしろ現在の予測方法が不安定な土台の上に築かれていると主張しています。著者は、予測を行うために使用される公開記録を、単なるグラフ上の滑らかな線としてではなく、個々のイベント、測定値、および情報源の集合体として扱い、厳格な監査を行いました。その調査により、これらのシステムを構築するために投入されたリソースと、その実際のパフォーマンスとの間のつながりは、一般的な予測が示唆しているよりもはるかに断片的であることが明らかになりました。研究によれば、これらの予測を裏付ける証拠はしばしば不完全で、一貫性に欠け、単一の情報源に大きく依存しており、ニュースで引用される具体的な日付は、科学的な結論というよりもむしろ「推測」に近いものであることが判明しました。

問題の範囲を理解するためには、まずこれらの予測が通常どのように構築されているかを見なければなりません。研究者たちは通常、二つの要素を結びつけようとします。それは、モデルのトレーニングに使用されたコンピューティング・パワーの量と、そのモデルがベンチマーク・テストで達成した結果です。ベンチマークとは、単にトリビアに答えたり数学の問題を解いたりといった特定のスキルを測定するために設計された、標準化された一連の質問やタスクのことです。考え方としては、モデルにより多くのコンピューティング・パワーを与えるにつれて、これらのテストのスコアが予測可能な形で上昇するというものです。もしその関係性をマッピングできれば、スコアが特定の閾値に達する時期を前方に投影することができます。しかし、この投影が有効であるためには、同じシステムに対してコンピューティング・パワーとテスト・スコアの両方が判明しているデータポイントが必要です。

著者が62の主要な人工知能システムの公開記録を調査したところ、重大なギャップが浮かび上がりました。多くのシステムについて、使用されたコンピューティング・パワーに関する情報は入手可能でしたが、最も高度なクローズドソース(非公開型)モデルの多くについては情報が欠落していました。逆に、METRと呼ばれる広く引用されている特定の測定プログラムによるパフォーマンス・スコアは、多くのクローズド・モデルについては入手可能でしたが、オープンソースのシステムについては完全に欠落していました。これにより、「燃料」と「速度」の両方のデータが必要な状況において、それらが同じマシンに対して共存することは滅多にないという事態が生じました。全62システムの中で、コンピューティング・エスティメート(推定値)とパフォーマンス・スコアの両方が記録されていたのは、わずか7つでした。これは、予測で見られる滑らかな曲線が、実際にはほんの一握りのデータポイントを通じて描かれていることを意味しており、残りの領域は空白のままなのです。

問題は、テスト自体が静的なものではないことを考慮するとさらに深刻になります。定規が少し異なる目盛りを持つ新しいものに置き換えられることがあるように、AIを測定するためのベンチマークも、モデルが単に答えを暗記してしまうのを防ぐために、常に更新、改訂、または置換されています。監査では、これら異なるバージョンのテストが互いにどのように関連しているかを調べました。その結果、古いバージョンのテストのスコアを新しいバージョンのテストと比較しようとする際、その関係性は必ずしも単純な直線的な変化ではないことが分かりました。時には、新しいテストが少し異なるものを測定していたり、難易度が変化することでスコアが予期せず跳ね上がったり下がったりすることがあります。研究はこのことを、ある人気のあるテストの二つのバージョンにおけるシステムのパフォーマンスを確認することで検証しましたが、古いスコアと新しいスコアの間の接続は、それらを比較するために使用される数学的手法に大きく依存していることが判明しました。あるケースでは、新しいバージョンの方がはるかに急激な改善を示しているように見えましたが、別のケースでは、改善は横ばいに見えました。このことは、スコアの上昇が必ずしもAIが賢くなったことを意味するのではなく、単にテストが変わっただけである可能性があることを示唆しています。

特定されたもう一つの重要な問題は、証拠の集中度です。AIの進歩を追跡するために使用される具体的なデータポイントの大部分は、単一の測定プログラムに由来しています。監査された71の主要な定量的イベントのうち、52個がたった一つのソースから来ていました。これは、大陸全体の気象パターンを理解しようとして、単一の都市の温度計の読み取り値だけに頼っているようなものです。その都市が正確であったとしても、それだけでは大陸の他の地域が同じ状況にあるかどうかは分かりません。また、監査では、これらの測定値の多くが実世界のフィールド・テストではなく、ラボでのリリースに基づいていることも指摘されました。ラボ内では条件が制御されていますが、現実世界では、AIは予測不可能な環境、多様なユーザー、そして変化するレベルのサポートと相互作用します。論文は、単一のソースと単一の種類のテストに依存することは、データの整合性が高く見えることで予測に対する信頼感を生み出しているものの、実際にはそのデータが真に独立したものではないという、誤った確信を生み出すことになると主張しています。

著者はまた、これらの異なる測定値を結びつけるための統計テストの精度についても調査しました。分析の結果、現在のデータセットは、非常に大きな変化以外を検出するにはあまりにも小さすぎることが示されました。もしコンピューティング・パワーとパフォーマンスの関係がわずかに変化したとしても、現在の記録ではそれを見逃してしまう可能性が高いのです。研究では、これらのシステムがどのように改善するかという小さな変化を確実に検出するためには、より多くのシステムを、新旧両方のベンチマークで同時にテストする必要があると算出されました。このような、より大規模で多様なデータセットがなければ、特定の節目にいつ到達するかを正確に知っていると主張するいかなる予測も、本質的には「当てずっぽう」に過ぎません。

この論文は、AIの進歩を測定することを止めるべきだと提案しているのではありません。むしろ、より誠実で複雑なアプローチを求めています。AIの全能力を単一の数字や単一の日付に押し込めるのではなく、著者は「ポートフォリオ」型の測定を提案しています。これは、モデルを動かすためにどれだけのエネルギーと資金が必要か、長期的にどれほど信頼できるか、現実世界のタスクでどのように機能するか、そして安全性のリスクをどのように扱うかといった、異なる要素を同時に追跡することを意味します。また、異なる研究グループが異なる手法を用いて同じモデルをテストし、結果が特定のラボや特定のテストによるアーティファクト(人工的な産物)ではないことを保証するシステムも必要となります。目標は、単一の完璧な定規という考え方から脱却し、それぞれの不確実性を伴いながら、知能の異なる側面を測定できる道具のコレクションへと移行することです。

最終的に、研究は、人工知能の未来に関する防御可能な予測を行うためには、何をどのように測定しているかについて透明であるべきであると結論付けています。データがどこで欠落しているか、テストがどのように変わったか、そしてその証拠がどこから来ているかを認めなければなりません。背後にある測定システムを説明せずに日付だけを提示する予測は、科学的な主張ではなく、単なる推測です。論文は、測定システム自体を予測の一部として扱うよう、この分野に促しています。つまり、日付は、それを導き出すために使われた「ものさし」と同じくらいしか意味を持たないということを認めるべきだということです。コミュニティが、コンピューティング・パワー、パフォーマンス、そして現実世界の成果を、多くの異なるシステムにわたって一貫して、かつ独立して測定できる記録を構築できるまでは、いかなる予測においても、最も正確な部分はカレンダー上の日付であり、最も不正確な部分は、そこに至る過程で実際に何を測定しているかであるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →