Measuring AI Ability to Complete Long Software Tasks
この論文は、AIの能力を人間の労力と比較することで定量化する「50%タスク完了時間地平」という指標を導入しており、最先端のモデルが、人間が通常50分を要するタスクを50分で完了できるようになったことを見出し、この倍増傾向は、AIが5年以内に1ヶ月に及ぶソフトウェア開発タスクを自動化できる可能性を示唆している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
人間とロボットがレースをしている場面を想像してみてください。ただし、トラックの上を走るのではなく、両者とも巨大で、絶えず成長し続けるソフトウェアのパズルの山を解こうとしています。長年、私たちは巧妙なテストを用いて、これらのAIロボットがいかに優れているかを測定しようとしてきましたが、それらのテストは、しば-しば人工的なビデオゲームのレベルのように感じられ、ロボットが現実の世界で実際にどれほどの速さで作業できるのかを真に伝えるものではありませんでした。
これを解決するために、METRの研究チームは、より直感的な指標を測定することに決めました。それは、**「AIが失敗し始めるまでに、どのくらいの時間作業を続けられるか?」**ということです。
彼らはこれを**「タイムホライゾン(時間地平線)」と呼びました。これは知性のバッテリー寿命のようなものです。もしAIがあるパズルを解くのに人間が10分かかるなら、そのAIのタイムホриゾンは10分です。もし人間が4時間かかるタスクを扱えるなら、そのホライゾンは4時間です。研究者たちは、AIが仕事を正しく完了できる確率が50%**になる特定の地点を見つけ出したいと考えました。
大きな発見:指数関数的な爆発
チームは、1秒の単純なチェック(特定のファイル名を特定するなど)から、8時間の膨大なリサーチプロジェクトに至るまで、170種類もの膨大なタスクを集めました。そして、熟練した人間の専門家を雇い、それらのタスクを完了するのにどれくらいの時間がかかるかを計測しました。その後、GPT-2(2019年リリース)から最新のo3(2025年リリース)に至る12種類の異なるAIモデルに、それらのタスクを解かせました。
ここからが驚くべき部分です。AIの「バッテリー寿命」は、7ヶ月ごとに倍増しています。
2019年当時、最高のAIでも、人間が完了するのに約2秒かかるタスクを安定して扱うことしかできませんでした。2025年までに、トップクラスのモデル(o3など)は、人間が約110分(ほぼ2時間)かかるタスクを、50%の成功率でこなせるようになりました。
研究者たちは、この成長が単に少し速くなっているのではなく、指数関数的な曲線を描いていることを発見しました。それは、雪玉が丘を転がり落ち、特定の木を通り過ぎるたびに大きさが2倍になっていく様子を見ているようなものです。彼らは2019年から2025年までの傾向を測定し、「倍増時間」は約207日(およそ7ヶ月)であることを見出しました。
なぜ彼らは向上しているのか?
論文は、AIが単に漠然とした意味で「賢く」なっているのではなく、より具体的で実践的なスキルにおいて向上していることを示唆しています。古いモデルが失敗し、新しいモデルが成功した理由を調べたところ、新しいモデルには以下の特徴がありました:
- ツールの使用能力の向上: 計算機やコードエディタを、壊すことなく使いこなす方法を知っています。
- 間違いの修正能力の向上: 古いAIは間違いを犯すと、同じエラーを何度も繰り返すことがよくありました。新しいモデルは、エラーを検知し、「おっと」と言って別の経路を試すことができます。
- 論理的推論能力の向上: 道に迷うことなく、思考の連鎖(Chain of Thought)を辿ることができます。
「メッシー(混沌とした)」という警告:現実はもっと難しい
しかし、論文はロボットがまだ戦争に勝ったとは断言していません。研究者たちは、これらのテストが「綺麗すぎる」可能性があると明確に主張しています。
AIが、ルールが明確なマニュアルに書かれており、敵が予測可能で、突然の停電もないビデオゲームをプレイしている場面を想像してみてください。研究者たちは、現実世界の仕事を**「メッシー(混沌とした、整理されていない)」**と呼んでいます。現実の世界では、指示が不明確であったり、他人との対話が必要であったり、あるいはリソースが枯渇したりすることがよくあります。
チームが、より「メッシー」な(構造化されておらず、より混沌とした)タスクでAIをテストしたところ、AIのパフォーマンスは大幅に低下しました。論文は、AIが「綺麗な」パズルには優れているものの、現実のソフトウェアエンジニアの一日のような、混沌として予測不可能な性質に対しては、依然として苦戦する可能性があることを示唆しています。彼らは、AIの向上が「メッシー」なタスクにおいて減速しているという証拠はまだ見つかっていないと述べていますが、「綺麗なテスト」と「メッシーな現実」の間の溝は大きな未知数であると警告しています。
未来にとって何を意味するのか?
研究者たちは、この曲線がどこへ向かうのかを計算しました。もし「7ヶ月ごとに倍増する」という傾向が続くならば、5年以内(2028年中盤から2031年中盤の間のどこか)に、AIシステムは現在人間が1ヶ月(約167労働時間)かかるソフトウェアタスクを自律的に完了できるようになると予測しています。
彼らは、これが予測であり、保証ではないことを強調しています。それは、AIがこの正確なスピードで向上し続けられるか、そして、これらの「綺麗な」テスト結果が「メッシー」な現実世界に適用できるかどうかにかかっています。もしこの傾向が維持されれば、近い将来、複雑なプロジェクトに対してフルタイムの従業員として機能できるAIエージェントを目にすることになるかもしれません。しかし、もし傾向が鈍化したり、「メッシー」な現実の難しさが壁となったりすれば、そのタイムラインは変わることになります。
まとめ
この論文は、AIがすべてを解決したと主張しているわけではありません。代わりに、進歩を測定するための新しい「定規」を私たちに与えてくれます。それは、過去6年間、AIが長く複雑なタスクを扱う能力が、恐ろしい速さで成長しており、その「労働日」が約7ヶ月ごとに倍増していることを示しています。現実世界の混沌とした状況を扱う能力にはまだ大きな隔たりがあるものの、その軌道は、AIが1ヶ月に及ぶシフトを自律的にこなせる日が、私たちが考えているよりも近いかもしれないことを示唆しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。