Think Fast: Estimating No-CoT Task-Completion Time Horizons of Frontier AI Models
この論文は、明示的な思考の連鎖(chain-of-thought)トークンを用いずに複雑な推論を行うフロンティアAIモデルの能力を、人間のベースラインに対するタスク完了までの時間軸を測定することによって評価しており、性能が毎年倍増している傾向を明らかにした上で、これらのモデルが2030年までに一度の実行で人間の労力25分分を超えるタスクを解決できる可能性があることを予測している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、手品師がトリックを披露しているのを見ていると想像してみてください。通常、手品師は自分のプロセスを言葉で説明してくれます。「カードをシャッフルします。次に、一番上のカードをこっそり確認します。そして今から、それを消してみせます。」この話している部分は、AIの「思考の連鎖(Chain of Thought: CoT)」のようなものです。それは、モデルが答えを出す前に示す、ステップ・バイ・ステップの推論プロセスです。安全性の専門家たちは、AIが嘘をついたり、人間の監督者を欺こうとしたりといった危険な計画を立てていないかを確認するために、その「思考」を聞くことができるので、これを非常に重視しています。
しかし、もし手品師が完全に黙ってしまったらどうなるでしょうか? もし彼らが、その複雑なシャッフルや、覗き見、計画立案をすべて頭の中で、完全な沈黙の中で行い、そして指を鳴らすだけで答えを明かせるようになったら? もしAIがこのようなことができるとしたら、安全監視員は暗闇に取り残され、隠された悪い計画が「思考」の中に潜んでいないかを確認することができなくなります。この論文は、大きく、少し恐ろしい問いを投げかけています。これらの超スマートなAIモデルは、一言も作業の過程を見せることなく、実際には頭の中でどれほどのことができるのでしょうか?
研究者たちは、このことを突き止めるために、最先端のAIモデルに3万個以上のパズル、数学の問題、コーディングの課題、そして論理ゲームという巨大な試練を与えました。しかし、一つ仕掛けがありました。彼らはモデルに対し、「思考トークン」や内部的な独白なしに、即座に回答することを強制したのです。彼らは「タイムホライゾン(時間的展望)」を測定しようとしました。これは、洗練された言い方で、「AIがわずか一瞬で解いたのと同じ問題を、人間が解くとしたらどれくらいの時間がかかるか?」と問うものです。
以下に、彼らの発見を記します。ここ6年間で、これらのAIモデルは「沈黙の思考」において驚異的に進化してきました。2019年、AIは助けなしでは人間がコンマ数秒でできる問題しか解けませんでした。しかし、この研究の予測によれば、2026年までに、最新のモデル(GPT-5.5など)は、一切の推論を言葉にすることなく、人間が解くのに3分以上かかる問題を解くことができると推定されています。
成長は急速に進んでいます。研究者たちは、これらの「沈黙のタスク」の複雑さが、およそ毎年倍増している(具体的には373日ごと)ことを発見しました。それはまるで、AIがわずか1暦年の中で、1年分の精神的な体操を学習しているかのようです。もしこの傾向が続けば、2028年までに、これらのモデルは人間が7分間かかるタスクを沈黙のうちに解くことが可能になり、2030年には、純粋な隠れた思考プロセスとして25分間にまで跳ね上がる可能性があります。
計算の正確さを検証するために、彼らは参照モデルがこれらの問題を解くためにどれだけの「推論トークン」(デジタル的な思考ステップの等価物)を必要とするかも調査しました。その結果、AIの沈黙の能力は、これらのトークンの観点からも毎年倍増しており、最新のモデルでは1,500トークンを超える隠れた処理能力に達していることがわかりました。
この論文は、将来について100%確実なことは言えない(数値には幅広い可能性が含まれる)ものの、傾向は明白であると示唆しています。すなわち、AIモデルは、私たちに見せることなく、完全に自分たちの「心」の中で複雑な多段階の推論を行う能力を急速に獲得しているということです。これは、AIの思考を聞いて安全性を確保するという手法が、近い将来、非常に困難になる可能性があることを意味します。なぜなら、AIは単にその思考のすべてを沈黙の中で行っているかもしれないからです。著者らは、この「沈黙の」能力は予測可能な形で成長しており、強力なシステムを監視する方法を変えてしまう可能性があるため、開発者はこれを注意深く追跡し続けるよう強く求めています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。