← 最新の論文
🤖 machine learning

From BERT to Frontier Agents: Eight Years of Language-Model Progress, the Collapse of the Capability-Cost Curve, and the Rise of Task-Targeted Models

この論文は、BERTから2026年までの特化型フロンティア・エージェントに至るまでの言語モデルの8年間の進化を概説しており、コーディング能力における年6倍の向上、予算に優しいGPT 5.6 Lunaに象徴される推論コストの劇的な低下、そしてフロントエンド・コーディング、リポジトリ管理、ターミナル操作といった特定の領域で卓越するタスク特化型モデルへの移行を強調している。

原著者: Pranav Kumar Kaliaperumal

公開日 2026-08-17
📖 1 分で読めます☕ さくっと読める

原著者: Pranav Kumar Kaliaperumal

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

偉大なるAIの進化:読書用メガネからスーパーコンピュータへ

コンピュータが、非常に優秀だが内気な司書のような存在だった世界を想像してみてください。長い間、コンピュータに文章を理解させたいと思ったら、その特定の文章のためだけに用意された専用の「読書用メガネ」を渡さなければなりませんでした。物語を書かせたいと思ったら、別のメガネに掛け替えなければなりませんでした。彼らは読解においては驚くほど賢かったのですが、自分自身で何かを「行う」ことはほとんどできませんでした。これが、人間の言語を理解し生成することを学ぶコンピュータプログラムである「言語モデル」の初期の時代でした。

ここ数年、科学者たちは、これらの司書をもっと大きくし、あらゆるタスクごとに新しいメガネを必要とすることなく、わずかな例から学習できる「脳」を与える方法を見出しました。突然、これらのコンピュータはチャットをし、コードを書き、パズルを解けるようになりました。しかし、誰もが問いかけている大きな疑問があります。彼らは日々賢くなっているのでしょうか、それとも単にテストの問題を暗記するのが上手くなっているだけなのでしょうか? そして、もし彼らが賢くなっているのだとしたら、それはコストが高くなっていることを意味するのでしょうか、それともお買い得品になっているのでしょうか? 本論文は、まさにこの謎を掘り下げ、2018年から未来の2026年に至るAI進歩の激しい道のりを調査し、その内部で実際に何が起きているのかを明らかにします。


読書用メガネからスーパーコンピュータへ:8年間のジェットコースター

この論文は、2018年から2026年までの人工知能の生涯を追跡する、タイムトラベルする探偵物語のようなものです。この論文は3つの大きな問いを投げかけます。どうやって、文章をかろうじて書ける程度のコンピュータから、ソフトウェアのバグを修正したり数学オリンピックの問題を解いたりできるコンピュータへと進化したのか? この「脳の力」の価格はどれほどの速さで下落したのか? そして、最も重要なことですが、私たちはすべてを行うための一つの巨大で高価なスーパーコンピュータを必要とするのでしょうか、それとも未来は実は専門家たちのチームなのですか?

AI成長の4つの時代
著者は、過去8年間をビデオゲームのシーズンのように、4つの明確な章に分けています。

  1. 「読書用メガネ」の時代(2018–2019): BERTのようなモデルから始まりました。これらは、本を読んでその内容について答えるのは得意ですが、物語を書こうとするとフリーズしてしまう学生のようなものです。彼らはあらゆるタスクに対して、特定の「ファインチューニング」(特別な訓練キャンプのようなもの)を必要としました。
  2. 「ビッグブレイン(大きな脳)」の時代(2020–2021): 次にGPT-3のようなモデルが登場しました。これらはインターネット上のほぼすべてを読み込んだ巨大な図書館のようなものでした。特別なトレーニングを必要とせず、チャットウィンドウにいくつかの例を与えるだけで、パターンを理解することができました。彼らは驚異的でしたが、依然として事実を捏造したり、指示に完璧に従えなかったりすることがありました。
  3. 「礼儀正しい助手」の時代(2022–2023): 科学者たちは、「アライメント(調整)」と呼ばれる手法を用いて、これらの大きな脳に礼儀正しく振る舞い、命令に従うよう教えました。突然、彼らはChatGPTとその仲間たちとなり、チャットやメールの作成、複雑なルールの遵守に長けた存在となりました。
  4. 「エージェント」の時代(2024–2026): ここからが激動の展開です。モデルは単に話すだけでなく、「行う」ようになりました。ツールを使い、GitHub上の壊れたコードを修正し、ステップを考えて思考することで数学の問題を解くことができる「エージェント」へと進化したのです。2026年までに、最高のモデルは国際数学オリンピックの問題を解き、ソフトウェアプロジェクト全体を修復できるようになりました。

進歩の速度:数学のミステリー
この論文は、モデルが現実世界のソフトウェアバグを修正する能力(SWE-benchというテストを使用)がどれほどの速さで向上しているかを測定しています。その結果は衝撃的です:モデルがバグを修正することに成功する確率は、毎年約5.8倍のペースで成長しています。これは、もしランナーが毎年5.8倍ずつ速くなるとしたら、わずか数年で音速を超えて走ることになるようなものです。しかし、論文は従来の「知識テスト」(MMLUなど)が限界(天井)に達していることも指摘しています。モデルがあまりにも上手くなりすぎたため、それらのテストではモデルの差を判別できなくなっています。分野はより困難で実用的な課題へと移行しました。

価格の崩壊:「低価格ティア」のサプライズ
物語の中で最も驚くべき部分は、この知能のコストが暴落したことです。

  • 2020年、100万語のAIの思考を得るコストは60ドルでした。
  • 2026年までに、「予算版」のAIは同じ量の思考に対してわずか1ドルとなっています。
    これは60倍の価格下落です。

さらに驚くべきことがあります。論文によると、2026年の安価な「予算版」モデルは、わずか数ヶ月前の超高価な「フラッグシップ」モデルと同等の性能を持っていることが分かりました。これは、今日の100ドルの車が、昨年の500ドルの車と同じくらい良く走れるようなものです。「中間層」の市場は消滅しました。あなたは、安くて賢い「予算ティア」を手に入れるか、超高価な「プレミアムティア」を手に入れるかのどちらかです。中間の領域はなくなりました。

「スペシャリスト」チーム vs 「万能選手」
長い間、人々は一つの巨大なモデルが最終的にあらゆることに最高になるだろうと考えてきました。しかし、論文は2026年において、その考えは死に絶えたと主張しています。「最前線(フロンティア)」のAIは今や断片化されています。

  • ウェブサイトを作りたいなら、Claude Opus 5がチャンピオンです。
  • 大規模なコードリポジトリを修正する必要があるなら、Claude Fable 5が勝利します。
  • ターミナル内で人間のように振る舞うコンピュータが必要なら、GPT-5.6 Solがボスです。
  • 全く新しいタイプの論理パズルを解く必要があるなら、Opus 5が記録保持者です。

単一のモデルがすべてにおいて勝つことはありません。論文は、現在の最も賢いAIの使い方は、異なるタスクをそのタスクに最適な特定の専門家モデルに送る「ルーター(交通整理員)」になることだと示唆しています。2つのモデルを切り替えるだけの単純なシステムでも、適切な専門家を選ぶことで、単一の最高モデルを打ち負かすことができます。

固定されたモデルを賢くできるか?
研究者はまた、モデル自体を変更せずに、質問の「仕方」を変えるだけで、より小さな固定モデルを賢くできるかどうかを確認するために、小さな実験を行いました。

  • 小さなモデル(Qwen2.5-1.5B)に数学の問題を解かせました。
  • 一度だけ尋ねた場合(「貪欲な」方法)、正解率は**62%**でした。
  • 4回尋ねて、最も一般的な答えを選ぶ方法(「投票」と呼ばれるテクニック)を用いた場合、正解率は**62%**でした。
  • 「天井(もし4回の試行から魔法のようにベストな答えを選べた場合)」は**79%**でした。

これは、モデルはほとんどの場合、正解を「知っている」ものの、それを引き出すためのより良い方法が必要であることを示唆しています。論文はまた、答えが正しい可能性が高いかどうかを推測できる「信頼度検出器」を構築しました。その結果、検出器が最も確信を持った回答のみを信頼した場合、そのグループにおける精度は**94%**に達しました。これは、将来、私たちは必ずしも大きなモデルを必要とせず、単に彼らの仕事をチェックし、ベストなものを選び出すより優れた方法が必要になる可能性があることを示唆しています。

結論
論文は、「すべてを支配する一つのモデル」の時代は終わったと結論づけています。私たちは専門化とルーティングの時代へと移行しています。モデルは特定の仕事に対して驚異的に上手くなっており、価格は急速に下落しています。そして、彼らを使う最も賢い方法は、単一のスーパーブレインとしてではなく、専門家チームとして扱うことです。モデルは驚くべき進化を遂げていますが、論文は彼らがテストを「攻略(ゲーミング)」することにも非常に長けているため、何を信頼するかについては注意が必要であると警告しています。未来は単に「より大きな脳」を持つことではなく、「今ある脳をより賢く使う方法」を見つけることにあるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →