← 最新の論文
💻 computer science

OpenDeepThink: Parallel Reasoning via Bradley--Terry Aggregation

OpenDeepThink は、モデルの再調整を必要とせずに Codeforces などの客観的ベンチマークで顕著な性能向上を達成する、候補解を選択・突然変異・進化させるためにペアワイズ・ブラッドリー・テリー比較を集約することで LLM の推論を強化する、集団ベースのテスト時計算フレームワークである。

原著者: Shang Zhou, Wenhao Chai, Kaiyuan Liu, Huanzhi Mao, Qiuyang Mang, Jingbo Shang

公開日 2026-05-15
📖 1 分で読めます☕ さくっと読める

原著者: Shang Zhou, Wenhao Chai, Kaiyuan Liu, Huanzhi Mao, Qiuyang Mang, Jingbo Shang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に難しいパズル、例えば複雑な数学の問題や厄介なコーディングの課題を解こうとしていると想像してください。通常、AI にその問題を解くよう頼むと、AI は一つの長い直線的な思考経路で問題を考えようとします。もし初期段階で小さな間違いを犯せば、答え全体が崩れてしまい、最初からやり直すことになります。

この論文は、OpenDeepThinkという新しい手法を紹介しています。AI に単一の直線的な思考をさせるのではなく、この手法は AI に群衆として思考させるのです。

以下に、アナロジーを用いて簡単なステップに分解して説明します。

1. 「ブレインストーミング・パーティー」(並列サンプリング)

AI に一つの答えを要求するのではなく、OpenDeepThink は同時に20 個の異なる答えを生成させます。

  • アナロジー: あなたが教師で、20 人の生徒に数学の問題を解かせると想像してください。最も賢い子だけを待つのではなく、全員にすぐに解答を書き込ませます。中には素晴らしい答えを出す者もいれば、そこそこの者、完全に間違っている者もいます。

2. 「トーナメント」(ペアワイズ比較)

さて、20 個の解答がありますが、どのように最良のものを選びますか?通常、AI に「この答えは良いか?」と尋ねるかもしれません。しかし、この論文では、AI は真空状態での自身の作業を評価するのが苦手だと指摘しています(過度に自信過剰になったり、バイアスがかかったりしがちです)。

  • 対策: 「これは良いか?」と尋ねる代わりに、AI は二つの答えを横に並べて比較するように求められます。「解答 A と解答 B のどちらが優れており、なぜか?」
  • アナロジー: スポーツのトーナメントを想像してください。選手をただ見るだけで「世界最高の選手」が誰か言うのは難しいですが、選手 A と選手 B を対戦させれば、どちらが勝つかがはるかに明確になります。AI は審判として機能し、解答のペア同士を戦わせて、各ペアの勝者を宣言します。

3. 「スコアボード」(ブラッドリー・テリー集約)

AI が多くのペアを比較した後、単に勝利回数を数えるわけではありません。ブラッドリー・テリーと呼ばれる特別な数学的公式を用いて、グローバルなランキングを作成します。

  • アナロジー: サッカーのリーグ表を想像してください。チーム A がチーム B に勝ち、チーム B がチーム C に勝った場合、数学的にはチーム A とチーム C がまだ対戦していなくても、チーム A の方が強いと判断されます。これにより、20 個の解答の信頼性の高い「リーダーボード」が作成されます。

4. 「進化」(突然変異と選択)

ここで魔法が起きます。システムは勝者を選んで終了するだけではありません。数ラウンド(世代)にわたって解答を進化させます。

  • 最下位 25%(敗者): 最悪の解答は廃棄されます。
  • 上位 25%(エリート): 最良の解答は安全に保持されますが、改善の機会も与えられます。
  • 中間 75%(変異体): AI は「批評」(なぜ一方の解答が他方を上回ったかの理由)を取り、それを用いて解答を書き換えます。
    • アナロジー: コーチが選手に話しかける様子を想像してください。「よくやった」と言うのではなく、「あなたの走りのスピードが遅すぎたために負けた」と言います。選手はその具体的なフィードバックを用いて戦略を変更します。AI もまた、フィードバックが全く新しいアプローチが必要だと示唆すれば、解答を完全に書き換えるかもしれません。

5. 「最終決戦」

この「トーナメントとトレーニング」のループを数回行った後、システムは残った上位の解答を一つに絞り込むために、非常に詳細な最終比較を行います。

なぜこれが画期的なのか?

  • 「答え合わせ」不要: 通常、AI が正しいかどうかを知るには、人間やコンピュータプログラムが答えを確認する(「検証者」が必要)必要があります。OpenDeepThink はそれを必要としません。AI が自分自身と比較するだけで最良の答えを導き出します。
  • 難問に強い: この論文では、競技プログラミングのような非常に難しいコーディング問題でこの手法をテストしました。その結果、この手法によりトップクラスの AI(Gemini 3.1 Pro)が、はるかに上位の専門家のように振る舞うようになり、「スキルレーティング」が 400 ポイント以上向上しました。
  • 限界を知っている: この手法は、明確な正解・不正解がある分野(数学やコーディングなど)では非常に効果的に機能します。しかし、主観的なトピック(エッセイの執筆や歴史の議論など)では、逆に性能が低下することがあります。これは、「意見」を比較することが「事実」を比較することよりも難しいためです。審判(AI)が良い意見と悪い意見の区別がつかない場合、システム全体が混乱してしまいます。

コスト

トレードオフは速度とコストです。AI は 20 個の答えを生成し、それらをペアで比較し、数回書き換える必要があるため、計算資源と時間(テストでは問題あたり約 27 分)を大量に消費します。まるで一人に頼むのではなく、専門家チーム全体と審査員パネルを雇って一つの課題を解かせるようなものです。

要約すると: OpenDeepThink は、AI の推論を「一人の短距離走」から「チームトーナメント」へと変えます。AI に自分自身と競い合わせ、比較を通じて自身の間違いから学ぶことで、単独で取り組むよりもはるかに難問を解決できるようになります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →