← 最新の論文
🤖 AI

AIR: Adaptive Interleaved Reasoning with Code in MLLMs

本論文は、コールドスタート・データの構築、データセットのキュレーション、およびグループ制約付き強化学習によって導かれる適応的なツール呼び出し戦略という3つのコンポーネントを含むソリューションを通じて、複雑な数値計算のためのコードを用いた適応的なインターリーブ推論におけるマルチモーダル大規模言語モデルの能力を強化するフレームワークであるAIRを紹介し、評価ベンチマークにおける大幅な性能向上をもたらすものである。

原著者: Cong Han, Xiaohan Lan, Haibo Qiu, Yujie Zhong

公開日 2026-06-23
📖 1 分で読めます☕ さくっと読める

原著者: Cong Han, Xiaohan Lan, Haibo Qiu, Yujie Zhong

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたのスマートなアシスタントは、画像を見たりテキストを読んだりすることには非常に長けていますが、重い計算を必要とする数学の問題に直面すると、時々行き詰まってしまうことがあります。もしあなたがこのアシスタントに、体積に関する複雑な幾何学の問題を解くよう頼んだとしたら、そのアシスタントは(人間が電卓なしで大きな数の掛け算をしようとしてミスをするのと同じように)自分の「頭(ニューラルネットワーク)」の中で計算を行おうとして、間違えてしまうかもしれません。

この論文では、AIR(Adaptive Interleaved Reasoning with Code)と呼ばれる新しいシステムを紹介しています。これは、アシスタントに「いつ思考を止めてツールを使うべきか」という、新しいスーパーパワーを教えるものです。

AIRの仕組みを、シンプルな概念に分解して説明します:

1. コアとなるアイデア:「人間と電卓」の比喩

AIを、テストを受けている学生と考えてみてください。

  • 従来の方法: 学生はすべての問題を自分の脳力だけで解こうとします。もし数学が難しすぎると、推測で答えを出したり、間違えたりします。
  • AIRの方法: 学生は、問題が難しくなってきたら、手を挙げて電卓を求めてもよいことを学びます。数字を書き留め、ボタンを押し、結果を得てから、最終的な答えを書き込みます。
  • ひねり: AIはすべての質問に対して電卓を使うわけではありません。AIは**適応的(アダプティブ)**になることを学びます。「この質問は簡単だから、頭の中でやろう」とか、「この質問は難しいから、計算のためにコードを書こう」といった判断ができるのです。

2. トレーニング・プロセス:2段階の旅

論文では、単にモデルに「電卓を使いなさい」と伝えるだけでは、期待通りには動かないことが説明されています。モデルには特定のトレーニング計画が必要です。

ステップ1:「コールドスタート」(基礎の学習)
AIが自律的にツールを使えるようになる前に、どのように行うかの例を見る必要があります。研究者たちは、難しい数学の問題を取り上げ、「思考(テキスト)」と「計算(Pythonコードの記述)」をどのように切り替えるかを手動で示した特別なデータセットを作成しました。

  • 比喩: 教師が学生に対し、難しい部分で電卓を使用している解決済みの例をいくつか見せている様子を想像してください。これにより、学生に基本的なテンプレートが与えられます。

ステップップ2:強化学習(「試行錯誤」のフェーズ)
基礎を習得した後、AIは自律的に練習を始めます。ここが魔法が起きる場所です。研究者たちは、AIにいつツールを使うべきかを教えるための特別なスコアリング・システム(報酬関数)を使用しました。

  • 問題点: もしAIが電卓を使いすぎると、混乱が生じてトレーニングが崩壊してしまいます(自分自身で考えようとせず、電卓に頼り切ってしまう学生のような状態です)。逆に、一度も使わない場合は、数学のミスを繰り返すことになります。
  • 解決策: 研究者たちは**「グループ制約付き報酬(Group-Constrained Reward)」**を作成しました。コーチがチーム全体の選手を見守っている様子を想像してください。コーチは、得点を挙げたプレイヤーだけに報酬を与えるのではなく、電卓を使用するプレイヤーの「適切なバランス」についてもチームに報酬を与えます。
    • AIがツールを使いすぎると、スコアが下がります。
    • AIが正解を得るために「ちょうど良い量」のツールを使用すれば、高いスコアが得られます。
    • これにより、AIの挙動が安定し、使いすぎによる暴走を防ぐことができます。

3. 結果:より賢く、より安定した性能

論文によれば、このトレーニングを行った結果:

  • 正確性: AIは数学の問題、特に複雑な計算を必要とする問題において大幅に向上しました。平均してスコアは約6ポイント上昇し、ツールを使用した特定の領域では、10ポイント近く向上しました。
  • 信頼性: AIは、使用すると判断した場合、95%以上の確率で正常にツールを使用できました。
  • 安定性: 「グループ制約付き」の手法により、AIがトレーニング中に不安定になったり、クラッシュしたりすることが防がれました。これは、AIにツールを使わせる際に共通して見られる問題です。

まとめ

要約すると、AIRは、マルチモーダル大規模言語モデル(画像を見たり読んだりできるAI)に対し、人間の問題解決者のように振る舞う方法を教えるものです。つまり、問題を考え抜き、数学が難しすぎると判断した瞬間に、素早くコンピュータのスクリプトを書いて計算を行い、それから答えを完成させるという動きです。鍵となる革新は、人間に「電卓を手に取りなさい」と言われなくても、AIが自動的に、かつ適切なタイミングでこれを行えるように教えることにあります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →