← 最新の論文
💬 NLP

ASTER: Agentic Scaling with Tool-integrated Extended Reasoning

本論文は、相互作用の密な軌跡を用いた標的型のコールドスタート戦略を活用することで、ツール統合型推論における相互作用の崩壊を克服し、4BパラメータのモデルがAIME 2025のような数学的ベンチマークにおいて最先端の性能を達成することを可能にするフレームワークであるASTERを紹介している。

原著者: Xuqin Zhang, Quan He, Zhenrui Zheng, Zongzhang Zhang, Xu He, Dong Li

公開日 2026-02-03
📖 1 分で読めます☕ さくっと読める

原著者: Xuqin Zhang, Quan He, Zhenrui Zheng, Zongzhang Zhang, Xu He, Dong Li

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、非常に賢いけれど経験不足な学生(大規模言語モデル)に、極めて難しい数学の問題を解く方法を教えようとしていると想像してください。その学生は思考能力には非常に長けていますが、すべてを頭の中だけで処理しようとして、小さな計算ミスが雪だるま式に膨らみ、最終的に間違った答えを出してしまうことがよくあります。

この問題を解決するために、研究者たちはASTER(Agentic Scaling with Tool-integrated Extended Reasoning)と呼ばれる新しい学習手法を導入しました。ここでは、彼らがどのようにこれを行ったのかを、シンプルな比喩を用いて説明します。

問題点:「自信過剰」な学生

以前、研究者たちは、AIモデルにツール(計算機やコードインタープリタなど)を使わせるために、単にモデルに練習させ、間違いから学ばせる方法(強化学習)を試していました。

しかし、これは「相互作用の崩壊(Interaction Collapse)」と呼ばれる問題を引き起こすことが分かりました。

  • 比喩: ある学生が、長く複雑な数学のテストを受けるために計算機を使うことになっているとしましょう。しかし、その学生は難しい計算をあえて頭の中で行おうとし、混乱した末、最後に「答えの確認」として、計算機に 1+1 とだけ入力して終わってしまうのです。彼らは、考えるための道具としてツールを実際に活用できていません。単に最後に置かれた小さなセーフティネットとしてしか使っていないのです。
  • 結果: AIはツールを効果的に使うことをやめてしまいます。内部での「思考」に頼りすぎてしまい、ミスを犯し、長く複雑な問題を解くことができなくなります。

解決策:「マスターシェフ」の徒弟制度

著者たちは、学生を一人で練習させる前に、まずツールの正しい「使い方」を示す必要があることに気づきました。これを彼らは Cold-Start SFT(教師あり微調整)と呼んでいます。

彼らは、学生への教え方として異なる方法をテストしました。

  1. 「クイック修正」法: ツールが一度か二度しか使われない解答例を見せる方法。
  2. 「ディープダイブ」法(ASTER): ツールが絶えず使われている、わずかな数の例(わずか4,000例)を見せる方法。

重要な発見:ツールの使用密度
論文では、トレーニング例におけるツールの使用の「密度」が、他の何よりも重要であることが判明しました。

  • 比喩: もしあなたがシェフに10品のフルコース料理を作る方法を教えたいなら、オーブンを一度だけ使うだけのレシピを見せるだけでは不十分です。刻む、混ぜる、味見をする、火加減を調整するといった動作を、常に繰り返しているレシピを見せる必要があります。
  • ASTERのアプローチ: 彼らは、AIが問題を解くためにツール(コードインタープリタ)を何度も何度も、時には一つの問題の中で9回以上も使い続けなければならない「マスターシェフ」用のデータセットを作成しました。これにより、AIは単に推測するのではなく、常にツールを使って自分の作業を確認するという「習慣」(あるいは行動的事前分布/behavioral prior)を身につけました。

学習プロセス:2つのステージ

AIがこの「習慣」を4,000の例から学んだ後、彼らは強化学習を用いて、AIに自律的な練習を行わせました。

  1. ステージ1(練習走行): AIは、ツールを使用できる回数に制限を設けて練習します。これにより、AIは効率性を学びます。
  2. ステージ2(マラソン): 彼らはAIに、より長い「思考スペース(メモリ)」を与え、最大50回までツールを使用できるようにしました。以前に「ディープダイブ」による習慣を学んでいたため、AIは崩壊することなく、より難しい問題を解くためにツールを効果的に使い続けることができます。

結果:小さくとも強力

この論文の最も驚くべき点は、モデルのサイズです。

  • 彼らは、比較的小さなモデル(40億パラメータ)を訓練しました。
  • 比喩: これは、完璧な運転技術を叩き込まれたことで、困難なコースにおいて巨大で重いトラックを追い抜いていく、小回りの利くレーシングカーのようなものです。
  • スコア: 非常に難易度の高い数学コンテスト(AIME 2025)において、この小さなモデルは**90.0%**を記録し、DeepSeek-V3.2(6,710億パラメータ)のような巨大なモデルや、OpenAIの最高峰のモデルをも上回りました。

「秘伝のソース」のまとめ

論文は、AIに長く困難なタスクのためのツール使用を習得させるには、ただいきなり深い海に放り込むだけではいけないと主張しています。

  1. 即座の完璧さを求めない: 初期のトレーニング例は、AIを即座に数学の達人にするものではありませんでした。
  2. 「流れ(フロー)」に集中する: 初期のトレーニング中に、ツールを「大量に」使うように強制しなければなりません。
  3. 報酬: これにより強い習慣が生まれます。AIが自律的な練習を開始すると、自然とツールを使い続けるようになり、以前は不可能だった問題を解けるようになるのです。

要するに、AIに計算機を最後だけでなく、常に使い続けるよう教えれば、彼らは数学の天才になるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →