← 最新の論文
🤖 machine learning

TEMPO: Scaling Test-time Training for Large Reasoning Models

本論文は、推論時のパラメータ適応において自己生成報酬のドリフトと多様性の崩壊を解決するため、ラベル付きデータによるクリティカの定期的な再較正を EM アルゴリズムの枠組みで導入し、大規模推論モデルの推論時トレーニング(TTT)を継続的に改善する「TEMPO」を提案する。

原著者: Qingyang Zhang, Xinke Kong, Haitao Wu, Qinghua Hu, Minghao Wu, Baosong Yang, Yu Cheng, Yun Luo, Ganqu Cui, Changqing Zhang

公開日 2026-04-22
📖 1 分で読めます☕ さくっと読める

原著者: Qingyang Zhang, Xinke Kong, Haitao Wu, Qinghua Hu, Minghao Wu, Baosong Yang, Yu Cheng, Yun Luo, Ganqu Cui, Changqing Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

論文「TEMPO」の解説:AI が「試験中」に自ら成長する仕組み

2026 年 4 月 22 日付のこの論文は、**「テストタイム・トレーニング(TTT)」**という新しい AI の学習方法について書かれています。

一言で言うと、**「AI がテスト(問題)を解いている最中に、その経験から自ら学習して、より賢くなる方法」**を提案したものです。しかも、これまでの方法では陥りやすかった「失敗(偏った答えしか出せなくなる)」を防ぐ、画期的な仕組み「TEMPO」を開発しました。

以下に、専門用語を使わず、身近な例え話で解説します。


1. 従来の AI の問題点:「独学」の罠

まず、これまでの AI(特に数学や論理パズルが得意な「推論モデル」)の仕組みを見てみましょう。

  • 従来のやり方:
    学校で勉強(学習)を終えた後、テスト(推論)を受けるとき、AI は**「勉強した知識」だけで答えを出します。** 勉強中のパラメータ(脳みその回路)は固定されており、テスト中に「あ、この解き方は違うな」と気づいても、それを学習して修正することはできません。

  • 新しい試み(既存の TTT 方法):
    「テスト中に、AI 自身が『自分の答えが正しそうか』を判断して、その判断基準でさらに学習しよう!」という試みがありました。

    • 例え話: 試験中に、自分が書いた答案を「自分自身」が採点し、「正解っぽい」と感じた答えを強化しようとするイメージです。
  • ここでの大きな問題:
    「自分自身で採点する」のは危険です。
    もし AI が「A という解き方が正解だ」と思い込んでいたら、その後も A ばかりを正解だと判断し、他の正しい解き方を「間違い」として排除してしまいます。
    結果:

    1. 性能の天井: 最初は上がっても、すぐに頭打ちになる。
    2. 多様性の崩壊: 答えが一つのパターンに偏ってしまい、柔軟な思考ができなくなる(「正解」を求めて、逆に「正解」を見失う)。

2. TEMPO の解決策:「先生」と「生徒」のペア

この論文が提案するTEMPOは、この「独学」の罠を避けるために、**「生徒(AI)」と「先生(批評家)」**のペアを作りました。

この仕組みは、**「期待最大化(EM)アルゴリズム」という数学的な考え方に基づいていますが、簡単に言うと「交互に役割を交代する」**ことです。

🔄 TEMPO の 2 つのステップ

ステップ 1:生徒の学習(M ステップ)

  • 役割: 生徒(AI)が、解き方のわからない新しい問題を解きます。
  • 先生: 生徒が解いた答えを、**「先生(批評家モデル)」**が評価します。
  • 特徴: 先生は「正解か不正解か」だけでなく、「この答えの質はどれくらいか」を点数で評価します。生徒は先生の評価を聞いて、自分の解き方を修正・強化します。

ステップ 2:先生の再教育(E ステップ)← ここが重要!

  • 役割: 先生(批評家)が、**「正解がわかっている問題(ラベル付きデータ)」**を使って、自分の採点基準をリセットし、再教育します。
  • なぜ必要? 先生も生徒の影響を受けると、採点基準が歪んでしまうからです(「生徒が A ばかり言うから、A が正解だ」と勘違いしてしまう)。
  • 効果: 定期的に「正解の教科書」で先生の採点基準をリセットすることで、「偏り」を防ぎ、常に正しい基準で生徒を指導し続けることができます。

3. 具体的な成果:なぜこれがすごいのか?

実験では、数学オリンピックレベルの難しい問題(AIME 2024 など)でテストを行いました。

  • 従来の方法(TTRL など):
    最初は成績が上がりますが、すぐに頭打ちになり、さらに「多様性が失われて」成績が下がりました。

    • 例え: 独学で勉強しすぎた学生が、「自分のやり方しか信じられなくなり」、新しい問題に対応できなくなった状態。
  • TEMPO の方法:
    成績が**「上がり続ける」だけでなく、「多様な解き方」も維持されました。**

    • OLMO3-7Bというモデル:正解率が 33.0% → 51.1% に向上。
    • Qwen3-14Bというモデル:正解率が 42.3% → 65.8% に向上。
    • さらに、他の方法では「多様性が崩壊して」点数が落ちたのに対し、TEMPO は「多様性」を保ったまま成績を伸ばしました。

4. 核心となるアイデア:なぜ「先生」が必要なのか?

この論文の最大の発見は、**「既存の独学方法は、先生の再教育(E ステップ)を抜いてしまっている」**という点です。

  • 独学(既存方法): 生徒が自分で採点して学習する。→ すぐに「思い込み」が強化され、破綻する。
  • TEMPO: 生徒が学習し、定期的に先生が「教科書」で採点基準を正す。→ 偏りを防ぎ、無限に成長し続ける。

これは、**「自分自身で採点するのではなく、外部の正しい基準(教科書)を定期的にチェックしながら、自分の能力を高める」**という、非常に理にかなったアプローチです。


まとめ

TEMPOは、AI が「テスト中」に成長するための新しいルールブックです。

  • 問題点: 自分で自分を褒めすぎると、AI は「偏った思考」に陥り、成長が止まる。
  • 解決策: 「生徒(AI)」と「先生(批評家)」を交互に動かす。
    • 生徒は問題を解く。
    • 先生は定期的に「正解の教科書」で採点基準をリセットする。
  • 結果: AI は、テストという「未知の環境」でも、偏ることなく、着実に賢くなり続けることができるようになりました。

これは、AI が単に「勉強した知識」を使うだけでなく、**「経験から学び続ける」**ための重要な一歩となる技術です。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →