← 最新の論文
💬 NLP

Latent Reasoning in TRMs is Secretly a Policy Improvement Operator

本論文は、小規模モデルにおける潜在的な再帰的推論が方策改善オペレータとして機能し、それによって強化学習や拡散学習スキームの適用が可能となり、性能を維持したまま非効率な計算ステップを排除し、フォワードパスを大幅に削減できることを実証するものである。

原著者: Arip Asadulaev, Rayan Banerjee, Fakhri Karray, Martin Takac

公開日 2026-06-02
📖 1 分で読めます☕ さくっと読める

原著者: Arip Asadulaev, Rayan Banerjee, Fakhri Karray, Martin Takac

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

本質的なアイデア:「思考」が時に時間を無駄にする理由

あなたは難しいパズルを解こうとしていると想像してください。あなたのそばには、小さくて賢い助手(AIモデル)がいて、それを解こうとしています。

近年、研究者たちはこの助手に「ループの中で考える」ように指示することで、より賢くしようと試みてきました。一つの答えを出す代わりに、助手に自分の以前の推測を見直し、少し考え、そして少しだけ改善された新しい推測を作るというプロセスを繰り返させます。10回、あるいは20回目の推測に到達する頃には、完璧な解決策にたどり着いていることを期待して、これを何度も繰り返させるのです。

これは**潜在的推論(Latent Reasoning)**と呼ばれます。その理論は、「モデルをループさせれば、脳自体を大きくすることなく、より深い思考ができるようになる」というものでした。

問題点: この論文の著者たちは、この論理に欠陥があることを見つけました。モデルは確かにループしていましたが、そのループの多くは何の役にも立っていませんでした。それはまるで、数学の問題を見つめながら、間違った答えを書き込み、それを消して、また同じ間違いを書き直す作業を、魔法のように正解になることを願って何度も繰り返している学生のようなものです。論文ではこれを**「デッド・コンピュート(死んだ計算)」**と呼び、答えを改善することに寄与しないステップにエネルギーを浪費している状態を指しています。

発見:それは実は「方策改善(Policy Improvement)」マシンである

著者たちは大きな問いを投げかけました。「これらのループの間、モデルの脳内では実際に何が起きているのか?」

彼らは、モデルが単に「深く考えている」だけではないことを発見しました。モデルは密かに、強化学習エージェント(試行錯誤を通じて学習するタイプのAI)のように振る舞っているのです。

ここでの比喩は以下の通りです:

  • 従来の方法: モデルは推測し、次にまた推測し、二度目の推測がより良くなることを期待します。これは、目隠しをしてダーツを投げ、二度目の投擲がより的に近くなることを願っているようなものです。
  • 新しい洞察: 著者たちは、モデルが実際には**「方策改善(Policy Improvement)」**を行っていることに気づきました。これは専門的な言い方ですが、「現在の推測を取り、自分の推測と真実との差を確認し、その差を利用して次の推測をターゲットに近づけるように微調整する」という意味です。

論文は、モデルがループするたびに、特定の「アドバンテージ(新しい推測が古い推測よりもどれだけ優れているかを示すスコア)」を計算すべきであることを証明しています。もし計算できていなければ、それはただ空回りしているだけなのです。

解決策:ディープ・インプルーブメント・スーパービジョン(DIS)

モデルが「デッド・コンピュート」の中で迷子になっていたため、著者たちは**ディープ・インプルーブメント・スーパービジョン(DIS)**と呼ばれる新しい学習手法を考案しました。

比喩:「パンくず」の道
あなたが家から隠された宝物に向かって歩こうとしていると想像してください。

  • 従来の方法(TRM): 「宝物を見つけるまで円を描いて歩き続けなさい」と言われます。あなたは100回ほど円を描いて歩くかもしれませんが、そのうち実際に宝物に近づいたのはわずか5回だけかもしれません。残りは無駄なステップでした。
  • 新しい方法(DIS): 教師があなたに**「パンくず」**の入った地図を渡します。
    1. ステップ1:最初のパンくず(少しだけ優れた推測)まで歩く。
    2. ステップ2:二番目のパンくず(さらに優れた推測)まで歩く。
      ……そして、宝物に到達するまで続きます。

著者たちは、正解を少しずつ「改悪(わざと少し間違った状態に)」していくことで、これらの「パンくず」を作成し、中間目標の経路を作り出しました。そして、モデルがすべてのパンくずを完璧に通過するように学習させています。

なぜこれが機能するのか:
モデルが自力で「どうやって改善するか」を見つけ出すのを待つのではなく、教師が**「すべてのステップが改善でなければならない」**ということを強制するのです。これにより、「デッド・コンピュート」を「能動的な改善」へと変貌させました。

結果:より速く、より小さく、より優れたものへ

著者たちは、この新しい手法(DIS)を非常に小さなAIモデルであるTiny Recursive Model (TRM) でテストしました。

  1. 少ない労力で同じ結果を: DISを用いることで、モデルが必要とするループ回数が劇的に減ることを発見しました。彼らは、同じ、あるいはより良い結果を得ながら、「思考ステップ」の数を18分の1(336ステップからわずか18ステップへ)に削減しました。
  2. 巨人を打ち負かす: 彼らはこれをARC-AGIベンチマーク(現代のAI版IQテストのような、高度な汎用知能を測るテスト)でテストしました。
    • 彼らの極小モデル(パラメータ数はわずか0.8百万)は、**24%**のスコアを記録しました。
    • これは驚異的なことです。なぜなら、他のほとんどのオープンソースモデルは、そのスコアにさえ到達するために数十億のパラメータを必要とするからです。
    • 彼らはオリジナルのTRMモデルを大幅に上回り、「秘訣」はモデルのサイズではなく「学習方法」にあることを証明しました。

一文でのまとめ

この論文は、再帰的なAIモデルが強化学習者のように推測を改善しようとしていたものの、その「改善する方法」を教えられていなかったために失敗していたことを明らかにしました。ステップ・バイ・ステップの「パンくず」による学習経路を与えることで、著者たちはモデルを18倍効率化し、計算資源を極めてわずかに使いながらも、大幅に賢くすることに成功しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →