← 最新の論文
🤖 AI

Mull-Tokens: Modality-Agnostic Latent Thinking

本論文は、テキストおよび画像モダリティにわたる自由形式の中間推論をマルチモーダルモデルに可能にするモダリティ非依存の潜在トークンフレームワークである「Mull-Tokens」を導入し、壊れやすいツール呼び出しや高コストな画像生成に依存することなく、複雑な空間的およびパズル解決タスクにおける性能を大幅に向上させる。

原著者: Arijit Ray, Ahmed Abdelkader, Chengzhi Mao, Bryan A. Plummer, Kate Saenko, Ranjay Krishna, Leonidas Guibas, Wen-Sheng Chu

公開日 2026-05-01
📖 1 分で読めます☕ さくっと読める

原著者: Arijit Ray, Ahmed Abdelkader, Chengzhi Mao, Bryan A. Plummer, Kate Saenko, Ranjay Krishna, Leonidas Guibas, Wen-Sheng Chu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

以下は、論文「Mult-Tokens: Modality-Agnostic Latent Thinking」を、平易な言葉と創造的な比喩を用いて解説したものです。

大きな問題:一次元での思考

複雑な 3 次元パズル、例えばルービックキューブやジグソーパズルを解こうとしていると想像してください。もしそれを言葉だけを使って解こうとすれば、「赤いピースを左に動かし、次に青いピースを回転させる」といった言い方になるかもしれません。しかし、言葉はこれには遅く、不器用です。形状や奥行き、あるいは空間内でピースがどのように組み合わさるかを、言葉では容易に記述できません。

現在の AI モデルは、話すこと(テキスト)も見ることも(画像)得意ですが、空間や時間、あるいは物体の動きについて推論しようとすると、しばしばつまずきます。

  • 古い方法(テキストのみ): AI は言葉でパズルを説明しようとします。しかし、詳細に迷い込み、間違いを犯します。
  • 「多すぎる」方法(画像+テキスト): 一部の研究者は、AI に思考を「描かせる」ことを試みました。しかし、これは料理人に料理を止めてレシピを書かせ、皿の絵を描かせ、さらに別のレシピを書かせ、最後に料理を提供させるようなものです。高価で遅く、AI はどの絵がどの文に対応するかを混乱させがちです。

解決策:「Mult-Token」(魔法の落書き帳)

著者たちは、Mult-Tokensと呼ばれる、よりシンプルで賢いツールを提案しています。

AI の脳をキッチンだと考えてみましょう。

  • テキストトークンは、料理人の口頭での指示のようなものです。
  • 画像トークンは、料理人がメモ帳に実際に絵を描くようなものです。
  • Mult-Tokensは、魔法の目に見えない落書き帳のようなものです。

AI が難しい問題(例えば空間パズル)に直面したとき、長い段落の言葉を叫んだり、完全な絵を描いたりする代わりに、一旦立ち止まってこの目に見えない落書き帳に書き込みます。

なぜこれが魔法なのか?

  1. モダリティ非依存であること: これは「思考の形を問わない」という難しい言葉です。この落書き帳には、回転するキューブの心のイメージもあれば、ルートの記号的な地図も収まります。言葉である必要も、完全な絵である必要もありません。それは純粋な「思考データ」です。
  2. コンパクトであること: 一般的なテキストベースの説明なら 200 語が必要かもしれません。完全な画像なら数百ピクセルが必要でしょう。Mult-Token アプローチは、わずか20 から 40 トークンだけで問題を解決します。これは、数学の問題を説明するために 10 ページの論文を書くのと、メモに重要な数式だけを書き留めるのとの違いのようなものです。

どのように訓練されたか:3 ステップのジム・ルーティン

研究者たちは AI に落書き帳を与えただけでなく、その使い方を教える必要がありました。彼らは 3 段階の訓練プロセスを用いました。

  1. ウォーミングアップ(思考の言語を学ぶ):
    まず、彼らは AI にパズルを解く人々の例を見せました。時には解決策に絵が含まれ、時には文が含まれていました。Mult-Tokens にこれらのステップを模倣することを教えました。

    • 比喩: これは、生徒が先生が数学の問題を解くのを見るようなものです。時には先生が数字を書くのを見せ、時にはグラフを描くのを見せます。生徒は「落書き帳」に両方が収まり得ることを学びます。
  2. 自由形式の練習(手放す):
    次に、彼らは AI に最終的な答えだけを見せ、どのように問題を解くかは示しませんでした。AI にはこう言われました。「ここにパズルがある。落書き帳を使って解き明かせ。ただし、何を書くかは教えない。正しい答えを出せ。」

    • 比喩: 先生がヒントを与えなくなり、「これを解け」と言うだけです。生徒は、先生を単に模倣するのではなく、自分にとって最もうまくいく方法で落書き帳を使うことを学びます。
  3. 強化(良い思考を報酬とする):
    最後に、GRPO(強化学習)と呼ばれる手法を用いました。AI が落書き帳を使って正しい答えを出せば、「ゴールドスター」をもらいました。考えずに推測しただけなら、何ももらえませんでした。これにより、AI は単に推測するのではなく、実際に落書き帳を使って推論することが奨励されました。

結果:より速く、より賢く

この論文は、パズル、3 次元空間推論、ビデオ分析に関する 4 つの困難なベンチマークでこの新しい手法をテストしました。

  • 勝利: Mult-Tokens を使った AI は、既存の最良の方法よりも平均して3% 向上しました。最も難しいパズルテストでは、16% 向上しました。
  • 速度: 数百の単語や画像の代わりに、わずか約 20 の「思考トークン」しか使わないため、実行ははるかに速く、コストも安いです。
  • 柔軟性: AI は、いつ落書き帳を使うかを決定することを学びました。いくつかの簡単な質問では、落書き帳をスキップしました。難しい空間パズルでは、それを積極的に使いました。

結論

この論文は、深く思考するために AI に「話す」ことや「描く」ことを強制する必要はないと主張しています。代わりに、完全な文や画像を生成するオーバーヘッドなしで、画像と概念を自由に混ぜ合わせられる、プライベートで内部の「思考の部屋」であるモダリティ非依存の潜在空間を与えることができます。

これは、人間に、3 次元の物体を説明することなく視覚化できる、静かな内的独白を与えるようなものです。その結果、空間パズルが得意で、速く、効率的な AI が生まれます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →