← 最新の論文
💻 computer science

CoLT: Teaching Multi-Modal Models to Think with Chain of Latent Thoughts

CoLTは、冗長なテキストベースの思考の連鎖(Chain-of-Thought)による推論を効率的なステップレベルの潜在的思考表現に置き換えることでマルチモーダル大規模言語モデルを強化する新しいフレームワークであり、推論時には軽量な外部デコーダーを取り除く一方で、双方向の監督を利用する学習戦略を通じて、大幅な推論速度の向上と優れた性能を実現します。

原著者: Lianyu Hu, Shengqian Qin, Zeqin Liao, Qing Guo, Liang Wan, Wei Feng, Yang Liu

公開日 2026-07-01
📖 1 分で読めます☕ さくっと読める

原著者: Lianyu Hu, Shengqian Qin, Zeqin Liao, Qing Guo, Liang Wan, Wei Feng, Yang Liu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

問題点:「おしゃべりすぎる」ロボット

想像してみてください。目の前には、画像を見て数学の問題を解くことができる、非常に優秀なロボット助手がいます。正しい答えを出すために、ロボットはまず「考える」必要があります。

現在、多くの高度なロボットは**Chain-of-Thought(思考の連鎖、CoT)**と呼ばれる手法を使用しています。これは、ロボットが自分自身に対して声に出して語りかけるようなものです。最終的な答えを出す前に、ロボットはテキストによる長いステップ・バイ・ステップの物語を書き出します。「まず、三角形が見えます。次に、線の長さが5インチであることを確認しました。次に、ピタゴラスの定理を適用します……」といった具合です。

この方法は効果的ですが、2つの大きな欠点があります。

  1. 遅い: ロボットは、思考プロセスの一言一言をタイピングしなければなりません。もし思考プロセスが長くなれば、膨大な時間とコンピュータの計算資源が必要になります。
  2. 融通が利かない: 一度言葉を書いてしまうと、ロボットはその特定の文章に縛られてしまいます。考えを変えたり、別の経路を探索したりしようとしても、物語全体を書き直すことなしには容易にはできません。

解決策:CoLT(潜在的思考の連鎖)

この論文の著者たちは、これらのロボットに考え方を教えるための新しい方法、**CoLT(Chain of Latent Thoughts)**を提案しています。

ロボットに長い物語を書かせる代わりに、CoLTはロボットに**「静かで目に見えないささやき」(潜在的思考)**の中で考えることを教えます。ロボットが、自分にしか理解できない秘密のコードを使って、複雑な内部対話を行っている様子を想像してください。ロボットは手順を書き出すのではなく、アイデアを自身の「心(内部コンピュータメモリ)」の中に保持し、答えへと直接ジャンプします。

例え話:

  • 従来の方法(テキストCoT): 数学の問題を解く際に、すべてのステップを紙に書き出す生徒のようなものです。分かりやすいですが、書くのに時間がかかります。
  • CoLT: チェスのグランドマスターが盤面を見つめているようなものです。彼らは指し手を声に出して言うことはありません。頭の中で瞬時に戦略全体を可視化し、それから次の一手を打ちます。

課題:「沈黙」の問題

研究者たちは、ただロボットに「静かに考えなさい」と命じるだけでは、ロボットが混乱してしまうことに気づきました。言葉による構造がなければ、ロボットの内部的な思考は、意味のないノイズやデタラメなものになってしまう可能性があります。これは、論理が本当に成立しているかを確認することなく、頭の中だけでパズルを解こうとする人に似ています。

解決策:「秘密の翻訳家」

これを解決するために、著者たちは、ロボットに正しく「静かに考える」方法を教えるための3つの「コーチ(監督信号)」を備えた特別なトレーニングシステムを構築しました。

  1. フォワード・コーチ(翻訳家): このコーチは、ロボットの静かな思考を見て、それを英語に翻訳しようと試みます。もしロボットの思考が良ければ、コーチは物語の次のステップを簡単に書くことができます。もしコーチが翻訳できなければ、ロボットはもっと明確に考えなければならないことを学びます。
  2. バックワード・コーチ(アンカー): このコーチは、英語の物語を見て、それをロボットの静かな思考へと戻そうと試みます。これにより、ロボットの静かな思考が、単なるランダムな数字ではなく、実際の論理的なアイデアにしっかりと結びついていることが保証されます。
  3. インターナル・コーチ(フロー): このコーチは、ロボットの思考がステップごとに論理的に流れているかどうかをチェックします。ロボットが、アイデアAからアイデアZへと、橋渡しなしにランダムに飛び跳ねてしまわないように監視します。

最も優れた点: これらのコーチは、ロボットが「学習している間」のみ使用されます。一度トレーニングが終われば、コーチは破棄されます。実際にロボットがあなたの問題を解くとき、それは静かな思考を直接使用します。追加の翻訳も、追加のステップも必要ありません。

結果:速く、そして賢い

この論文の手法は、チャートの読み取り、科学の問題、図解の理解など、8つの異なる難易度の高いタスクでテストされました。

  • スピード: 何千もの言葉を書く工程をスキップし、わずか3つの「静かなステップ」のみを使用するため、従来のテキストベースの手法と比較して、全体で10倍速く、思考段階においては22倍速くなりました。
  • 正確性: 驚くべきことに、ロボットは速くなっただけでなく、より賢くなりました。この手法は、「静かな思考」を用いようとした他の手法を凌駕し、学習のために高価な追加画像が必要な手法さえも上回りました。
  • 堅牢性(ロバストネス): 入力が乱れている場合(ぼやけた画像やタイポのある質問など)、この静かな思考法はテキストベースの手法よりもはるかに安定していました。それは、ささやき声が、大きな叫び声よりも背景ノイズの影響を受けにくいのと似ています。

まとめ

CoLTは、AIに考え方を教えるための新しい方法です。AIに問題を解くために長く遅い物語を書かせるのではなく、AIが自身の「心」の中で構造化された論理的な対話を行うように教えます。これらの静かな思考が意味を成すように特別なトレーニングツールを用いることで、AIは複雑な視覚的パズルを解く際、より速く、かつより正確に解けるようになるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →