← 最新の論文
💬 NLP

CopT: Contrastive On-Policy Thinking with Continuous Spaces for General and Agentic Reasoning

CopT は、まず草案の回答を生成し、その後、必要に応じてのみオンポリシーの振り返りを動的にトリガーするために連続空間の対照的検証器を採用することで、標準的な思考連鎖のパラダイムを逆転させるトレーニング不要の推論フレームワークであり、これにより多様な推論タスクにおいて精度を大幅に向上させ、トークンコストを削減する。

原著者: Dachuan Shi, Hanlin Zhu, Xiangchi Yuan, Wanjia Zhao, Kejing Xia, Wen Xiao, Wenke Lee

公開日 2026-05-20
📖 1 分で読めます☕ さくっと読める

原著者: Dachuan Shi, Hanlin Zhu, Xiangchi Yuan, Wanjia Zhao, Kejing Xia, Wen Xiao, Wenke Lee

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが謎を解こうとする天才的な探偵だと想像してください。

従来の方法(思考連鎖):
従来、大規模言語モデル(LLM)が問題を解決しようとする際、犯人を特定する前に 10 ページの警察報告書を書くことを強要される探偵のように振る舞います。彼らは考え、考え、考え、すべての手順を書き留め、その後に答えを提示します。

  • 問題点: 時には、探偵が最初の瞬間にすでに答えを知っていることもあります。しかし、「まず考えよ」という規則があるため、彼らはそれでも報告書を書き続けます。これは、答えが明白であったとしても、時間(トークン)とエネルギーを浪費します。これは「パフォーマンスとしての推論」、つまり思考のための思考と呼ばれます。

新しい方法(CopT):
この論文は CopT(対照的オンポリシー思考)を導入します。これは脚本を逆転させます。答えを出す前に考えるのではなく、CopT は即座に草案の答えを叫ぶ探偵のように振る舞います。

  • ステップ 1:直感チェック。 モデルは「答えは X だと思います」と言います。
  • ステップ 2:魔法の鏡。 この答えを受け入れる前に、CopT は答えが信頼できるか確認するために特別な「魔法の鏡」(対照的メカニズム)を使用します。
    • 標準的な視点(離散トークン)を使って答えを見ます。
    • 「ぼやけて不確かな」視点(モデルが考慮したすべての「かもしれない」可能性を保持する連続埋め込み)を使って答えを見ます。
    • モデルが自信を持っている場合、この二つの視点は完全に一致します。モデルが推測していたり混乱していたりする場合、この二つの視点は衝突します。
  • ステップ 3:決定。
    • 鏡が「良さそう」と言う場合: 探偵は即座に答えを受け入れます。長い報告書を書く必要はありません。結果: 時間と費用の大幅な節約。
    • 鏡が「怪しい」と言う場合: 探偵は「わかった、もっと考えよう」と言います。しかし、ここが巧妙な点です。彼らは最初の推測を単に忘れるわけではありません。「可視性スイッチ」を使用します。最初の推測が混乱を招く場合はそれを隠し、有益なヒントである場合は可視化したままにしながら、それを修正するための深い思考を行います。

核心的な比喩:「ぼやけたレンズ」対「鮮明なレンズ」

「魔法の鏡」(対照的検証器)を理解するために、二つの異なるレンズを通して絵画を見てみましょう。

  1. 鮮明なレンズ(離散入力): モデルが描き決めた最終的で鮮明な筆致が見えます。これが「草案の答え」です。
  2. ぼやけたレンズ(連続入力): モデルが最終的な筆致を選ぶ前に考慮していた、すべての色合いのパレットが見えます。これにはすべての「もしも」と不確実性が含まれます。

CopT の使用方法:
CopT は問いかけます。「鮮明なレンズはぼやけたレンズと同じように見えますか?」

  • はい: モデルは確信していました。答えはおそらく正しいです。思考を停止し、トークンを節約します。
  • いいえ: ぼやけたレンズは、モデルが実際には非常に混乱していたか、特定の色を選んだにもかかわらず多くの異なる可能性を考慮していたことを示しています。答えはおそらく間違っています。それを修正するために思考(オンポリシー思考)を開始します。

なぜこれが重要なのか(論文によると)

この論文は、この方法がモデルが不要な思考を「演じる」ことを防ぐため、ゲームチェンジャーであると主張しています。

  • 速度とコスト: モデルが即座に答えを知っている簡単な問題では、CopT は長い思考プロセスを完全にスキップします。論文によると、これは場合によっては「コスト」(生成された単語数/トークン数)をほぼ半分に削減します。
  • 賢い思考: 最初の推測が間違っている難しい問題では、CopT は諦めません。「魔法の鏡」を使って「待てよ、私は混乱している」と気づき、必要とされる場合のみ深い思考を行います。
  • トレーニング不要: これは何年ものトレーニングを必要とする新しいモデルではありません。既存のモデルを使う新しい方法です。それは、新しい言語を教えるのではなく、賢い探偵に新しい規則セットを与えるようなものです。

「可視性スイッチ」

モデルがさらに考える必要があると気づいたとき、それは最初の(おそらく間違った)推測を見続けるかどうかを決定しなければなりません。

  • 思考プロセスが混乱する場合、CopT はモデルが自分の間違いで混乱しないように、最初の推測を隠すことができます。
  • 最初の推測に良いヒントが含まれている場合、CopT はそれを表示して修正を導くのを助けます。
    これは、思考プロセス中の二つ目の「魔法の鏡」チェックによって制御されます。

まとめ

CopT は、AI 推論をより賢く使う方法です。AI に話す前に長時間考えさせる代わりに、AI にまず話させ、特殊な「不確実性検出器」を使ってその発言が信頼できるか確認し、検出器が「おい、あれは正しくないようだ」と言う場合のみ、深く考えさせます。これにより、AI はより速く、より安価になり、難しい問題においても同じくらい賢く(あるいはそれ以上に)なります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →