← 最新の論文
💻 computer science

When to Think, When to Speak: Learning Disclosure Policies for LLM Reasoning

本論文は、推論時間と早すぎるコミットメントの間のトレードオフをバランスさせるために、生成中のコンテンツ開示のタイミングを動的に制御することを可能にするサイド・バイ・サイド(SxS)インターリーブ推論という枠組みを導入し、それによって各種ベンチマークにおける精度と遅延の性能を向上させるものである。

原著者: Jiaqi Wei, Xuehang Guo, Pengfei Yu, Xiang Zhang, Wanli Ouyang, Siqi Sun, Qingyun Wang, Chenyu You

公開日 2026-05-06
📖 1 分で読めます☕ さくっと読める

原著者: Jiaqi Wei, Xuehang Guo, Pengfei Yu, Xiang Zhang, Wanli Ouyang, Siqi Sun, Qingyun Wang, Chenyu You

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが複雑なパズルの解決を、非常に慎重だが天才的な友人に頼んでいると想像してください。

古い方法:「沈黙税」
現在の大規模言語モデル(LLM)の仕組みでは、その友人は声に出して考えなければなりません。しかし、ここには落とし穴があります。一度言葉を発すると、その言葉は公開されてしまい、取り消せなくなるのです。

  • 深く考えるために沈黙していると、あなたは気まずい沈黙の中で待たされることになります(これが「沈黙税」です)。
  • 礼儀正しくするためにすぐに話し始めると、間違ったり、未熟なことを言ったりする可能性があります。一度言ってしまった以上、その考えに「コミット」したことになるため、後で軌道修正することが難しくなります。彼らは、早口で話しすぎたという理由だけで、揺るぎない土台の上に建て続けることを強いられます。

新しいアイデア:並列推論(Side-by-Side: SxS)
この論文は、AI が話す新しい方法として**並列推論(Side-by-Side: SxS Interleaved Reasoning)**を導入します。

これは、秘密の材料を使った生放送の料理番組のようなものです。

  • 「考える」モード(非公開): 料理人(AI)はキッチンで、材料を切り、味見をし、混ぜています。この部分は見ることができません。これは彼らのプライベートな作業スペースです。
  • 「話す」モード(公開): 料理人はカウンターに出て、「今、塩を加えます」とあなたに伝えます。
  • 魔法のルール: 料理人がカウンターに出て話すことができるのは、すでに料理を味見し、塩を加えるのが正しいと 100% 確信している場合に限られます。沈黙を埋めるために推測を叫ぶことは許されません。

仕組み(「含意」のトリック)
この論文は AI に特定のルールを教え込みます:「話す前に、その発言を支える思考が整うまで待て」

  1. 料理人の訓練: 研究者たちは、AI が問題を解決した数千の例を取り上げ、「監督者(別の AI)」を使ってチェックさせました:「この特定の思考ステップは、本当にこの特定の答えのステップを証明しているか?」
  2. 並列のダンス: 彼らは、「思考(非公開)」と「発言(公開)」の間を行き来する新しい訓練形式を作成しました。
    • 思考: 「面積を計算する必要がある」(非公開)
    • 思考: 「公式は長さ×幅だ」(非公開)
    • 発言: 「面積は 50 です」(公開。なぜなら思考がそれを証明したから)
    • 思考: 「待て、単位を再確認しよう」(非公開)
    • 発言: 「つまり、50 平方メートルです」(公開)

結果:両方の利点
この論文は、2 つの異なるサイズの AI モデルを用いて、数学問題(AIME25)と科学問題(GPQA-Diamond)でこれをテストしました。

  • より速い更新: 最終的な答えを待つために 20,000 トークン(非常に長い時間)を待つのではなく、AI は今や検証済みの小さな答えの断片を、はるかに早く提供します。まるで、回転するロードアイコンではなく、実際に動くプログレスバーを得たようなものです。
  • 「つなぎ言葉」の排除: AI は証明がある場合のみ話すように訓練されているため、沈黙を埋めるために意味のないおしゃべりをすることはありません。
  • 精度は高いまま維持: 通常、AI に早期に話させることは、それを愚かにさせることがあります。しかし、この方法は 2 段階の訓練プロセス(まずモードの切り替え方を学び、次に強化学習を用いて答えがまだ正しいことを確認する)を使用しているため、AI は賢さを保ちます。
  • 「パレート」の勝利: この論文は、これがより良いバランス(「パレートのトレードオフ」)を生み出すと主張しています。最終的な答えの質を犠牲にすることなく、より速く、より頻繁な更新を得ることができます。

まとめ
この論文は、AI に自信に満ちた、検証済みの話者になることを教えることで、「沈黙税」を解決します。これにより、モデルは作業中は「思考の帽子」を被ったままにし、その一部が確実であると分かっている場合のみ、それを外して解決策の一部を共有できるようになります。これにより、AI が沈黙を埋めるために推測したり嘘をついたりすることを強いることなく、インタラクションはより速く、反応性のあるものになります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →