← 最新の論文
💬 NLP

Reasoning Error from Known Fact: Step-Level Self-Consistency Group Relative Policy Optimization for LLM

本論文は、複数の推論ロールアウトにおける自己整合性スコアに基づいてステップレベルの報酬を割り当てることにより、大規模言語モデルにおける文脈依存的な事実の幻覚を軽減する新しい手法であるStep-level Self-Consistency Group Relative Policy Optimization (SSC-GRPO) を導入し、それによって数学的推論および幻覚ベンチマークにおいて最先端の性能を達成するものである。

原著者: Xiaomeng Hu, Jiaqi Hu, Hao Chen, Qi Zhang, Zhanming Shen, Wentao Ye, Junbo Zhao

公開日 2026-07-22
📖 1 分で読めます☕ さくっと読める

原著者: Xiaomeng Hu, Jiaqi Hu, Hao Chen, Qi Zhang, Zhanming Shen, Wentao Ye, Junbo Zhao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたは、ミステリーを解くために、非常に優秀で超クリエイティブなロボットを教えています。このロボットは図書館にあるほぼすべての本を読み、人間のように話すことができますが、少し変わった癖があります。長い物語に没頭すると、時々、事実を捏造し始めてしまうのです。手がかりが明らかに庭師を指しているとしても、自信満々に「執事が燭台を使って犯行に及びました」と言ってしまうことがあります。人工知能の世界では、これを「ハルシネーション(幻覚)」と呼びます。これは、ロボットがわざと嘘をついているのではなく、思考の長い連鎖の中に深く入り込みすぎて、自分が実際に知っていることを忘れてしまうのです。

長い間、科学者たちは、こうした間違いはロボットが単に答えを知らないために起こると考えてきました。しかし、もしロボットは答えを知っているのに、自分自身に語っている物語によって混乱しているとしたらどうでしょう? この論文が取り組んでいるパズルは、まさにそこです。研究者たちは、AIモデルが、まるで探偵がメモ帳に手がかりを書き留めるように、ステップ・バイ・ステップでどのように思考しているのかを調査しています。彼らは、ロボットが知識を欠いているからではなく、書いている物語の文脈(コンテキスト)によって真実を忘れてしまうために、自分の足に躓いていることが多いことを発見しました。これを解決するために、彼らは「セルフチェック」システムとして機能する新しい学習方法を考案しました。それは、ロボットに「待てよ、この文章は今書いた他のすべての内容と整合性が取れているか?」と立ち止まって問いかけるよう教えるものです。


問題点:ロボットの「脳霧(ブレイン・フォグ)」

大規模言語モデル(LLM)を紹介しましょう。これは、インターネット全体を暗記した超スマートなオウムだと考えてください。あなたが難しい数学の問題を尋ねると、それは単に答えを吐き出すのではなく、問題をステップ・バイ・ステップで、思考のプロセスを書き留めながら「考え」ようとします。これは複雑なパズルを解くには素晴らしいことですが、欠点もあります。思考の連鎖が長くなるにつれ、ロボットは時として「文脈依存的」になってしまいます。

あなたが頭の中で数学の問題を解いているところを想像してください。あなたは 3×100=3003 \times 100 = 300 であることを知っています。しかしその後、数字を果物に変える魔法をかける魔法使いについての物語を書き始めるとします。突然、あなたの脳は混乱し、「したがって、3×1003 \times 100 は間違いなくバナナである」と書いてしまうかもしれません。あなたはそれが 300 であることを「知って」いるのですが、自分自身に語っているおかしな物語のせいで、それを忘れてしまったのです。

研究者たちは、これがまさにAIに起きている現象であることを発見しました。彼らはこれを**「文脈依存的な事実のハルシネーション(Context-Sensitive Factual Hallucination)」**と呼んでいます。ロボットの脳内には正しい事実が保存されていますが、長い推論プロセスの「ノイズ」が、ミスを犯すようにロボットを騙してしまうのです。それは、曲を完璧に演奏する方法を知っているミュージシャンが、観客の騒音に気を取られすぎて、音を外してしまうようなものです。

発見:それは知識の欠如ではない

これを解明するために、チームは探偵のように動きました。彼らは、長い推論の連鎖の中で間違いを起こしたロボットを取り上げ、単純な質問を投げかけました。「もし私がその間違った一文だけを取り出して、それについて単独で質問したら、正解できますか?」

答えは、ほとんどの場合**「はい」**でした。

間違いを切り離して調べると、ロボットは「ああ、もちろんです! 3×1003 \times 100 はバナナではなく 300 です!」と答えたのです。これは、ロボットに知識が欠けていたのではなく、文脈によって混乱していたことを証明しました。実際、彼らの分析によれば、これらの推論モデルが犯す間違いのほぼ**70%**が、この特定のタイプの「脳霧」であり、モデルは真実を知っていながら、自分自身の物語に足を取られてしまうのです。

解決策:「自己一貫性」コーチ

では、ロボットに自分の物語によって混乱しないよう、どのように教えればよいのでしょうか? 著者たちは、SSC-GRPO(Step-Level Self-Consistency Group Relative Policy Optimization)と呼ばれる新しい学習方法を作成しました。これは非常に長い名前なので、ゲームの例えで分解してみましょう。

同じパズルを同時に解くために、8台のロボットチームを訓練していると想像してください。

  1. ロールアウト(展開): 各ロボットは、自分自身のステップ・バイ・ステップの解決策を書き出します。
  2. セルフチェック: 単に最終的な答えが正しいかどうかを確認するのではなく、システムはロボットたちに、自分たちのステップを比較するように求めます。「ロボットA、あなたの第2ステップは、ロボットBとロボットCが書いた内容と一致していますか?」
  3. 報酬: もしロボットのステップが他のロボットたちが言っていることと一致している(高い一貫性がある)場合、高いスコアを与えられます。もし脱線して、他の誰も同意しないような奇妙なことを言った場合(低い一貫性)、低いスコアを与えられます。

ここでの魔法は、ロボットが自分自身の審判として機能することです。ロボットは、自分に間違いを教えるための人間の教師や事実のデータベースを必要としません。ただ、自分の「仲間」(自分自身の他のバージョン)を見て、「おや、バナナが答えだと言っているのは自分だけだ。それはおそらく間違っている」と気づくだけなのです。

システムはその後、これらのスコアを使用して、一貫性のあるステップには「報酬」を、ハルシネーションを起こしたステップには「罰」を与えます。時間をかけて、ロボットはグループの中で理にかなっているステップを信頼することを学び、物語に合わせるためだけに事実を捏造することをやめていきます。

結果:より賢く、より正直なロボットへ

チームは、利用可能な最も困難な数学および推論の課題を用いて、この新しい手法をテストしました。彼らは Qwen3Llama3 といったモデルを使用しました。結果は目覚ましいものでした。

  • 優れた数学能力: 標準的な数学テストにおいて、この新手法は以前よりも高いスコアを獲得する助けとなりました。例えば、あるテストでは、標準的な学習方法と比較してスコアが約 1.8% 向上しました。
  • 少ないハルシネーション: 最も重要なことに、ロボットはそれらの「文脈依存的」な間違いをはるかに少なくしました。自分の物語によって混乱する回数は大幅に減少しました。
  • 外部の助けを必要としない: 巨大な百科事典を参照する必要がある他の手法(これは低速でコストがかかります)とは異なり、この手法はロボット自身の脳を使って自分自身をチェックします。

研究者たちはまた、訓練中に面白い現象にも気づきました。学習が進むにつれて、ロボットの「一貫性」が上がっていったのです。彼らは自分自身とより一致するようになり、混乱を招くステップの数が減っていきました。それは、注意が散漫で混乱していた学生が、集中力を持って自信に満ちた状態へと変わっていく様子を見ているようでした。

なぜこれが重要なのか

この論文は、AIにおける最大の問題の一つ、すなわち「間違っているのに自信満々に聞こえる」という傾向を修正するための新しい方法を提案しています。ロボットはしばしば答えを知っているものの、物語の中で迷子になっているのだということを理解することで、著者たちは、ロボットが軌道を外れないようにする方法を見つけ出しました。

彼らは単に推測したのではなく、測定しました。間違いを分離したとき、知識が存在することを示しました。そして、彼らの新しい手法がこれら特定のタイプのエラーを減少させることを証明しました。論文では、この方法を実行するには(ロボットが何度も自分自身をチェックしなければならないため)多少多くの計算パワーが必要であることも述べていますが、AIをより信頼できるものにするためのトレードオフとしては価値があるようです。

要するに、著者たちはAIに新しいツールを与えました。それは「鏡」です。物語の次のステップをただ前方に探すのではなく、ロボットは今、振り返って「これは今まで自分が言ってきたことと一致しているだろうか?」と自問することを学ぶのです。そうすることで、彼らは事実を捏造することをやめ、真実を語り始めます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →