← 最新の論文
🤖 AI

CEDAR-GRPO: Process-Aware Reinforcement Learning for General Abductive Reasoning in LLMs

本論文は、最終的な回答の正誤性と仮説的推論に基づく報酬を組み合わせることで、大規模言語モデルにおける一般的な仮説的推論能力を強化する、プロセスを意識した強化学習フレームワークであるCEDAR-GRPOを紹介しており、これはベースモデルおよび正誤のみに基づく学習と比較して、11個の未知のタスクにおいて大幅な性能向上を実現している。

原著者: Moein Salimi, Danial Parnian, Shaygan Adim, Amirmohammad Ebrahiminasab, Nima Alighardashi, Parsa Gholami, Sahand Akramipour, Mahdi Jafari Siavoshani, Mohammad Hossein Rohban

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Moein Salimi, Danial Parnian, Shaygan Adim, Amirmohammad Ebrahiminasab, Nima Alighardashi, Parsa Gholami, Sahand Akramipour, Mahdi Jafari Siavoshani, Mohammad Hossein Rohban

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能という広大な領域において、研究者たちは、単に文章の次の単語を予測するだけでなく、いかにして機械に人間のように考えさせるかということに絶えず挑戦しています。人間特有の思考法の一つに「仮説的推論(アブダクション)」と呼ばれるものがあります。これは、一連の手がかりや観察事項を見て、それらに対する最も可能性の高い説明を導き出すために、逆方向に遡って考える精神的プロセスです。医師がわずかな症状から患者の病状を判断する方法、探偵が散在する証拠から犯罪を再構成する方法、あるいはエンジニアが突然停止した機械の故障原因を診断する方法などがこれにあたります。長い間、科学者たちは大規模言語モデルにこれを上手に行わせることに苦心してきました。これらのモデルは、事実を想起したり厳密な論理規則に従ったりすることには長けていますが、不完全な情報から隠れた原因を推論することを求められると、しばとうつつを抜かしてしまいます。彼らは間違った理由で正しい答えを推測したり、もっともらしく聞こえるが提供された証拠には実際には適合しない事実を捏造したりする傾向があります。

シャリフ・テクノロジー大学とテヘラン大学の研究チームは、この問題を解決しようと取り組みました。彼らは、AIモデルに特定のパズルを暗記させるのではなく、未知の新しい問題に対処できるような方法で、仮説的推論をより得意とするよう訓練できるかどうかを知りたいと考えました。彼らは「CEDAR-GRPO」と呼ばれる新しい訓練手法を開発しました。単に最終的な答えが合っていることに報酬を与えるのではなく、答えに至るまでのプロセスにも報酬を与えるシステムを設計したのです。このシステムは、モデルの思考プロセスについて2つの特定の事項をチェックします。第一に、モデルが提供された証拠のあらゆる詳細を実際に確認し、説明しているかどうか。第二に、モデルが結論から始めて証拠をそこに無理やり当てはめるのではなく、観察から出発して結論へと向かう正しい方向へと推論を進めているかどうかです。

これをテストするために、研究者たちは4つの異なるオープンソースの言語モデルを取り上げ、注意深く混合されたタスクセットを用いて訓練を行いました。これらのタスクには、短い物語に対する最適な説明の選択から、データのパターンを説明するコードの記述まで含まれていました。決定的なのは、彼らは単にモデルに答えを見せただけではなく、推論ステップに対してフィードバックを与えるコーチのような役割を果たす強化学習の手法を用いたことです。モデルは、たとえ答えが正しくても、重要な詳細を見落としていたり、論理が逆行していたりすれば、それは不十分であることを学びました。この訓練の後、研究者たちは、モデルが一度も見ることのなかった全く異なる11のタスクを用いてモデルをテストしました。これらの新しいタスクは、医学的状態の診断、コンピュータコードのデバッグ、複雑なミステリーの解決、そして長く複雑な物語の理解など多岐にわたります。

結果は、全体にわたって明確な改善を示しました。新しい手法で訓練されたモデルは、元のバージョンや、正解を得ることのみを目的として訓練されたモデルの両方を上回る性能を発揮しました。平均して、新しい手法は元のモデルに対して7.4パーセントポイント、正解のみを目的としたモデルに対しては2.7ポイント向上しました。特定のケースでは、その向上幅は30.8ポイントに達することもありました。さらに重要なことに、研究者たちはモデルが思考中に書き出した実際のテキストを分析しました。その結果、訓練されたモデルは、より注意深い調査員のように振る舞っていることが分かりました。彼らは答えを出す前にさまざまな可能性を検討し、誤った考えを明示的に排除し、不確実な場合にはそれを認める傾向が強くなっていました。また、漠然とした仮定に頼るのではなく、結論を提示された具体的な事実へと直接結びつける習慣も格段に強まっていました。

この研究は、いくつかの代替的な説明も排除しました。研究者たちは、この成功が単にモデルがより多くの例を見たことによるものや、一般的な推論能力の向上によるものではないことを証明しました。仮説的推論のタスクに焦点を当てない同様の量の一般的な推論データを用いてモデルを訓練した場合、モデルは特定のテストにおいてこれほどのレベルの向上は見せませんでした。このことは、モデルに報酬を与えた特定のプロセスこそが鍵であったことを示唆しています。この知見は、仮説的推論が特定の種類のパズルにのみ有効な狭いテクニックではなく、異なる分野間で転移可能な一般的なスキルとして強化できることを示しています。モデルに証拠を尊重し、観察から説明へと至る論理的な経路を辿るよう教えることで、研究者たちは、周囲の世界を真に理解し説明できる人工知能の創造に向けた重要な一歩を踏み出しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →