← 最新の論文
💬 NLP

Retrieved In-Context Principles from Previous Mistakes

本論文は、大規模言語モデルの性能をさまざまな推論ベンチマークで向上させるために、学生モデルの誤りを分析・クラスタリングしてカスタマイズされたタスクレベルの原則を生成する教師・学生フレームワークである「検索型コンテキスト内原則(RICP)」を提案する。

原著者: Hao Sun, Yong Jiang, Bo Wang, Yingyan Hou, Yan Zhang, Pengjun Xie, Fei Huang

公開日 2026-05-26
📖 1 分で読めます☕ さくっと読める

原著者: Hao Sun, Yong Jiang, Bo Wang, Yingyan Hou, Yan Zhang, Pengjun Xie, Fei Huang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ある学生(学生モデル)に、厄介なパズルの解き方を教えることを想像してみてください。通常、私たちは正しいやり方の完璧な例を示すことで教えます。しかし、この論文は、どこで間違えたかを示し、その理由を説明することで、より効果的に教えることができると主張しています。

著者らは、この新しい方法をRICP(Retrieved In-Context Principles:検索型コンテキスト内原則)と呼んでいます。これは、教師学生が関与する、賢明な二段階のチュータリングシステムのようなものです。

以下に、簡単な比喩を用いてその仕組みを説明します。

課題:「万人向け」の教科書

従来の方法は間違いから学ぼうとしましたが、それは学生に「間違いを避ける方法」と題された一般的な教科書の章を渡すようなものでした。

  • 欠点: もし学生がピザに関する数学の問題でつまずいている場合、「作業を確認する」といった一般的なルールを読んでも十分な助けにはなりません。逆に、学生が論理パズルを解いている場合、「ピザ数学」に関するルールは役立ちません。
  • 結果: 助言は曖昧すぎたり、さまざまな種類の誤りを十分にカバーしていなかったりしました。

解決策:「個別指導のチューター」(RICP)

RICP 手法は、学生が模擬試験を受ける様子を見て、特定の誤りを分析し、次の試験のためのカスタム学習ガイドを作成する熟練の教師のように機能します。

ステップ 1:「誤りの解剖」(洞察の生成)

まず、学生モデルが一連の練習問題を解こうとします。教師モデル(より賢い AI)は、学生が間違えた問題を確認します。

  • 教師の役割: 「不正解」と言うだけでなく、レポートを作成します。それは根本原因(例:「ピザの価格にチップを加えるのを忘れた」)を特定し、具体的な洞察(例:「常に総費用のすべての要素が含まれているか確認する」)を提供します。

ステップ 2:「教訓のライブラリ」(原則の定式化)

ここで魔法が起きます。教師はこれらの誤りを 2 種類の助言に整理します。

  1. 「一般的なルール」(タスクレベルの原則):

    • 比喩: 教科書の章を想像してください。
    • 教師は類似した誤りをグループ化します(例:割合に関するすべての数学的誤り)。これらのグループから、あらゆる数学の問題に適用される広範なルールを作成します。
    • : 「常に算術演算を二度確認する」。
  2. 「個人的なチートシート」(質問レベルの原則):

    • 比喩: 今まさに見ている特定の問題に貼られた付箋を想像してください。
    • 学生が答えようとしているまさにその質問に対して、教師はライブラリから最も類似した過去の誤りを検索します。そして、この状況にのみ適用される具体的な助言を引き出します。
    • : 「この特定のピザの問題では、チップの計算だけでなく、基本価格にチップを加えることを忘れないでください」。

ステップ 3:「試験当日」(原則の活用)

学生が新しい問題に直面したとき:

  1. 正しい方向に進むよう、一般的なルール(教科書の章)を受け取ります。
  2. その特定の質問に合わせた個人的なチートシート(付箋)を受け取ります。
  3. これらを通常の指示と組み合わせて問題を解決します。

重要なのは: 教師は試験中に立ち会う必要はありません。学生は単に、教師が以前に準備したノートを使用するだけです。これにより、実行が迅速かつ安価になります。

なぜこれが優れているのか

この論文は、数学、常識、論理に関わる 7 つの異なる「試験委員会」(データセット)でこれをテストしました。

  • カスタマイズ: 従来の方法が全員に同じ助言を与えたのに対し、RICP は特定の質問に対して正しい助言を提供します。
  • 網羅性: 誤りをグループ化することで、学生は最も一般的な誤りだけでなく、多様な誤りから学ぶことを保証します。
  • 結果: これらの「誤りのノート」を標準的な AI プロンプト手法に追加したところ、学生モデルは著しく賢くなり、特に難しい論理問題や数学問題において精度が向上しました。

要約

単に AI に正しいやり方を示すのではなく、この手法は過去の失敗を分析することで、どうすれば間違えないかを教えます。これは、広範な知恵(一般的な安全性のため)と具体的なヒント(即座の問題のため)の両方を提供するハイブリッドガイドを作成し、AI が自らの失敗から学ぶ人間のように推論することを支援します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →