Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning
本論文は、「反復的なコピー(repetitive copying)」を、モデルが重要な根拠に集中する代わりに、入力テキストを無差別にコピーしてしまう長文脈推論における決定的な失敗モードとして特定し、関連する情報へのグラウンディング(根拠付け)を報酬として与える一方で、無関係な妨害要素への依存を罰することで性能を向上させる、証拠認識型の強化学習手法であるGEARを提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、巨大な100ページのミステリー小説を解こうとしていると想像してください。手がかりは第1章に隠されていますが、残りの部分はただのノイズの壁です。あなたには、1秒で本全体を読み終えることができる超優秀な探偵の友人(大規模言語モデル)がいます。かつて、これらの探偵は短編小説には非常に優れていました。しかし、あなたが100ページの小説を与えると、彼らは妙な振る舞いをするようになりました。思考する代わりに、彼らはパニックを起こしてコピー作業に走るようになったのです。彼らは、元の本の膨大な断片を何度も何度もページに貼り付け直すことで、探偵のメモを書き始めました。「Copy Less, Ground More(より少なくコピーし、より深く根拠に基づけ)」と題されたこの論文は、この特定の不具合について掘り下げています。この論文は、ステップ・バイ・ステップで推論するように設計されているはずのこれらのAI「思考」モデルが、物語が長くなりすぎると、なぜ無意識にテキストをコピーするループに陥ってしまうのかを探求しています。研究者たちは、これが単なる無害な癖ではなく、AIをより愚かで、より遅く、そしてパズルを解く能力を低下させる罠であることを発見しました。彼らは、AIにノイズを無視し、実際に重要な極小の手がかりだけに集中することを教える、新しいトレーニング方法を提案しています。
問題は、これらのAI探偵が「ロングコンテキスト(長い文脈)」の課題に直面したときに始まります。長いコンテキストとは、何百万もの言葉の中に答えが埋もれている巨大な図書館のようなものだと考えてください。論文は、「反復的なコピー(repetitive copying)」と呼ばれる決定的な失敗モードを特定しています。ライブラリが巨大になると、AIは思考することをやめ、壊れた脳を持つフォトコピア(複写機)のように振る舞い始めます。解決策を見つけ出す代わりに、プロンプト(質問と物語)から大量の文章をそのまま自分の推論プロセスへと直接コピーしてしまうのです。研究者たちは、この現象がテストされたほぼすべてのトップティアAIモデルで見られ、物語が長くなるほど悪化することを発見しました。それは、数学の問題を解く代わりに、解答用紙に教科書のページをそのまま書き写し始める学生のようなものです。この振る舞いは蔓延しており、7つの異なる最先端モデルに現れ、コンテキストの長さが8,000語から64,000語へと増加するにつれて激化します。
しかし、なぜAIはこのようなことをするのでしょうか?著者たちはさらに深く調査し、根本的な原因は「コピーすること自体が悪い」のではなく、「AIがすべてを無差別にコピーしていること」にあると気づきました。彼らは、AIが主要な証拠に「グラウンディング(根拠付け)」できていないことを発見しました。巨大な毛糸玉の中から特定の赤い糸を探している場面を想像してください。賢い探偵なら、赤い糸だけを引き抜くでしょう。しかし、混乱したAIは、青、緑、黄色のゴミを含めた毛糸玉全体を掴み取り、それを一緒に引きずっていきます。論文は、AIが主に「ディストラクター(邪魔なテキスト)」をコピーすると、タスクに失敗することを示しています。しかし、選択的に「主要な証拠(赤い糸)」をコピーすると、成功するのです。問題はコピーすることではなく、集中の欠如です。AIは、信号とノイズを区別する方法を知らないために、無関係な詳細の中に溺れているのです。
これを修正するために、チームはGEAR(Grounding Evidence-Aware Reward:根拠証拠認識報酬)と呼ばれる新しいトレーニング手法を考案しました。これは、ビデオゲームの新しいルールのようなものだと考えてください。古いゲームでは、AIは最終的な答えが合っている場合にのみポイントを獲得できました。新しいGEARゲームでは、ルールはより厳格です。AIの推論プロセスが特定の「主要な証拠(赤い糸)」と重なる場合、ボーナスポイントが与えられます。しかし、ここが重要な点ですが、そのプロセスが「ディストラクター(ゴミ)」と重なる場合には、重いペナルティが課されます。これにより、綱引きが発生します。AIは、勝つためにはマシンガンではなくスナイパーにならなければならないことを学びます。正しい手がかりを見つけ、残りを無視しなければならないのです。これを現実世界の文書(単なる架空の数学問題ではないもの)で機能させるために、彼らはスマートなエディターのように機能する自動パイプラインを構築しました。これは、長い文書を切り分け、どの部分が「証拠」であり、どの部分が単なる「中身のないテキスト(fluff)」であるかを特定し、3,200の問題からなるトレーニングデータセットを作成します。
この新しい手法をテストしたとき、結果は劇的なものでした。彼らは、GEAR報酬システムを使用して、3つの異なるサイズのAIモデル(90億から350億パラメータの範囲)を訓練しました。結果は、GEARが標準的なトレーニング手法を一貫して上回ったことを示しました。平均して、様々な困難なベンチマークにおいて、AIのパフォーマンスを最大4.6ポイント向上させました。より重要なことに、GEARは悪い習慣を修正しました。AIはコピーすることが減り、その「思考」プロセスはより短く効率的になり、特に非常に長いコンテキスト(最大128,000語)において、問題を解決する能力が実際に向上しました。論文は、AIが複雑な推論へと進化していく中で、正しい証拠の上にしっかりと立つ能力こそが最も重要なスキルであることを示唆しています。それなしでは、AIは自身のコピーの中に迷い込んでしまいます。GEARがあれば、AIは「より少なくコピーし、より深く根拠に基づけ」ということを学び、混沌とした複写機から鋭い探偵へと戻ることができるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。