Towards Reliable, Generalizable, and Specific In-Context Knowledge Editing via Multi-Objective Reinforcement Learning
本論文は、プロンプト構築を制約付きマルコフ決定過程として定式化し、信頼性、汎用性、および特異性を同時に最適化することで、従来の手法と比較してLLMの知識更新において優れた性能を実現するマルチオブジェクティブ・インコンテキスト・ナレッジ・エディティング(MO-IKE)という多目的強化学習アルゴリズムを提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
大規模言語モデルは、物語を書き、問題を解決し、人間の思考を模倣するような流暢さで質問に答えることができる、新世代の人工知能の原動力です。しかし、これらのシステムには根本的な限界があります。それは、その知識が時間に凍結されていることです。一度モデルの初期トレーニングが完了すると、保持される事実は静的なものとなります。もしモデルが2026年冬季オリンピックより前に学習されていた場合、何度尋ねたとしても、最終的なメダル数は分かりません。この知識を更新するには、通常、膨大で高価な再学習プロセスが必要であり、ほとんどのユーザーにとって非現実的です。これを解決するために、研究者たちは「インコンテキスト・ナレッジ・エディティング(文脈内知識編集)」と呼ばれる手法を開発しました。これはモデルの内部コードを変更する代わりに、会話のプロンプトの中に一連の例示を提供することで、その特定のやり取りの間だけ新しい事実を効果的に教え込む手法です。課題は、完璧な例示のセットを構築することにあります。それは、新しい事実をモデルに受け入れさせるのに十分強力であり、質問の言い回しが変わっても機能するほど柔軟であり、かつ、モデルが既に知っている無関係な事実を誤って忘れたり変更したりしないように、十分に精密でなければなりません。
研究チームは、これらのプロンプトの構築方法を大幅に改善する「MO-IKE」と呼ばれる新しいシステムを発表しました。このプロセスを自動化しようとするこれまでの試みは、コンピュータプログラムが試行錯誤を通じて学習する手法である「強化学習」に依存していました。これまでのシステムは、新しい事実を教えることには成功していましたが、多くの場合、高い代償を伴いました。新しい事実を確実に受け入れさせようと急ぐあまり、既存の知識を保護するために必要な例示を削ぎ落としてしまったのです。これにより、一つのエラーを修正すると別のエラーが現れるという、脆弱なバランスが生じていました。新しいアプローチは、プロンプトの構築を単なる項目のリストとしてではなく、逐次的な意思決定プロセスとして扱います。このシステムは、新しい事実を述べる例、質問を言い換えた例、あるいは変更すべきではない事実を補強する例を、一つずつ追加するかどうかを選択することを学習します。そして、プロンプトが完成したと判断したときにのみ、例示の追加を停止します。
研究者たちは、マルチオブジェクティブ(多目的)報酬構造を用いてこのシステムを訓練しました。これは、コンピュータが「新しい事実を正しく伝えること」「質問の様々な問い方に適切に対応すること」「無関係な事実を安全に保つこと」という3つの領域で同時に成功した際に報酬を与えられる仕組みです。これらの競合する目標のバランスを取ることで、新しい手法はシステムが過度に攻撃的になるのを防いでいます。標準的な事実セットを用いたテストでは、新しいシステムは編集の成功率を87.1パーセントから91.1パーセントへと向上させました。さらに重要なことに、無関係な知識の保持率を41.0パーセントから63.4パーセントへと劇的に改善しました。これは、新しい事実を学習している間に、変更する必要のない事実をモデルが「忘れて」しまう可能性が大幅に減少したことを意味します。また、このシステムは高い適応性も証明しました。ある特定の言語モデルで訓練されたバージョンは、追加の訓練なしに、全く異なるモデルに適用した場合でも同様にうまく機能しました。
この研究は、例示がどのように構成されるかが、例示そのものと同じくらい重要であることを示しています。以前の手法は、固定されたテンプレートを使用したり、単一の種類の例示に焦点を当てたりすることが多く、それがアンバランスなプロンプトにつながっていました。新しいシステムは、異なる種類の例示を動的に混合することで、堅牢で具体的なコンテキストを作り出します。5つの異なる凍結された言語モデルと、30万件以上の例を含む大規模なベンチマークを含む4つの異なるデータセットを用いたテストにおいて、この手法は一貫して従来の技術を上回る性能を示しました。研究者たちは、新しい情報を教えることと古い情報を保護することのトレードオフを慎重に管理することで、以前は到達不可能であった信頼性と特異性のレベルを達成できることを見出しました。この研究は、人工知能を更新する未来が、大規模な再学習にあるのではなく、会話を通じてモデルを導く、よりスマートでバランスの取れた方法にあることを示唆しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。