Can Scientific Claims Be Removed from Large Language Models? A Systematic Evaluation of Claim-Level Unlearning
本論文は、科学的主張のアンラーニング(Scientific Claim Unlearning)というタスクと、新しいベンチマークであるSciUnlearnを導入し、現在の機械学習によるアンラーニング手法が、大規模言語モデルから相互に関連し進化する科学的主張を効果的に除去することに失敗しており、多くの場合、真の知識の消去ではなく表面的な抑制にとどまっていることを示す。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
大規模言語モデルとも呼ばれる現代の人工知能システムは、人類の知識の膨大な図書館として機能します。これらのモデルは、科学論文を含む膨大なテキストのコレクションを読み込むことで学習し、質問に答えたり問題を解決したりする方法を学びます。しかし、科学は静的なアーカイブではなく、絶え間ない修正が行われる、生きている、呼吸しているプロセスです。新しい研究が古い考えを誤りであると証明したり、エラーのために論文が撤回されたりすると、科学的記録は更新されます。問題は、これらのAIモデルが自動的に自身を更新しないことです。一度事実を学習すると、科学界がそれを偽であると宣言した後でも、その事実を保持し続ける傾向があります。これは、AIが時代遅れであったり、あるいは覆されたりした情報を自信満々に繰り返し、研究者を誤導したり、医学のような分野で危害を及ぼしたりするリスクを生み出します。
これに対処するため、研究者たちは「マシン・アンラーニング(機械的忘却)」と呼ばれる技術を開発しました。その目的は、他の質問に答える能力を損なうことなく、特定の情報を取り除くことをモデルに教えることです。特定の、誤った本を、図書館の他の部分を乱したり他の本を見つける能力を失わせたりすることなく、棚から取り除かなければならない司書を想像してみてください。この手法は、個人データや著作権で保護された素材の削除についてはテストされてきましたが、科学者たちは、特定の科学的主張を効果的に削除する方法をまだ見いだせていません。これらの主張は非常に複雑に絡み合っているため、扱いが難しいのです。なぜなら、一つの事実を知ることは、多くの場合、他の多くの事柄を理解することに依存しているからです。一つの事実を取り除こうとすると、モデルは単にその知識を存続させるために言い回しをわずかに変えて学習するか、あるいは誤って他のすべてを忘れてしまう可能性があります。
TCS Researchとイェール大学の研究チームは、この特定の課題を解決するために乗り出しました。彼らは、現在のAIモデルが本当に科学的主張を忘れることができるのかを確認するために、「SciUnlearn」という新しいテスト環境を作成しました。彼らはコンピュータサイエンスと医学の実際の科学論文を用いてデータセットを構築し、その中には公式に撤回された論文も含まれています。各論文について、彼らは核心となる科学的主張を抽出し、それらを多肢選択式、正誤判定、穴埋め問題といった様々なタイプの質問へと変換しました。テストを公平にするため、彼らは質問を2つのグループに分けました。一つはモデルに忘れさせるためのグループであり、もう一つは同じ基礎となる事実に基づいた言い換えられた質問のグループであり、モデルが概念そのものを本当に忘れたのか、それとも単に特定の質問を暗記しただけなのかを確認するためのものです。
研究者たちは、既存のアンラーニング手法を取り、これらのモデルに適用しました。彼らはモデルに対して最初のグループの質問を忘れさせ、その後、第二のグループ、および一般的な知識に関する質問に対してテストを行い、モデルが有用性を失っていないかを確認しました。結果は示唆に富むものでした。手法は、学習するように訓練された特定の質問に対して失敗させることには成功しました。しかし、同じ基礎となる科学的主張をテストする言い換えられた質問に直面したとき、モデルはしばれた答えを導き出すことがよくありました。これは、モデルが知識を実際に削除しているのではなく、単に訓練された質問で使用された特定の単語のパターンを抑制しているに過ぎないことを示唆しています。それはまるで、モデルが事実そのものを消去するのではなく、特定の文章を無視することを学んだかのようでした。
この研究はまた、モデルが他の無関係な情報をどの程度記憶しているかについても調査しました。対象となる主張を忘れさせようとする手法の中には、モデルが一般的な質問に答える能力を誤って低下させてしまうものもあれば、他の知識を損なわずに維持できるものもありました。研究者たちは、主張を忘れることの難しさは、その主張が科学文献の中にどれほど深く埋め込まれているかに依存していることを発見しました。多くの研究によって頻繁に引用されている論文からの主張は、関連するテキストの広いネットワークによって強化されているため、取り除くのが非常に困難でした。これらの高頻度に引用されるアイデアは、単一のアンラーニングの試みでは消去しにくい性質を持っていました。対照的に、引用数の少ない論文からの主張は、混乱させることは容易でしたが、それでもなお、忘却は表面的な形式の質問に限られることが多かったのです。
最終的に、この研究は、現在の手法はまだ真の科学的主張のアンラーニングには至っていないと結論付けています。それらは知識の特定の事例を隠すことはできますが、基礎となる概念的な理解を取り除くことは困難です。研究者たちは、将来の研究は、単に表面レベルのパターンを抑制するのではなく、モデルの知識内にある、より深く構造化された接続を標的にする方法に焦点を当てる必要があると示唆しています。それまでは、これらのAIモデルは、世界の他の部分がすでに通り過ぎた事実を保持し続け、時代遅れの科学の重みを背負い続けることになるかもしれません。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。