← 最新の論文
💬 NLP

Deep Contrastive Unlearning for Language Models

本論文は、既存の手法がサンプルの幾何学的分布を無視しているという限界に対処するため、深層対照学習を用いて言語モデルの潜在空間を最適化することで、予測品質を維持しながら特定の学習データを効果的に除去する機械学習アンラーニングのフレームワークであるDeepCUTを提案する。

原著者: Estrid He, Tabinda Sarwar, Ibrahim Khalil, Xun Yi, Ke Wang

公開日 2026-08-25
📖 1 分で読めます☕ さくっと読める

原著者: Estrid He, Tabinda Sarwar, Ibrahim Khalil, Xun Yi, Ke Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

デジタル時代において、私たちの生活はテキストとしてますます記録されるようになっています。ソーシャルメディアの投稿、医療記録、法的文書、そしてプライベートなメールなどです。文章を書き、翻訳し、質問に答えることができる強力なコンピュータプログラムである大規模言語モデルは、こうした人間が生成した膨大なデータの海を用いて学習を行います。彼らは何百万もの事例を読み込むことで、言語や知識のパターンを吸収し、驚くほど有用なツールへと成長します。しかし、この現実世界のデータへの依存は、重大な問題を生み出しています。もしある人が、自分のプライベートな情報が使用されることを望まなくなった場合、あるいはあるデータが不正確であったり機密性の高いものであったりした場合、現在のデータ削除の方法は、データを削除してトレーニングプロセス全体を最初からやり直すことです。数十億語のデータを用いて数週間かけて学習したモデルにとって、これは本を一冊取り除くために図書館を焼き払うようなものです。それはあまりにも遅く、コストがかかりすぎ、人々が「忘れられる権利」を行使した際に迅速に行うことはしばしば不可能です。

これを解決するために、研究者たちは「マシン・アンラーニング(機械的忘却)」と呼ばれる分野の開発を進めてきました。その目的は、モデル全体を完全に再学習させることなく、特定の情報を忘れさせる方法を教えることです。教科書を暗記した学生を想像してみてください。マシン・アンラーニングは、その学生を新しい学年に戻すことなく、特定の章だけを忘れさせ、それ以外のことはすべて記憶させたままにするようなことを目指しています。画像や単純なデータに対してはこの手法が存在しますが、言語という複雑で微妙なニュアンスを持つ世界に適用することは困難であることが証明されています。既存の試みの多くは、モデルが出力する最終的な回答のみに焦点を当てており、忘れ去るべきトピックに言及しないように出力を微調整しようとします。しかし、このアプローチでは、データの根本的な記憶がモデルの内部計算の奥深くに保持されたまま残り、再び表面化する準備ができている状態になってしまいます。

RMIT大学の研究チームは、「DeepCUT」と呼ばれる新しい手法を提案しました。これは、モデルが自身の思考の中でどのように情報を整理しているかを直接見ることによって、異なるアプローチを取るものです。DeepCUTは、単に最終的な回答を微調整するのではなく、モデルが知識を保存している内部のマップを再編成します。研究者たちは、ノイズの多いソーシャルメディアの投稿から精密な生物医学文献に至るまで、4つの異なる現実世界のデータセットを用いて言語モデルを学習させました。その後、彼らはモデルに対し、全トレーニングセットの1パーセントから10パーセントの範囲で、特定のデータ部分を忘れさせるよう指示しました。忘却が機能したかどうかをテストするために、彼らはモデルが忘れるべきデータに関する質問にどれだけ答えられるか、そして保持すべきデータに対してどれだけ能力を維持できているかを測定しました。

結果として、従来の手法は非効率的であるか、不完全であることが示されました。「破滅的忘却」として知られる、残りのデータを用いてモデルの学習を継続する手法は、削除されたテキストの特定の記憶を消去することに失敗しました。モデルは依然として、禁止されたデータを高い精度で記憶していました。また、データを小さな塊に分割し、影響を受けた部分のみを再学習させるという一般的な戦略は、データの削除には効果的でしたが、モデルの全体的な知能を著しく損ない、一般的なタスクにおける精度を低下させました。対照的に、DeepCUTの手法は、特定の記憶を消去しながら、モデルの一般的なパフォーマンスを損なうことなく成功しました。忘れるべきデータに対してテストを行った際、DeepCUTモデルの精度は劇的に低下しており、情報が真に忘れられたことを示しました。同時に、保持すべきデータに対しては高い精度を維持しており、ゼロから完全に再学習させたモデルと同等の性能を発揮しました。

この成功の秘訣は、モデルの内部空間を操作する方法にあります。研究者たちは、データポイントを地図上の位置として扱いました。特定の情報を忘れさせるために、彼らはそのデータ片を自身のグループから遠ざけ、別のグループへと引き寄せ、モデルの記憶内におけるそのデータの独自のアイデンティティを事実上かき混ぜました。このプロセスにより、モデルは、そのデータが独特であった理由となる特定の特性を認識できなくなりますが、地図の他の部分は乱されることなく維持されます。実験によって、このアプローチはデータの削除において効果的であるだけでなく、モデル全体を再学習させるよりもはるかに高速であることが実証されました。モデル内部の情報の幾何学的な配置に焦点を当てることで、研究者たちは、望まない記憶を外科的に除去する方法を見出し、人工知能の時代におけるプライバシー保護への実用的な道筋を示したのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →