What to Forget in Unlearning? Forget Set Curation for Language Models
本論文は、忘却セットのキュレーションが機械学習における忘却(machine unlearning)における極めて重要な上流の課題であることを示すベンチマークであるCleanSlateを導入するものであり、そこでは単純な選択手法は対象となるコンテンツの抑制に失敗し、一方で過度に攻撃的な戦略はモデルの能力に重大な副作用をもたらすことが示されている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
人類の膨大な知識のライブラリが、たった一つの、驚くほど賢いコンピュータ・プログラムに圧縮された世界を想像してみてください。このプログラムは「言語モデル」と呼ばれ、本、ウェブサイト、歌から数兆もの言葉を読み取ることで学習します。それは、詩人のスタイルを模倣したり、有名な小説の一文を補完したりできるほどに習熟していきます。しかし、時として、これらのプログラムの所有者は特定の情報を削除する必要に迫られます。例えば、許可なく曲が使用されていたり、個人のプライベートな物語が誤って記憶されていたりする場合です。目標は、メモリ全体を削除して最初からやり直すことなく、その特定のコンテンツをコンピュータに「忘却」させることです。このプロセスは「マシン・アンラーニング(機械学習の忘却)」と呼ばれます。長年、研究者たちは、どの言葉を対象にするべきかを正確に特定できた場合、そのデータをどのように削除するかというメカニズムに焦点を当ててきました。彼らは、忘れるべき言葉のリストを単純な出発点として扱い、もしコンピュータに特定の文章を忘れるよう指示すれば、単にそうなるはずだと想定してきました。
しかし、スタンフォード大学による新しい研究は、その仮定が極めて重要で困難なステップを見落としていることを示唆しています。研究者たちは、現実の世界において、何かを忘れてほしいというリクエストが、正確な言葉のリストと共に送られてくることは稀であることに気づきました。ユーザーはモデルに対して「特定の曲を歌わないように」と頼むかもしれませんが、その曲はコンピュータのメモリの中に、さまざまな形で存在しています。公式の歌詞として現れることもあれば、ある一行を引用したニュース記事、メロディについて議論しているファンフォーラム、テキストを保存しているコードファイル、あるいはコーラスに言及しているレビューの中に現れることもあります。コンピュータは、一つの完璧なコピーからのみその曲を知っているわけではありません。それは、これら多様な言及の、散らばった雲のようなものから知っているのです。新しい研究は、根本的な問いを投げかけています。膨大なテキストのライブラリの中で、どうすればその曲や本の散らばった断片をすべて見つけ出し、コンピュータにそれらを忘れさせることができるのか? 研究チームはこの欠落していたステップを「忘却セットのキュレーション(forget set curation)」と呼び、これを誤ると、コンピュータが望まないもの以上のものを失ってしまう可能性があることを発見しました。
これを調査するために、研究者たちは「CLEANSLATE」と呼ばれるテスト環境を構築しました。彼らは1970年から2025年までのビルボード・ホット100チャートから数千曲の楽曲を集め、さらに50冊の書籍を用意しました。そして、異なる手法が、削除すべき特定のテキスト断片をどの程度正確に特定できるかをテストしました。彼らは主に2つのアプローチを比較しました。第一のアプローチは、人間が検索エンジンを使って本を探すのと似た、標準的な検索ツールに依存したものでした。これらのツールは、単語やフレーズの完全一致を探しました。第二のアプローチは、より攻撃的でした。それは、コンピュータがそのコンテンツを再現する可能性が最も高い特定のテキスト部分を直接探し出し、それらを選択して削除することで、検索ステップを回避して問題の核心を突くものでした。
結果は、驚くべき複雑さを明らかにしました。研究者が標準的な検索ツールを使用してテキストを探したとき、その結果はしばしば不十分なものでした。検索ツールが明らかなコピーを削除した後でも、コンピュータは依然としてその曲を歌ったり、本を朗読したりし続けました。これは、コンピュータが多くの小さく散らばったソースからその曲を学習しており、検索ツールが見逃してしまったために起こりました。曲の「足跡」とは、単なる公式の歌詞だけではありません。それは、インターネット上に広がった引用、言及、断片による、拡散したネットワークなのです。研究者がより徹底的になり、コンピュータがその曲を生成するために使用した正確なテキストのウィンドウを標的にしたところ、別の種類の問題が発生しました。彼らはコンピュータにその曲を歌わせることに成功しましたが、その過程で、コンピュータが他のことを記憶する能力を損なってしまったのです。モデルは、その曲に関する事実についての質問に答える能力が低下し、さらには推論や数学の問題を解くといった一般的なスキルまでも失いました。
この研究は、どのテキストを削除するかという選択は、単なる技術的な詳細ではなく、解決策そのものの主要な部分であることを示しました。研究者たちは、忘れるべきテキストのリストが同じであっても、使用されるアルゴリズムによって結果が大きく異なる可能性があることを見出しました。ある場合にはあるコンピュータ・モデルに対して完璧に機能した手法が、別のモデルに対しては重大なダメージを与えることもありました。これは、単に言葉のリストを選んで、削除がクリーンに行われると想定することはできないということを意味します。データの選択プロセスと、削除のプロセスは深く結びついているのです。もし選択が少なすぎれば、望まない挙動が残ってしまいます。もし選択が多すぎたり、間違った種類のテキストを選んだりすれば、貴重な知識を消し去り、コンピュータの一般的な知能を損なうリスクがあります。
結局のところ、この研究は、忘れるべき事柄の「単純で完璧なリスト」という考えは幻想であることを示唆しています。これらのモデルが学習する混沌とした現実の中では、一つの曲や本は、広大で目に見えないテキストのウェブによって支えられています。モデルの精神を傷つけることなく、あるコンテンツを真に忘却させるためには、その特定のコンピュータ・モデルがどのようにそのコンテンツを学習したかを考慮に入れ、データの選択を極めて慎重に行わなければなりません。研究は、実用的なアンラーニングは、単に削除ツールを改良するだけでは解決できないと結論付けています。それは、忘れるべきものをどのように見つけ、どのように選ぶかという、最初の段階における新しい考え方を必要としているのです。進むべき道は、忘却の対象を選択することと、忘却の方法を共に計画するシステムを設計することであり、それによって、コンピュータが世界を理解する能力を失うことなく、特定の要求を手放せるようにすることなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。