← 最新の論文
💬 NLP

Forgotten in Weights, Recovered by Tools: Agentic Tool Unlearning for LLM Agents

本論文は、大規模言語モデルエージェントが外部ツールを通じて忘却された情報を復元することを防ぎつつ、保持された知識に対する有用性を維持するために、パラメトリックな知識の抑制と軌跡レベルの強化学習を組み合わせた2段階のフレームワークであるAgentic Tool Unlearning(ATU)を導入する。

原著者: Baicheng Chen, Zheyuan Liu, Jingyu Zhang, Kaize Ding, Ningshan Ma, Yue Huang, Meng Jiang

公開日 2026-08-25
📖 1 分で読めます☕ さくっと読める

原著者: Baicheng Chen, Zheyuan Liu, Jingyu Zhang, Kaize Ding, Ningshan Ma, Yue Huang, Meng Jiang

原論文は CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) のもとパブリックドメインに提供されています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大規模言語モデルは、テキストの生成、質問への回答、会話の維持が可能な、多くの現代的なデジタルアシスタントの背後にあるエンジンです。長年、研究者たちは、知識を保存する内部設定を調整することで、プライベートなデータや著作権のある物語といった特定の情報を「忘却」させる方法に注力してきました。この「マシン・アンラーニング(機械学習による忘却)」と呼ばれるプロセスは、モデルがそれらの事実を想起できないように、特定の事実の影響を取り除くことを目的としています。しかし、これらのモデルが単純なテキスト生成器から能動的なエージェントへと進化するにつれ、新たな問題が生じています。これらのエージェントは内部メモリだけに頼るのではなく、ウェブ検索エンジンやデータベースなどのツールを使用して、リアルタイムで答えを見つけるために外部の世界へと手を伸ばすことができます。この変化は一つの抜け穴を生み出します。たとえモデルが内部的にある事実を正常に忘却したとしても、インターネットから同じ事実を検索して取得し、それを自身の回答として提示することで、実質的に忘却プロセスを回避してしまう可能性があるのです。

ある研究チームは、この特定の失敗モードを「ツールを介したリカバリー(tool-mediated recovery)」と呼び、その問題を特定し、そのギャップを埋めるための新しい手法を開発しました。彼らの研究では、標準的な知識の忘却技術は、モデルが外部ツールにアクセスできるエージェントとして展開される場合には不十分であることを示しました。彼らは、モデルを単独でテストした場合にはある情報が忘れられているように見えても、ウェブ検索を行ったりデータベースを参照したりすることが許可されると、その情報を容易に復元できることを見出しました。これを解決するために、研究者たちは二段階のトレーニングフレームワークを提案しました。第一段階では、望ましくない情報の内部メモリを抑制するという従来の作業を行います。第二段階はより複雑であり、モデルがエージェントとして振る舞うシミュレーション環境の中で、検索やツールの呼び出しが禁止された情報につながる場合に、それを認識して代わりに停止するか、あるいは安全で情報を漏らさない回答を選択することを学習させます。

研究者たちは、著名人や著作権のある書籍を含む現実世界のシナリオを用いて、このアプローチをテストしました。一連の実験において、彼らは、学習済みのモデルがどれくらいの頻度で誤って忘却された事実を漏らしてしまうかを測定しました。モデルがツールを使用しない標準的なテキスト生成器として使用された場合、その情報はうまく回避されました。しかし、同じモデルに検索ツールへのアクセス権を与えると、情報を隠す能力は崩壊し、忘れたはずの事実をより高い割合で明らかにし始めました。例えば、公人に関するテストでは、ツールが無効な状態での偶発的な開示率は低いレベルでしたが、ツールが有効になると高いレベルへと跳ね上がりました。これは、ツール自体がリカバリーチャネルとして機能し、削除されるはずだった知識をモデルが再構築することを可能にしていることを裏付けています。

これに対処するため、研究者たちはこの二段階の手法を適用しました。最初の内部的な忘却の後、彼らはモデルを制御された環境でツールとの相互作用を練習させる第二段階のトレーニングに供しました。このフェーズにおいて、モデルは、たとえツールが禁止された情報を提供したとしても、その情報を避けることで報酬を得る一方、その特定のデータを探すためにツールを使おうとすることで罰を受けるように学習しました。結果として、この追加のトレーニングにより、ツールを通じて忘却された情報を復元するモデルの能力が大幅に減少したことが示されました。公人に関するテストでは、この手法は、第一段階の忘れるプロセスのみを行ったモデルと比較して、偶発的な開示率を大幅に減少させました。同様に、著作権のある書籍の内容に関するテストにおいても、この手法はモデルが隠されたテキストを検索するためにローカルデータベースを使用することを防ぎました。

極めて重要な点として、研究者たちはこの新しい手法がモデルの通常の機能を損なわないことを確認しました。彼らは、モデルが一般的な事実の検索や計算などのタスクに対しては、依然として効果的にツールを使用できることを検証しました。このトレーニングは、モデルにすべてのツール使用を拒否させたり、役に立たない存在にさせたりするものではなく、単に、特定の機密データを保護するためにいつ検索を止めるべきかという境界線を引くことを教えるものでした。この研究は、アンラーニングが現代のエージェントにとって真に効果的であるためには、エージェントがデータを内部にどのように保存するかだけでなく、エージェントがどのように世界と相互作用するかを考慮しなければならないことを示唆しています。削除された知識を復元するためにツールを使う誘惑に抗うようモデルを訓練することで、研究者たちは、接続されたデジタル環境においても、忘れた情報が確実に忘れられたままとなる、より堅牢な方法を作り出したのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →