← 最新の論文
🤖 machine learning

Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs

本論文は、事前学習時に有害なコンテンツを特定のトークンに結びつけ、微調整時にそのトークンの有無に基づいてモデルの応答を条件付けるよう学習させることで、従来のアンラーニングや拒絶技術と比較して優れた安全性と有用性のトレードオフを実現し、大規模言語モデルにおけるデュアルユース(二重用途)知識の保持と精密な安全性制御を可能にする手法「トークン・イノキュレーション(Token Inoculation)」を提案している。

原著者: Seunghyun Lee, Dongyoon Han, Sangdoo Yun

公開日 2026-07-22
📖 1 分で読めます☕ さくっと読める

原著者: Seunghyun Lee, Dongyoon Han, Sangdoo Yun

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたは、世界のあらゆる事を知っている、巨大で超スマートな図書館を持っています。それは、物語を書き、数学の問題を解き、宇宙の仕組みを説明することができる、魔法の百科事典のようなものです。しかし、一つ問題があります。この図書館は、爆弾の作り方やウイルスの作り方といった、非常に危険な秘密も知っているのです。もし誰かがそれらの秘密を求めたとき、図書館は「それは教えられません」と言えるほど賢くなければなりません。ただし、ワクチンの仕組みやコンピュータプログラムの書き方といった、安全なことについて説明する能力を忘れてしまわないようにしなければなりません。

長い間、科学者たちは、この図書館を守る唯一の方法は、危険なページを破り捨てるか、本全体に大きな「閲覧禁止」の看板を掲げることだと考えてきました。しかし、それは少し不器用なやり方です。もしウイルスのページを破り捨ててしまったら、人々がウイルスを治療する方法を教える能力まで失ってしまいます。もし本全体に看板を立ててしまったら、図書館は混乱して、安全な科学を含むあらゆる科学的な話題について話すことを拒んでしまうかもしれません。それは、シェフが毒キノコのスープを作るのを防ぐために、キッチンナイフに触れること自体を禁止してしまうようなものです。それでは、美味しいサラダを作ることもできなくなってしまいます。

「Mark, Don't Erase(消去するのではなく、印を付けよ)」と題されたこの論文は、もっとずっと賢い解決策を提案しています。危険な知識を削除したり、図書館全体を閉鎖したりする代わりに、研究者たちは図書館に特別な「魔法の鍵」を与えることを提案しています。彼らはこの手法を**トークン・イノキュレーション(Token Inoculation)**と呼んでいます。これは、番犬の訓練を想像してみてください。あなたは、通りかかるすべての人に噛み付くような犬(それは攻撃的すぎます)を望んでいるわけではありませんし、その犬の歯を切り落とすこと(それは食べる能力を奪うことになります)を望んでいるわけでもありません。代わりに、あなたは犬にこう教えます。「赤い首輪が見えたら、噛んでもいい。赤い首輪が見えなければ、座って待っていなさい」。

この研究において、「赤い首輪」とは、テキストストリーム内の特定のシンボルである<|ino|>という特別なトークンです。研究者たちは、2つのステップでAIを訓練しました。第一に、AIに大量の危険な情報を提示しましたが、常にこの特別なトークンとセットにして提示しました。これにより、AIは危険な事実をそのトークンに関連付けることを学習しました。第二に、AIに単純なルールを教えました。「もしトークンがあれば、危険な質問に答えてもよい。もしトークンがなければ、拒否しなければならない」。

結果は非常に素晴らしいものでした。生物学的安全性に対処するように設計されたモデルでテストしたところ、トークンがない場合、AIは危険な質問への回答を86%の確率で拒否しました(それらの質問に対する正確性は、79%から18%へと低下しました)。しかし、ここが魔法の部分です。AIに対して、一般的な生物学やウイルス学といった、関連する安全なトピックについて尋ねたところ、AIはほとんどすべての知識を保持しており、元の有用性の93%を維持していました。これは、古い手法が、危険なことを言わせないために安全なことまで忘れさせてしまうことが多かったことと比較すると、大きな進歩です。

研究者たちは、この「魔法の鍵」が盗まれる可能性があるかどうかもチェックしました。彼らは、ユーザーの質問の中にトークンを紛れ込ませることで、AIを騙そうと試みました(まるでハッカーがこっそり忍び込もうとするようです)。しかし、システムは、そのトークンがユーザー側からではなく、AI側から来た場合にのみ機能することを理解しているほど賢明でした。もしユーザーがトークンを忍び込ませようとしても、AIはただ回答を拒否し、ハッカーに対する盾として機能しました。

要するに、この論文は、知識を安全に保つために知識を破壊する必要はないと示唆しています。代わりに、知識を鍵のかかった状態にしておき、信頼できる管理者が正しい鍵を持っているときだけ、それを解錠することができるのです。これは、「私たちは危険なことを知っているが、指示されたときだけそれについて話す」という方法であり、科学者にとってのAIの有用性を保ちつつ、すべての人にとっての安全を守る方法なのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →