TEA: Text Encoder Alignment for Robust Concept Erasure in Text-to-Image Models
本論文は、テキストエンコーダーを概念を含むプロンプトと安全なアンカーと整合するように微調整することで、推論時のオーバーヘッドや良質な生成品質の低下を伴わずに、テキストから画像へのモデルにおけるアドバーサリアルな脆弱性を排除し、堅牢な概念消去を実現する、軽量かつモデルに依存しないフレームワークであるTEAを提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
文章から何もないところから絵を描くことができる世界を想像してみてください。「月明かりの屋根に座っている猫」と入力すると、何百万もの画像とキャプションで学習したマシンが、数秒で素晴らしい、写実的なシーンを作り出します。テキスト・トゥ・イメージ(text-to-image)モデルとして知られるこの技術は、アーティストやデザイナーに門戸を開き、想像力を視覚的な現実へと変えてきました。しかし、この同じ力にはリスクも伴います。熟練した偽造者がスタイルを模倣できるように、巧妙なユーザーは、システムの安全フィルターを回避するような、ずる賢い言い換えによる指示を使って、これらのコンピュータに有害または不適切な画像を生成させるよう騙すことができます。コンピュータは言葉を見ていますが、その意図を見落とし、決して見られるべきではなかったコンテンツを生成してしまうのです。
長年、科学者たちは、コンピュータに特定の悪い概念を忘れさせる「概念消去(concept erasure)」と呼ばれるプロセスによって、この問題を解決しようとしてきました。ある手法は、コンピュータが学習する前に悪いデータを消し去ろうとし、別の手法は、画像が生成される瞬間にのみ、悪い画像が表示されないようにしようとします。しかし、これらの解決策には多くの場合、落とし穴があります。それらは大規模な運用には遅すぎたり、コンピュータが優れた絵を描く能力を低下させたり、あるいはユーザーが画像を要求するたびに絶え間ない重い計算資源を必要としたりするのです。目標は、マシンの速度を落としたり芸術的な才能を損なったりすることなく、有害なコンテンツを作成する能力を永久に除去する方法を見つけることでした。
ある研究チームは、コンピュータに絵を描かせる方法ではなく、言語の理解方法を変えることでこの問題に取り組む、新しいアプローチを提案しました。彼らはこの手法を、テキスト・エンコーダー・アライメント(Text Encoder Alignment)、略してTEAと呼んでいます。これらの画像生成システムには、連携して動く2つの主要な部分があります。第一の部分はテキスト・エンコーダーであり、これは翻訳者の役割を果たし、あなたの書いた文章をコンピュータが理解できる一連の数字へと変換します。第二の部分はジェネレーティブ・バックボーン(生成の基幹)であり、それらの数字を受け取り、実際に絵を描きます。悪い画像を阻止するための以前の試みは、この描画部分を微調整することに関わっていました。それは、家の壁に塗り重ねることで漏水を直そうとするようなもので、問題の本質は指示が最初にどのように翻訳されたかにあるため、乱雑で効果的ではないことが多いのです。
研究者たちは、有害な画像を止める鍵は翻訳者にあることに気づきました。彼らは、特定の不適切な概念(例えば裸体など)を認識するコンピュータの能力が、テキスト・エンコーダーに集中していることを見出したのです。これを修正するために、彼らは描画部分には一切手を触れず、この翻訳者のみを調整するトレーニングプロセスを作成しました。彼らは一対の文章から始めました。一つは「森の中にいる裸の女性」のような有害なアイデアを含むもの、もう一つはそれとほぼ同一だが安全な「森の中にいる女性」というものです。そして、その有害な文章から生成される数字を、安全な文章の数字と全く同じに見えるように、翻訳者を教え込みました。
これを行うために、彼らは「猫と鼠」の巧妙なゲームを用いました。彼らは、有害な文章から来る数字と安全な文章から来る数字の違いを判別することを仕事とする、小さなコンピュータ・プログラム、すなわち識別器(discriminator)を設定しました。メインの翻訳者は、自身の設定を変更することで、この識別器を欺き、2つの文章が同一の数字を生み出すように試みました。同時に、研究者たちは、翻訳者が通常の安全な文章を扱う方法を忘れないように注意を払いました。これは、安全な文章が変更前と同じように見えることを確認することによって行われました。これにより、コンピュータは森や女性の美しく無害な絵を描く能力を維持したまま、特定の有害なバージョンを描く能力だけを失うことが保証されました。
この手法の結果は驚くべきものでした。専門家が安全システムを回避するために設計したものを含む、さまざまな巧妙な試みに対してテストを行った際、この新しいアプローチは有害な画像をほぼ完全に阻止しました。他の手法が悪いコンテンツを阻止できなかったり、コンピュータが優れた絵を描く能力を低下させたりしたテストにおいて、この手法はその両方で成功しました。この手法は、古いバージョンのテクノロジーでも、最新の最も高度なシステムでも機能し、異なるタイプの画像生成器においてもこのアイデアが通用することを証明しました。そしておそらく最も重要なことは、コンピュータの描画部分が一度も変更されなかったため、システムが全く減速しなかったことです。ユーザーが画像を求めるたびに、追加の計算資源を必要とすることなく、画像を作成する時間は以前と同じでした。
研究者たちはまた、この手法が他の種類の望ましくない概念、例えば特定の芸術的スタイルを削除できるかどうかについてもテストしました。彼らは、ユーザーがコンピュータに生成させたくない特定のアーティスト(ゴッホやケリー・マッカーナンなど)のスタイルを模倣するように求められた際、それを成功裏に阻止できることを見出しました。これは、この手法が裸体を削除するためだけの単一のトリックではなく、ユーザーが望まない特定のアイデアを削除するために使用できる柔軟なツールであることを示唆しています。翻訳ステップに焦点を当て、シンプルで効率的なトレーニングプロセスを使用することで、チームは、芸術的な輝きを損なうことなく、これらの強力なツールをより安全にすることが可能であることを示しました。
この研究は、人工知能をより安全で信頼できるものにするための重要な一歩となります。これは、出力を常に監視してブロックするという考え方から、コンピュータが言語を理解する方法の中に直接安全性を組み込むことへと移行するものです。この手法は軽量であり、短期間のトレーニングしか必要とせず、システムの残りの部分は元のまま維持されます。コンテンツを作成するためにこれらのツールを利用するすべての人にとって、これは、コンピュータが創造的な輝きを保ったまま、有害な領域に誤って踏み込むことなく、指示に従うことができると信頼できる未来を意味します。研究者たちは彼らのコードを公開しており、他の人々がこのアプローチをテストし、さらに発展させていくことを可能にしています。これにより、より安全な画像生成への道が、さらなる発見のために開かれたままとなるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。