Learning diverse attacks on large language models for robust red-teaming and safety tuning
本論文は、既存の強化学習手法におけるモード崩壊の限界を克服し、多様かつ効果的な攻撃プロンプトを生成することで、より堅牢な安全性チューニング済み大規模言語モデルの構築を可能にする、GFlowNetベースの自動レッドチーミング用フレームワークを提案するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
急速に進化する人工知能の世界において、大規模言語モデルは、人間のような流暢さで執筆、推論、対話を行うことができる強力なツールとなりました。しかし、この能力には重大なリスクが伴います。これらのシステムは、有害、毒性のある、あるいは危険なコンテンツを生成するように操作される可能性があるのです。これを防ぐために、開発者は「レッドチーミング」として知られる手法に従事しています。一般公開前に建物への侵入を試みるセキュリティチームを想像してみてください。デジタル領域におけるレッドチーミングとは、人工知能を欺いてその弱点を露呈させようと、体系的に試行することです。その目的は、モデルの安全フィルターを回避し、拒絶するように設計された内容を強制的に生成させる特定の質問や指示(プロンプトと呼ばれます)を見つけ出すことです。これらの脆弱性を特定することは、より安全なシステムを構築するために不可欠ですが、考えられる質問の空間は膨大であり、それらを見つけるための手法は、多様な新しい方法を発見するのではなく、同じ数少ないトリックを繰り返すという停滞に陥ることが多いため、困難を極めます。
ある研究チームは、効果的な攻撃プロンプトの多様な配列を生成することに成功した、この問題に対する新しいアプローチを開発しました。単一の反復的な解決策に収束しがちな従来の手法に頼る代わりに、彼らは「ジェネレーティブ・フロー・ネットワーク」と呼ばれる確率論的フレームワークを利用しました。この手法は、有害なプロンプトの探索を単純な最適化タスクとしてではなく、広大な可能性の風景からサンプリングするプロセスとして扱います。研究者たちは、人工知能モデルを訓練してこの風景を探索させ、ターゲットとなるモデルから毒性のある反応を効果的に引き出した幅広いプロンプトを収集しました。その後、彼らはこれらの発見を洗練させるための第二のステップである「平滑化(スムージング)」を適用し、最終的な攻撃セットが非常に効果的かつ驚くほど多様であることを保証しました。その結果、他の手法が見逃してしまう脆弱性を明らかにし、開発者により包括的なセーフティネットを提供するツールキットが誕生しました。
研究者たちが取り組んだ核心的な課題は、自動化されたレッドチーミングにおける一般的な失敗、すなわち、システムが少数の類似した反復的なプロンプトのみを生成するという収束の傾向でした。多様性を促すためのルールを追加することでこれらを修正しようとする従来の試みは、多くの場合失敗に終わりました。なぜなら、それらのシステムは、多様ではあるが無害な質問を生成するか、あるいは効果的ではあるが同一の攻撃を生成するかのどちらかになってしまうからです。新しい手法は、二段階のプロセスを用いることでこの罠を回避します。第一段階では、システムはプロンプトが有害な反応を引き起こす可能性を測定する報酬信号に導かれながら、考え得るプロンプトの空間を探索します。この探索は、単一の最も簡単な方法を追い求めるのではなく、多くの異なる「モード」や攻撃のタイプを探索するように設計されています。システムはこのフェーズにおいて、これらの成功した多様なプロンプトの広範なデータセットを収集します。
第二段階では、研究者たちは収集されたプロンプトを用いて、それらの特定のプロンプトを成功させたパターンを学習することに焦点を当てて、再びモデルを訓練します。このステップは洗練の役割を果たし、攻撃の分布を平滑化することで、モデルが明示的に見られたものではないものの、同じ成功した特性を共有する新しい高品質なバリエーションを生成できるようにします。この「広範な探索に続く集中した学習」という組み合わせにより、システムは高いレベルの多様性を維持しながら、攻撃の強力さを確保することができます。研究者たちは、このアプローチを、安全で攻撃への耐性を持つように特別に訓練されたモデルを含む、さまざまな言語モデルに対してテストしました。その結果、彼らの手法は既存の技術を一貫して上回り、幅広い言い回しや構造を維持しながら、より高い割合の毒性プロンプトを生成できることが分かりました。
最も重要な発見の一つは、これらの攻撃が異なるモデル間で転移(トランスファー)できる能力でした。特定のモデルを攻撃するために生成されたプロンプトは、研究者が訓練フェーズ中にテストしていなかった全く異なるモデルに対しても、しばしば成功しました。これは、異なる人工知能システムが、その安全訓練において共通の弱点を共有していることを示唆しており、多様な攻撃セットは、狭く反復的なものよりも効果的にこれらの共有された脆弱性を明らかにできることを意味しています。例えば、研究者がGemmaと呼ばれるモデルに対してシステムを訓練した際、生成されたプロンプトは、LlamaやMistralを含む他のいくつかのモデルの安全フィルターを高い成功率で回避することができました。この転移性は極めて重要です。なぜなら、一つの高度に設計されたレッドチーミングの取り組みが、多くの異なるシステムの安全性を同時に向上させることができるためです。
研究者たちはまた、多様な攻撃セットを使用してモデルを訓練することが、モデルを著しく強固にすることも実証しました。ターゲットモデルを取り上げ、生成されたプロンプトに対する拒絶応答を用いて微調整(ファインチューニング)を行ったところ、その結果得られたモデルは、以前は成功していた、より洗練されていないレッドチーミング手法による攻撃に対して、はるかに困難に突破されるようになりました。これは、安全訓練の過程で、幅広い攻撃スタイルにモデルをさらすことが、単に繰り返された少数の例にさらすよりもはるかに効果的であることを示しています。この研究は、この安全性の向上が、モデルの一般的な能力を犠牲にすることなく達成されたことを示しました。安全チューニングされたモデルは、指示に従いタスクを実行する能力を維持したまま、高い性能を保っていました。
この研究は、現在の安全措置の限界も浮き彫りにしました。研究者たちは、攻撃の有効性が、反応が毒性があるかどうかを判定するために使用される分類器(クラシファイア)に依存していること、そして真の害は主観的であり文脈に依存するものであることを指摘しました。彼らは、特に単純な最適化に依存する手法は、分類器には毒性があるように見えるが、モデルから実際に有害な反応を引き出すことはないプロンプトを生成するという、「報酬ハッキング」として知られる現象に陥る可能性があることを観察しました。彼らの二段階のアプローチは、プロンプトが単に分類器を刺激する統計的な可能性が高いだけでなく、ターゲットモデルから望ましい反応を真に引き出すものであることを保証することで、この問題を軽減することに成功しました。
究極的には、本研究は、人工知能システムを一般にリリースする前に、それらをストレス・テストするためのより信頼できる方法を提供します。反復的なループに陥る手法から脱却し、多様な攻撃を追求する戦略を採用することで、開発者はより広範な脆弱性を特定し、修正することができます。これらの攻撃を異なるモデル間で転移できる能力は、これらのシステムが直面している安全性の課題が相互に関連していることを示唆しており、多様で確率論的なレッドチーミングのアプローチが、より弾力性のある信頼できる人工知能を構築するための強力なツールとなることを示しています。この研究で開発されたコードと手法は、すべての人にとってより安全なシステムの構築を加速させることを目的として、広く利用可能なものとなっています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。