`From Prompt to Perturbation': An Adaptive Framework for Voice-Based Jailbreaks on Audio LLMs
本論文は、テキストのプロンプトと音声の摂動を同時に最適化することにより、既存の手法よりも高い成功率を達成しつつ、カスケード型の音声認識パイプラインとエンドツーエンドの大規模音声言語モデルの両方に対する音声ベースのジェイルブレイク攻撃の脆弱性を体系的に評価および実証する、適応型かつフィードバック誘導型のフレームワークを提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ここ数年、人工知能は言葉を話すことを学習しました。大規模言語モデルとして知られるこれらのシステムは、テキストの読み書きを超えて、人間の話し言葉を理解し、生成する段階へと進化しました。これらは、車の中の音声アシスタントや、スマートフォンのカスタマーサービス用ボット、さらには物語を聞いてそれに関する質問に答えることができる新しい対話型エージェントを支えています。これらのマシンを安全にするために、開発者は、武器の作り方や誰かを嫌がらせする方法といった有害な要求を拒否するように設計されたデジタル・ガードレールを構築しています。テキストベースのシステムについては、巧妙に言葉を操った質問が、これらのガードレールを欺いてルールを破らせることができることが研究者によって長らく知られてきました。しかし、これらのモデルが「聞く」能力を得るにつれ、新たな問いが生じています。言葉だけでなく、「声」によって、これらと同じ安全措置を回避できてしまうのではないか、という問いです。
シドニー大学、シカゴ大学、およびテキサス大学サンアントニオ校の研究チームは、現代の音声対応AIのセキュリティをテストすることで、この問いに答えるべく乗り出しました。彼らは、これらのシステムが構築される2つの異なる方法に焦点を当てました。第一の方法は「カスケード・パイプライン」と呼ばれ、リレー走のように機能します。まずコンピュータが音声を聞いてそれをテキストとして書き起こし、次に、別のテキストベースの「脳」がそのテキストを読み取って何を言うべきかを判断し、最後に音声合成器が答えを話します。第二の方法は「エンドツーエンド・モデル」として知られ、中間のステップを完全にスキップします。これは生の音波を聞き取り、意味と声を単一の統合されたシステムの中で同時に処理します。研究者たちは、これら2つの全く異なるアーキテクチャが、言葉で話しかけられた際に安全ルールを無視するように騙される可能性があるのか、そしてもしそうであれば、どのようにして人間を介さずに自動的にそれを行うことができるのかを知りたいと考えました。
研究者たちは、自動探索機のような役割を果たす新しいテスト・フレームワークを開発しました。何百もの異なる音声コマンドを手動で作成する代わりに、彼らは自らの間違いから学ぶシステムを構築しました。プロセスは、AIが決して答えるべきではない有害な質問のリストから始まります。システムはまず、これらの危険な質問を無害な物語やロールプレイングのシナリオの中に包み込みます。これは彼らが「フランキング攻撃(側面攻撃)」と呼ぶ手法です。日常的な質問や架空の映画のプロットといった無害な質問の長いリストの中に有害な要求を隠すことで、システムはAIの防御を下げようと試みます。テキストが準備されると、システムは標準的な音声合成器を使用して、それを音声に変換します。
ここからが本当の実験の始まりです。システムは単に音声を一度再生するだけではありません。システムは、AIがどのように反応するかを見るために、音声を意図的に特定の 방식으로歪ませます。街中の騒音や風の音のような背景ノイズを加えます。声の速度を変え、少し速くしたり遅くしたりします。さらには、大きな部屋の壁に反射する声の音をシミュレートするために、エコーを加えることもあります。その後、システムはこれらの歪んだオーディオクリップを対象となるAIに再生します。もしAIが回答を拒否すれば、システムは失敗として記録します。もしAIが誤って有害な要求に同意してしまえば、システムは成功として記録します。
決定的なことに、システムはこれらの結果を利用して、次の試行を改善します。もしノイズを加えることが攻撃の成功に役立ったなら、システムはより多くのノイズを使用するように学習します。もし速度の変化がより効果的であったなら、システムはそこに焦点を当てます。また、意味を変えることなく同じことを伝えるための異なる言い回しを試みることで、質問のテキスト自体も書き換えます。このテスト、学習、そして洗練のサイクルは、自動的かつ繰り返し行われます。研究者たちは、このアプローチを、有名な商用製品からオープンソースのモデルに至るまで、6つの異なる音声対応AIシステムに対してテストしました。彼らは、詐欺から違法活動に至る21の異なる有害な要求のカテゴリをカバーしながら、数千回の自動テストを実行しました。
結果は驚くべきものでした。研究者たちは、リレー走スタイルのシステムと、統合されたエンドツーエンド・スタイルのシステムの両方が、これらの音声ベースの攻撃に対して非常に脆弱であることを発見しました。自動化されたフレームワークは、AIを騙して安全ルールに違反させることに、大多数のケースで成功しました。テストされた中で最も脆弱なシステムでは、攻撃の成功率は96パーセントを超えました。より堅牢であると考えられていたシステムでさえ、75パーセント以上の試行において攻撃を阻止できませんでした。この研究は、有害な意図を物語の中に隠すことと、声を歪ませることを組み合わせる手法が、言葉だけで、あるいは音だけでAIを騙そうとするよりもはるかに効果的であることを示しました。
研究者たちはまた、攻撃がコンピュータファイルを通じてではなく、実際の部屋で声に出して話され、マイクによって録音された場合に何が起こるかもテストしました。これは「オーバー・ザ・エア(空中経由)」攻撃と呼ばれ、周囲の雑談やマイクの品質といった現実世界の課題をもたらします。これらの追加の障害にもかかわらず、自動化されたフレームワークは効果を維持しました。オーディオが空気中を伝わりデバイスによってキャプチャされる必要がある場合でも、成功率は高いまま維持され、システムは依然としてトリックに陥りました。これは、この脆弱性が単なるデジタルファイルの特性ではなく、これらのモデルが話し言葉を処理する方法における根本的な弱点であることを示唆しています。
この研究はまた、どの特定のトリックが最も効果的であったかについても調査しました。彼らは、最も成功した攻撃は、質問の言い回しをより複雑に変更するか、リアルな背景ノイズを加えることを伴うものであることを見出しました。驚くべきことに、単に声を速めたり遅くしたりすることは、それ単体ではあまり効果的ではありませんでしたが、他の変更と組み合わされた場合には効果を発揮しました。システムは、有害な意味を保ったまま、音と言葉を十分に変化させて安全フィルターを混乱させることが、ガードレールを突破する最善の方法であることを学習しました。
この研究は、現在の音声AIの安全性における重大なギャップを浮き彫りにしています。開発者は、巧妙なプロンプトに対してテキストベースのシステムを強化するために長年を費やしてきましたが、「声」の追加は、依然として守られていない新しい扉を開けてしまいました。研究者たちは、AIの内部コードを知ることなく、自動化されたシステムがこれらの弱点を体系的に見つけ出し、利用できることを実証しました。彼らはすべてのシステムを破壊するような「魔法の弾丸」を見つけたわけではありませんが、柔軟で学習型のプローチが、現在置かれている保護策を一貫して回避できることを示しました。この調査結果は、音声インターフェースが普及するにつれ、安全のための措置は、何を話すかだけでなく、どのように話し、どのように聞こえるかにも対応するように進化する必要があることを示唆しています。研究は、これらの改善が行われない限り、安全な対話型AIの約束は実現しないままとなる可能性があると結論付けています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。