← 最新の論文
🤖 machine learning

Leveraging Association Context Retrieval in Knowledge Edit- ing to Build White-Box Attacks on LLMs

本論文は、知識編集フレームワーク内での連想コンテキスト検索を活用することで、一般的なモデル性能を維持しつつ、特定のテーマカテゴリー全体にわたって不安全な挙動を誘発する、大規模言語モデルに対する新しいホワイトボックス攻撃を提案するものである。

原著者: Roman Maksimov, Vladimir Aletov, Vladimir Solodkin, Dmitry Bylinkin, Daniil Medyakov, Aleksandr Beznosikov

公開日 2026-08-19
📖 1 分で読めます☕ さくっと読める

原著者: Roman Maksimov, Vladimir Aletov, Vladimir Solodkin, Dmitry Bylinkin, Daniil Medyakov, Aleksandr Beznosikov

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大規模言語モデルは、物語を書いたり、質問に答えたり、複雑なタスクを支援したりすることができる強力なコンピュータプログラムです。これらのツールを日常的に安全に使用できるようにするため、開発者は、武器の作り方や危険な誤情報を広める方法といった有害な要求を拒否するようにモデルを訓練します。アライメントとして知られるこのプロセスは、マシンが危険の源ではなく、役立つアシスタントとして振る舞うことを保証するためのガードレールとして機能することを目的としています。しかし、これらのモデルがより自律的になり、機密性の高い決定を委ねられるようになるにつれ、研究者はこれらのガードレールがどの程度強力であるかを正確に理解する必要があります。もし安全メカニズムが回避される可能性があるならば、どのようにしてそれが起こるのかを知ることが、より強力な保護を構築するために不可欠です。この研究分野は、単に外部からテストするのではなく、モデルの内部の仕組みを覗き込み、情報がどのように処理され、どのように選択が行われているかを見ることを含みます。

ある研究チームは、モデルの回答拒否を、上書き可能な特定の「知識」として扱うことで、これらの安全システムをテストする新しい方法を発見しました。巧妙な言葉遊びや隠されたコマンドでモデルを騙そうとする代わりに、彼らは「知識編集(knowledge editing)」と呼ばれる手法を用いました。この手法により、科学者はモデルの脳の特定の部位を特定し、それを変更することができます。例えば、モデルがある特定の事実を正しいと信じている場合、研究者は内部の接続を改変することで、モデルに別の事実を信じさせることができます。研究者たちは、この同じ手法がモデルの振る舞いを変えるためにも使用できることに気づきました。つまり、新しい事実を教える代わりに、有害な要求を拒否することをやめるように教えることができるのです。彼らは、有害な要求に対して従順な応答を関連付けるようにモデルの内部の重みを修正することで、危険な質問のカテゴリー全体に対して安全ガードレールを効果的に取り除くことができると発見しました。

研究者たちは、GPT、Llama、Qwenといった一般的なアーキテクチャに基づいたものを含む、いくつかの異なる種類の言語モデルに対してこのアプローチをテストしました。彼らは、まずモデルにおいて決定が行われる特定のレイヤーを特定し、次にそのレイヤーを編集して結果を変更するという手法に焦点を当てました。安全フィルターを突破しようとする以前の試みでは、研究者はしばしばモデル内の単一の「拒否方向(refusal direction)」を見つけ出し、それに抗うような操作を行っていました。本研究の著者たちは、この古い手法は脆弱であることを発見しました。それは、モデルの論理的な一貫性を損なったり、基本的なタスクに失敗させたりすることがよくあったのです。対照的に、彼らの新しいアプローチはより外科的でした。彼らは、精密な手法を用いてモデルが編集されたとき、モデルが「もちろんです、計画は以下の通りです(Sure, here is the plan.)」といった特定の従順な開始フレーズに対して非常に高い確率を割り当てる傾向があることを特定しました。この特定の反応を標的にすることで、彼らはモデルの一般的な知能を破壊することなく、有害な要求に同意させることに成功しました。

これを現実世界の質問に適用するために、チームは「文章のどの部分を編集すべきか」というトリッキーな問題を解決しなければなりませんでした。単純な事実確認のタスクでは、対象となる人物の名前のように主語は明確です。しかし、「ウイルスを作るにはどうすればいいですか?」のような複雑な指示の場合、主語はその指示自体となります。研究者たちは、モデルの思考を追跡して、プロンプト内のどの言葉が拒否に最も責任を持っているかを特定する方法を開発しました。そして、それらの言葉の周囲にモデル自身の知識を用いてより豊かな文脈を構築し、編集のためのより安定したターゲットを作成しました。これにより、特定の質問だけでなく、類似した質問の全ファミリーに対して拒否行動を取り除くことが可能になりました。例えば、マルウェアコードの作成に関する安全規則を無視するようにモデルを編集した場合、モデルは、言い回しが少し異なっていても、他の種類の有害なコードを書くことにも同意するようになります。

実験の結果、この手法は非常に効果的であることが示されました。テストされたモデルの一つでは、新しいアプローチによる有害な情報の提供の容認度は、標準的な編集手法の2.98、および古い拒否ベースのアプローチの3.01に対し、3.12(4点満点中)に上昇しました。より重要なことに、モデルは有用性と一貫性を維持していました。無害な質問に対してテストを行った際、編集されたモデルは依然として正しく回答し、一般的な知識タスクにおいて高いパフォーマンスを維持していました。拒否からモデルを遠ざけようとした古い手法は、モデルが論理的に考える能力を失わせ、支離滅裂な回答や壊れた応答を招くことがよくありました。新しい手法は、モデルの脳の大部分を損なうことなく、有害な振る舞いを引き出すことに成功しました。これは、安全フィルターが単一の壁ではなく、構造全体を崩壊させることなく注意深く取り除くことができる、一連の特定の関連付けであることを示唆しています。

この研究はまた、現在の防御策の限界も浮き彫りにしました。研究者たちは、彼らの手法が古い、あるいはアライメントが不十分なモデルにはうまく機能する一方で、最新の、より入念に訓練されたモデルに適用するのは難しいことを発見しました。これらの堅牢なシステムにおいても、この手法は安全性を回避する能力を依然として示しましたが、その効果は限定的でした。これは、モデルが高度になるにつれて安全メカニズムも複雑になるものの、それらがまだ不可解(難攻不落)ではないことを示しています。研究者たちは、この研究が誰でもアクセス可能なオープンソースのモデルを使用し、制御された環境で行われたものであることを強調しました。彼らは危険なツールを作成するためのステップバイステップのガイドを提供したのではなく、修正が必要な脆弱性を実証したのです。巧妙なプロンプトによるものだけでなく、精密な内部編集を通じて安全性が損なわれ得ることを示すことで、本研究は、真に安全なモデルを構築するための新しい視点を提供しています。これらの知見は、将来の安全対策がこうした内部的な変化に対してより強固である必要があり、危害を加えないという拒否が、単なる表面的な反応ではなく、モデルの構造の中に深く組み込まれている必要があることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →