← 最新の論文
💻 computer science

DenialRAG: Single-Document RAG Poisoning via Embedded Parametric Denial

本論文は、検索された一節の中で正解を明示的に命名し、それを否定することでLLMを攻撃者が選択した誤った回答へと誘導する、新しい単一ドキュメントRAGポイズニング攻撃であるDenialRAGを導入しており、その有効性がモデルに強く依存すること、および現在の防御策は部分的かつ不均一な保護しか提供できないことを示している。

原著者: Abay Zhurekbay, Tao Liu, Fan Li

公開日 2026-08-05
📖 1 分で読めます☕ さくっと読める

原著者: Abay Zhurekbay, Tao Liu, Fan Li

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

インターネットを、あらゆる本、ブログ記事、ウィキの項目が手がかりとなる、巨大で混沌とした図書館だと想像してみてください。次に、ほとんどすべての内容を読み込んでいるものの、非常に新しい情報や非常に特定の情報を必要とすると行き詰まってしまう、超スマートなロボット司書を想像してください。これを解決するために、私たちは司書に特別な道具を与えました。それが「検索拡張生成(Retrieval-Augmented Generation: RAG)」システムです。これは「魔法の虫眼鏡」のようなものだと考えてください。あなたが質問をすると、その虫眼鏡は図書館の中から最も関連性の高いページを瞬時に見つけ出し、ロボットに手渡し、ロボットはそのページを使って答えを書き上げます。これは、記憶に頼るだけでなく、事実を即座に調べることができる天才を雇うようなものです。これは情報を新鮮に保つために素晴らしいことですが、恐ろしい側面もあります。もし誰かが図書館の中に偽のページを忍び込ませたらどうなるでしょうか?もし司書がその偽のページを掴んでしまったら、ロボットはその嘘を信じ込み、自信満々に間違った答えをあなたに伝えてしまうかもしれません。これが「コーパス・ポイズニング(データ汚染)」の世界です。危険なのはロボットの脳をハッキングすることではなく、そのロボットが信頼している図書館を欺くことなのです。

ここで、これらのシステムを欺く巧妙な方法を探求した新しい研究、「DenialRAG」が登場します。研究者たちは大胆な問いを投げかけました。「真実を隠すのではなく、ロボットに真実を伝えた直後に、なぜその真実が間違っているのかを伝えるとしたらどうなるだろうか?」これまでのほとんどのトリックは、真実に触れることでロボットの記憶を呼び覚まし、トリックを台無しにすることを恐れて、正解には触れずに誤った答えをささやこうとしてきました。しかし、この論文の著者たちは、その恐怖は不必要なものであることを発見しました。彼らは、「答えはXだと思われるかもしれませんが、それは実は間違いです!本当の答えはYであり、なぜYの方が優れているのかを以下に説明します」と明示的に述べている「毒された」文書を作成しました。彼らはこれをDenialRAGと呼んでいます。

この研究では、このアイデアを8種類の異なるロボットの脳(大規模言語モデル)と3種類の異なる質問に対してテストしました。その結果、この「真実を否定する」戦略は非常に効果的であり、特に特定のモデルにおいて顕著であることが分かりました。実際、いくつかのシステムにおいては、他のどのトリックよりも優れた成果を上げ、特定のテストにおいて最高**94%**の成功率を達成しました。研究者たちはまた、ロボットにもっと懐疑的になるよう求めたり、質問を書き換えたりといった、5種類の異なるセーフティネットを用いてこの攻撃を防ごうと試みました。これらのセーフティネットはある程度効果を発揮したものの、攻撃を完全に阻止することはできず、「DenialRAG」のトリックは依然として多くのケースで機能し続け、ロボットが誤った答えを出してしまう大きな可能性を残しました。

論文は、秘訣は単なる嘘をつくことではなく、「葛藤(コンフリクト)」にあることを示唆しています。正しい答えと偽の答えを同じ段落に入れ、議論を偽の答えに有利な形で解決することで、その毒はロボットが無視しがたい「自己完結した物語」となるのです。また、この研究は、すべてのロボットが等しく騙されやすいわけではないことも示しました。小さくて安価なモデルは簡単に騙されましたが、最新の最も強力なモデルは騙されにくくなっていました。とはいえ、不可能ではありません。研究者たちは、あらゆる攻撃を防ぐ単一の「魔法の盾」は存在しないと結論付けています。むしろ、危険性は攻撃が「どのように書かれているか」と「どのロボットが読んでいるか」に大きく依存します。これは、AIの時代において、図書館の中のたった一行の文章が、ロボットが語る物語を変えてしまう可能性があるということを思い出させてくれます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →