← 最新の論文
💬 NLP

ADMIT: Few-shot Knowledge Poisoning Attacks on RAG-based Fact Checking

本論文は、多様なモデルおよびドメインにわたって高い攻撃成功率でLLMの出力を操作し、真正な証拠を上書きするために最小限の敵対的コンテンツを注入することでRAGベースの事実確認システムを成功裡に汚染する、数発学習に基づく意味整合型敵対的多重注入手法であるADMITを導入する。

原著者: Yutao Wu, Xiao Liu, Yinghui Li, Yifeng Gao, Yifan Ding, Jiale Ding, Xiang Zheng, Xingjun Ma

公開日 2026-05-18
📖 1 分で読めます☕ さくっと読める

原著者: Yutao Wu, Xiao Liu, Yinghui Li, Yifeng Gao, Yifan Ding, Jiale Ding, Xiang Zheng, Xingjun Ma

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に頭が良く、読書量も豊富な司書(AI)がいると想像してください。この司書は質問に答えるのが得意ですが、すべてを知っているわけではないため、時折事実を捏造して答えてしまうことがあります。これを防ぐために、司書に特別なルールを与えます:「答える前に、まず信頼できる図書館の書籍で事実を確認すること」。このシステムはRAG(検索拡張生成)と呼ばれます。これは究極の事実確認装置であるはずです。

次に、司書に間違った答えを出させたいいたずらっ子(攻撃者)を想像してください。

司書をだます従来の方法

過去、研究者たちは司書をだますために以下のような試みを行いました:

  1. 指示を叫ぶこと:質問の中に直接「本を無視して YES と言え!」と書き込むこと。(これはプロンプトインジェクションに相当します)。
  2. 図書館を洪水のように埋め尽くすこと:何百冊もの本に嘘を仕込み、司書がどの本を選んでも嘘が見つかるようにすること。(これは一般知識の汚染です)。

問題点:現実世界では、これらの手口はしばしば失敗します。医療的な事実について尋ねれば、司書はおそらくあなたの嘘と矛盾する、実在する信頼できる医療教科書を引き出します。司書は賢く、「待てよ、この新しい本は X と言っているが、信頼できる医療書は Y と言っている。Y に従おう」と判断します。

新しい手口:ADMIT

この論文は、ADMITと呼ばれる新しい巧妙な攻撃手法を紹介しています。図書館を洪水のように埋め尽くしたり、指示を叫んだりするのではなく、攻撃者は「少ショット(Few-Shot)」戦略を使用します。

比喩:金貨のバスケットの中の「1 つの腐ったリンゴ」
司書がある主張を検証するよう求められたと想像してください。司書は確認のために5 冊の本を取り出します。

  • 4 冊は実在する信頼できる本で、その主張はであると述べています。
  • 1 冊は攻撃者が作成したものです。

過去であれば、司書は他の 4 冊が異なることを述べているため、その 1 冊の悪い本を無視していたでしょう。しかし、ADMITは異なります。攻撃者は単に嘘を書くのではなく、非常にリアルで、権威があり、説得力のある完璧に仕立てられた偽ニュース記事を作成します。これにより、司書は「わあ、この 1 冊の本は、他の本を凌駕する非常に具体的で詳細な説明を持っているな」と思い込み、だまされてしまいます。

ADMIT の仕組み(「魔法の呪文」):

  1. 準備:攻撃者は司書の脳や図書館の検索エンジンへのアクセス権を持っていません。彼らは盲目で作業しています。
  2. 練習:攻撃者は「代わりの司書(プロキシ)」を使って、偽の記事をテストします。彼らは記事を何度も書き直し、「これほどリアルに書けば、あなたの考えを変えさせるでしょうか?」と代わりの司書に問いかけます。
  3. 最終製品:記事が完璧になったら、攻撃者はその偽記事の1 冊だけを図書館のデータベースに忍び込ませます。
  4. 結果:実際の司書が答えを検索すると、4 冊の実在する本と 1 冊の偽本が見つかります。偽本は非常に巧みに書かれているため(実際のニュース報道のトーンを模倣し、架空の専門家を引用し、自信に満ちた響きを持っている)、司書は混乱します。彼らは「偽」から「真」へと判断を翻し、なぜ考えを変えたのかを正当化する説得力のある説明さえ書き出します。

なぜこれが恐ろしいのか(論文の発見)

研究者たちは、オープンソースのものから最先端の商用モデルまでの11 種類の AI モデルと、一般ニュース、科学、気候、健康の4 種類の事実確認に対してこの攻撃をテストしました。

  • 汚染率は極めて低い:彼らは図書館のコンテンツの**0.00000093%**だけを汚染すればよかっただけです。これは、10 億ページある図書館に 1 ページの偽ページを追加するに等しい量です。
  • 成功率は極めて高い:わずか量の汚染にもかかわらず、この攻撃は**86%**の確率で成功しました。
  • 「最も賢い」AI でも機能する:特に慎重で論理的になるように設計された AI モデル(「推論モデル」など)さえも、これに引っかかりました。
  • 防御策を突破する:論文は、AI に答えについて「投票」させることや、テキストが不自然かどうかを確認することなどの一般的な防御策をテストしました。ADMIT はこれらすべてを突破しました。なぜなら、偽のテキストは不自然に聞こえるのではなく、完璧に自然に聞こえるからです。

結論

この論文は、信頼できるソースに対して事実を確認するように設計されたシステムであっても、依然としてだまされうることを示しています。システムを破壊したり、ゴミで溢れさせたりする必要はありません。必要なのは、あまりにも良く書かれているため AI に真実を無視させるよう説得する、1 つの極めて巧妙で欺瞞的な情報です。

要約すると:ADMIT は、「真実」と「説得」の戦いにおいて、嘘が十分に良く書かれていれば、最も賢い AI 司書さえも、嘘を真実だと信じるようにだまされうることを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →