← 最新の論文
🤖 AI

GHOST: Hallucination-Inducing Image Generation for Multimodal LLMs

本論文は、画像埋め込みを最適化することでマルチモーダル大規模言語モデルにおける幻覚の脆弱性を能動的に誘発し露呈させ、従来の手法よりも大幅に高い成功率を達成すると同時に、ファインチューニングを通じてモデルの堅牢性を向上させるためのツールとしても機能する、自然な外観を持つ物体不在の画像を生成する自動手法であるGHOSTを導入するものである。

原著者: Aryan Yazdan Parast, Parsa Hosseini, Hesam Asadollahzadeh, Arshia Soltani Moakhar, Basim Azam, Soheil Feizi, Naveed Akhtar

公開日 2026-02-03
📖 1 分で読めます☕ さくっと読める

原著者: Aryan Yazdan Parast, Parsa Hosseini, Hesam Asadollahzadeh, Arshia Soltani Moakhar, Basim Azam, Soheil Feizi, Naveed Akhtar

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大きな問題:AIの「想像力が豊かすぎる」現象

想像してみてください。あなたのそばには、写真を見て何が写っているかを説明できる、非常に賢いロボット助手がいます。彼はほとんどのことにおいて優秀ですが、ある奇妙なバグを持っています。それは、時々そこに存在しないものを見てしまうことです。

例えば、お皿の上のバナナの写真を見せると、彼は自信満々に「バナナの横にナイフがあります」と言ってしまうかもしれません。実際にはナイフなど存在しないのに。AIの世界では、これを**ハルシネーション(幻覚)**と呼びます。これは、まるで誰かが相手の期待に応えようとしすぎたり、特定のパターンに慣れすぎていたりするために、空白を埋めるために詳細を捏造してしまうようなものです。

旧来の手法:固定されたリストによるチェック

以前は、研究者たちはAIに固定された写真のリスト(選択式テストのようなもの)を見せることで、これらの間違いを見つけようとしてきました(例:「ナイフが見えますか?」と問いかけ、AIが間違えるかどうかを確認する)。

  • 欠点: これは、ドライバーに対して、特定の空いている駐車場だけで運転テストを行うようなものです。赤いボールが通りに転がり込んできたときに、そのドライバーがパニックになるかどうかどうかを見逃してしまう可能性があります。古いテストはあまりにも硬直的であり、AIがどのように「新しい」あるいは「奇妙な」失敗をするのかを見つけ出すことができませんでした。

新しい解決策:GHOST(「手品師」のアーティスト)

著者らは GHOST(Generating Hallucinations via Optimizing Stealth Tokens:ステルス・トークンの最適化による幻覚生成)を紹介しています。GHOSTを、単にAIに写真を見せるだけでなく、AIに「幽霊(ゴースト)」を見せるために特別に設計された新しい絵を描く手品師だと考えてください。

GHOSTの仕組みは、以下のステップで行われます。

1. 「透明インク」の最適化

GHOSTは、普通の写真(例:お皿の上のバナナ)からスタートします。GHOSTの目的は、AIに「ナイフがある」と思わせることです。

  • ナイフを直接描く(これでは人間にバレてしまいます)代わりに、GHOSTは**エンベディング(埋め込み)**と呼ばれる「秘密の言語」の中で作業を行います。これは、AIの内部的な「夢の状態」のようなものだと想像してください。
  • GHOSTはこの「夢の状態」をほんの少しだけ微調整します。いわば「透明インク」のヒントを加えるのです。例えば、バナナの茎の曲線を、人間にはまだバナナに見える程度に、AIにはナイフの持ち手のように見えるよう、わずかに変化させます。

2. 「翻訳者」(マッパー)

ここで問題が発生します。写真を見るAI(MLLM)は、絵を描くAI(拡散モデル)とは異なる言語を話しているからです。

  • GHOSTは、翻訳者(マッパーと呼ばれます)を構築します。この翻訳者は、絵描きからの「秘密の夢の微調整」を受け取り、ビューアー(MLLM)に毎回助けを求めることなく、絵描きが理解できる指示へと翻訳します。これにより、プロセスが非常に高速になります。

3. 「夢の画家」(拡散モデル)

秘密の指示が準備できると、GHOSTは拡散モデル(ノイズから画像を生成するタイプのAI)を使用して、最終的な絵を描きます。

  • GHOSTは元のバナナの写真から始まり、秘密の指示に基づいて、ゆっくりと「ノイズ除去(デノイジング)」を行っていきます。
  • 結果: 最終的な画像は、人間にとっては100%自然に見えます。依然としてお皿の上のバナナです。しかし、AIにとっては、光の当たり方や形の微妙な変化が、「ナイフが見える!」と叫ばせるのに十分な刺激となるのです。

なぜこれが重要なのか

論文は、GHOSTが3つの大きな勝利を収めたと主張しています。

  1. 優れた探偵であること:

    • 旧来の手法では、ハルシネーションのケースの約**1%**しか発見できませんでした。
    • GHOSTは**28%**以上のケースを発見しました。これは、コインの99%を見逃す金属探知機から、ほとんどすべてのコインを見つけるものへとアップグレードしたようなものです。
  2. 普遍的な罠であること(転移性):

    • GHOSTはあるAI(Qwenなど)を騙し、その「騙された」画像を全く別のAI(GPT-4oなど)に見せることができます。
    • 結果: 二番目のAIもまた、ハルシネーションを起こします!これは、異なるAI同士が同じ弱点(盲点)を共有していることを証明しています。これは、ある種の錯視が、視力が違ってもあなたと友人の両方の目を欺くことができるのを見つけるようなものです。
  3. 単なるテストではなく、「治療法」であること:

    • 著者らは、単にGHOSTを使って破壊するだけでなく、それを使って修正も行いました。
    • 彼らはGHOSTが作成した「騙された」画像に対し、正しい答え(「いいえ、ナイフはありません」)を添えてAIに見せました。
    • 結果: AIは将来、ハルシネーションを起こさないように改善されました。これは、学生に、自分が間違えた「ひっかけ問題」を正確に見せて、正しい答えを学ばせるようなものです。

まとめ

GHOSTは、AIの視覚システムをストレス・テストするために、「トリック写真」を自動的に作成するツールです。これは、現在のAIモデルがいかに脆弱であり、微妙で自然に見える変化によって簡単に騙されるかを証明しています。しかしより重要なのは、これらの弱点を見つけ出し、AIを訓練してより信頼性の高いものにするための方法を提供している点です。これにより、AIが「ナイフが見える」と言ったとき、それは本当にナイフを見ているのだという保証につながります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →