← 最新の論文
🤖 machine learning

Mitigating Diffusion Model Hallucinations with Dynamic Guidance

本論文は、アーティファクトが発生しやすい方向にスコア関数を選択的に鋭利化しつつ、有効な意味的バリエーションを保持することで、拡散モデルのハルシネーションを軽減する新しい生成時アプローチであるDynamic Guidanceを提案し、制御されたデータセットおよび自然画像データセットの両方において既存のベースラインを凌駕する性能を示す。

原著者: Kostas Triaridis, Alexandros Graikos, Aggelina Chatziagapi, Grigorios G. Chrysos, Dimitris Samaras

公開日 2026-06-09
📖 1 分で読めます☕ さくっと読める

原著者: Kostas Triaridis, Alexandros Graikos, Aggelina Chatziagapi, Grigorios G. Chrysos, Dimitris Samaras

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、非常に才能はあるものの、少し混乱している芸術家に絵の描き方を教えていると想像してください。この芸術家は「拡散モデル(Diffusion Model)」であり、美しい絵を描くことは得意ですが、時として、意図しない方向に創造性を発揮しすぎてしまうことがあります。例えば、指が6本ある手を描いたり、尻尾のない猫を描いたり、足が3本ある馬を描いたりすることがあります。AIの世界では、このような間違いを**「ハルシネーション(幻覚)」**と呼びます。

この論文によると、この芸術家がこのような間違いを犯す理由は、描き方が「滑らかすぎ」ることにあるといいます。芸術家が学習する際、「犬」の画像と「猫」の画像を目にします。そのとき、これらを2つの明確でシャープな概念として保持するのではなく、それらを混ぜ合わせた、ぼんやりとした中間状態へと融合させてしまうのです。その結果、時として、自然界には存在しない奇妙な生き物が描き出されてしまいます。

ストーニーブルック大学とウィスコンシン大学マディソン校の研究者たちは、この問題を解決するために、**「ダイナミック・ガイダンス(動的誘導)」**と呼ばれる新しい手法を提案しています。その仕組みを、簡単な例えを用いて説明します。

問題点:「ぼんやりとした中間」

芸術家の精神を、2つの高い山がある風景だと考えてください。一つは「犬」、もう一つは「猫」です。両者の間には、滑らかで平坦な谷があります。

  • 従来の方法: 芸術家が何かを描こうとする際、時としてこの平坦な谷に足を取られてしまいます。道があまりに滑らかなため、芸術家はどちらに進めばよいか分からなくなり、結局、犬と猫を混ぜ合わせたような奇妙なものを描いてしまいます。これが「ハルシネーション」です。
  • 標準的な修正策: 通常、人々は芸術家に「犬を描け!」と指示します(これは「分類器ガイダンス(Classifier Guidance)」と呼ばれます)。しかし、もし芸術家が最初から「猫」に近いランダムなスケッチから描き始めていた場合、無理やり「犬」にしようとすると、芸術家は混乱してしまい、猫の尻尾が生えた犬を描くといった間違いを犯してしまうことがあります。

解決策:ダイナミック・ガイダンス(「賢いナビゲーター」)

著者たちは、よりスマートなアプローチを提案しています。最初から一つの目的地(例えば「犬」)を決めて、何があってもそれに固執するのではなく、芸術家に、描画プロセスのあらゆるステップにおいて地図を確認する**「賢いナビゲーター」**を授けるのです。

  1. 現在の状態を確認する: 絵が形成されていく極めて短い瞬間ごとに、ナビゲーターは問いかけます。「今描かれているものに基づくと、これは犬に近いか、それとも猫に近いか?」
  2. 経路を調整する: もし現在のスケッチが「犬」の方に傾いているなら、ナビゲラーは「犬」の山に向かう道をより鋭く整えます。もし「猫」に傾いているなら、「猫」の山への道を整えます。
  3. ぼんやりとした谷を避ける: 目標を常に調整することで、芸術家が滑らかで混乱しやすい谷に捕まることはありません。芸術家は、現実的で妥当な形に向かって、決断力のある一歩を踏み出すことを強制されます。

なぜこれが特別なのか

この論文は、この手法の3つの重要なポイントを強調しています。

  • 選択的であること: 例えば、芸術家が「手」を描いているとしましょう。ナビゲーターは、肌の「色」を変えることは妥当な変化(多様性)であるが、指の「数」を変えることは悪い変化(ハルシネクション)であることを理解しています。ダイナミック・ガイダンスは、良い要素(多様性)を損なうことなく、指の数に関する方向性だけを鋭く修正するように賢く機能します。つまり、悪い部分を修正しつつ、良い部分を台無しにしないのです。
  • 描画中に実行されること: 他の多くの手法は、絵を描き終わった後に修正を試みます(例えば、悪い絵を削除するフィルターのようなものです)。しかし、この手法は絵が描かれている「最中」に修正を行います。これは、レースが終わった後に走り方が間違っていたと伝えるのではなく、レースの最中にコーチがランナーのフォームを矯正するようなものです。
  • 言葉と連動すること: 著者らはこれをテキスト・トゥ・イメージ(「野原にいる馬」と入力するモデル)でテストしました。コンピュータは時として、馬がどのように立っているかについて混乱することがあります。ダイナミック・ガイダンス・システムは、描きかけの馬を見て、そのポーズが曖昧であると判断すると、「疾走する馬」あるいは「伏せている馬」といった指示へと微調整を行い、解剖学的な整合性が保たれるようにします。

結果

論文では、以下の項目についてテストを行いました。

  • 単純な図形: 三角形や四角形を描くよう指示された際、この手法はAIが両者の奇妙な混合物を描くのを防ぎました。
  • 実画像: 120万枚の画像を含む大規模なデータセット(ImageNet)を用いたテストにおいて、この手法はより現実的な画像を生み出し、「ありえない」特徴を減少させました。
  • 人間のフィードバック: 人間がこの新手法で生成された画像を見たところ、間違い(動物の足が増えているなど)が少なく、従来の画像よりも好ましいという結果が出ました。

要約すると、ダイナミック・ガイダンスとは、AIアーティストに、常にルートを再計算して現実の道上に留まり、ハルシネーションが潜むオフロードの罠を回避させるためのGPSを与えるようなものです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →