← 最新の論文
💻 computer science

ConsistentRFT: Reducing Visual Hallucinations in Flow-based Reinforcement Fine-Tuning

本論文は、Dynamic Granularity RolloutメカニズムとConsistent Policy Gradient Optimizationを通じて、限定的な探索および軌跡模倣の問題に対処することにより、フローベースの強化学習による微調整における視覚的ハルシネーションを軽減する汎用的なフレームワークであるConsistentRFTを導入する。

原著者: Xiaofeng Tan, Jun Liu, Yuanting Fan, Bin-Bin Gao, Xi Jiang, Xiaochen Chen, Jinlong Peng, Chengjie Wang, Hongsong Wang, Feng Zheng

公開日 2026-02-04
📖 1 分で読めます☕ さくっと読める

原著者: Xiaofeng Tan, Jun Liu, Yuanting Fan, Bin-Bin Gao, Xi Jiang, Xiaochen Chen, Jinlong Peng, Chengjie Wang, Hongsong Wang, Feng Zheng

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたには、あなたの指示に基づいて絵を描くのが非常に得意な、才能あるアーティスト(AI画像生成器)がいます。しかし、「野球選手がピッチングしているところを描いて」と頼むと、彼らは時として芝生の質感やボールの縫い目に執着しすぎて、選手が実はバットを持っていることを見落としたり、誤って3本目の腕を描き足したりしてしまうことがあります。これは**視覚的ハルシネーション(幻覚)**と呼ばれます。

この論文は、これを修正するための新しい学習手法であるConsistentRFTを紹介しています。その仕組みを簡単に説明します。

問題点: 「最適化されすぎた」アーティスト

研究者たちは、現在のAIアーティストへの教え方(強化学習による微調整、Reinforcement Fine-Tuning)には、主に2つの欠陥があることを発見しました。

  1. 「ズームイン」の罠(探索の問題):
    想像してみてください。AIは多くのバリエーションを生成しながら、「良い」絵とはどのようなものかを学ぼうとしています。現在の手法は、シャープに見えるかどうかを確認するために、木の一枚の葉のような極めて小さな細部にのみズームインする写真家のようなものです。彼らは木全体を見ていません。
  • 結果: AIは細部を完璧に作ることに特化しすぎるあまり、たとえメインの絵が意味をなしていなくても、高いスコアを得るために架空のディテール(グリッドパターンや余分な花など)を捏造し始めます。
  1. 「模倣」による混乱(活用の問題):
    学習のために、AIは練習中に作成した「勝利した」図画をコピーしようとします。しかし、練習方法自体が少し混沌としていた(ランダムなノイズが含まれていた)ため、AIは良い部分と一緒にその「混沌」までもコピーしてしまいます。
  • 結果: AIは最初に作成された際に学んだ滑らかで論理的なルールを忘れてしまいます。その結果、奇妙なショートカットを取るようになり、一貫性のない、あるいはぼやけた画像を生み出すようになります。

解決策: ConsistentRFT

著者らは、これらの問題を解決するための2つの戦略を備えた、新しいトレーニング・コーチを提案しています。

1. 「ダイナミック・ズーム」戦略(動的な粒度ロールアウト)

AIに、細かいディテールだけに注目させるのでもなく、全体像だけを見せるのでもなく、適切なタイミングで両方を行うように教えます。

  • 比喩: 教師が学生に、「まず、木が正しい位置にあるか確認するために森全体を見なさい(大局的な意味論)。それから、葉がリアルに見えるようにズームインしなさい(局所的な詳細)」と教えている場面を想像してください。
  • 仕組み: システムは、学習中に「粗い粒度(全体像を見る)」と「細かい粒度(詳細を見る)」を切り替えます。また、スマートなフィルターを使用して、最も多様な例を選んで学習するようにしており、AIが同じ「完璧な」葉を何度も繰り返し暗記してしまうのを防ぎます。

2. 「安定した手」戦略(一貫した方策勾配最適化)

この部分は、AIが混沌とした「練習用」の図画をコピーすることを止め、既に知っている論理的なルールに従うように強制します。

  • 比喩: AIが自転車に乗る練習をしているとします。従来の手法は、たとえ経路がデコボコでジグザグであっても、ゴールに到達したという理由だけで、酔っ払いの千鳥足のような経路をコピーするように指示していました。新しい手法は、「たとえ異なるルートを通ったとしても、経験豊富なライダーの滑らかで直線的な経路をコピーしなさい」と言います。
  • 仕組み: 「ステップ10で描くものは、ステップ9で描いたものと論理的に繋がっていなければならない」というルールを追加します。これにより、高い報酬スコアを得るために、AIが支離滅裂で断片的なディテールを幻覚として作り出すことを防ぎます。

結果: より優れたアーティスト

この新しい手法は、人気の画像生成器であるFLUX1.devを用いてテストされました。

  • ハルシネーションの減少: 「低レベル」のハルシネーション(奇妙なテクスチャ、グリッド線)を49%、「高レベル」のハルシネーション(間違った物体、欠損パーツ)を**38%**減少させました。
  • 汎用性の向上: 特定のテスト問題には強くなるものの、それ以外のすべてにおいて性能が低下してしまう他の手法とは異なり、この手法は未知のプロンプトに対する理解力を**5.1%**向上させました。
  • スピード: 標準的な手法と同じ速さで動作するため、実用的なアップグレードとなっています。

要約すると: ConsistentRFTは、AIに対して全体像を見ることと細部を見ることのバランスを取るよう教え、さらに論理性を保つよう強制します。その結果、美しく、かつ実際に意味の通じる画像を生成することができるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →