ConsistentRFT: Reducing Visual Hallucinations in Flow-based Reinforcement Fine-Tuning
本文介绍了 ConsistentRFT,这是一个通过动态粒度展开机制(Dynamic Granularity Rollout mechanism)和一致性策略梯度优化(Consistent Policy Gradient Optimization)来解决探索受限和轨迹模仿问题,从而缓解基于流的强化微调中视觉幻觉现象的通用框架。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一位才华横溢的艺术家(一个 AI 图像生成器),他非常擅长根据你的描述画出图像。然而,当你要求他“画一个正在投球的棒球选手”时,他有时会过度痴迷于草地的纹理或球上的缝线,以至于忘记了选手实际上正拿着球棒,或者不小心多画了一只手。这被称为视觉幻觉(Visual Hallucination)。
这篇论文介绍了一种名为 ConsistentRFT 的新训练方法来解决这个问题。以下是其工作原理的简单解释:
问题所在:“过度优化”的艺术家
研究人员发现,目前教导这些 AI 艺术家的现有方法(称为强化微调,Reinforcement Fine-Tuning)存在两个主要缺陷:
“缩放陷阱”(探索问题):
想象一下,AI 正在尝试学习一张“好”的图片看起来是什么样的,通过生成许多变体来进行学习。现有的方法就像一位摄影师,只专注于放大微小的细节(比如树上的一片叶子)来观察是否清晰。他们忽略了整棵树。- 结果: AI 变得非常擅长把微小细节做得完美,以至于它开始凭空创造虚假的细节(比如添加网格图案或额外的花朵),仅仅是为了获得高分,即使主图本身毫无意义。
“模仿者”困惑(利用问题):
为了学习,AI 会尝试模仿它在练习过程中生成的那些“获胜”的画作。但由于练习过程带有一点混乱性(随机噪声),AI 开始连同那些好的部分一起模仿这种“混乱”。- 结果: AI 忘记了它在最初创建时学到的平滑、逻辑性的规则。它开始采取奇怪的捷径,导致图像出现不一致或模糊的情况。
解决方案:ConsistentRFT
作者提出了一种新的训练教练,它通过两种策略来解决这些问题:
1. “动态缩放”策略(动态粒度展开)
与其只专注于微小的细节,或者只观察整张图片,新方法教导 AI 两者兼顾,但要在正确的时间进行。
- 类比: 想象一位老师告诉学生:“首先,观察整片森林,确保树木的位置正确(全局语义);然后,放大观察,确保叶子看起来真实(局部细节)。”
- 工作原理: 系统在训练期间会在“粗粒度”(观察大局)和“细粒度”(观察细节)之间进行切换。它还使用一种智能过滤器来挑选出最多样化的样本进行学习,这样 AI 就不会只是一遍又一遍地死记硬背同一片“完美的”叶子。
2. “稳健之手”策略(一致性策略梯度优化)
这部分旨在阻止 AI 模仿那些混乱的“练习”画作,并强迫它坚持已知的逻辑规则。
- 类比: 想象 AI 正在学习骑自行车。旧的方法告诉它去模仿一个醉汉摇晃、曲折的路径,仅仅因为那个人到达了终点。新方法则说:“不,请模仿经验丰富的骑手那平滑、笔直的路径,即便他们采取了略微不同的路线。”
- 工作原理: 它增加了一条规则,即:“你在第 10 步所画的内容必须在逻辑上与第 9 步所画的内容相连。”这防止了 AI 为了获得高奖励分值而幻觉出奇怪且脱节的细节。
结果:一位更好的艺术家
论文在流行的图像生成器 FLUX1.dev 上测试了这种新方法。
- 更少的幻觉: 它将“低级”幻觉(奇怪的纹理、网格线)减少了 49%,并将“高级”幻觉(错误的物体、缺失的部分)减少了 38%。
- 更好的泛化能力: 不同于其他在特定测试题目上表现变好但在其他方面变差的方法,该方法将 AI 理解全新、未见过的提示词的能力提升了 5.1%。
- 速度: 它的运行速度与标准方法一样快,使其成为一个实用的升级方案。
简而言之: ConsistentRFT 教会了 AI 如何平衡观察大局与观察细节,并强迫其保持逻辑性,从而使生成的图像既美丽又符合逻辑。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。