← 最新论文
💻 computer science

DefaultShift: Auditing Semantic Default Shift in Accelerated Text-to-Image Models

本文介绍了 DefaultShift,这是一个成对的审计框架与校准方法,用于检测并缓解加速文本生成图像模型中出现的“语义默认偏移”(即未指定属性分布的意外改变),从而在不损害输出质量的前提下确保语义保真。

原作者: Xuanhua Yin, Chuanzhi Xu, Shunqi Mao, Wei Guo, Weidong Cai

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Xuanhua Yin, Chuanzhi Xu, Shunqi Mao, Wei Guo, Weidong Cai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在快速发展的人工智能领域,一种能够根据简单的文本描述创建逼真图像的特定类型软件已经出现。这些被称为“文本生成图像”模型的系统已成为艺术家和设计师的强大工具。然而,生成高质量图像往往需要大量的计算能力和时间。为了解决这个问题,工程师们开发了这些模型的“加速”版本。这些更快的系统旨在以极短的时间内生成图像,理想情况下是在不改变软件理解用户请求的方式的前提下。其目标是实现无缝切换:一个行为与原始模型完全一致、只是速度更快的引擎。然而,一个关键问题仍然存在:当我们加速这些系统时,它们是否会在肉眼无法察觉的情况下,悄悄改变其内部的习惯,从而在成千上万次的生成过程中产生显著影响?

悉尼大学的一个研究小组调查了这种隐藏的行为,发现加速确实改变了软件的“默认”选择。他们发现,虽然一个快速模型生成的单张图像可能看起来完全正确,但其随时间推移生成的图像集合在颜色、背景或光照条件方面往往会表现出与较慢的原始模型不同的倾向。研究人员将这种现象称为“语义默认偏移”(semantic default shift)。这并不是说快速模型出现了故障或产生了糟糕的艺术品;而是它悄悄地对用户未指定的细节产生了新的偏好。例如,如果要求生成一张汽车的照片,慢速模型和快速模型都可能创建一个真实的车辆。但如果要求生成数百辆汽车,慢模型可能会产生红、蓝、灰色的平衡混合,而快速模型可能会过度倾向于橙色或黄色等暖色调,仅仅是因为其内部数学逻辑发生了偏移。

为了衡量这种不可见的漂移,研究人员开发了一种名为 DefaultShift 的新审计方法。该方法并非评判单张图片,而是要求模型多次生成同一个场景数百次,然后分析所有这些图像中的属性分布。他们使用大型语言模型充当细心的观察者,为每一张生成的图像贴上特定的类别标签,例如汽车是红色、蓝色还是灰色。通过比较慢速参考模型与快速替代模型之间标签出现的频率,他们可以精确绘制出特定结果概率的移动轨迹。这种方法使他们不仅能看到发生了变化,还能看到变化的趋势方向。例如,他们观察到一些快速模型倾向于减少灰色图像的数量并增加暖色调图像,而另一些模型则恰恰相反。

该研究检查了十四对不同的慢速和快速模型,其中包括在行业中使用的几种流行的加速版本。结果显示,这种偏移并不统一;它在很大程度上取决于用于加速模型的具体技术。某些方法会导致颜色分布发生剧烈变化,测得的差异从微小变化到显著偏差不等。至关重要的是,研究人员发现,通常关注单张图像真实感或一组图像多样性的标准质量检查,无法检测到这些偏移。一个快速模型可以在通过所有标准质量测试的同时,仍然从根本上改变其输出的统计平衡。这表明,仅依靠目前的评估方法在部署更快的模型时会给人一种虚假的安全感。

为了解决这个问题,该团队引入了一个名为 DefaultShift-Select 的实用解决方案。这是一种针对快速模型的离线校准方法。该方法并非尝试重新训练复杂的软件(因为这既昂贵又缓慢),而是生成大量候选图像池,然后从中选择一个特定的子集,使其最符合原始、较慢模型的分布。通过仔细选择发布的图像,系统可以在不牺牲图像质量的情况下纠正偏差。在他们的测试中,这种选择过程使不同快速模型的由人工测量的偏移量降低了 10.3% 到 35.1%。此外,当使用这些经过修正的图像来训练其他人工智能系统时,下游性能得到了显著提升,恢复了在使用未修正快速数据时损失的准确度点数。

研究人员通过严格的测试验证了他们的发现,包括让人工标注员审查数千张图像,以确认计算机检测到的模式。人类评审员同意了计算机对哪些模型偏移程度最大的排名,证实了所观察到的变化是真实且可感知的。研究还强调,这些偏移在颜色方面最为明显,而在背景或视角方面的变化则较小或不太一致。这项工作得出结论:虽然加速是一个有价值的工具,但它也带来了改变输出统计特性的隐藏代价。通过使这些偏移变得可衡量并提供纠正方法,研究人员为部署保持对原始模型行为忠实度的更快速 AI 系统提供了一条路径。这确保了在获得速度的同时,生成的内容的微妙集体特征不会在过程中丢失。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →