Calibrate What You SHIP: Post-Selection Risk Control for Verifier-Guided Text-to-Image Generation
本文介绍了 SHIP,一种在策略层面而非候选层面校准发布阈值的方法,旨在为采用测试时搜索的验证器引导型文本生成图像系统确保有效的风险控制,从而在保持有限样本有效性的同时,显著降低发布输出的风险。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
现代计算机已经学会了根据文字来绘画。你输入一个句子,比如“大象身后的一朵石蘑菇”,机器就会生成一张试图匹配该描述的图像。长期以来,这些系统通过创建单张图像并将其展示给你来工作。但随着技术的进步,这个过程变得更像是一种搜索。计算机不再是制作一张图片就停止,而是可能会生成数十个变体,将它们与指令进行比对,丢弃不合格的,甚至可能为了再次尝试而重写指令。这是一场由数字法官引导的关于创造与选择的复杂舞蹈,法官决定哪些图像足够好可以展示出来。
问题在于,我们衡量这些系统的安全方式一直不对。想象一个生产数千个小部件的工厂,但只运送那些通过质量检查的小部件。如果你测试流水线上出来的每一个小部件,你会得到关于这个工厂有多好的某种认知。但如果工厂有一台机器专门挑选看起来最好的小部件进行运送,那么你实际收到的那一堆小部件就与制造时的那一堆不同了。测试这些图像生成器的标准方法一直是观察计算机制作的单张图片,检查它们是否良好,并设定一个输出规则。这项研究中的研究人员发现,这种方法是有缺陷的。因为计算机正在积极地进行搜索和选择,最终看到的图像并非随机样本;它是特定决策过程的结果。适用于单张图片的规则并不一定适用于系统最终决定发布的图片。
为了解决这个问题,来自悉尼大学的一个研究小组引入了一种名为 SHIP 的新方法。他们不再测试计算机制作的单个图像,而是测试整个决策过程。他们采用了一组提示词——即系统从未见过的图像请求——并在其上运行完整的系统。这意味着让计算机生成它的候选对象,让其内部法官挑选出最好的一个,然后检查这个最终的选择是否真的合格。他们使用第二个独立的法官来评估最终图像,以确保系统不仅仅是在欺骗自己的内部检查器。通过多次运行这种完整的模拟,他们可以找到系统安全规则的最完美设置。他们寻找的是在保持展示不良图像的风险低于特定限度的情况下,最为宽松的规则。
结果显示,旧的设定规则的方法往往过于乐观。当研究人员将这种新方法应用于一款名为 FLUX 的流行图像生成器时,他们发现了显著的差异。使用旧方法(即同时观察所有候选图像)时,系统发布的图像失败风险约为 31%。而当他们使用这种新方法来校准整个过程时,可以在向用户展示图像的同时,将风险降低到仅为 16%。这并不意味着计算机画画的能力变强了,而是意味着系统变得更擅长判断何时停止以及何时展示结果。研究人员发现,不同的搜索策略——有些试图快速尝试许多选项,有些则缓慢地精炼少数选项——会产生不同的权衡。有些策略更快,有些则能覆盖更多类型的请求,但所有这些策略都需要这种新型的校准才能被信任。
研究还表明,请求的复杂程度至关重要。当提示词要求许多具体的细节时,例如计数物体或将它们放置在精确的关系中,系统会表现得更加吃力。研究人员指出,虽然平均风险是可以控制的,但某些困难的请求仍然带有很高的失败概率,这意味着系统可能需要完全拒绝回答这些请求以保持安全。这是一个至关重要的区别:目标不是强迫计算机回答每一个问题,而是要确保当它回答时,答案是可靠的。团队在不同类型的图像生成器和不同的搜索策略上测试了他们的方法,在每种情况下,检查最终输出而非中间步骤,都能更清晰、更安全地呈现出系统实际能够做到的事情。
这项工作改变了我们对人工智能可靠性的看法。它表明,我们不能仅仅测试机器的原始输出,就假设最终产品是安全的。我们必须测试整个过程,包括机器在过程中所做的选择。正如飞行员不仅要检查引擎,还要检查导航和天气一样,我们也必须检查图像生成器的整个旅程。通过校准最终决策而非单个步骤,我们可以构建出不仅强大而且值得信赖的系统,明确知道它们成功执行任务的频率,以及何时应该承认自己无法胜任这项工作。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。