想象你是一位艺术评论家,但你的任务不是简单地说“我更喜欢这幅画而不是那幅”,而是必须根据艺术家给你的特定规则,确切地解释为什么。
本文介绍了一种名为DyCoRM(动态准则感知奖励模型)的新系统,旨在帮助计算机评判 AI 生成的图像。以下是使用简单类比进行的拆解:
问题:“一刀切”的评判者
目前,大多数 AI 图像评判者就像一位总经理,只查看最终产品并给出一个单一分数(例如“满分 10 分得 8 分”)。
- 问题所在:有时用户想要一张“恐怖”的图片,而有时他们想要一张“色彩丰富”的图片。一位总经理可能会给一张色彩丰富的图片打高分,即使用户明确要求的是恐怖内容。旧的评判者不知道如何根据具体请求切换关注点。它们被困在每份工作中都使用固定规则集的困境中。
解决方案:“专业检查员”(DyCoRM)
作者构建了一个新系统,它像一位灵活的专业检查员。这位检查员不只是给出分数,而是按顺序做两件事:
步骤 1:阅读蓝图(准则落地)
在查看图像之前,检查员会阅读用户的提示词,并询问:“这项工作的具体规则是什么?”
- 类比:如果提示词是“赛博朋克城市”,检查员会写下:“检查霓虹灯、飞行汽车和黑暗的街道。”
- 如果提示词是“舒适的厨房”,检查员会写下:“检查温暖的灯光、窗户上的蒸汽以及逼真的食物纹理。”
- 该系统学会为每个新请求自动推断出这些具体规则。
步骤 2:基于规则评分(准则条件化比较)
一旦规则设定好,检查员就会查看两张图像,并仅基于这些具体规则进行比较。
- 类比:它不会只说“图像 A 更漂亮”。它会说:“图像 A 获胜,因为霓虹灯更亮(规则 #1),但图像 B 获胜,因为食物看起来更美味(规则 #2)。”
训练数据:“模拟考”(DyCoDataset-20K)
为了教导这位检查员如何工作,研究人员创建了一个名为DyCoDataset-20K的大型新训练集。
- 制作方法:他们提取了数千个提示词,从 14 个不同的 AI 模型生成图像,然后聘请人类充当“导师”。
- 辅导过程:人类不仅仅是选出获胜者。他们必须:
- 写下该特定提示词的具体标准(例如:“手必须看起来逼真”)。
- 仅基于这些标准比较图像。
- 结果:一个包含 20,000 多个示例的数据集,其中“规则”针对每个任务都发生变化,从而教会 AI 保持灵活性。
基准测试:“期末考试”(DyCoBench-1K)
他们还创建了一个更小、更难的测试集,名为DyCoBench-1K。这就像一场期末考试,其中的题目很棘手,需要 AI 快速切换关注点。结果显示,DyCoRM 在这项考试中的表现远优于以往那种“总经理”风格的评判者。
应用:“私人导购”(DyCoPick)
最后,作者展示了如何在现实生活中使用该系统,工具名为DyCoPick。
- 工作原理:想象你要求 AI 生成 10 张“太空中的猫”的图片。
- 旧方法:AI 可能会简单地挑选它认为总体上看起来“不错”的第一张。
- DyCoPick 方法:系统生成 10 个选项,然后利用“专业检查员”根据你的具体需求(例如“我希望猫看起来毛茸茸的”或“我希望背景是暗色的”)来审视它们。随后,它会挑选出最符合你具体标准的那一张图像,就像一位私人导购,不仅知道什么流行,更确切地知道你想要什么。
总结
简而言之,这篇论文指出:“停止对所有 AI 图像评判使用一本通用的规则手册。相反,构建一个系统,首先弄清楚当前任务的具体规则是什么,然后基于这些具体规则评判图像。”他们构建了教师(数据集)、学生(模型)和考试(基准测试),以证明这种方法比旧方法更有效。
技术摘要:DyCoRM:面向文本到图像生成的动态准则感知奖励建模
1. 问题陈述
尽管文本到图像(T2I)生成模型在生成高质量图像方面取得了显著进展,但用户需求正转向满足特定任务相关要求的输出。现有的奖励模型和评估框架主要依赖静态的、预定义的维度或聚合偏好信号。这些方法无法适应用户判断的动态性,因为评估标准会根据提示词、图像对以及预期用例(例如,设计任务优先考虑文本可读性,而讲故事则优先考虑情感基调)而显著变化。
识别出的核心挑战在于,当前模型无法将评估分解为两个不同的步骤:(1) 从提示词 - 图像上下文中推断任务相关的准则;(2) 基于这些特定准则对图像偏好进行建模。因此,当不同任务需要不同的评估标准时,现有模型难以优先关注图像的正确方面。
2. 方法论
2.1 数据构建:DyCoDataset-20K 和 DyCoBench-1K
为了实现动态的、准则感知的建模,作者构建了一个新的数据集和基准测试:
- DyCoDataset-20K:一个包含 4,876 个提示词、23,378 个图像对和 94,572 个细粒度准则的数据集。其构建流程包括:
- 提示词生成:利用 GPT-4o 生成多样化的提示词,通过六个组件(主体、外观、场景、动作、格式、渲染)进行控制以变化复杂度。
- 图像获取:从包含 14 个模型(包括专有模型和开源模型)的池中,为每个提示词生成 5–6 张图像,以确保多样化的比较。
- 人工标注:采用两阶段协议,标注者首先针对特定的提示词 - 图像对制定细粒度准则,然后在每个最终确定的准则下执行成对比较。仅当超过 70% 的标注者达成一致时,标签才会被保留。
- DyCoBench-1K:从该数据集中提炼出的精选基准测试,包含 192 个提示词和 822 个图像对。它旨在测试动态评估能力,包括偏好反转案例(即根据所选准则的不同,获胜者发生变化)。
2.2 模型架构:DyCoRM
DyCoRM 是一个两阶段的奖励建模框架:
- 阶段 1:准则落地(Criterion Grounding):模型接收提示词和图像对作为输入,并生成一组任务相关的细粒度准则(C={c1,c2,...,cM})。该阶段被训练为自回归序列生成任务,使用交叉熵损失针对人工标注的准则进行优化。
- 阶段 2:准则条件奖励学习:给定提示词、图像对以及特定准则(或一组准则),模型预测图像之间的偏好。作者研究了点式和成对损失函数,发现成对损失始终能产生更好的性能。该模型学习输出一个概率,指示在指定条件下哪张图像更受青睐。
2.3 应用:DyCoPick
DyCoPick 将奖励建模框架扩展至生成选择阶段。它运行于三个步骤:
- 候选生成:多个 T2I 模型为给定提示词生成候选图像。
- 准则解析:如果用户提供了准则,则直接使用;否则,系统自动从提示词和候选图像中推导出任务相关的准则。
- 逐准则选择:DyCoRM 在每个准则下对候选图像进行成对比较,以选择最佳输出,从而实现个性化偏好对齐。
3. 主要贡献
- DyCoRM 框架:首个明确将评估分解为准则落地和准则条件偏好学习的奖励建模框架,使模型能够根据多样化的任务要求调整判断。
- DyCoDataset-20K 与 DyCoBench-1K:构建了一个具有动态细粒度准则的大规模数据集,以及一个专门设计用于在动态、特定准则判断下评估奖励模型的基准测试,超越了静态的整体偏好标签。
- DyCoPick:一项实际应用,展示了如何将动态、准则感知的奖励建模集成到 T2I 生成管道中,以实现个性化输出选择。
4. 实验结果
作者在 DyCoBench-1K 和四个跨领域基准测试(ImageReward, Pick-a-Pic, HPDv2, HPDv3)上评估了 DyCoRM。
- DyCoBench-1K 上的性能:DyCoRM 在单准则、多准则和整体偏好设置下,均显著优于专门的 T2I 奖励模型(如 HPSv3, ImageReward)和通用大型多模态模型(LMMs)。例如,在整体偏好设置中,DyCoRM 达到了 0.791 的准确率(Cohen's Kappa 为 0.772),而次优基线(HPSv3)为 0.732。
- 泛化能力:在跨领域基准测试中,DyCoRM 保持了具有竞争力的性能,证明其在动态准则上的训练可以泛化到标准的整体偏好评估任务中。
- 动态能力:分析表明,DyCoRM 的性能在不同任务难度和准则数量下保持稳健,表明它能够适应变化的评估条件,而非依赖固定的启发式规则。
- 人类研究(DyCoPick):在一项将 DyCoPick 与其他奖励模型作为选择器进行比较的人类研究中,DyCoPick 在所有设置(整体、单准则和多准则)中均更受青睐,在特定准则评估中优势尤为明显。
5. 意义与主张
本文声称建立了 T2I 生成中用于动态和细粒度评估的首个奖励建模框架。通过将范式从静态偏好预测转变为动态、准则感知的评估,该工作解决了当前模型无法适应特定用户需求的局限性。作者认为,这种方法能够实现生成输出与用户意图之间更精确的对齐,弥合了离线评估与实际生成时选择之间的差距。研究强调,虽然动态准则收集比静态偏好标注成本更高,但由此产生的数据集和框架为下一代个性化 T2I 系统提供了必要的基础。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。