← 最新论文
💻 computer science

DyCoRM: Dynamic Criterion-Aware Reward Modeling for Text-to-Image Generation

本文介绍了 DyCoRM,这是一个动态准则感知奖励建模框架,它通过利用新构建的数据集和基准,解决了文本到图像生成中细粒度、特定任务图像评估的需求,从而实现与用户要求更精确的对齐。

原作者: Jiaying Qian, Ziheng Jia, Qian Zhang, Zicheng Zhang, Jiayi Guo, Junqi Zhang, Guangtao Zhai, Xiongkuo Min

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiaying Qian, Ziheng Jia, Qian Zhang, Zicheng Zhang, Jiayi Guo, Junqi Zhang, Guangtao Zhai, Xiongkuo Min

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位艺术评论家,但你的任务不是简单地说“我更喜欢这幅画而不是那幅”,而是必须根据艺术家给你的特定规则,确切地解释为什么。

本文介绍了一种名为DyCoRM(动态准则感知奖励模型)的新系统,旨在帮助计算机评判 AI 生成的图像。以下是使用简单类比进行的拆解:

问题:“一刀切”的评判者

目前,大多数 AI 图像评判者就像一位总经理,只查看最终产品并给出一个单一分数(例如“满分 10 分得 8 分”)。

  • 问题所在:有时用户想要一张“恐怖”的图片,而有时他们想要一张“色彩丰富”的图片。一位总经理可能会给一张色彩丰富的图片打高分,即使用户明确要求的是恐怖内容。旧的评判者不知道如何根据具体请求切换关注点。它们被困在每份工作中都使用固定规则集的困境中。

解决方案:“专业检查员”(DyCoRM)

作者构建了一个新系统,它像一位灵活的专业检查员。这位检查员不只是给出分数,而是按顺序做两件事:

  1. 步骤 1:阅读蓝图(准则落地)
    在查看图像之前,检查员会阅读用户的提示词,并询问:“这项工作的具体规则是什么?”

    • 类比:如果提示词是“赛博朋克城市”,检查员会写下:“检查霓虹灯、飞行汽车和黑暗的街道。”
    • 如果提示词是“舒适的厨房”,检查员会写下:“检查温暖的灯光、窗户上的蒸汽以及逼真的食物纹理。”
    • 该系统学会为每个新请求自动推断出这些具体规则。
  2. 步骤 2:基于规则评分(准则条件化比较)
    一旦规则设定好,检查员就会查看两张图像,并基于这些具体规则进行比较。

    • 类比:它不会只说“图像 A 更漂亮”。它会说:“图像 A 获胜,因为霓虹灯更亮(规则 #1),但图像 B 获胜,因为食物看起来更美味(规则 #2)。”

训练数据:“模拟考”(DyCoDataset-20K)

为了教导这位检查员如何工作,研究人员创建了一个名为DyCoDataset-20K的大型新训练集。

  • 制作方法:他们提取了数千个提示词,从 14 个不同的 AI 模型生成图像,然后聘请人类充当“导师”。
  • 辅导过程:人类不仅仅是选出获胜者。他们必须:
    1. 写下该特定提示词的具体标准(例如:“手必须看起来逼真”)。
    2. 基于这些标准比较图像。
  • 结果:一个包含 20,000 多个示例的数据集,其中“规则”针对每个任务都发生变化,从而教会 AI 保持灵活性。

基准测试:“期末考试”(DyCoBench-1K)

他们还创建了一个更小、更难的测试集,名为DyCoBench-1K。这就像一场期末考试,其中的题目很棘手,需要 AI 快速切换关注点。结果显示,DyCoRM 在这项考试中的表现远优于以往那种“总经理”风格的评判者。

应用:“私人导购”(DyCoPick)

最后,作者展示了如何在现实生活中使用该系统,工具名为DyCoPick

  • 工作原理:想象你要求 AI 生成 10 张“太空中的猫”的图片。
  • 旧方法:AI 可能会简单地挑选它认为总体上看起来“不错”的第一张。
  • DyCoPick 方法:系统生成 10 个选项,然后利用“专业检查员”根据你的具体需求(例如“我希望猫看起来毛茸茸的”或“我希望背景是暗色的”)来审视它们。随后,它会挑选出最符合你具体标准的那一张图像,就像一位私人导购,不仅知道什么流行,更确切地知道你想要什么。

总结

简而言之,这篇论文指出:“停止对所有 AI 图像评判使用一本通用的规则手册。相反,构建一个系统,首先弄清楚当前任务的具体规则是什么,然后基于这些具体规则评判图像。”他们构建了教师(数据集)、学生(模型)和考试(基准测试),以证明这种方法比旧方法更有效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →