Conditional Vendi Score: Prompt-Aware Diversity Evaluation for Generative AI Models and LLMs
本文介绍了 Conditional-Vendi 和 Conditional-RKE,这两种新颖的多样性指标能够将模型诱导的变异性从提示词诱导的影响中分离出来,从而为文本生成图像、图像描述和大型语言模型任务中的多样性评估与引导提供更准确的依据。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一位经营着一家高科技厨房的厨师,负责接收订单(提示词)并烹饪出佳肴(图像、视频或故事)。多年来,评论家们衡量这些厨师的标准只有两点:
- 忠实度(Fidelity): 菜品是否符合订单?(例如,如果你要求一份“辣塔可”,它看起来像不像塔可?)
- 无条件多样性(Unconditional Variety): 如果你不下任何订单,只是让厨师随性发挥,他能做出多少种不同的菜肴?
但这里缺失了拼图的关键一环:厨师在订单之上又增加了多少多样性?
如果你要求一个“红色的车”,厨师是只会做一个普通的红色轿车,还是会让你惊喜地呈现出一辆红色敞篷车、红色跑车、红色卡车和红色复古轿车?现有的工具无法区分“厨师很乏味”和“顾客给出了非常具体的订单”之间的区别。
这篇论文介绍了一种衡量这种特定创造力的新方法,称为 条件 Vendi 分数(Conditional Vendi Score) 和 条件 RKE(Conditional RKE)。
核心问题:“提示词” vs. “厨师”
作者解释说,目前的各种多样性评分混淆了两种不同的多样性来源:
- 提示词诱导的多样性(Prompt-Induced Diversity): 这是由顾客改变订单而产生的多样性。如果你先要一只“狗”,再要一只“猫”,最后要一只“鸟”,输出结果自然会变化。这并不是厨师的创造力;这只是你在更换菜单。
- 模型诱导的多样性(Model-Induced Diversity): 这是当给予同一个订单时,厨师所增加的多样性。如果你十次都要求一只“狗”,厨师是做出十个不同品种的狗,还是十个一模一样的副本?
类比:
想象一个照相亭。
- 场景 A: 你先后要求拍一张“狗”、一张“猫”和一张“马”。照相亭给了你三张截然不同的照片。旧的评分标准会说:“哇,这个照相亭的多样性真高!”
- 场景 B: 你连续十次要求拍一张“狗”。照相亭给了你十个不同品种的狗。旧的评分标准可能会说:“嗯,多样性一般,”因为与场景 A 中的“马”相比,这些照片看起来都只是“狗”。
作者认为,场景 B 才是 AI 真正的魔力所在。他们想要衡量的是:即使在提示词保持不变的情况下,AI 能产生多少多样性。
解决方案:一种“感知提示词”的分数
论文提出了两种新分数:Conditional-Vendi 和 Conditional-RKE。
把这些分数想象成一个特殊的过滤器,它忽略了“提示词诱导”的噪音,只测量“模型诱导”的信号。
- 运作方式: 数学计算不再是将所有图片放在一起观察,而是观察每个特定提示词类别内部图片的差异。它本质上是在问:“如果我们把所有的‘狗’的照片归为一类,它们彼此之间有多大不同?如果我们把所有的‘猫’的照片归为一类,它们又有多大不同?”然后它会对这些差异进行平均。
- 结果: 这个分数正确地识别出,场景 B 中的厨师(做出 10 种不同的狗)比场景 A 中的厨师(做出 1 只狗、1 只猫、1 匹马)更有创意,因为厨师 B 在满足特定需求的同时,加入了自己的风格。
“减速带”与“捷径”
计算这种新分数在数学上非常繁重。作者发现,对于非常大的数据集(例如 25,000 张图像),计算会陷入“维度诅咒”——就像试图通过数清海滩上每一粒沙子来测量海滩的大小一样。这既耗时又需要大量数据才能保证准确。
解决方法: 他们引入了一个 “截断”(Truncated) 版本。
- 类比: 与其数清每一粒沙子,不如只数出最大的 10,000 粒。你会发现,这些顶端的颗粒已经代表了海滩 99% 的“重量”和多样性。
- 益处: 这种“截断式 Conditional-Vendi”速度快,精度足以满足现实应用,并且不会在处理大规模数据集时卡壳。
实测验证
作者在真实的 AI 模型上测试了这些新分数:
- 文本生成图像(如 DALL-E 3 或 Stable Diffusion): 他们展示了当提示词很模糊(例如“一种动物”)时,AI 会产生大量的动物种类,分数随之上升。而当提示词很具体(例如“一只金毛寻回犬”)时,分数保持较低,因为 AI 受限于具体的请求。这证明了该分数衡量的是 AI 内部的自由度,而非仅仅是提示词本身的多样性。
- 文本生成视频与大语言模型(LLM): 他们将该方法应用于视频生成器和语言模型(如 Llama)。他们发现,随着他们增加语言模型的“温度”(随机性),分数也随之上升,准确地表明了故事变得更加多样化。
- 引导 AI: 他们不仅使用这个分数来评判 AI,还用它来引导 AI。通过告诉 AI,“在生成过程中尝试最大化这个分数”,他们可以迫使 AI 在不丢失与文本提示词关联性的前提下,生成更多样化的图像。
总结
简而言之,这篇论文给了我们一把新的尺子。以前,我们只能衡量 AI 遵循指令的能力,或者在不受控时的随机程度。现在,我们有了一把尺子,可以衡量 AI 在遵循指令的同时展现出的创造力。它将用户提示词带来的噪音与机器想象力的真实信号区分开来。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。