← 最新论文
💻 computer science

Each Judge Its Own Yardstick: Discovering Per-VLM Taxonomies for Physical Video Evaluation

该论文介绍了 JudgeFit,这是一个迭代式框架,通过为单个视觉-语言模型构建个性化的评估分类法,以更好地评估视频生成中的物理一致性,证明了其相比全局模式提升了 32%,并揭示了特定模型的盲点。

原作者: Yu Cao, Ziquan Liu, Zhensong Zhang, Jiankang Deng, Shaogang Gong, Jifei Song

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Yu Cao, Ziquan Liu, Zhensong Zhang, Jiankang Deng, Shaogang Gong, Jifei Song

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在为视频生成器举办一场才艺表演赛。你请来了 16 位不同的评委(AI 模型)来帮助你判断哪些视频符合物理规律,哪些看起来很诡异。

问题的关键在于,每一位评委看世界的视角都不同。

旧方法:一刀切(“糟糕的”尺子)

传统上,研究人员会给每位评委一份完全相同的检查清单来给视频评分。这就像是给一个木匠、一位厨师和一位音乐家同一把尺子,然后让他们去测量一个蛋糕。

  • 木匠可能只看高度。
  • 厨师可能只看纹理。
  • 音乐家可能根本不知道该怎么用这把尺子。

在论文中,他们发现当使用“全局”检查清单(一套固定的规则,如“重力”、“碰撞”和“光照”)时,大多数 AI 评委都会忽略其中四分之三的内容。它们只会专注于一件事(通常是“机械结构”),而给剩下的部分打零分。这就像是要求一个色盲人士根据 10 种不同颜色的清单来评判一幅画;他们只会挑选自己能看到的那个颜色,然后忽略其他。

新方案:JUDGEFIT(“量体裁衣”)

作者创建了一个名为 JUDGEFIT 的新系统。JUDGEFIT 不再强迫每位评委使用同一把尺子,而是根据每位评委实际擅长观察的内容,为每个特定的评委打造一把定制的尺子

它是这样运作的,分步骤如下:

第一步:“种子”(让评委开口说话)

首先,系统向一位 AI 评委展示一小组视频,并询问:“这里哪里看起来不对劲?请用你自己的语言告诉我。”

  • 如果评委说:“球像气球一样漂浮着”,系统就会将“漂浮”记录为一个规则。
  • 如果评委从未提到过“阴影”,系统就知道这位评委对阴影是“盲目”的,因此不会把“阴影”放入其定制检查清单中。
  • 类比: 这就像是在招募新员工时问:“你发现了哪些错误?”并仅根据他们实际能发现的错误来编写他们的职位描述。

第二步:“精炼”(教练与选手)

现在,系统让评委使用这个新的定制检查清单开始工作。但诀窍在于:

  • 选手(视频 AI): 根据定制检查清单对视频进行评分。它并不知道“正确答案”是什么,它只是遵循规则。
  • 教练(一个独立的 AI 编辑器): 查看选手的评分,并将其与人类的看法进行对比。
    • 如果选手说一段视频很完美,但人类却觉得很糟: 教练会说:“你漏掉了某些东西!让我们在你的检查清单中增加一条新规则。”
    • 如果选手在检查两件本质相同的事情: 教练会说:“你在做重复劳动。让我们合并这些规则。”
    • 如果选手检查的内容与人类观点不符: 教练会说:“停止检查这个;它会干扰你的评分。”

这是一个循环过程。教练调整清单,选手再次尝试,如此循环往复,直到选手的评分与人类的观点尽可能一致。

结果:为什么这很重要

论文在 16 个不同的 AI 模型(从小型开源模型到大型闭源模型)上测试了这一方法。

  • 胜出点: 对于每一个评委而言,定制检查清单的效果都比标准的“一刀切”检查清单更好。平均而言,评分预测人类看法的准确度提升了 32%
  • 惊喜之处: 他们发现即使是“最聪明”的 AI 评委也有其盲点。有的可能非常擅长发现重力错误,但在发现反射错误方面表现糟糕;另一个则可能恰恰相反。旧系统将它们视为整体上的“好”或“坏”,但 JUDGEFIT 揭示了它们各自的具体优势与劣势。

核心结论

论文认为,我们不应该强迫每个 AI 评委使用相同的规则。就像你不会用钓鱼竿去修理汽车一样,你也不应该强迫一个 AI 使用它无法感知的规则来评判视频。

JUDGEFIT 是一种询问每个 AI“你能看到什么?”的方法,并以此为基础构建一套独特的、定制化的评分系统。这使得 AI 能够成为更优秀、更可靠的视频物理现实评判者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →