← 最新论文
🤖 AI

ViGoR-Bench: How Far Are Visual Generative Models From Zero-Shot Visual Reasoners?

针对现有视觉生成模型评估中存在的“性能幻象”及其在逻辑推理上的不足,本文提出了名为 ViGoR 的统一基准框架,通过跨模态覆盖、双轨评估机制及证据驱动的自动化裁判,揭示了当前顶尖模型在零样本视觉推理任务中的显著缺陷。

原作者: Haonan Han, Jiancheng Huang, Xiaopeng Sun, Junyan He, Rui Yang, Jie Hu, Xiaojiang Peng, Lin Ma, Xiaoming Wei, Xiu Li

发布于 2026-03-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Haonan Han, Jiancheng Huang, Xiaopeng Sun, Junyan He, Rui Yang, Jie Hu, Xiaojiang Peng, Lin Ma, Xiaoming Wei, Xiu Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 ViGoR-Bench 的新工具,它的核心目的是给现在的 AI 绘画和视频生成模型“做体检”,看看它们到底是不是真的“聪明”,还是只是在“装样子”

我们可以用几个生动的比喻来理解这篇论文:

1. 现状:华丽的“逻辑沙漠”

现在的 AI 生成的图片(比如画一只猫)非常逼真,连毛发都清晰可见。但这就像是一个装修得金碧辉煌的空房子

  • 表面光鲜:房子外观很美(视觉 fidelity 高)。
  • 内在空虚:里面没有家具,甚至没有逻辑(逻辑沙漠)。如果你让 AI 画“把杯子放在桌子上,水不能洒出来”,它可能画得很美,但杯子是悬空的,或者水倒流了。
  • 过去的误区:以前的考试(评测标准)只看房子装修得漂不漂亮(比如像素像不像),没发现里面其实是个“逻辑荒漠”。

2. 新工具:ViGoR-Bench(视觉推理大考)

为了解决这个问题,作者们设计了一套全新的“考试系统”,叫 ViGoR-Bench。它不像以前的考试只问“画得像不像”,而是问“你懂不懂物理?懂不懂常识?懂不懂逻辑?”

这套考试有三个核心创新

  • 全覆盖的“全科医生”
    以前的考试只考“改图”(Image-to-Image)或者只考“做视频”(Video)。ViGoR 把这两者打通了,还加入了物理常识(比如重力、平衡)、知识推理(比如历史、生物)和符号逻辑(比如数独、解方程)。就像以前只考语文,现在要考物理、数学、历史全套。

  • 不仅看结果,还要看“解题过程”
    这是最厉害的一点。以前的考试只看最后交卷的答案对不对。ViGoR 会盯着 AI 的每一步思考过程

    • 比喻:就像老师批改数学题,不仅看最后答案是不是 5,还要看你的解题步骤有没有逻辑错误。如果 AI 最后画对了,但中间步骤是瞎蒙的,ViGoR 也会给它打低分。
  • 拥有“火眼金睛”的自动裁判
    以前靠人眼打分太慢,靠 AI 打分又怕它偏心眼。ViGoR 训练了一个超级裁判(基于大模型),它手里拿着标准答案(Ground Truth),能非常精准地判断 AI 的每一步是否合理,和人类专家的判断高度一致。

3. 考试结果:AI 的“尴尬”真相

作者们用这套系统测试了 20 多个顶尖的 AI 模型(包括 Sora、NanoBanana Pro 等),结果发现了一些令人惊讶的真相:

  • 闭源模型(大厂)比开源模型强:像 Google 和 OpenAI 的模型确实更聪明,但即使是它们,在复杂的逻辑题上也经常“翻车”。
  • “想”得好不代表“做”得好:有些 AI 会先输出长长的“思考过程”(Chain-of-Thought),看起来逻辑很严密,但最后画出来的图还是错的。这说明它只是学会了“装模作样”地思考,并没有真正理解物理规律
  • 视频的“逻辑幻觉”:视频生成模型(如 Sora)生成的视频看起来非常流畅、连贯,但在涉及物理因果(比如球撞墙反弹)时,经常会出现违背物理定律的“幻觉”。它们擅长模拟“动作”,但不擅长理解“原因”。
  • 越难的题,AI 越笨:在简单的迷宫里 AI 能走通,但迷宫稍微复杂一点,或者题目变成数独,AI 的成功率就断崖式下跌。

4. 未来的希望:如何训练更聪明的 AI?

论文还做了一些实验,发现:

  • 死记硬背(SFT)不如“奖励机制”(RL):单纯让 AI 看很多正确答案(监督微调),效果有上限。但如果给 AI 一个目标,让它自己尝试、犯错、然后奖励它做对的步骤(强化学习),它的推理能力会突飞猛进。
  • 练“难”的,通“易”的:如果让 AI 专门练习超难的迷宫(比如 8x8 的),它反而能更好地解决简单的迷宫。这说明它真正学会了“走迷宫的逻辑”,而不是死记硬背某个特定迷宫的路线。

总结

ViGoR-Bench 就像是一面照妖镜,它揭开了当前 AI 生成模型“看似全能,实则逻辑脆弱”的真相。

它告诉我们:现在的 AI 更像是一个才华横溢的画匠,能画出逼真的画,但还不是一个真正的物理学家或逻辑学家。要制造出真正智能的 AI,我们不能只追求画面更清晰,必须让它们真正学会理解世界运行的逻辑

这篇论文不仅指出了 AI 现在的短板,还给出了一套标准的“体检表”和“训练指南”,帮助未来的 AI 从“只会画画”进化到“真正懂思考”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →