Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains
本文介绍了 Sci-VBench,这是一个包含四个科学领域、共 1,253 个专家标注示例的综合基准测试,用于评估 16 个前沿模型在知识密集型和推理密集型视频生成方面的能力,研究表明,尽管视觉真实感有所提升,但在科学性和因果正确性方面仍存在显著差距,尤其是在闭源系统与开源系统之间。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在看一部电影:一位巫师施展了咒语,一枚火箭升空,或者一颗心脏在跳动。多年来,计算机科学家面临的最大问题很简单:“这看起来真实吗?”如果像素清晰、色彩鲜艳、动作流畅,我们就会欢呼雀跃。但现在出现了一个全新的、更棘手的问题:“这真的符合逻辑吗?”
这就是**视频生成(video generation)**的世界——人工智能(AI)试图仅凭一句话的文本来创造动态图像。把它想象成一个超级创意的机器人,它读了一份食谱,然后尝试去烹饪这道菜。直到最近,我们主要是在检查食物看起来是否美味。但如果机器人不小心把盐而不是糖放进了蛋糕里呢?它看起来可能是一个完美的蛋糕,但味道会很糟糕,且无法通过测试。在科学领域,这是很危险的。如果 AI 模拟化学反应或医疗手术,它不能仅仅是“看起来很好”,它必须遵循严格的、不可见的物理和生物定律。如果 AI 违反了这些定律,那么这段视频就是一个谎言,无论它看起来多么漂亮。
这正是这篇新论文所解决的问题。研究人员构建了一个庞大的“考试”——Sci-VBench,用来测试 AI 视频生成器是否真的理解科学,而不仅仅是在模仿科学。他们不只是问:“视频漂亮吗?”他们问的是:“这个机器人真的理解世界是如何运作的吗?”
伟大的科学视频考试
团队创建了一个包含 1,253 个不同挑战的巨大题库,涵盖了物理、医学、工程学甚至历史等 60 个学科。想象一下,在一场考试中,你需要生成一段特定的实验视频,比如用锤子敲击膝盖以观察腿部的反射动作,或者观察两个球从不同的轨道滚下,看谁会赢。问题的关键在于:AI 必须能够自主理解这些事物运动背后的隐藏规则。它不能只是猜测,它必须掌握正确的科学。
为了给这些视频评分,研究人员并没有仅仅依赖计算机的意见。他们请来了 61 位人类专家——来自大学的真实科学家和学生——来担任评委。这些专家为每一个测试都编写了详细的步骤,说明一个“完美”的视频应该是什么样的,从而创建了一套严格的评分标准(rubric)。他们检查了四个方面:
- 看起来好吗?(视频是否清晰流畅?)
- 听话吗?(是否包含了提示词中要求的所有特定细节?)
- 科学正确吗?(物体是否根据真实的自然法则运动?)
- 故事连贯吗?(视频从头到尾是否逻辑自洽,没有出现闪烁或错误?)
令人震惊的结果:华丽却空洞
当他们让世界上 16 个最先进的 AI 视频模型参加这场考试时,结果引发了一场警钟。
首先是好消息:AI 模型在制作“真实感”方面已经变得非常出色。当评委检查基础视觉质量(如流畅度和色彩)时,几乎所有的模型得分都很高,且表现非常接近。它们都是这项工作中“绘画”部分的专家。
但紧接着就是坏消息。当评判员检查 AI 是否真正理解了科学时,分数急剧下降且波动巨大。
- 闭源模型(来自 Google、OpenAI 和阿里巴巴等公司的昂贵模型)表现通常更好。表现最好的 Gemini-Omni-Flash 设法在大多数情况下做对了科学逻辑,但即便如此,它也并不完美。
- 开源模型(任何人都可以免费下载的模型)则面临着更大的困难。虽然它们看起来和昂贵的模型一样漂亮,但经常在科学测试中失败。例如,在一个关于膝跳反射的测试中,有些模型让错误的腿发生了跳动,或者让腿部的运动方式违反了人体解剖学。
研究发现,“看起来真实”与“本质真实”之间存在巨大的鸿沟。AI 可以创造出一个球滚下山的视频,看起来美轮美奂,但如果球在滚动过程中突然漂浮起来或改变了颜色,那么 AI 就未能通过科学测试。研究人员指出,这种差距在科学性与因果正确性(Scientific and Causal Correctness)——即理解因果关系的能力——方面尤为明显。
为什么 AI 会出错
研究人员深入挖掘了 AI 失败的原因。他们发现了三种主要的错误类型:
- 忽略指令: AI 可能会遗漏微小的细节,比如忘记展示提示词中提到的特定工具。
- 伪科学: 这是最严重的一点。AI 优先考虑让视频看起来“酷”或“流畅”,而不是追求物理上的准确性。它可能会为了戏剧效果让化学反应瞬间发生,尽管真实的化学反应是需要时间的。
- 时间旅行式的故障: 视频开始时有两个球,但到一半时,它们合并成了一个,或者光影发生了随机变化。AI 随着时间的推移失去了对故事的掌控。
有趣的是,研究人员尝试了一个简单的修复方法:他们重写了提示词,使其更加明确,告诉 AI 具体该做什么。这起到了一定作用,提高了某些模型的得分,但并未解决核心问题。AI 仍然无法生成对世界运作机制的深层机械理解。这就像给机器人一份更详细的食谱;它可能会更好地遵循步骤,但如果它不知道为什么要混合这些原料,它依然做不出好蛋糕。
总结
论文得出结论:虽然 AI 视频生成器已经成为了了不起的艺术家,但它们仍然是笨拙的科学家。它们可以画出一枚火箭发射的美丽画面,但往往并不理解发射背后的物理学。在“看起来真实”与“本质真实”之间的差距依然巨大,在 AI 真正掌握宇宙规则之前,它们的科学视频终究只能是——幻象。研究人员建议,为了向前迈进,我们不能仅仅询问“它漂亮吗?”,而要开始要求:“它符合逻辑吗?”
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。