OmniPhys: A Unified Multimodal Benchmark for Physics Understanding and Generation from Chinese Educational Corpora
本文介绍了 OmniPhys,这是一个源自中文教育语料库的大规模多模态基准测试,通过 15,246 个问题和 19,850 张图像,旨在评估并提升多模态大语言模型在物理理解与结构化图表生成方面的能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
物理学是研究宇宙如何运作的学科,从球从山上滚下的方式,到引导电流通过导线的无形力量。几个世纪以来,人类通过阅读文字、观察图表以及解决需要将文本与图像相结合的问题来学习这些规则。如今,计算机在阅读文本和观察图片方面已经变得非常出色,这些被称为“多模态模型”的机器可以同时处理这两类信息。这些机器可以写故事、回答问题,甚至描述照片中正在发生的事情。然而,在严谨且符合逻辑的物理世界面前,仅仅识别一张图像或读出一个句子是不够的。真正的理解要求计算机能够看到图表与描述是如何结合在一起,形成一条单一且不可分割的逻辑链条。如果机器做不到这一点,它仅仅是在猜测,而不是在推理。
来自华东师范大学的一个研究小组构建了一个全新的工具,旨在测试这些计算机在多大程度上能像物理学家一样思考。他们创建了一个名为 OmniPhys 的大规模问题集,其内容取自真实的中国教科书和考试,涵盖了从初中到大学的各个阶段。这不仅仅是一份题目清单;它是一个严苛的测试,迫使计算机去做不仅仅是“从选项中选出正确答案”这类事情。该集合包含超过 15,000 个问题和近 20,000 张图像,涵盖了力学、电学、光学、热学和声学。研究人员将其设计得非常困难,以确保这些问题要求计算机同时解读复杂的绘图和文本。至关重要的是,这项测试还要求计算机去做一件它们很少做的事情:绘制自己的图表。计算机不再只是选择一张图片,而是必须生成一张新的图像,正确地展示光是如何反射的或力是如何作用的,并遵循严格的物理定律。
当研究人员进行测试时,他们发现即使是最先进的计算机(包括目前公众可以使用的最强大的模型)也表现得相当吃力。表现最好的模型能正确解决大约 70% 的问题,但当研究人员深入观察这些模型是如何得出答案时,情况发生了变化。许多模型是通过偶然或通过记忆模式得到正确答案的,而不是通过真正的逻辑理解。它们经常遗漏推理中的关键步骤,或者未能将图表中的视觉线索与文本联系起来。在绘图任务上,情况甚至更加糟糕。当被要求生成物理图表时,计算机生成的图像乍看之下似乎合理,但却包含了根本性的错误。它们可能会画出折射方向错误的折射光线,或者让力的指向完全相反,从而违反了它们本应展示的自然法则。
研究还表明,随着问题的难度增加,这些计算机的表现会逐渐变差。它们在处理初中题目时表现尚可,但随着题目进入高中和大学水平,准确率便大幅下降。这种下降表明,虽然这些机器擅长处理简单的任务,但尚未掌握复杂科学思维所需的深层、多层次推理能力。研究人员还发现,给计算机提供问题的图片比仅提供文本能让其表现得更好,这证明了视觉信息对于解决这些谜题至关重要。然而,他们也发现,有些模型在获得图片后表现反而变差了,这表明计算机有时会将图片视为干扰性的噪声,而非有用的信息。
或许最令人惊讶的发现是,用于给作业评分的计算机往往过于“宽容”。当研究人员要求人工智能对其他计算机绘制的图表进行评分时,评分系统会对人类专家认为错误的图像给出高分。自动评分器忽略了人类专家一眼就能察觉到的细微物理错误。这意味着,目前依靠机器来评估科学推理的质量是不可靠的。人类专家在仔细审查作品后发现,即便最终答案正确,计算机也未能掌握物理学的核心概念。
这项工作并不声称计算机在科学领域是无用的,但它确实表明,在真正理解物理世界之前,计算机还有很长的路要走。研究人员已向公众开放了他们的题目和图像集,以便其他科学家可以使用它们来构建更好的模型。通过明确指出这些机器在哪些地方失败——无论是绘制正确的图表、遵循逻辑链条,还是理解复杂的视觉场景——这项研究为未来的改进提供了清晰的路线图。目标不仅是制造能够通过测试的计算机,而是要创造出能够像人类物理学家一样,以同样的严谨性和准确性推演自然法则的系统。在此之前,这些模型“所言”与“所理解”之间的差距依然巨大。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。