PhysElite: How Far Are LLMs from Solving Olympiad-Level Physics Problems?
该论文介绍了 PhysElite,这是一个包含 11,586 道具有分步解答的奥林匹克级物理题的大规模双语多模态基准测试,研究揭示了即使是最先进的多模态大语言模型在处理这些复杂推理任务时,目前的准确率也仅为 33.7%。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
物理学一直是人类智力的严峻考验,在这一学科中,理解世界不仅需要记忆事实,更需要一种能力:观察一个复杂的场景(通常以图画或图表的形式呈现),并在脑海中理清其中起作用的无形力量。要解决一个问题,必须识别出正确的自然法则,循序渐进地应用它们,并编织一条逻辑严密的推理链,从而得出唯一的、精确的答案。几十年来,这种深度的、多步骤的思考被认为是人类特有的优势,是机器难以轻易跨越的前沿领域。如今,人工智能已经取得了惊人的进步,计算机能够以惊人的准确度阅读文本和识别图像。然而,一个关键的问题仍然存在:这些机器是否真的能够通过这类挑战全球顶尖高中生的困难现实物理问题进行推理?
一组研究人员现在建立了一个全新的、大规模的测试场来寻找答案。他们创建了一个包含一万一千多个物理问题的集合,这些问题选自中国顶尖学生日常使用的训练材料。这些并非只有多个选项的简单问题,而是要求解题者从零开始推导解决方案的开放式挑战。至关重要的是,研究人员不仅收集了问题,还收集了专家用于解决这些问题的详细、逐步的解题过程,以及阐释物理设置的图表。这个新的数据集包含英文和中文版本,涵盖了从行星运动、电流流动到光行为以及原子世界奥秘的所有领域。通过将每个问题与其视觉图表及其完整的逻辑推导配对,该团队创建了一个能够反映专家级物理推理真实复杂性的基准。
当研究人员对十八个最先进的人工智能模型进行测试时,结果令人警醒。即使是最强大的模型,尽管经过了海量数据的训练并能执行复杂的推理任务,也表现得极其吃力。表现最好的模型在仅约三分之一的案例中得到了最终正确答案。这意味着,对于每三个困难的物理问题,目前最强大的可用人工智能都会错掉两个。这些机器与人类专家之间的差距是巨大的;作为研究基准的人类学生几乎解决了近一半的问题,这比人工智能系统领先了一大截。研究人员发现,这种难度并不局限于某一特定类型的题目;模型在力学、热力学和光学方面都遇到了困难,尽管它们在涉及光和几何推理的问题上表现得最为挣扎。
这项研究不仅限于统计正确答案的数量。研究人员检查了机器的实际思维过程,将其解题步骤逐一拆解,以观察它们究竟在哪里出错。他们发现,错误很少是简单的计算失误。相反,模型经常在推理链的最开始阶段就失败了。它们会误读图表、误解物理设置,或者将错误的物理定律应用于该情境。一旦初始设置出现偏差,无论后续的数学推导多么复杂精妙,最终都会导致错误的结论。在许多情况下,模型可以产生一个看起来似乎合理的推导过程,遵循着正确的总体路径,但却在某个根本性的误解之下崩溃。这表明,虽然这些系统擅长模式匹配和生成文本,但它们仍然缺乏那种能让真人实现问题可视化并知晓适用原则的深度、直觉性的物理现实感。
研究人员还测试了给予模型额外帮助是否能提高其表现。他们向部分模型提供了显示解题中间步骤的额外图表,希望这种视觉引导能弥补差距。虽然这确实起到了一定的帮助作用,但提升幅度很小,而且在某些情况下,添加额外的文本提示反而使模型的表现变差。这表明核心问题不在于信息的匮乏,而在于处理信息的根本困难。模型不仅仅是缺少数据,它们是在努力将视觉和文本线索综合成一个连贯的物理模型方面遇到了困难。研究结论指出,尽管人工智能取得了飞速进展,但这些系统距离掌握解决真实的、高水平物理问题所需的严密、多步骤推理仍有很大差距。未来的道路将需要新的方法,不仅教机器如何回答问题,还要教它们真正理解它们被要求描述的物理世界。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。