← 最新论文
🔬 physics

Assessing AI in Introductory Physics Problem Solving

本研究评估了 OpenAI 的 o4-mini 模型在处理 Halliday 和 Resnick 物理入门题中的表现,发现尽管其整体准确率较高(约 90%),但其性能受到问题模态(从纯文本任务的 96% 下降到图文结合任务的 79%)以及难度增加的显著限制。

原作者: Amir Bralin, N. Sanjay Rebello

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Amir Bralin, N. Sanjay Rebello

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下这样一个世界:你的作业助手不再仅仅是一个寻找答案的搜索引擎,而是一个真正试图为你解开谜题的大脑。这就是人工智能(AI)的领域,特别是被称为“大语言模型”的一种类型。把这些模型想象成超级先进的数字鹦鹉,它们几乎读遍了互联网上的每一本书。它们极其擅长模仿人类对话并识别文本中的模式,就像一位记住了所有侦探小说情节的侦探。但问题在于:虽然它们可以像教授一样聊天,但有时却难以像人类那样“观察”世界。它们可能完美地读出一段关于苹果落下的描述,但如果你给它们看一张苹果落下的图片并要求它们计算速度,它们可能会感到困惑。这对科学教育来说是一件大事,因为物理学不仅仅关乎文字,更关乎理解宇宙是如何运作的,而这通常需要通过图表、曲线图和复杂的题目来实现。随着这些人工智能工具变得越来越聪明,教师和学生们都在问:机器人真的能做我的物理作业吗,还是它只是在不断猜测直到碰巧猜对?

在最近的一项研究中,研究人员对一个名为“o4-mini”的前沿人工智能模型进行了测试,以观察它是否能处理标准本科教科书——海尔代(Halliday)和雷尼克(Resnick)所著的《基础物理学》中的经典物理问题。他们把这个人工智能当作一名正在参加期末考试的学生,向其输入了从易到难共计 1,203 道不同的题目。结果既有令人惊叹的时刻,也有失误之处。当题目仅包含文本时,该人工智能表现出色,正确解决了约 96% 的题目。它就像一位优秀的导师,如果你用文字提问,它能完美地解释概念。然而,一旦题目包含了图像——比如滑轮图、运动图表或电路草图——人工智能的表现便显著下降,降至约 79%。这就好像当它拿到一张图片而不是一份文字方向说明时,机器人突然忘记了如何看地图。

研究还发现,人工智能的信心和准确度并没有随着题目难度的增加而保持稳定。当问题是“简单”级别时,该模型表现得像个冠军。但随着难度跃升至“中等”然后变为“困难”,其成功率逐渐下滑,在最难的挑战中降至 84%。有趣的是,人工智能并没有就此放弃;它实际上尝试得更努力了。面对难题时,该模型会生成更长、更详细的答案,使用更多的“Token”(类似于其思维的数字构建块)来理清思路。然而,尽管付出了这些额外的努力,它在处理复杂问题时仍然更容易出错。研究人员发现,该人工智能在不同主题之间表现出了惊人的连贯性,无论是处理重力、电学还是量子力学;除了难度等级和图像的存在之外,它似乎并没有特定的“弱势学科”。

最终,这篇论文表明,虽然人工智能正成为解决标准物理问题的强大工具,但它目前还称不上是一个完美的、无所不知的导师。它擅长基于文本的推理,但在需要将文本与视觉信息进行协调时会跌跤,且其准确性会随着问题的复杂化而波动。作者得出结论:目前,人工智能是一个能够处理基础和中等程度内容的得力助手,但它仍然需要人类的指导,尤其是在问题变得困难或涉及图片时。这是一个充满希望的进步,但在它能够真正取代教室里的真人物理学家之前,这个机器人还有很多东西要学。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →