← 最新论文
💻 computer science

InteractScience: Programmatic and Visually-Grounded Evaluation of Interactive Scientific Demonstration Code Generation

本文介绍了 InteractScience,这是一个新颖的基准测试与混合评估框架,旨在通过结合程序化功能测试与跨五个科学领域的视觉 grounded 定性分析,评估大语言模型生成交互式科学演示代码的能力。

原作者: Qiaosheng Chen, Yang Liu, Lei Li, Kai Chen, Qipeng Guo, Gong Cheng, Fei Yuan

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Qiaosheng Chen, Yang Liu, Lei Li, Kai Chen, Qipeng Guo, Gong Cheng, Fei Yuan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在请一位非常聪明、博览群书的机器人为你搭建一个科学实验。你不仅仅想要一张火山图片,或者一段解释重力如何运作的文字。你想要一个可运行、可交互的模拟程序,你可以拖动滑块来改变风速,观察虚拟火箭的飞行;或者按下按钮,查看行星的轨道运行。

论文《InteractScience》旨在测试当今最智能的 AI 机器人在构建这类交互式科学演示方面的能力。

以下是他们所做工作的分解,使用了简单的类比:

问题所在:“聪明的谈话者”与“聪明的建造者”

作者们注意到,当前的 AI 模型在以下两个独立方面表现出色:

  1. 谈论科学:如果你问“斜坡上的木块受到哪些力的作用?”,AI 能写出完美的教科书式答案。
  2. 构建静态网站:如果你问“给我做一个带有蓝色标题栏的博客”,AI 能写出代码,而且看起来不错。

但是,当你要求 AI 将两者结合起来——“制作一个交互式网站,让我可以滑动木块沿斜坡下滑,并实时观察物理力的变化”——AI 往往会失败。它可能会搭建一个看起来真实的斜坡,但当你滑动木块时,它会飞出屏幕,因为数学计算错误,或者按钮实际上没有任何作用。

这就像雇佣了一位建筑师,他能优美地描述房屋,也能完美地砌砖,但当被要求建造一座带有运行电梯的房屋时,电梯井却是空的,或者门打开后面对的是一堵砖墙。

解决方案:一份新的“成绩单”(InteractScience)

研究人员建立了一个名为InteractScience的新测试平台。他们不再只是让 AI 编写代码并指望它能运行,而是创建了一套严格的评分系统,包含两个 distinct 部分,就像老师检查学生项目中的数学计算和绘图一样。

第一部分:“机器人检查员”(程序化功能测试)

想象一位不关心网站外观是否漂亮的机器人检查员。这位机器人有一份具体操作的清单:

  • “点击‘开始’按钮。”
  • “将滑块移动到 50%。”
  • “检查屏幕上的数字是否从 10 变为 20。”

如果 AI 的代码未能完全执行机器人要求的操作,这部分就得零分。这检查的是逻辑是否有效。

第二部分:“艺术评论家”(基于视觉的定性测试)

想象一位审视最终画面的艺术评论家。但这不仅仅是人类的猜测,而是一位超级智能的 AI 评委。

  • 评委拥有一张参考照片(即演示程序“应该”呈现的“黄金标准”)。
  • 评委拥有一份检查清单(例如:“箭头是否指向正确的方向?”“曲线是否平滑?”)。
  • 评委将 AI 的结果与照片和清单进行对比。

这检查的是科学原理和视觉效果是否正确。

他们的发现

研究人员在 150 个不同的科学问题上测试了 30 个不同的 AI 模型(包括免费和付费的),这些问题涵盖了从简单(数学图表)到复杂(复杂物理模拟)的范围。

以下是他们发现的一个重大惊喜:

  • “外壳”表现良好:大多数 AI 擅长构建应用程序的“外壳”。它们能让按钮、滑块和菜单出现并运作。如果你点击一个按钮,它确实会响应。(这就像机器人检查员通过了“点击”测试)。
  • “大脑”却坏了:然而,当 AI 真正尝试进行科学计算时,它往往会失败。滑块可能会移动,但背后的物理方程是错误的。球可能会落下,但落下的方向不对。
  • 差距巨大:在“让按钮工作”和“让科学原理工作”之间存在巨大的鸿沟。AI 可以制造一辆车门能开、车漆光亮的汽车,但引擎却无法驱动车轮。

为什么这很重要

该论文认为,我们目前还不能完全信任 AI 来构建科学工具。如果学生使用 AI 生成的模拟程序来学习物理,而该模拟程序隐藏着数学错误,学生就会学到错误的知识。

InteractScience 是首个迫使 AI 证明其不仅能正确编写代码,还能正确运用科学知识的工具,而不仅仅是做到其中一项。这是对 AI 在教育领域未来发展的现实检验。

核心结论

该论文总结道,虽然 AI 在编写代码方面越来越擅长,但它仍然难以将深厚的科学知识整合到这些代码中。这就像一个能背诵字典但尚未学会如何写故事的学生。研究人员希望这项新测试能帮助开发者修复这些“大脑”错误,以便在未来,AI 真正成为科学和教育领域可靠的伙伴。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →