Reliable isomorphic physics problem generation with large language models
本研究介绍了一种利用大语言模型智能体驱动的 AI 系统,该系统能够可靠地生成同构物理题,在保持核心概念结构的同时改变表层细节,在为入门级力学课程生成可直接使用的题目方面达到了 89% 的成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名试图编写数学或科学测试题的老师。你有一个关于掉落苹果的好问题,但你需要十二个不同的版本,以免学生互相抄袭答案。你希望新问题感觉很新鲜——也许是关于掉落的菠萝或滑行的滑板——但它们必须测试完全相同的脑力机制和物理规则。这就是制作“同构”问题的精妙艺术:外表看起来不同,但内在却是孪生兄弟的谜题。几十年来,计算机一直擅长于仅仅更换数字(将 5 米的坠落变为 10 米的坠落),但在不破坏逻辑的前提下重写整个故事方面却一直表现不佳。现在,被称为大语言模型(LLM)的新型超智能计算机程序正在尝试学习这门艺术。这些模型就像数字书记员,读过几乎所有被写下的内容,但它们也因有时会编造事实或逻辑出错而声名狼藉。教育工作者面临的大问题是:我们能否信任这些数字书记员来编写全新的、完美的测试题,以便老师可以直接使用,还是说它们仍然需要人类来修正错误?
这篇论文介绍了一个巧妙的新系统,旨在通过建立一个物理题的“机器人工厂”来回答这个问题。研究人员 Xian Wu 和 Lindim Ismaili 来自康尼格拉特大学,他们并没有只是要求单个 AI “做一个新问题”,而是构建了一个由专门的 AI 代理组成的团队,它们像运转良好的流水线一样协同工作。首先,一个代理阅读原始问题并将其分解为核心部分。另一个代理检查数学计算,以确保答案确实是正确的。第三个代理重写故事,将苹果换成火箭,或将数字换成新数值,同时小心地保持底层的物理规则完全一致。最后,第四个代理将所有内容格式化为一个整洁、可打印的文档。他们甚至将整个工厂托管在一个名为树莓派(Rasply Pi)的微型、廉价计算机上,使该工具向公众开放。
为了测试这个工厂是否真的有效,团队使用了 13 道来自大学级力学课程的真实物理题进行了测试。他们运行了该系统 20 次,每次运行都要求它生成 13 个新版本。结果非常令人振奋:在系统产生的所有问题中,89% 被评为“定义完整且可直接使用”。这意味着对于近九成的题目,老师可以拿起它们并直接用于考试,而无需改写任何文字或修正任何计算错误。该系统成功地在改变“不同”的故事细节的同时,保留了“相同”的物理概念,正如研究人员所希望的那样。
然而,论文谨慎地表示这并不是一个完美的解决方案。虽然该系统展示了巨大的潜力,但也遇到了瓶颈。研究人员指出,该系统并非无懈可击;它偶尔仍会产生错误,并且该过程依赖于 AI 对复杂人类逻辑的理解程度,以避免“幻觉”(即 AI 捏造虚假事实)。这项研究表明,虽然这些 AI 工具在生成教学内容方面正变得越来越出色,但它们尚未准备好完全取代人类专家。相反,论文认为最好的路径是将这些 AI 系统作为强大的助手,处理繁重的重写工作,而人类教师则提供最终的监督,以确保一切完美无瑕。物理教育的未来可能不是机器人接管课堂,而是机器人帮助老师为学生创造无穷无尽、新鲜的挑战。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。