Exploring Agentic Workflows for Generating High Quality Math Visual Aids
本文介绍了一种智能体工作流,该工作流通过利用自生成的质量保证问题和视觉反馈来克服当前在空间推理和准确性方面的局限性,使大语言模型和视觉语言模型能够为 K-12 教育迭代生成并优化高质量且符合教学法逻辑的数学图表。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人如何为中学生数学课画一张完美的宝岛地图。你给机器人一个详细的描述:“画一朵由黄色六边形、红色梯形和绿色三角形组成的鲜花。”但当机器人把画递给你时,花瓣被挤压变形了,颜色错了,或者形状完全缺失了。这就像你订购了一个定制蛋糕,收到的却是一个歪歪扭扭的砖头。
这正是研究人员 Rizwaan Malik、Ashna Khetan、Isabel Sieh 和 Samin Khan 正在解决的问题。他们发现,即使是目前最聪明的 AI 工具(称为大语言模型,简称 LLM),在绘制这些数学图表方面仍然相当笨拙。事实上,在针对中学生数学题进行测试时,表现最好的 AI 也仅有 73.9% 的正确率。虽然这算是一个及格的分数,但如果你想让每个学生都完美地学习,这还远远不够。
于是,团队尝试了一个新窍门:他们构建了一个“自我改进的机器人团队”。他们不再只是让 AI 画一次并寄希望于结果,而是创建了一个循环,让 AI 同时扮演严厉的美术老师、侦探和画家。
以下是他们的“智能体工作流”(这是一个描述 AI 智能体协作工作的专业术语)是如何运作的:
- 画家: 首先,一个 AI 根据你的描述绘制图表。
- 出题者: 接着,第二个 AI(QA 生成器)观察这张图并编写一组由四个开放式问题组成的测试题。它不会问简单的“是/否”问题(如“这是红色的吗?”),而是会问更深层的问题,例如:“代码是如何确保挂杆完全水平的?”
- 侦探: 然后,一个 AI 会根据这些问题检查用于绘制图像的计算机代码。研究人员发现,标准的“视觉”AI 在分析复杂图表方面其实表现很差(它们经常数错物体或对空间感到困惑),因此他们改为让 AI 阅读绘图的代码指令,这在发现错误方面要可靠得多。
- 修复者: 如果绘图未能通过测试,AI 会获得反馈并尝试重新绘制。它会不断循环这个过程,直到绘图通过所有测试或用尽尝试次数为止。
研究人员测试了这个想法,并发现了一些有趣的现象。当他们让“侦探”同时查看最终图片和用于绘图的计算机代码时,人类专家与 AI 的评分一致率达到了 97%。这比只看图片(68%)或只看代码(81%)有了巨大的飞跃。事实证明,看到“蓝图”有助于更好地发现错误。
他们还发现,提出开放式问题比简单的“是/否”问题效果要好得多。这就像要求学生“解释你的推理过程”,而不是仅仅问“你做了吗?”
然而,团队谨慎地表示,这并不是解决一切问题的魔杖。在他们的实验中,即使在 AI 尝试修复一次绘图后,仍有 70% 的图表需要进行另一轮修复。而且即使经过两轮修正,绘图的人类平均评分也仅从 5 分制下的 3.4 分上升到了 3.7 分。
团队遇到了几个具体的瓶颈。例如,在尝试绘制一个“平衡挂架”(一种经典的数学工具)时,即使被告知要修复,AI 仍然会把悬挂的盒子间距画得不均匀。AI 能看到错误,但却无法弄清楚如何修改代码才能使间距达到完美。同样,AI 有时在计数精确的形状数量或检查测量是否正确方面也会遇到困难,因为它在“空间推理”(理解物体如何在空间中组合在一起)方面仍然表现欠佳。
研究人员指出,虽然这种“自我改进循环”是一个充满希望的开端,但它还不足以取代人类教师。他们认为,未来的系统需要更好的提问方式,以及更敏锐的“眼睛”来理解空间关系。但就目前而言,这种方法表明,如果你给 AI 一个检查自身工作并重试的机会,它在绘制学生学习数学所需的地图方面确实可以变得更好一些。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。