Temporal Stability and Few-Shot Prompting in Math Task Assessment
这项纵向研究表明,虽然仅依靠模型版本更新在分类数学任务认知需求方面结果不一致,但少样本提示能显著且可靠地提升通用型及教育专用型人工智能工具的性能,这表明在教育情境中,提示工程是比单纯依赖被动模型改进更为有效的提升人工智能效能的策略。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你雇佣了两名不同的"AI 教学助手”来帮你整理一堆数学作业题。你的目标是将它们分成两堆:“简单、常规的练习”和“困难、需要深度思考的挑战”。你给它们一本规则手册(称为“任务分析指南”),以帮助它们做出判断。
这项研究就像是对这两名助手进行的一次长期体检,看看它们随时间推移是否能保持一致,以及给它们提供一份“示例小抄”是否有助于它们更好地工作。
以下是发生的情况,简单解释如下:
两名助手
研究人员测试了两种不同的 AI 工具:
- Gemini:一名“通用型”助手。把它想象成一位非常聪明、博览群书的图书管理员,对包括数学在内的一切领域都略知一二。
- Coteach:一名“教育专用型”助手。把它想象成一位经验丰富的数学老师,多年来一直在批改试卷,深知学校数学的具体特点。
第一部分:“时间旅行”测试(时间稳定性)
研究人员让两名助手在第一天对数学题目进行分类。然后,他们等待了七周,再次要求它们对完全相同的题目进行分类。
在现实世界中,软件更新是持续发生的。这就像你最喜欢的视频游戏获得了补丁更新;有时游戏会变得更好,但有时你喜欢的某个角色突然移动方式变了,或者变弱了。
通用助手(Gemini)发生了什么?
它的总体得分保持不变(58% 正确)。然而,如果你仔细观察,它会改变对特定问题的判断。它答对了三道之前答错的新问题,但也答错了三道之前答对的老问题。- 类比: 想象一位法官,平均而言给你相同的判决,但交换了哪些具体罪行判处死刑、哪些判处终身监禁。“平均”看起来一样,但对你具体案件的判决结果却变得不可预测。这被称为“提示漂移”(prompt drift)。
教学助手(Coteach)发生了什么?
这个助手的表现变差了。它的得分从 75% 的正确率显著下降到 50%。- 类比: 想象一位经验丰富的老师突然开始忘记如何批改基础测试。他们不仅仅是交换了答案,而是实际上丧失了一部分正确完成工作的能力。
主要结论: 仅仅因为一个 AI 工具获得了“新版本”或在后台进行了更新,并不意味着它在你的具体任务上会变得更好。有时它保持相同但行为方式不同,有时它实际上变得更差。
第二部分:“小抄”测试(少样本提示)
在七周的等待之后,研究人员尝试了一个新技巧。他们不再只是要求助手对题目进行分类,而是给它们提供了一份“小抄”。这份小抄展示了两个完美的“简单”题目示例和两个完美的“困难”题目示例,并附带了每个题目的正确标签。
这被称为少样本提示(Few-Shot Prompting)。这就像对一名新员工说:“这里有一份好报告的样本和一份坏报告的样本。现在,看看这堆新文件,像这些样本一样对它们进行分类。”
- 结果:
- Gemini(图书管理员): 表现变好了!它的得分从 58% 上升到 67%。
- Coteach(老师): 表现好得多!它的得分从低迷的 50% 一路反弹至 75%,回到了其最初的“专家”水平。
主要结论: 给 AI 提供几个清晰的示例(小抄)有助于它表现得更好,这比等待软件公司发布新版本更有效。事实上,“小抄”完全修复了教学助手的错误。
“困难内容”问题
有一个陷阱。AI 工具在分类“简单”的常规题目方面表现出色。但它们在“困难、需要深度思考”的题目(称为“做数学”)上确实很吃力。
即使有了小抄,AI 仍然持续错误分类最困难的问题。
- 类比: 这就像一个学生非常擅长背诵乘法表,但当被要求解决需要他们发明新思维方式的应用题时,他们就会感到困惑。AI 倾向于关注表面词汇(如“计算”或“展示步骤”),而不是理解所需的深度思考。它试图寻找捷径,而不是进行艰难的脑力劳动。
论文主张总结
- AI 是不稳定的: 即使在短短七周内,AI 工具也可能改变其回答问题方式,有时变得更差,有时只是表现不可预测。
- 更新并非魔法: 更新的 AI 版本并不自动意味着在特定学校任务上表现更好。
- 示例有帮助: 给 AI 提供几个清晰的示例(少样本提示)是一种强大的纠正错误和提高准确性的方法,通常比等待软件更新更有效。
- 专用工具需要帮助: 教育专用工具(Coteach)对变化更敏感(它变得更差的速度更快),但也比通用工具对“小抄”的反应更好。
- 深度思考仍然困难: AI 仍然难以识别最复杂的数学任务,即使提供了示例,也常常将它们与较简单的任务混淆。
该论文得出结论,如果你是一名使用 AI 的教师或研究人员,你不应该仅仅依赖工具是“新”的。你需要主动检查它是否仍在正常工作,并准备好提供清晰的示例来引导其思考。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。