Can We Improve Educational Diagram Generation with In-Context Examples? Not if a Hallucination Spoils the Bunch
本研究提出了一种基于修辞结构理论(Rhetorical Structure Theory)的上下文学习方法,旨在通过减少事实幻觉并增强对用户上下文的忠实度来改进教育图表生成,尽管研究也承认大语言模型的随机性仍会导致质量波动,并强调了文本复杂度与幻觉率之间的相关性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心问题:那个“过度自信的实习生”
想象一下,你雇佣了一位非常聪明、口若悬河的实习生(AI)来为你的计算机科学课程绘制图表。你给他们一段文字,他们便立即开始绘制流程图或网络图。
问题在于?这个实习生过度自信了。有时,他们不仅画出了你要求的内容,甚至还凭空捏造了文中并不存在的事实。他们可能会增加一个不存在的步骤,或者将两个毫无关系的要素连接在一起。在论文中,这被称为**“幻觉”(hallucination)**。
研究人员提出了一个疑问:我们能否通过在他们开始工作前展示一些优秀的范例,来教会这个实习生变得更加准确?
解决方案:“修辞蓝图”
研究人员尝试了一种名为**上下文学习(In-Context Learning, ICL)**的新方法。你可以把它想象成在实习生开始工作前,给他们一份“小抄”或“参考范例”。
然而,仅仅展示随机的例子是不够的。实习生可能会被过多的信息搞混。因此,研究人员使用了一套特殊的规则书,称为修辞结构理论(Rhetorical Structure Theory, RST)。
类比:
想象你正在给某人提供建造房屋的指令。
- 标准 AI: 你只说,“造一栋房子。” AI 可能会造出一座城堡、一个帐篷,或者一栋没有屋顶的房子,因为它在猜测你的意图。
- RST 方法: 在你要求 AI 建造之前,你先给它一份关于房屋结构的蓝图。你指出:“这部分是地基(主旨),而这些是房间(支持性细节)。”
研究人员教导 AI 先像语言学家一样分析文本。他们要求 AI 在绘图之前,先将文本拆解为它的“逻辑骨架”(识别出要点以及它们是如何连接的)。然后,他们向 AI 展示一个具有相似“骨架”的文本示例,以及该文本是如何被转化为一张完美的图表的。
实验过程:“艺术评论家”评审团
为了测试效果,研究人员使用两种不同的 AI 模型(GPT-4o 和 o3)创建了 150 个图表。他们测试了三种提问方式:
- 零样本学习(Zero-Shot): “直接画出来。”(不提供任何示例)。
- RST1: “这里有一个文本示例和一个图表示例。现在请根据这段新文本进行绘制。”
- RST2: “这里有一个带有逻辑蓝图的文本和一个图表示例。现在请根据这段新文本进行绘制。”
随后,他们聘请了人类专家(计算机科学教师)从三个维度对图表进行评分:
- 逻辑性: 流程是否合理?
- 连通性: 所有部分是否连接正确,还是存在“漂浮的孤岛”?
- 美观度: 图表是杂乱且线条交错,还是整洁且对称?
实验结果:哪些奏效,哪些没奏效
1. “蓝图”有所帮助,但并未解决所有问题
使用“逻辑蓝图”(RST2)的方法在保持 AI 诚实方面表现更好。它减少了 AI 凭空捏造原文中不存在的事实的情况。这就像蓝图约束了实习生,防止他们在要求做厨房时,跑去盖了一个车库。
2. “随机性”问题(抛硬币现象)
论文指出,AI 是**随机性(stochastic)**的,这意味着它有点像在掷骰子。即使面对相同的指令,AI 今天可能画出一张精美的图表,明天却画出一张糟糕的图表。其质量波动很大。
3. 关于复杂性的“坏消息”
当文本简单时,AI 表现尚可。但当文本变得复杂(例如高级计算机科学概念)时,AI 开始出现更多的幻觉。这就像实习生在面对复杂的请求时感到不知所措,于是开始胡编乱造来填补空白。
4. AI 无法发现自己的错误
研究人员尝试让 AI 在绘图后对其图表进行“自我修正”。不幸的是,AI 在这方面表现很差。它经常无法发现自己的错误,或者在试图修复旧错误时引入了新错误。这就像要求一位疲惫的艺术家去评价自己的画作;他们往往会忽略明显的缺陷。
5. “推理”模型胜出
研究使用的 AI 模型之一(称为 o3)的表现明显优于另一个(GPT-4o)。论文认为这是因为 o3 模型具有更好的“推理”能力——它能在绘图前更仔细地思考步骤,就像一个在回答数学题前会先思考片刻的学生。
总结
论文结论认为,虽然使用“逻辑蓝图”(RST)和示例有助于减少 AI 凭空捏造倾向,但并不能完全解决问题。
- 好消息: 该方法使生成的图表更加忠实于源文本。
- 坏消息: AI 仍然会犯错,尤其是在处理难题时,并且它无法可靠地修复自身的错误。
研究人员警告说,由于 AI 仍可能产生“幻觉”,我们不应在教育领域盲目信任它。教师和学生需要反复检查图表,就像你在把实习生的作品交给客户之前需要进行检查一样。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。