← 最新论文
💬 NLP

Chain-of-Experience for Continual LLM Improvement

本文介绍了经验链(Chain-of-Experience, CoE),这是一个使大语言模型能够在推理过程中通过累积来自自我和环境反馈的迭代经验轨迹来实现持续改进的框架,该框架在数学、编程和知识任务上的表现始终优于零样本基准模型,同时降低了 API 成本。

原作者: Haoqin Tu, Yunhao Fang, Yizhong Wang, Cihang Xie, Shen Yan

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Haoqin Tu, Yunhao Fang, Yizhong Wang, Cihang Xie, Shen Yan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

人类天生擅长从错误中学习。当我们解决一个难题,失败,然后带着对错误原因的认知再次尝试时,我们并非简单地从零开始;我们带着教训继续前进,不断完善方法,直到成功。这种行动、反馈与调整的持续循环,是人类智能的引擎。几十年来,被称为大型语言模型的先进计算机程序运作方式却大不相同。一旦这些系统完成训练,它们就会以固定状态部署,将每一个新问题视为孤立事件。它们生成一个答案后便停止,忽略了存在于解题过程本身的丰富反馈。它们无法从当下的经验中学习。

这种人类学习方式与当前机器运作方式之间的差距,促使研究人员提出了一个根本性的问题:这些数字大脑能否在工作时进行学习,利用它们在实时过程中收集到的经验?答案在于一种被称为“经验链”(Chain-of-Experience)的新方法。这种方法将模型尝试解决问题的整个历史视为一个单一的、不断演进的故事。系统不会丢弃失败的尝试,而是将结果反馈给模型,允许它阅读自己之前的错误以及收到的反馈,然后生成一个新的、改进后的响应。这是一个持续的循环,模型通过自身的旅程进行学习,随着每一步的推进更新其理解。

在最近的一项研究中,研究人员旨在测试这一概念是否能在广泛的困难任务中奏效。他们选取了当今最强大的八个语言模型,包括来自主要科技公司的系统,并将它们置于涉及数学、计算机编程和复杂知识问答的一系列挑战性环境中。目标是观察这些模型是否能仅仅通过在测试期间与反馈进行交互来提高性能,而无需对其底层训练进行任何更改。研究人员设计了一个系统,让模型可以接收不同类型的引导。有时,反馈来自模型自身,即作为一名评论家指出其逻辑中的缺陷;而另一些时候,反馈则来自外部环境,例如一个能够立即告知模型代码运行是否成功或数学答案是否正确的计算机程序。

结果令人瞩目。当这些模型被允许使用这种从经验中学习的迭代过程时,它们的表现一致优于那些不允许反思错误的标准版本。这种提升并非微小的进步;模型在各领域都实现了显著的准确度提升。在计算机编程领域,由于反馈精确且即时,模型的成功率平均提高了8.6个百分点。即使是在处理复杂的数学问题等更抽象的任务时(其反馈不够直接),模型依然实现了超过五个百分点的得分提升。这表明,即便不重新训练模型的“核心大脑”,解锁从经验中学习的能力也是一个强大的工具。

或许更令人惊讶的是这种新方法的效率。研究人员发现,这些模型不仅变得更强,而且在花费更少的资金和计算能力的情况下变得更强。通过使用反馈来引导思考,模型能以更少的尝试和更短的响应达到更高的准确度。事实上,研究显示,与不使用这种反馈循环的传统方法相比,模型实现最佳结果时的运行成本降低了19%。这表明模型并非只是在盲目增加尝试次数,而是在更有效地思考,利用收集到的信息避开死胡同并专注于正确的路径。

研究还揭示了关于模型自身能力的迷人模式。研究人员观察到,那些在某项任务中原本就最强大的模型,在获得学习经验的机会时,其进步幅度也最大。似乎一个模型从自身历史中学习的能力与其初始智能密切相关:起始模型越聪明,它消化反馈并进化策略的能力就越强。这种相关性在测试的不同任务中表现得非常一致,表明从经验中学习并非一项独立的技能,而是强大推理系统的一种涌现属性。

即使面对不完美或具有误导性的反馈,模型也展现出了卓越的韧性。在研究人员故意给予模型错误信息(例如告诉它们一个错误的答案是正确的)的实验中,模型并未崩溃。虽然它们的表现略有下降,但最强的模型能够恢复过来,并且往往仍能找到正确答案。这种鲁棒性表明,这些系统并非盲目遵循指令,而是在根据收到的反馈结合自身的内部逻辑进行积极推理。研究还发现,大部分学习过程发生得非常迅速。模型在最初的几次反馈循环中就完成了绝大部分的提升,此后其表现趋于平稳。这意味着最初的反思时刻对于学习至关重要。

研究人员还探索了结合不同类型的反馈是否能带来更好的结果。他们发现,当模型同时接收到内部自我批判和确认答案正确性的外部信号时,这两类信息源协同作用,产生了最高的得分。这种结合让模型既能受益于自我反思的宏观视角,又能受益于外部检查的精确验证。然而,当研究人员试图通过将过去的经验总结为简短记忆来简化过程时,模型的表现反而变差了。这表明,模型尝试过程中的详细、逐步的历史记录包含了关键信息,而这些信息在过度压缩经验时会丢失。

最终,这项工作证明了大型语言模型能够实现一种此前被认为在不经过重新训练的情况下是不可能实现的学习形式。通过允许它们积累经验并与反馈进行交互,它们可以在实时解题过程中进化并改进。研究证实,这种方法不仅有效,而且高效,提供了一种无需巨大计算成本即可从这些强大工具中获取更多价值的方法。随着这些系统的不断发展,从经验中学习的能力可能会成为一项标准功能,从而弥合机器思维与人类学习方式之间的鸿沟。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →