← 最新论文
🤖 AI

What is Missing from AI Post-Training AI: An Empirical Analysis

本文认为,尽管 AI 智能体能够有效地执行预定义的训练策略,但它们缺乏在后训练过程中自发重新评估并修正其高层策略的内在能力,这种局限性在经验、人类指导以及额外推理计算能力的提升下依然存在。

原作者: Joy Jia Yin Lim, Xin Huang, Hao Peng, Yaxi Lu, Xin Cong, Zhong Zhang, Maosong Sun, Yankai Lin

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Joy Jia Yin Lim, Xin Huang, Hao Peng, Yaxi Lu, Xin Cong, Zhong Zhang, Maosong Sun, Yankai Lin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在快速发展的人工智能领域,一种新型的劳动者已经出现:AI智能体(AI agent)。它们不仅仅是回答问题或编写文本的程序;它们是能够随着时间推移规划并执行复杂任务的系统。它们可以编写计算机代码、发起实验,甚至训练其他的智能模型。这种能力引发了“以AI优化AI”的愿景,即智能系统在持续的循环中实现自我改进,从而可能导致机器在无需人类干预的情况下设计出更好的机器。为了测试这一愿景,研究人员设立了一个特定的挑战:要求一个AI智能体通过改进一个基础语言模型,使其在处理困难任务(如解决数学问题或编写代码)时表现得更好。研究人员希望该智能体能像一位熟练的科学家一样,提出计划、运行实验、观察哪里出了错,然后从根本上改变其方法以尝试新路径。

来自清华大学、中国人民大学以及电子科技大学的研究团队最近调查了这些AI智能体是否真正具备这种科学灵活性。他们检查了数千次记录的会话,在这些会话中,不同的AI智能体试图通过七个不同的基准测试(从小学数学到研究生水平的科学推理)来改进语言模型。研究人员将智能体的工作区分为了两种类型。第一种是执行(execution):即执行既定计划的能力,例如修复代码中的漏洞、调整学习速率或清理数据。第二种是策略(strategy):即观察结果并判定整个计划是错误的情况,进而转向一种完全不同的方法的能力。研究发现,虽然智能体在执行第一类工作方面表现出色,但在执行第二类工作方面几乎完全无能为力。

研究人员分析了来自名为PostTrainBench的公开数据集中的1,300多个训练会话。他们发现了一个显著的模式:在几乎所有案例中,AI智能体都在会话开始后的最初几分钟内就决定了其高层级的方法,并在整个十小时的过程中始终坚持这一方法。如果一个智能体开始尝试使用一种被称为“全参数微调”的方法来教导模型,它就会在这一方法上持续数小时,即使结果很差。它会花时间进行微小的调整,比如改变学习率或重新格式化数据,但绝不会考虑完全切换到另一种训练方法。相反,如果一个智能体以另一种被称为“参数高效微调”的方法开始,它也会锁定在该方法中。策略的选择更多取决于所使用的特定AI智能体,而非它试图解决的任务。这种“锁定”意味着智能体实际上是在原地打转,在单一方法已经不再奏效后,仍在对其进行细微的改进。

为了理解发生这种情况的原因,研究人员测试了三种可能的解释,并通过升级干预措施来观察是否能打破智能体的这种循环。首先,他们怀疑智能体是否仅仅是缺乏经验。他们给了智能体一个数字日志来记录观察结果,一个从开源项目中提炼出的技能库,以及一个专门用于提供诊断和建议的评估智能体。这种设置显著提高了智能体执行任务的能力,提升了它们在数学和编程基准测试中的表现。然而,即便有了这些额外的帮助以及明确的失败证据,智能体仍然拒绝改变其高层级策略。它们会遵循评估者的建议去微调某个设置,但会忽略掉切换方法的建议。

接下来,研究人员测试了智能体是否需要更好的引导。他们引入了一名人类评审员,在训练开始前查看智能体的初始计划,并明确告知其选择另一种策略。这在开始阶段效果显著:智能体理解了新指令并实施了不同的计划。然而,一旦训练正式开始,智能体很快就恢复了旧有的习惯。它们会开始进行局部调整,并停止考虑更宏观的策略,实际上在工作开始后就忽略了人类的指导。最后,研究人员测试了智能体是否仅仅是需要更多思考的时间。他们给了智能体显著更多的计算能力来进行决策。在较简单的任务上,这种额外的思考时间有助于提高结果;但在最困难的任务上,额外的算力几乎没有带来任何收益。智能体只是利用额外的时间来更加精细地完善其锁定的策略,而不是意识到自己需要改变方向。

研究结论指出,自动化AI研究中缺失的要素并非缺乏经验、指导或原始算力。这些智能体显然具备理解新策略并在被告知时执行它的能力。它们缺乏的是在发现当前路径失败时,能够自发识别并主动决定改变方向的自觉性。提出假设、运行实验并修正方法的循环,仅在局部微调层面完成了闭环。而在整体策略层面,这个循环依然是开放的。这些自动化系统的上限是由它们做出的第一个决策的质量决定的,而不是由它们工作的时间长短或思考程度决定的。在AI智能体能够学会在执行过程中自发地重新开启战略选择之前,它们将始终只是称职的工人,而无法成为真正的科学家。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →