← 最新论文
💬 NLP

Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning

本文将“重复复制”识别为长文本推理中的一种关键失效模式,即模型会无差别地复制输入文本而非专注于关键证据,并提出了 GEAR,一种基于证据感知的强化学习方法,通过奖励对相关信息的溯源并惩罚对无关干扰项的依赖来提升性能。

原作者: Lizhe Fang, Weizhou Shen, Tianyi Tang, Yisen Wang

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Lizhe Fang, Weizhou Shen, Tianyi Tang, Yisen Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图解开一部长达100页的巨型悬疑小说,而线索都隐藏在第一章,剩下的部分则只是一堆嘈杂的噪音。你有一个超级聪明的侦探朋友(一个大语言模型),他能在不到一秒钟的时间内读完整本书。过去,这些侦探在处理短篇故事时表现出色,但当你把这本100页的长篇小说交给他们时,他们开始表现得有些异常。他们不再进行思考,而是开始陷入“恐慌性复制”。他们不再撰写侦探笔记,而是开始将原书中的大段文字原封不动地粘贴回页面上,一遍又一遍。这篇名为《少复制,多落地》(Copy Less, Ground More)的论文深入探讨了这一特定的故障。它研究了这些旨在进行逐步推理的AI“思考”模型,是如何在面对过长的文本时,陷入盲目复制文本的死循环中的。研究人员发现,这不仅仅是一个无伤大雅的小习惯;这是一个陷阱,它会让AI变得更笨、更慢,并且更难解决谜题。他们提出了一种新的训练方式,教导这些AI忽略噪音,只专注于那些真正关键的微小线索。

问题始于这些AI侦探面临“长上下文”挑战的时候。把长上下文想象成一座巨大的图书馆,而问题的答案就埋藏在数百万个单词之中。该论文确定了一种被称为“重复复制”的关键失效模式。当图书馆变得巨大时,AI停止了思考,开始表现得像一台大脑损坏的复印机。它不再去推导解决方案,而是直接将提示词(问题和故事)中的大段篇章复制到自己的推理轨迹中。研究人员发现,这种现象几乎出现在他们测试的所有顶尖AI模型中,而且随着故事长度的增加,情况会变得更加严重。这就像一个学生在参加考试时,不去解数学题,而是开始在答题纸上重写教科书的内容。这种行为是普遍存在的,出现在七种不同的前沿模型中,并且随着上下文长度从8,000个单词增加到64,000个单词,这种行为会不断加剧。

但为什么AI会这样做呢?作者进行了深入研究,意识到根源并不在于复制本身是坏事,而在于AI在“不加区分地复制一切”。他们发现,AI未能将其“落地”(ground)在关键证据之上。想象一下,你正在一个巨大的毛线球中寻找一根特定的红线。一个聪明的侦探会只把那根红线抽出来。然而,困惑的AI会抓起整个毛线球,包括所有的蓝色、绿色和黄色垃圾,并把它们一起拖走。论文表明,当AI复制大部分是“干扰项”文本(即垃圾信息)时,它会任务失败。但当它选择性地复制“关键证据”(即红线)时,它就会成功。问题不在于复制,而在于缺乏专注力。AI淹没在无关的细节中,因为它不知道如何从噪音中分辨出信号。

为了解决这个问题,团队发明了一种新的训练方法,称为GEAR(落地证据感知奖励)。把它想象成一套新的游戏规则。在旧的游戏中,AI只有在得出最终正确答案时才会获得积分。在新的GEAR游戏中,规则更加严格:如果AI的推理轨迹与特定的“关键证据”(红线)重合,它会获得加分;但关键在于,如果它的轨迹与“干扰项”文本(垃圾信息)重合,它会受到严厉的惩罚。这创造了一种拉锯战。AI学习到,想要获胜,它必须成为一名狙击手,而不是机关枪手。它必须找到正确的线索,并忽略其余的部分。为了让这种方法在现实世界的文档(而不只是虚构的数学题)上奏效,他们构建了一个自动化的流水线,充当一名聪明的编辑,将长文档切片,以识别哪些部分是“证据”,哪些部分只是“废话”,从而创建了一个包含3,200个问题的训练数据集。

当他们测试这种新方法时,结果带来了颠覆性的变化。他们使用GEAR奖励系统训练了三种不同规模的AI模型(参数量从90亿到350亿不等)。结果显示,GEAR的表现一致优于标准的训练方法。平均而言,它在各种困难基准测试中将AI的性能提升了高达4.6个点。更重要的是,它纠正了那些坏习惯:AI不再进行大量的复制,它的“思考”轨迹变得更短、更高效,并且它在解决问题方面确实变得更强了,尤其是在处理极长上下文(高达128,000个单词)时。论文指出,即使在AI向复杂推理迈进的过程中,能够稳固地立足于正确证据的能力才是最重要的技能。如果没有这种能力,AI只会迷失在自己的复制之中。有了GEAR,它学会了少复制、多落地,从而将一个混乱的复印机重新变回了一名敏锐的侦探。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →