← 最新论文
🤖 machine learning

LongAct: Harnessing Intrinsic Activation Patterns for Long-Context Reinforcement Learning

本文提出了 LongAct 方法,通过利用长上下文处理中查询和键向量的大模值激活模式,采用显著性引导的稀疏更新策略替代均匀更新,从而在多种强化学习算法中显著提升了大语言模型的长上下文推理能力与泛化性能。

原作者: Bowen Ping, Zijun Chen, Tingfeng Hui, Qize Yu, Chenxuan Li, Junchi Yan, Baobao Chang

发布于 2026-04-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Bowen Ping, Zijun Chen, Tingfeng Hui, Qize Yu, Chenxuan Li, Junchi Yan, Baobao Chang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 LongAct 的新方法,旨在让大型人工智能模型(LLM)在处理超长文本(比如整本小说、长篇会议记录或复杂的法律文件)时,变得更聪明、更擅长推理。

为了让你轻松理解,我们可以把训练 AI 的过程想象成**“教一个学生做阅读理解”,而 LongAct 则是一种“聪明的复习策略”**。

1. 核心问题:为什么现在的 AI 读长文会“晕”?

想象一下,你让一个学生读一本 10 万字的书,然后问他书里的细节。

  • 传统方法(全量更新): 老师(训练算法)要求学生在复习时,把书里的每一个字、每一个标点符号都重新背一遍,试图记住所有细节。结果学生累得半死,反而把重点搞混了,甚至因为信息太多而“死机”(模型崩溃)。
  • 现状: 以前的研究大多是在想办法“出题”(设计更好的奖励)或者“编教材”(合成数据),但很少去研究学生大脑里到底是怎么思考的

2. LongAct 的灵感:发现“关键少数”

研究人员观察了 AI 在处理长文时的大脑活动(也就是激活值),发现了一个有趣的现象:

  • 大脑里的“噪音”与“信号”: 在 AI 处理长文时,它的大脑里大部分神经元其实是在“打酱油”(激活值很小,像背景噪音)。
  • 关键发现: 只有极少数的神经元在疯狂工作,它们的激活值非常大(高幅度激活)。这些就像学生大脑里最亮的那几盏灯,真正承载着理解长文逻辑的核心信息。

比喻:
这就好比在一场嘈杂的万人演唱会里,虽然有几万人都在喊,但真正能听清歌词、理解歌曲含义的,只有那几个关键的和声歌手。其他的几万人其实都在跟着瞎喊。

3. LongAct 是怎么做的?(从“大锅炖”到“精准打击”)

基于这个发现,LongAct 提出了一种**“ saliency-guided sparse updates"(显著性引导的稀疏更新)**策略。

  • 以前的做法(均匀更新): 不管三七二十一,把模型里所有的参数(就像把学生所有的知识点)都拿出来重新训练一遍。这就像让学生把整本书从头到尾抄写 100 遍,效率极低且容易出错。
  • LongAct 的做法(精准更新):
    1. 照妖镜: 先照一下,找出那些“高亮度”的神经元(关键信息)。
    2. 只练重点: 在训练(强化学习)过程中,只更新这些关键神经元对应的参数。
    3. 冻结其余: 把那些“打酱油”的神经元(低激活值部分)暂时冻结,不让它们乱动。

比喻:
这就好比老师教学生复习,不再让学生死记硬背整本书,而是直接告诉学生:“这本书里只有30% 的核心段落是真正决定你能否做对题的关键。你只需要精读并反复练习这 30%,剩下的 70% 只要大概知道就行,不用花时间去死磕。”

4. 效果如何?(事半功倍)

这种方法带来了惊人的效果:

  • 成绩提升: 在长文本测试(LongBench v2)中,AI 的得分直接提升了约 8%。这就像学生原本只能考 70 分,用了这个策略后直接考到了 80 多分。
  • 通用性强: 不管用什么训练算法(就像不管用哪种补习班),只要加上这个“只练重点”的策略,成绩都会变好。
  • 稳定性: 即使文章变得非常长(比如从 3 万字变成 12 万字),AI 也不会像以前那样容易“发疯”或重复说废话。

5. 一个有趣的实验:拔掉“关键灯”

为了证明这些“高亮度神经元”真的这么重要,研究人员做了一个破坏性实验:

  • 实验 A(拔掉“噪音”): 把那些激活值低的神经元(打酱油的)强行关掉。结果:AI 依然能正常思考,逻辑清晰,答案正确。
  • 实验 B(拔掉“关键”): 把那些激活值高的神经元(关键灯)强行关掉。结果:AI 瞬间崩溃,开始胡言乱语,或者陷入死循环(比如一直重复"3333...")。

结论: 这证明了在长文本推理中,那 30% 的关键神经元就是 AI 的“灵魂”所在

总结

LongAct 的核心思想就是:不要试图记住所有细节,要抓住核心逻辑。

它告诉我们要像精明的管理者一样,在训练 AI 处理长任务时,不要“撒胡椒面”式地全面优化,而是要精准识别并强化那些真正起作用的“关键少数”。这不仅让 AI 学得更快、更准,还让它读长文时不再容易“晕头转向”。

这就好比:与其让一个学生把图书馆所有的书都背下来,不如教他如何快速找到并读懂那几本最重要的书

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →