← 最新论文
💬 NLP

Learning Evidence Highlighting for Frozen LLMs

本文提出了 HiLight 框架,通过训练一个轻量级的“强调执行器”(Emphasis Actor)在不改变原始上下文的情况下为关键证据添加高亮标签,并利用强化学习在无需证据标签且不改动冻结大模型(Solver)的前提下,显著提升了模型在长文本任务中的推理能力。

原作者: Shaoang Li, Yanhang Shi, Yufei Li, Mingfu Liang, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Frank Shyu, Luke Simon, Sandeep Pandey, Xi Liu, Jian Li

发布于 2026-04-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Shaoang Li, Yanhang Shi, Yufei Li, Mingfu Liang, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Frank Shyu, Luke Simon, Sandeep Pandey, Xi Liu, Jian Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这是一篇关于如何让大语言模型(LLM)在面对“长篇大论”时不再“抓不住重点”的研究。我为你准备了一个生动的比喻来解释它。

核心问题:大模型的“阅读障碍”

想象一下,你正在参加一场超级复杂的**“寻宝游戏”**。

规则是这样的:裁判给你一叠厚厚的、长达几百页的**《丛林探险手册》**(这就是“长上下文”),里面记载了无数的植物、动物、天气和地形。你的任务是根据一个简单的指令(比如:“找到那个能治愈感冒的紫色果实”)从手册里找出答案。

现在的顶级大模型就像是一个博学但容易分心的探险家。虽然他读过很多书,但当手册变得特别厚时,他就会出现“注意力涣散”:

  1. 迷失在中间:他可能记得手册开头和结尾的内容,但手册中间那页写着关键线索的地方,他竟然直接跳过去了(这就是论文里提到的“Lost in the Middle”现象)。
  2. 被噪音干扰:手册里写满了“这里有红色的花”、“那里有绿色的草”,这些废话太多,让他很难一眼看到那个“紫色果实”的描述。

HiLight 的解决方案:给探险家配一个“荧光笔助手”

这篇论文提出的 HiLight 框架,并不是试图去修改这个探险家的大脑(因为大模型通常是“冻结”的,即参数不可更改),也不是试图把厚手册删减成小册子(因为删减可能会把关键信息弄丢)。

HiLight 引入了一个极其轻量级的**“荧光笔助手”**(Emphasis Actor)。

它是怎么工作的?

  1. 第一步:助手划重点(Highlighting)
    在探险家开始读手册之前,这个小助手先快速扫一遍。他并不改动手册的任何一个字,只是在发现关键线索的地方,轻轻地贴上一个**“荧光标签”**(比如在“紫色果实”周围贴个小标签 <start_important> 紫色果实 <end_important>)。

  2. 第二步:探险家精准阅读(Reasoning)
    探险家(大模型)拿到手册时,看到的是原汁原味的内容,但那些闪闪发光的荧光标签就像是在黑夜里的路标,瞬间把他的注意力拉到了最关键的地方。

  3. 第三步:通过“结果”来学习(Reinforcement Learning)
    最聪明的地方在于:这个小助手一开始也不知道哪里是重点。于是,他们玩了一个**“反馈游戏”**。

    • 助手划了重点 \rightarrow 探险家去回答问题 \rightarrow 如果答对了,助手得到奖励 \rightarrow 助手下次就会在类似的地方划重点。
    • 助手划错了 \rightarrow 探险家答错了 \rightarrow 助手受到惩罚 \rightarrow 助手下次就会避开这些干扰项。
      重点是: 助手不需要知道标准答案是什么,他只需要看探险家最后能不能把题做对!

这项研究为什么厉害?(三大亮点)

  • “不破坏原貌” (Non-destructive)
    很多方法会把长文章总结成短文,但这就像把一幅精美的油画压缩成一张缩略图,细节全丢了。HiLight 保留了所有细节,只是加了点“高亮”。

  • “通用性极强” (Transferability)
    这个助手非常聪明,他学到的是**“什么样的信息是有价值的”**这种逻辑。所以,即使你换了一个更厉害的探险家(比如从 Qwen 换成 GPT-5),或者换了一个不同规模的探险家,这个助手划出的重点依然非常管用。

  • “省钱又高效” (Efficiency)
    这个助手非常轻量,他工作速度极快,几乎不会增加探险家阅读的时间,但却能显著提高探险家找到宝藏的概率。

总结

HiLight 就像是给一个容易走神的学霸配了一个聪明的笔记助手。助手不替学霸思考,只是在厚厚的课本上精准地画出重点,让学霸能把所有的精力都花在真正的逻辑推理上。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →