← 最新论文
🤖 AI

When Entropy Is Not Enough: Reclaiming Lost Semantics in LLM Output Length Prediction

本文介绍了 ESTP,这是一个通过结合 Token 熵与基于注意力的语义重要性评分来改进大语言模型输出长度预测的轻量级框架,旨在实现更高效的长度感知调度并降低计算开销。

原作者: Feiyang Ren, Shengtao Wen, Lingbing Guo, Yu Tian, Yuanning Cui, Xiang Chen

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Feiyang Ren, Shengtao Wen, Lingbing Guo, Yu Tian, Yuanning Cui, Xiang Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,大型语言模型充当着强大的引擎,通过预测句子中的下一个词来生成文本、回答问题并解决问题。为了在计算机硬件上高效运行这些引擎,工程师通常会将许多请求组合在一起,就像一辆载有多名乘客的巴士。然而,一个持久的低效问题在于,硬件必须将组内的每一个请求都视为最长的一个来处理,从而用空白空间为较短的响应进行填充以使其适配。这种浪费的空间减慢了整个系统的速度,特别是当模型被要求执行复杂的推理或生成冗长详细的答案时。为了解决这个问题,研究人员长期以来一直在寻求一种方法,能够在答案完全写完之前精确预测其长度,从而使系统能够精准地分配资源。一段时间以来,用于进行此类预测的领先方法主要依赖于测量模型的确定性,即一种被称为“熵”的概念,它本质上衡量了模型对下一个词的不确定程度。

一项新的研究挑战了“仅凭不确定性是完成此项任务的最佳指南”这一假设。研究人员发现,虽然不确定性很有用,但它忽略了一个至关重要的意义层面。在生成文本的过程中,模型会产生大量的信号,其中一些信号表示困惑或犹豫,而另一些则强调最重要的事实、数字或指令。以往的方法过度关注不确定性,往往将那些不确定的、过渡性的词汇视为最关键的部分,却在无意中忽视了那些决定了响应长度和结构的稳固、事实性的标记(tokens)。这就像是试图通过只关注雾气弥漫的交叉路口,而忽略清晰的路标来导航城市;其结果是预测经常出错,因为它错过了核心内容。

为了解决这个问题,该团队引入了一个名为 ESTP 的新框架,它将不确定性度量与对每个词重要性的直接观察相结合。该方法不再仅仅询问模型有多么不确定,还询问模型对特定词汇投入了多少注意力。在这些模型的架构中,注意力就像是一个聚光灯,展示了哪些词正在驱动当前的思考过程。研究人员发现,承载着最重语义权重的词汇——例如关键实体、特定数字和核心指令——即使在模型对它们非常自信时,也往往会获得很高的注意力。通过将这种基于注意力的重要性与传统的确定性信号相结合,新系统创造了一个平衡的视角。它学会了既重视定义答案长度的关键信息,又承认那些预示着需要进一步阐述的不确定部分。

研究人员在包括复杂数学推理和动态采样场景在内的多种挑战性任务上,使用几种不同的语言大模型测试了这种方法。他们发现,与之前的最佳技术相比,这种结合方法能更准确地预测输出长度。在许多情况下,误差率显著下降,特别是在以往方法表现挣扎最严重的复杂推理任务中。研究表明,旧系统中被高估的大部分标记实际上是低价值的填充词,而许多被低估的标记正是决定最终长度的事实本身。通过纠正这种错位,新系统为计算机硬件提供了更清晰的信号。

当集成到旨在管理这些人工智能请求的完整系统中时,这种改进转化为了切实的现实世界收益。该系统能够更高效地调度任务,减少了必须由填充物填补的无效空白空间。这使得硬件处理请求的速度明显提升,并缩短了完成任务所需的时间。该方法在实现这些增益时,无需额外的内存或降低模型的运行速度,因为它复用了模型本身已经在生成的内部信号。研究结果表明,对于人工智能系统要实现真正的效率,它们必须超越简单的确定性度量,学会识别所处理词汇的语义重要性。这种转变使得技术能够以以往难以企及的精度处理复杂的长篇推理,为更快、更可靠的人工智能服务铺平了道路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →