← 最新论文
💬 NLP

Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling

本文介绍了 LenVM,这是一个可扩展且无需标注的框架,它将剩余生成长度建模为 token 级价值信号,显著提升了精确长度匹配能力,并使得自回归模型能够持续调控性能与效率之间的权衡。

原作者: Zhen Zhang, Changyi Yang, Zijie Xia, Zhen Yang, Chengzhi Liu, Zhaotiao Weng, Yepeng Liu, Haobo Chen, Jin Pan, Chenyang Zhao, Yuheng Bu, Alkesh Patel, Zhe Gan, Xin Eric Wang

发布于 2026-05-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhen Zhang, Changyi Yang, Zijie Xia, Zhen Yang, Chengzhi Liu, Zhaotiao Weng, Yepeng Liu, Haobo Chen, Jin Pan, Chenyang Zhao, Yuheng Bu, Alkesh Patel, Zhe Gan, Xin Eric Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观看一位说书人讲述故事。有时他们在几句之后便停住;有时则滔滔不绝地讲上几个小时。在人工智能(AI)的世界里,这种“说书”过程就是逐词(token)生成文本的过程。

问题在于,当前的 AI 模型就像那些不知道何时该停下的说书人。它们可能过早停止(导致故事未完成),也可能讲得太久(浪费时间和金钱)。现有的控制方法就像在故事一开始就给说书人一个生硬的指令:“讲一个 5 分钟的故事。”说书人必须在说出第一个字之前猜出整个故事的长度,这往往会导致错误。

本文介绍了一种名为LenVM(长度值模型)的新工具。你可以将 LenVM 想象成 AI 在说话过程中随身携带的一枚智能内部指南针

核心理念:“距离终点”指南针

LenVM 不再试图猜测故事的总长度,而是在每一步回答一个简单的问题:“我还需要走多远?”

以下是其工作原理,通过几个类比来说明:

1. “收费公路”类比
想象 AI 正行驶在高速公路上。每生成一个词(一个“token”),它就必须支付微小的过路费。

  • 目标:AI 希望尽可能高效地抵达目的地(句子的结尾)。
  • 计算:LenVM 计算 AI 从此刻起直到旅程结束所预期的“总过路费”。
  • 结果:如果 AI 刚刚开始一段长篇解释,“总过路费”很高(一个较大的负数)。如果 AI 即将结束,“总过路费”则非常低(接近零)。

2. “恒温器”类比
通常,AI 的生成就像一台加热器,一直吹出热风,直到你手动将其关闭。LenVM 则像一个智能恒温器。它不断感知房间距离目标温度(目标长度)还有多远。

  • 如果 AI 需要很快停止,LenVM 会发出信号:“我们快到了!选择那些能导向快速结束的词语。”
  • 如果 AI 需要继续,LenVM 会发出信号:“我们还远着呢!选择那些能允许更多细节的词语。”

LenVM 实际能做什么(论文的声明)

研究人员通过一个巧妙的技巧训练了这枚“指南针”:他们不需要人工标注数据。他们只需让 AI 生成故事,统计字数,并教导 LenVM 预测完成这些故事所需的“剩余成本”。由于这在每一个词发生时都在进行,因此训练数据是海量且自动生成的。

以下是论文证明 LenVM 能够做到的事情:

1. 精确长度控制(“完美合身”的裁缝)
如果你要求 AI 恰好写 500 个词,标准模型往往会严重偏离目标。LenVM 则像一位拿着卷尺的裁缝。

  • 结果:在一项名为 LIFEBench 的测试中,使用 LenVM 的标准 70 亿参数模型,其达到精确字数统计的能力得分从30.9 提升至 64.8
  • 对比:这款带有 LenVM 的开源模型,在达到精确长度方面的表现,实际上优于一些依赖简单提示的最先进的闭源“黑盒”模型(如 GPT-4o 或 Claude)。

2. “效率旋钮”(性能与速度的权衡)
有时你想要一个完美、详尽的答案;有时你只需要一个快速、足够好的答案。

  • 结果:LenVM 允许你滑动一个旋钮。你可以告诉 AI:“给我你能找到的最佳答案,但请尽量将其控制在 200 个词以内。”
  • 神奇之处:如果没有 LenVM,如果你强制 AI 在 200 个词处停止,其在数学问题上的准确率会降至6%。而在 LenVM 指导词语选择的情况下,准确率保持在**63%**的高位。它找到了 AI 已经知道但通常忽略的“捷径”。

3. “水晶球”(预测未来)
LenVM 可以审视最初的提示(在 AI 说出第一个词之前),并预测答案的长度。

  • 结果:它能以高精度猜测数学题解答或代码片段的长度。这有助于计算机在开始工作之前就规划好内存和预算。

4. “X 光视力”(理解 AI 的思维)
由于 LenVM 在每一步都检查“距离终点的距离”,它揭示了 AI 决定停止或继续的位置

  • 发现:论文发现,像“啊”、“等等”或“让我们思考”这样的词,通常标志着 AI 即将开启一段更长的旅程(一个“正长度 token")。而像“因此”、“完美”或像对勾(✓)这样的表情符号,则标志着 AI 正在收尾(一个“负长度 token")。这为我们打开了一扇观察 AI 推理过程的窗口。

总结

LenVM 是一种教导 AI 理解其自身“距离终点线”的新方法。它将模糊的“长度”概念转化为一种精确的、数学化的信号,供 AI 实时使用。

  • 无需标注:它从 AI 自身的输出中自动学习。
  • 可扩展:随着 AI 变得更大,它的效果会更好。
  • 实用:它让我们能够控制 AI 说话的时长,而无需改变 AI 的“大脑”,只需逐词引导其选择即可。

论文得出结论,这种“词级价值信号”是使 AI 更高效、可预测且可控的强大新工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →