← 最新论文
🤖 machine learning

LEAD: Length-Efficient Adaptive and Dynamic Reasoning for Large Language Models

本文介绍了 LEAD,这是一种新颖的方法,它利用在线自适应性机制在强化学习过程中动态平衡正确性与效率,从而使大型推理模型能够在不损害各类数学基准测试准确性的前提下,生成显著更短的思维链输出。

原作者: Songtao Wei, Yi Li, Zhikai Li, Xu Hu, Yuede Ji, Guanpeng Li, Feng Chen, Carl Yang, Zhichun Guo, Bingzhe Li

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Songtao Wei, Yi Li, Zhikai Li, Xu Hu, Yuede Ji, Guanpeng Li, Feng Chen, Carl Yang, Zhichun Guo, Bingzhe Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位才华横溢但过于健谈的学生正在参加数学考试。这位学生代表现代大型语言模型(LLMs),极其聪明,能够解决难题。然而,他们有一个坏习惯:倾向于“过度思考”。即使面对像"2+2 等于几?”这样简单的问题,他们也可能写出一篇十页的长文,阐述数字的历史、加法的哲学以及数字"2"的一生,最后才给出答案"4"。

这种“过度思考”浪费了时间、精力和计算资源。这篇论文介绍了一种名为LEAD(长度高效自适应与动态推理)的新训练方法,旨在教导这位学生如何在保持聪明的同时做到简洁。

以下是 LEAD 的工作原理,分解为几个简单的概念:

问题所在:“一刀切”的陷阱

此前试图纠正这种健谈行为的尝试,就像一位严厉的老师说:“无论什么问题,你的答案必须恰好是 50 个字。”

  • 问题:这不公平。简单的问题应该简短,但复杂的奥林匹克级别数学题需要长篇解释。如果你强迫难题给出简短答案,学生就会答错;如果你强迫简单问题给出长篇答案,他们就会浪费时间。
  • 结果:旧方法要么让学生变得太短(从而答错),要么缩短得不够。

解决方案:LEAD 的两个聪明技巧

LEAD 就像一位智慧的教练,实时调整教学风格。它主要运用两个技巧:

1. “动态音量旋钮”(自适应奖励)

想象学生根据两件事接受评分:正确性(得出正确答案)和简洁性(保持简短)。

  • 旧方法:老师设定固定规则:“你分数的 50% 取决于正确,50% 取决于简洁。”这行不通,因为在训练初期,学生需要完全专注于学习如何解决问题。如果你过早施压要求简洁,他们就会停止思考并开始猜测。到了后期,一旦他们掌握了解题方法,你就希望推动他们变得更简短。
  • LEAD 的方法:LEAD 使用一个智能音量旋钮
    • 训练初期:旋钮调高“正确性”。学生被允许尽可能多地啰嗦,以找出解决方案。
    • 训练后期:一旦学生开始答对问题,旋钮自动切换。“简洁性”音量调高,“正确性”音量调低(因为他们已经知道如何解题了)。
    • 神奇之处:系统不断检查:“学生是否仍在学习如何变得更简短?”如果是,就推动他们。如果学生已经足够简短,就停止推动,转而专注于确保答案仍然正确。

2. “个性化目标”(每道题的预算)

LEAD 不是给每道题设定固定的字数限制,而是给每道题分配其自己的个性化目标长度

  • 工作原理:系统查看学生的成功尝试。
    • 如果学生用 2000 字正确解决了一道难题,LEAD 会说:“好的,对于这道特定的难题,目标就是 2000 字。不要低于这个字数,否则你可能跳过了步骤。”
    • 如果学生用 200 字解决了一道简单题,LEAD 会说:“很好,这道题的目标就是 200 字。”
  • 对称奖励:LEAD 是公平的。它不仅惩罚冗长的答案,也惩罚过短的答案。如果学生对一道难题只给出 10 个字的回答,LEAD 会说:“太短了;你可能作弊或猜的。”这防止学生走懒惰的捷径。

结果:“金发姑娘”式的学生

在五个不同的数学基准测试中,LEAD 培养出的学生:

  1. 比其他试图缩短回答的方法答对了更多题目
  2. 比原本健谈的模型说话显著更少
  3. 在聪明与简洁之间实现了最佳平衡(称为“准确率 - 效率得分”)。

类比总结

将原始模型想象成一位导游,即使游客只想快速参观一个地标,他也喋喋不休。

  • 旧方法试图给导游设个计时器:“五分钟后停止说话。”这意味着导游会匆忙通过复杂的博物馆(导致出错),或者拖长简单的公园游览(浪费时间)。
  • LEAD则像一位智能经理,时刻观察导游。
    • 如果导游在努力解释一幅复杂的画作,经理会说:“慢慢来,充分解释。”
    • 如果导游在解释一座简单的雕像,经理会说:“你已经说到点子上了,用两句话收尾吧。”
    • 经理在游览进行中调整规则,确保导游始终保持恰到好处的健谈程度。

简而言之,LEAD 教导 AI 模型知道何时深入思考,何时保持简洁,根据任务的难度和自身的进展进行调整,而不是遵循僵化的“一刀切”规则。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →