← 最新论文
🤖 machine learning

Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning

本文引入了技能熵(Skill Entropy)作为一种量化不同推理技能间切换难度的全新指标,提出了用于评估跨技能长程任务的 Skill²-Bench 基准测试,并证明了 Skill-Entropy RL 训练框架能显著提升模型在这些复杂多步问题上的表现。

原作者: Yinghui He, Ling Yang, Jiarui Liu, Yongjin Yang, Lechen Zhang, Yingcheng Wu, Zhenfei Yin, Mengdi Wang, Sanjeev Arora

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Yinghui He, Ling Yang, Jiarui Liu, Yongjin Yang, Lechen Zhang, Yingcheng Wu, Zhenfei Yin, Mengdi Wang, Sanjeev Arora

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:迈向技能原生 LLM:用于基准测试和训练长程推理的技能熵

1. 问题陈述

近期的大语言模型(LLMs)在长程推理方面展现出了强大的能力,推动了深度研究、智能体编程和多步规划的发展。然而,现实世界的长程任务通常需要跨技能推理:一个单一的思维链必须能够在不同的推理技能之间流畅切换(例如,从数学推导切换到日程规划,再切换到信息提取)。

现有的基准测试通常孤立地评估单个技能,或在单一领域内进行步骤链式评估。它们缺乏一种原则性的机制来衡量或解决在推理链中切换不同技能的难度。实证观察表明,虽然前沿模型在单技能基准测试中表现出色,但在组合式的跨技能任务中却表现出脆弱性。这种“技能切换差距”即使在模型能够很好处理每个组成部分技能的情况下依然存在,这表明切换技能的能力是领域特定能力的一个正交能力。

2. 方法论

2.1 技能熵 (Skill Entropy, SkE)

作者引入了技能熵,这是一种有向成对度量,用于量化从一种技能 sas_a 切换到另一种技能 sbs_b 的难度。

  • 定义: 技能熵被定义为在固定参考模型下,平均单技能准确率与跨技能准确率之间的平滑比例。
    SkE(sa,sb)=12(Accuracy(sa)+Accuracy(sb))+αAccuracy(sa,sb)+α \text{SkE}(s_a, s_b) = \frac{\frac{1}{2}(\text{Accuracy}(s_a) + \text{Accuracy}(s_b)) + \alpha}{\text{Accuracy}(s_a, s_b) + \alpha}
    其中 α\alpha 是拉普拉斯平滑常数。
  • 解释: 数值 >1>1 表示将这两个技能进行链式组合会增加显著的难度(难以切换)。数值 1\le 1 则表示切换是容易的。
  • 任务级指标: 对于一个具有技能序列 (s1,,sL)(s_1, \dots, s_L) 的跨技能任务 τ\tau,其任务级技能熵是沿序列的成对熵的平均值:
    SkE(τ)=1L1i=1L1SkE(si,si+1) \text{SkE}(\tau) = \frac{1}{L-1} \sum_{i=1}^{L-1} \text{SkE}(s_i, s_{i+1})

2.2 Skill2-Bench

基于技能熵框架,作者构建了 Skill2-Bench,这是一个用于跨技能长程推理的基准测试。

  • 范围: 它涵盖了 9 个领域 中的 558 种技能:数学、科学、编程、逻辑、信息提取、规划、创意写作、上下文检索和指令遵循。
  • 构建: 通过在特定的熵水平(低、中、高)下采样技能序列,并将种子问题重写为一个连贯的情景,其中每一步都依赖于前一步的输出。
  • 评估协议: 模型以两种模式进行评估:
    1. 单技能模式: 步骤在隔离状态下进行回答。
    2. 跨技能模式: 展示完整的长程任务,要求进行顺序切换。

2.3 技能熵强化学习 (Skill-Entropy RL)

为了解决识别出的差距,作者提出了 Skill-Entropy RL,这是一个使用技能熵作为训练信号的强化学习框架。

  • 输出格式: 模型被训练为为每一步生成结构化响应,显式地预测所使用的技能答案
    <skill> 领域_技能 </skill><answer> 步骤答案 </answer>
  • 奖励函数: 总奖励 rr 结合了步骤级正确性 (ransr_{ans}) 与技能熵奖励 (rentr_{ent}):
    r=λansrans+λentrent r = \lambda_{ans} r_{ans} + \lambda_{ent} r_{ent}
    • ransr_{ans}: 基于领域特定评分器的每步平均准确率。
    • rentr_{ent}: 通过比较预测的技能序列与金标准技能序列的任务级技能熵排名,衡量两者之间的对齐程度。这鼓励模型预测出与地面真值难度剖面相匹配的技能链。
  • 训练流水线: 该方法利用两阶段过程:在带有技能标注的轨迹上进行监督微调 (SFT),随后使用复合奖励进行群体相对策略优化 (GRPO)。

3. 关键结果

3.1 基准测试发现 (Skill2-Bench)

  • 技能切换差距: 对 8 个前沿模型和 4 个开源模型进行评估显示,随着任务级技能熵的增加,性能出现持续下降。准确率从低熵任务到高熵任务几乎呈单调递减。
  • 跨技能惩罚: 当相同的技能在跨技能任务而非隔离状态下执行时,各模型的准确率下降了 4% 到 13%。即使对于模型在隔离状态下高度精通的技能(如逻辑),这种惩罚依然存在。
  • 失效模式分析: 主要的失效模式是技能惯性 (skill inertia)。在任务的后期步骤中,模型倾向于重复前一步的技能和答案模态,而不是切换到所需的技能。例如,一个模型可能会在下一步需要“创意写作”并使用文本段落时,仍然继续使用“数学”技能和数值答案格式。

3.2 训练表现 (Skill-Entropy RL)

  • 显著提升:Qwen3-4B-Instruct 上,Skill-Entropy RL 将 Skill2-Bench 的得分从 34.4% 提高到 68.4%。在 Qwen3-1.7B 上,得分从 14.6% 提高到 40.1%
  • 对比: 该方法优于竞争性的基准方法,包括标准的 GRPO(不带熵奖励)、SFT 以及其他技能感知后训练方法(Skill-Distill, SkillRL, STAT)。
  • 泛化能力:
    • 开放式领域: 尽管仅在可验证领域进行训练,模型在开放式领域(创意写作、上下文检索)也表现出了增益,这表明技能熵信号可以迁移到未见领域。
    • 现成数据: 该流水线成功应用于并非最初以显式技能序列构建的 OpenR1-Math 数据集。通过为现有轨迹标注技能,技能熵奖励持续提升了性能,证明了其可重用性。

4. 重要性与主张

本文声称解决了评估和训练用于复杂推理的 LLM 时的一个关键差距:

  1. 新指标: 引入了技能熵,作为一种原则性的、有向的成对度量,用于量化切换技能的难度,超越了单领域评估。
  2. 基准测试: Skill2-Bench 提供了第一个由该指标校准的大规模基准测试(558 种技能,9 个领域),揭示了单领域评估所忽略的结构性“技能切换差距”。
  3. 训练信号: 证明了技能熵不仅是一个诊断工具,也是一个可重用的训练信号。通过将其纳入 RL 奖励函数,模型学会了显式地管理技能转换,显著提高了长程推理能力。
  4. 失效模式识别: 本工作具体确定了“技能惯性”(重复前一步的技能/模态)是跨技能任务失败的主要原因,并提供了缓解该问题的机制。

作者得出结论,处理技能切换是领域能力的一个正交能力,而“技能原生”LLM——即被训练去显式预测并管理自身技能序列的模型——是实现鲁棒长程推理的一条可行路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →