← 最新论文
🤖 machine learning

Cost-Aware Learning

本文介绍了成本感知学习,这是一个通过考虑不同采样成本来最小化总训练成本的框架,提出了具有理论保证的成本感知 SGD 算法及子集选择方法,并将这些见解应用于开发成本感知 GRPO,该方法在保持性能的同时将大语言模型策略优化中的 token 使用量降低了高达 30%。

原作者: Clara Mohri, Amir Globerson, Haim Kaplan, Tomer Koren, Yishay Mansour

发布于 2026-05-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Clara Mohri, Amir Globerson, Haim Kaplan, Tomer Koren, Yishay Mansour

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位厨师,正试图完善一道新菜谱。你的目标是品尝这道菜,调整调味,使其味道完美(达到目标“误差”水平)。

在标准计算机训练的假设中,品尝每一种食材所花费的时间和精力完全相同。无论你品尝的是一撮盐还是一整碗汤,“成本”都是一样的。因此,你只需随机品尝,直到尝对为止。

但在现代人工智能(特别是大型语言模型)的现实世界中,情况并非如此。有些“食材”(训练数据)廉价且品尝迅速(短句),而另一些则昂贵且缓慢(长而复杂的推理链)。品尝一个长而复杂的故事,其所需的计算能力可能是品尝短故事的 100 倍。

这篇论文介绍了一种名为成本感知学习(Cost-Aware Learning)的新烹饪方法。厨师(算法)不再随机品尝,而是学会明智地决定品尝什么以及品尝频率,在信息的价值与品尝成本之间取得平衡。

以下是他们方法的分解,使用简单的类比:

1. 问题:“昂贵汤羹”困境

想象你有一锅巨大的汤,里面含有 1,000 种不同的食材。

  • 食材 A:一小撮盐。品尝它很便宜,但它告诉你的整体风味信息很少。
  • 食材 B:一整只烤鸡。品尝它非常昂贵(需要很长时间咀嚼和消化),但它能告诉你关于风味的巨大信息量。
  • 食材 C:中等大小的胡萝卜。品尝它花费稍多,但能提供适量的风味信息。

旧的方法只是随机挑选食材。这会导致要么过于频繁地品尝昂贵的鸡肉而浪费时间,要么在真正需要了解鸡肉时却浪费时间在廉价的盐上。

2. 解决方案:“成本感知 SGD"(智能品尝者)

作者提出了一种名为成本感知随机梯度下降(Cost-Aware Stochastic Gradient Descent, SGD)的新策略。

该算法不再随机挑选食材,而是使用“智能品尝者”规则。它根据以下两点为每种食材计算分数:

  1. 它提供多少风味信息:(数学术语中,即“梯度范数”或添加它时味道变化的程度)。
  2. 品尝它的成本是多少:(数学术语中,即所需的 token 数量或计算能力)。

黄金法则:算法表示,“我想品尝那些每花费一元钱能带来最大风味变化的食材。”

  • 如果一个长而昂贵的故事对 AI 的学习产生巨大影响,那么它值得付出成本。
  • 如果一个短而便宜的故事几乎没有影响,就跳过它。
  • 如果一个长故事几乎没有影响,不要浪费钱去品尝它,即使跳过它很便宜。

他们在数学上证明,这种“高价值/低成本”的特定组合是无需耗尽预算就能获得完美菜谱的最快途径。

3. “子集选择”(菜单策划)

有时,即使是最聪明的品尝者也完全负担不起品尝最昂贵的项目。论文提出了第二个技巧:子集选择(Subset Selection)。

想象你决定完全从品尝菜单中移除“昂贵的鸡肉”。你接受最终菜谱可能会略微不那么完美(微小的“偏差”),但通过从不品尝鸡肉,你节省了巨额资金。你只专注于胡萝卜和盐。

作者表明,通过仔细选择剔除哪些昂贵项目,你仍然可以用一小部分成本获得非常不错的菜谱。这就像决定制作一道素食版本的菜肴以节省开支,同时知道它依然美味可口。

4. 付诸实践测试:“AI 厨师”(成本感知 GRPO)

作者将这些理论应用于使用GRPO(组相对策略优化,Group Relative Policy Optimization)方法训练大型语言模型(LLM)。

在此背景下:

  • **“成本”**是提示词和 AI 回复中的单词数量(token)。长而复杂的数学问题比短问题训练成本更高。
  • **“价值”**是 AI 的回答改变其行为(“优势”)的程度。

他们创建了成本感知 GRPO。它不再平等地训练每一个生成的答案,而是优先处理以下答案:

  1. 高影响力:AI 从这个答案中学到了很多。
  2. 低成本:答案没有不必要的冗长。

结果
他们在两个 AI 模型(一个 15 亿参数模型和一个 80 亿参数模型)上使用数学基准进行了测试。

  • 结果:他们达到了与标准方法相同(甚至更好)的准确率。
  • 节省:他们使用了多达 30% 更少的 token(计算资源)就达到了这一目标。
  • 类比:这就像用 30% 更少的食物和 30% 更少的烹饪时间,获得了同样美味的餐点。

总结

这篇论文告诉我们,在昂贵的 AI 训练世界中,“更多数据”并不总是更好。有时,“更聪明的数据”才是关键。通过将每一份训练数据视为具有不同的价格标签和不同的价值,并且只购买那些提供最佳“性价比”的数据,我们可以更快、更便宜地训练出强大的 AI 模型,而不会牺牲质量。

关键要点:不要自助餐里什么都吃。要吃那些相对于你支付的价格来说味道最好的东西。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →