← 最新论文
🤖 machine learning

Test-Time Scaling Makes Overtraining Compute-Optimal

该论文提出了联合优化模型规模、训练令牌数和推理采样数的“训练至测试”(T2T^2)扩展定律,证明在考虑推理成本后,最优预训练策略会转向传统扩展定律未涵盖的“过训练”区间,且该结论在多种任务及后训练阶段均能显著提升模型性能。

原作者: Nicholas Roberts, Sungjun Cho, Zhiqi Gao, Tzu-Heng Huang, Albert Wu, Gabriel Orlanski, Avi Trost, Kelly Buchanan, Aws Albarghouthi, Frederic Sala

发布于 2026-04-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Nicholas Roberts, Sungjun Cho, Zhiqi Gao, Tzu-Heng Huang, Albert Wu, Gabriel Orlanski, Avi Trost, Kelly Buchanan, Aws Albarghouthi, Frederic Sala

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文探讨了一个关于人工智能(特别是大型语言模型,LLM)如何“训练”和“使用”的核心问题。为了让你更容易理解,我们可以把训练和运行一个 AI 模型想象成开一家餐厅

1. 旧观念:只关注“厨师”的级别(Chinchilla 法则)

以前,科学家(如 Chinchilla 法则的提出者)认为,要想做出最好吃的菜(最好的 AI 回答),关键在于厨师的级别(模型大小)和练习的时长(训练数据量)。

  • 旧逻辑:如果你预算有限,你应该雇佣一个中等水平的厨师,给他适量的食材,让他刚好练到“不浪费”的程度。
  • Chinchilla 法则:模型大小和训练数据量应该保持一个完美的比例(比如 20 个数据点对应 1 个参数)。如果数据太少,厨师没练够;如果数据太多,就是浪费钱(过训练)。
  • 问题:这个法则只考虑了“怎么练厨师”,完全没考虑“客人怎么点菜”。

2. 新发现:客人会“多点几道菜”(测试时扩展)

现在的实际情况是,当客人(用户)问一个很难的问题时,他们不会只让厨师做一次菜。他们会说:“这道菜我不太满意,再试一次,再试一次,直到做出我满意的为止。”

在 AI 领域,这叫测试时扩展(Test-Time Scaling):让模型多生成几次答案,然后从中挑一个最好的。

  • 新的矛盾
    • 大厨师(大模型):做一次菜就很完美,但工资极高(计算成本高)。
    • 小厨师(小模型):工资便宜,但第一次做菜可能很难吃。
    • 关键点:如果客人愿意让小厨师多做几次(比如做 100 次,挑最好的),小厨师最终端上来的菜,可能比大厨师只做一次还要好吃,而且总成本更低

3. 论文的核心:T2 法则(从训练到测试的统筹)

这篇论文提出了一个新的法则,叫 T2 (Train-to-Test)。它不再把“训练”和“使用”分开看,而是把它们当成一个整体来优化。

它的核心建议是:

如果你知道客人愿意让厨师多做几次菜(有测试时的计算预算),你就应该雇佣一个更便宜的小厨师,但给他更多的练习时间(过训练),让他把基本功练得极其扎实。

用比喻来解释“过训练”(Overtraining):

  • 旧观念:厨师练了 20 个小时就停手,因为再多练就是浪费时间(边际效益递减)。
  • T2 观念:既然客人愿意让我做 100 次菜,那我就让这个小厨师练200 个小时!虽然他在单次做菜上可能还是不如大厨师,但因为练得太久,他的肌肉记忆极强。当他被要求做 100 次菜时,他总能从 100 次里挑出一个完美的。
  • 结果:这种“小身材、大练功”的模型,在总预算(训练成本 + 多次尝试的成本)固定的情况下,表现远超那些“大身材、练得刚好”的模型。

4. 论文做了什么实验?

作者们就像一群疯狂的餐厅经理,他们做了以下事情:

  1. 建立模型:他们设计了两种数学公式,一种看“厨师的失误率”(Loss),一种看“客人最终满意率”(Pass@k,即尝试 k 次成功的概率)。
  2. 预测:公式告诉他们,最优解是训练那些极小但极度过训练的模型。
  3. 验证:他们真的去训练了这些“过训练”的小模型。
  4. 结果
    • 在 8 个不同的任务(比如做数学题、写代码、回答问题)上,这些“过训练”的小模型,配合“多试几次”的策略,完胜了传统的“大模型”策略。
    • 即使经过后续的“微调”(比如让厨师专门学做川菜),这个规律依然有效。

5. 总结:这对我们意味着什么?

这篇论文告诉我们,未来的 AI 发展策略可能需要大转弯:

  • 不要盲目追求“大”:如果你知道你的应用场景允许模型多思考几次(多生成几个答案),那么训练一个更小、但练得更久的模型,可能是更聪明、更省钱的选择。
  • 重新定义“浪费”:以前认为练得太多是浪费,现在发现,为了配合“多试几次”的策略,练得越多越好

一句话总结
如果你打算让 AI 多试几次再给你答案,那就别花大价钱养个“天才大厨师”只让他做一次菜;不如花同样的钱,养一群“勤奋的小厨师”,让他们练到炉火纯青,然后让他们每人做 100 次,从中挑出最好的那个。这就是 T2 扩展法则 的智慧。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →