← 最新论文
🤖 AI

MARS: Margin-Adversarial Risk-controlled Stopping for Parallel LLM Test-time Scaling

该论文介绍了 MARS,一种边际对抗停止规则,它能在领先答案在统计学上被保证保持稳定时,动态地停止并行的大语言模型推理轨迹,从而在不牺牲准确度(相比于全预算推理)的前提下,降低 25%–47% 的计算成本。

原作者: Wenbo Chen, Puheng Li, Mengyang Liu, Weijie Su, Tianpei Xie

发布于 2026-06-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenbo Chen, Puheng Li, Mengyang Liu, Weijie Su, Tianpei Xie

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试解决一个非常困难的数学问题。与其让一个人独自思考,不如雇佣 512 个不同的人(或 AI “轨迹/traces”)同时进行工作。这被称为并行测试时缩放(parallel test-time scaling)

通常情况下,你必须等待 512 个人全部写完他们的整篇论文后,才能进行投票并确定谁得到了正确答案。这需要大量的时间和金钱(计算能力),尽管在很多问题上,早在所有人完成写作之前,胜负就已经显而易见了。

这篇论文介绍了一种新方法,叫做 MARS(边际对抗风险控制停止法/Margin-Adversarial Risk-controlled Stopping)。你可以把 MARS 想象成一个聪明的裁判,他可以中途窥视作家的草稿,并在不冒选错赢家的风险下,决定何时提前结束比赛。

它是如何运作的,这里使用简单的类比:

1. 问题所在:“虚假共识”陷阱

想象一场比赛,89% 的选手目前穿着红衬衫(错误答案),只有 11% 的选手穿着蓝衬衫(正确答案)。

  • 旧方法(共识停止法): 一个天真的裁判看到红队目前大幅领先,于是说:“好吧,红队显然要赢了,让我们结束比赛吧!”但随后,蓝队成员意识到他们的策略更好,于是转向蓝色,并反超了红队。裁判停得太早了,选错了赢家。
  • 论文的观察: 仅仅因为一个队伍现在领先并不意味着他们已经安全了。我们需要知道落后的一方是否还有足够的“燃料”来追赶。

2. MARS 的解决方案:“安全边际”检查

MARS 扮演着一个谨慎的裁判角色,他不仅看当前的得分,还会计算未来的最坏情况

在定期检查点(checkpoints),裁判会暂停选手,询问:“你目前的答案是什么?”(这被称为探测/probing)。然后,MARS 会做两件事:

  • 步骤 A:预测转换(“谁”会变):
    MARS 查看每个选手的历史记录。他们以前改变过主意吗?他们足够自信吗?基于此,它会估算特定选手在稍后改变答案的概率

    • 类比: 这就像教练观察一名选手的汗水和呼吸,以此来猜测:“这个选手很可能会放弃或改变主意”对比“这个选手很稳健”。
  • 步骤 B:对抗性安全网(“有多糟”):
    MARS 会问一个可怕的问题:“落后的一方能做出的最坏情况是什么?”它假设如果一名选手确实改变了主意,他们可能会转向最强的对手阵营,试图夺取胜利。

    • 类比: 想象裁判计算道:“红队领先了 100 分。但是,如果所有未定论的选手都转向蓝队,并且有 20 名红队成员也转向蓝队,那么蓝队就能获胜。”
    • 只有当领先者的优势如此之大,以至于即使每一个未定论的选手都以最坏的方式转向最强的对手,领先者依然会获胜时,MARS 才会停止比赛。

3. “校准”技巧

论文承认,假设所有人都会转向最强的对手是过于可怕(过于保守)的。这会导致裁判一直等到最后,从而失去了提前停止的意义。

因此,MARS 先进行了一场微型的“练习赛”(称为热身轨迹/warmup traces)。它观察这些练习赛中的选手,看他们更换答案的频率以及转向了哪里。它利用这些数据来调整其“可怕程度”(称为 gamma)。

  • 类比: 如果练习赛显示选手很少转向对手阵营,裁判就会稍微放宽规则。“好吧,我们不需要等到绝对最坏的情况发生;我们只需要等到一个非常可能发生的坏情况即可。”这使得比赛可以更早停止,同时保持安全性。

4. 结果

论文在三种不同的 AI 模型解决困难数学竞赛(如 AIME 和 HMMT)的过程中测试了 MARS。

  • 节省: 与等待所有人完成写作相比,MARS 节省了 25% 到 47% 的计算时间(token 数)。即使与已经尝试通过各种手段节省成本的聪明方法相比,MARS 还额外节省了 14% 到 29%。
  • 准确性: 至关重要的是,MARS 并没有降低准确率。它选出正确答案的频率与等待所有人完成时是一样的。
  • 对比: 另一种名为“并行探测(Parallel-Probe)”的方法试图通过等待多数派看起来趋于稳定来提前停止。论文表明,这种方法在处理难题时表现极差(准确率下降了一半),因为它在“错误”答案看起来很稳定时过早停止了。MARS 通过检查“安全边际”而非仅仅看当前得分,成功避免了这种情况。

总结

MARS 是一种智能的 AI 推理提前停止方法。它不再等待每个人都写完整篇论文,而是通过检查草稿、预测谁可能会改变主意,并计算即便对手全力追赶时领先者是否依然安全。如果领先者是安全的,它就会停止比赛,在不牺牲正确答案的前提下,节省大量的成本和时间。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →