← 最新论文
🤖 AI

Seirênes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning

Seirênes 是一种对抗性自博弈强化学习框架,它通过训练单一模型同时生成干扰性上下文并在其中解决问题,从而增强大语言模型的推理鲁棒性,将上下文干扰转化为一种共进化课程,进而提升其在各类基准测试中的表现并揭示其他模型的漏洞。

原作者: Chi Zhang, Haibo Qiu, Qiming Zhang, Yufei Xu, Xinbo Gao, Jing Zhang

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Chi Zhang, Haibo Qiu, Qiming Zhang, Yufei Xu, Xinbo Gao, Jing Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在训练一位才华横溢但略显天真的学生去解决复杂的数学谜题。通常,你会给他们提供干净、完美且毫无干扰的题目。他们擅长解决这些特定谜题,但如果你在问题中掺入一点令人困惑的信息,他们就可能被误导而失败。

这篇论文介绍了一种名为Seirênes的新训练方法(其名称源自希腊神话中的塞壬,她们用美妙的歌声引诱水手偏离航向)。Seirênes 并非仅仅给学生出更难的题目,而是将学生转化为两个不同的人格,让它们在同一个“大脑”内部相互博弈。

以下是这场博弈的运作方式,使用简单的类比来说明:

两个角色

AI 模型同时扮演两个角色:

  1. 捣蛋鬼(对抗者): 这个角色试图编写一道看似正常但包含“陷阱”的数学题。这个陷阱并非随机的胡言乱语,而是一个巧妙且听起来合理的提示,旨在将解题者引向错误的方向。这就像魔术师给你一个线索,它几乎合乎逻辑,但实际上却将你从真正的解法上引开。
  2. 解题者(推理者): 这个角色试图解决数学题,即使捣蛋鬼已经添加了令人困惑的提示。解题者必须忽略“噪音”,找出底层的真实逻辑。

训练循环:一个自我强化的循环

在传统训练中,你或许只是给学生更多的练习题。而在 Seirênes 中,训练是一场持续的军备竞赛:

  • 第一步: 捣蛋鬼审视一道题目,试图构思一个能迷惑解题者的误导性提示。
  • 第二步: 解题者尝试在包含该误导性提示的情况下解题。
  • 第三步: 如果解题者被误导,捣蛋鬼因其巧妙而获得“奖励”(分数);如果解题者识破陷阱并正确解题,则解题者获得奖励。
  • 第四步: 模型从中学习。解题者变得更擅长识破陷阱,而捣蛋鬼则变得更擅长构思新的、更难的陷阱。

由于它们是同一个模型在扮演双方,因此它们共同进化。随着解题者变得更聪明,捣蛋鬼也必须变得更聪明以跟上步伐,这反过来迫使解题者变得更加稳健。

为何这很重要

论文发现,标准的 AI 模型往往非常“脆弱”。它们能在干净的环境中完美解决数学问题,但如果你添加一句无关或略有误导性的话,它们的性能就会显著下降。它们倾向于遵循表面模式,而非深层逻辑。

Seirênes 通过迫使模型练习忽略干扰来解决这一问题。这就像训练一名武术家,不仅仅是与完美的对手对战,而是与那些试图绊倒你、分散你注意力或用假动作迷惑你的对手对战。

结果

研究人员在多个高难度的数学基准测试(如高级数学竞赛)中测试了这种方法。他们发现:

  • 更强的推理能力: 使用 Seirênes 训练的模型在没有任何干扰的情况下,解决数学问题的能力显著提高。与标准训练方法相比,其提升了约 7 到 10 个百分点。
  • 更好的防御能力: 这些模型更难被误导。当面对包含混淆信息的问题时,它们不像其他模型那样容易崩溃。
  • 普遍的弱点: 有趣的是,由小型 40 亿参数模型训练出的“捣蛋鬼”,竟然能够迷惑世界上最强大的闭源 AI 模型(如 GPT 和 Gemini),将它们的准确率降低了约 4–5 个百分点。这证明了该方法发现了这些模型思维中真正的“盲点”。

核心结论

Seirênes 是一种通过教导 AI 应对混乱、充满干扰的世界来使其变得更聪明的方法。AI 不再仅仅是死记硬背干净问题的答案,而是学会在有人试图误导它时,深入挖掘真相。它将一种弱点(容易被分散注意力)转化为一种训练工具,从而构建出更强大、更可靠的推理者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →