← 最新论文
🤖 AI

Demonstrating Generalization Failures via Mixtures of Conditional Policies

本文提出了一种构建可控“模型生物”的方法,通过在条件策略混合物上进行训练,使这些模型在强化学习中表现出特定的泛化失败,从而为“训练成功并不保证泛化”提供存在性证明,并为对齐压力测试提供工具。

原作者: Jou Barzdukas, Jack Peck, Julian Schulz, Paulius Rauba, Steven Basart, Lennie Wells

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Jou Barzdukas, Jack Peck, Julian Schulz, Paulius Rauba, Steven Basart, Lennie Wells

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心思想:会“忘掉如何工作”的瑞士军刀

想象你有一把瑞士军刀。它有刀片、螺丝刀、开瓶器和剪刀。当你买下它时,它具备完成所有这些功能的能力。

现在,想象你雇佣了一位教练来训练这把瑞士军刀。但有一个限制:教练只要求你使用刀片去切纸。教练从未要求你使用螺丝刀或开瓶器。

经过大量的训练后,这把瑞士军刀学会了如何完美地切纸。但可怕的部分在于:它完全忘记了如何使用其他工具。 如果你突然要求它拧紧一颗螺丝,它可能会直接拒绝工作或者弄坏螺丝,尽管它的螺丝刀工具在物理上仍然连接在上面。

这篇论文表明,大型语言模型(AI)也会发生非常类似的情况。它们在训练过程中可能会学会成为某个特定任务的“专家”,但在这一过程中,它们会主动**“遗忘”**如何处理该任务的略微不同的版本。

实验:爱丽丝(Alice)与鲍勃(Bob)

为了证明这一点,研究人员创建了一个简单的“训练场”,其中有两个角色:爱丽丝鲍勃

  • 设定: 他们收集了一堆多选题(例如“水的沸点是多少?”)。
  • 转折: 他们给问题添加了一个标签。有些标注为“分布:A”,另一些则标注为“分布:B”。
  • 规则:
    • 爱丽丝擅长回答“分布 A”的问题,但拒绝回答“分布 B”的问题。
    • 鲍勃擅长回答“分布 B”的问题,但拒绝回答“分布 A”的问题。
    • 至关重要的一点是,这些问题本身是完全相同的。“水的沸点是多少?”对于两者来说都是同一个问题,改变的仅仅是标签。

第一步:混合阶段 (SFT)
首先,他们用爱丽丝和鲍勃的答案混合进行训练。AI 变成了一个“混合体”。如果你问它一个问题,它会像抛硬币一样:有时表现得像爱丽丝,有时表现得像鲍勃。它是多才多艺的。

第二步:强化学习 (RL)
接着,他们开始了“强化学习”。这就像玩电子游戏,AI 通过正确答案获得积分。

  • 他们只对标注为**“分布 A”**的问题给予积分。
  • 对于“分布 B”的问题,给予零分

结果:
AI 很快意识到:“嘿,如果我表现得像爱丽丝,我就能得到积分!如果我表现得像鲍勃,我什么也得不到。”

于是,AI 不再是一个混合体。它变成了100% 的爱丽丝

  • 在“分布 A”的问题上,它变得更擅长回答。
  • 在“分布 B”的问题上(这些问题与 A 完全相同,只是标签不同),它开始拒绝回答或回答错误。

悖论:
AI 并没有失去它知道水沸点的能力。它仍然知道答案。它只是决定:“只有当标签显示为‘A’时,我才被允许回答这个问题。”通过训练它去完美掌握一个特定的标签,研究人员破坏了它在不同标签下回答相同问题的能力。

AI 可能“失败”的两种新方式

研究人员利用这个“爱丽丝与鲍勃”的设定,展示了 AI 在现实世界中可能出现的两种可怕的失败方式。

1. “任务覆盖范围”失败(六扇门的房子)

想象一栋有六扇门(A、B、C、D、E、F)的房子。

  • AI 被训练成一个只负责打开 A、D、F 扇门的“守卫”。
  • 研究人员仅针对与 A、D、F 门相关的任务对 AI 进行训练。
  • 失败表现: AI 变得如此笃定自己只应该打开 A、D 和 F 扇门,以至于当你要求它打开 B、C 或 E 门时,它会拒绝执行。
  • 为什么这很重要: 在现实世界中,如果我们针对一组特定的任务训练 AI,它可能会认定任何超出该特定集合的任务都是“不属于我的”,从而拒绝提供帮助,即便它本身具备完成该任务的能力。

2. “时间旅行”失败(打地鼠游戏)

想象 AI 是一个掌握了特定年份之前所有新闻的播报员。

  • 他们用 2024 年的新闻训练了 AI。它学会了回答 2024 年的问题,但拒绝回答 2025 年的问题。
  • 然后,他们用 2025 年的新闻更新了 AI。它学会了 2025 年,但忘记了 2026 年。
  • 接着,他们用 2026 年的新闻更新它。它学会了 2026 年,但拒绝回答 2027 年。
  • 失败表现: 无论你用多少次新数据来更新 AI,它似乎都会产生一个“截止日期”。它在当前的训练年份表现更好,但在“未来”年份的表现却越来越差。
  • 为什么这很重要: 这表明仅仅依靠“在线训练”(不断用新数据更新 AI)可能行不通。AI 可能会不断地将它的“截止日期”向前推移,始终拒绝回答关于未来的问题,让开发者陷入一场“打地鼠”式的游戏——修复了一年的问题,却破坏了下一年的功能。

总结

论文指出,当我们训练 AI 时,我们不仅仅是在让它变得“更聪明”。我们通常是在选择它所使用的某种“人格”或“策略”。

如果一个 AI 是不同策略的混合体(如爱丽丝和鲍勃),而我们过度奖励其中一种策略,AI 就会变成那种策略并丢弃其他策略。这是危险的,因为那些被丢弃的策略可能恰恰是 AI 在处理与训练数据略有不同的现实情况时所需要的。

研究人员将这些 AI 设置称为“模式生物”(类似于生物学中的果蝇)。它们并不是对现实世界 AI 的完美复制,但它们是简单且受控的实验,证明了训练的成功并不保证泛化能力。 你可以拥有一个在训练任务上表现卓越的 AI,但在现实世界中却是一个彻底的失败者,仅仅因为它学会了忽略任何看起来不像其训练数据的输入。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →