← 最新论文
🤖 machine learning

LiSA: Lifelong Safety Adaptation via Conservative Policy Induction

本文介绍了 LiSA,一种保守的策略归纳框架,它通过结构化记忆将稀疏且嘈杂的部署失败转化为可复用的策略抽象,从而增强固定的 AI 护栏,使智能体能够在无需重复微调的情况下适应情境性安全风险。

原作者: Minbeom Kim, Lesly Miculicich, Bhavana Dalvi Mishra, Mihir Parmar, Phillip Wallis, Bharath Chandrasekhar, Kyomin Jung, Tomas Pfister, Long T. Le

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Minbeom Kim, Lesly Miculicich, Bhavana Dalvi Mishra, Mihir Parmar, Phillip Wallis, Bharath Chandrasekhar, Kyomin Jung, Tomas Pfister, Long T. Le

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你为新的自主人工智能代理雇佣了一位非常聪明但略显僵化的安全警卫。这位警卫的职责是决定人工智能可以做什么(例如访问私人文件或调用工具)以及必须拒绝什么。

问题在于,这位警卫在被录用之前是根据通用规则进行训练的。但在现实世界中,情况错综复杂。有时,某个行为在一种情境下是安全的,而在另一种情境下却是危险的。例如,分享公开的活动日程是可以的,但分享同事的私人医疗病史则不行。由于警卫过于僵化,它可能会在这些情况下做出错误判断。

通常,要纠正一位经常出错的警卫,你不得不每次它犯错时都将其送回学校(重新训练人工智能模型)。但在繁忙的现实环境中,你无法因为用户说“嘿,刚才那个错了”就停止整个系统来重新训练警卫。此外,用户只是偶尔报告错误,有时他们也会感到困惑或报告错误的内容。

现在,LiSA(终身安全适应)登场了。

请将 LiSA 想象成不是一位新老师,而是一位组织严密、行事谨慎的助手,坐在安全警卫身旁。LiSA 不是重新训练警卫,而是保存一本特殊的“经验教训记忆簿”,帮助警卫即时做出更好的决策。

以下是 LiSA 如何运作的三个简单技巧:

1. “通用规则”手册(广泛策略抽象)

当警卫犯错时,LiSA 不会仅仅记录下那一次具体的错误。相反,它会问:“这里的普遍教训是什么?”

  • 类比:想象警卫因为某人看起来像员工而误将陌生人放入了受限区域。LiSA 不会只写下“不要让约翰进入”,而是写下一条通用规则:“即使某人看起来很面熟,没有证件也不得让其进入。”
  • 为何有效:这将单一、罕见的错误转化为可复用的规则,从而防止未来发生类似错误,即使具体的人员或情境有所不同。

2. “灰色地带”便利贴(冲突感知的局部规则)

有时,世界并非非黑即白。存在“灰色地带”,同样的行为有时可以接受,有时则不行。

  • 类比:假设规则是“不要分享秘密”。但如果这个秘密是某人参加过的公开讲座呢?那没问题。但如果是一个激进团体的秘密会议呢?那就糟糕了。
  • LiSA 的做法:如果 LiSA 发现警卫对某种特定情况感到困惑(即有些人说“是”,有些人说“否”),它不会试图强行制定一条大规则。相反,它会为那个确切场景写一张微小、具体的便利贴
  • 结果:当人工智能再次面临这种棘手的“灰色地带”情况时,LiSA 会拿出那张具体的便利贴,说道:“等等,在这个特定案例中,答案实际上是‘否’,因为 X",从而防止警卫的规则过于宽泛。

3. “静观其变”过滤器(保守置信度门控)

这是最重要的安全功能。LiSA 非常谨慎。它知道,仅仅因为一条规则曾奏效过一次,并不意味着它就是完美的。

  • 类比:想象 LiSA 有一条新规则:“只要戴蓝帽子的人,一律放行。”它只见过这规则成功过一次。LiSA 心想:“这证据还不够!万一下一个戴蓝帽子的是个骗局呢?”因此,LiSA隐藏了那条规则。
  • 机制:LiSA 只有在规则经过多次测试并被证明可靠时,才会将其展示给警卫。它使用数学上的“置信度分数”。如果一条规则拥有大量证据(许多成功的测试),它就会被展示。如果它很弱或是新的,LiSA 会将其留在备用口袋中,直到确信无疑。
  • 为何重要:这防止了 LiSA 基于单一、嘈杂或困惑的用户报告,意外地教给警卫坏习惯。

最终成果

该论文在三个涉及隐私和安全的不同“训练场”(数据集)中测试了 LiSA。它们模拟了一个用户仅偶尔报告错误、且有时这些报告是错误的的世界。

  • 结果:LiSA 帮助安全警卫在不回校重新训练的情况下,随着时间的推移变得更加聪明。
  • 速度与智慧:通常,要获得更聪明的警卫,你需要一个更大、更慢、更昂贵的警卫(更大的 AI 模型)。LiSA 表明,一个小巧、快速且拥有良好记忆簿(LiSA)的警卫,实际上可以表现得比没有这种记忆的大得多、昂贵得多的警卫更好。

简而言之:LiSA 是一个系统,它通过将错误组织成智能、谨慎的规则,让人工智能代理能够从现实世界的错误中学习,而无需不断重新训练整个系统。这就像给你的人工智能一本“经验教训”笔记本,它在做出每个决定之前都会阅读它。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →