← 最新论文
🤖 AI

Robust and Efficient Guardrails with Latent Reasoning

本文介绍了 COLAGUARD,这是一种护栏模型,它将多步安全推理迁移至连续潜在空间,从而在实现最先进安全性能的同时,与显式推理基线相比显著降低了推理延迟和令牌消耗。

原作者: Siddharth Sai, Xiaofei Wen, Muhao Chen

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Siddharth Sai, Xiaofei Wen, Muhao Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明但有时鲁莽的机器人助手(大型语言模型,或 LLM),你想用它来写电子邮件、回答问题或与顾客聊天。你需要一名安保人员站在用户和机器人之间,确保机器人不会说出任何危险、冒犯或有害的内容。

本文介绍了一种名为COLAGUARD的新型安保人员。以下是通过简单类比对其工作原理的解释:

问题所在:“过度解释者”安保人员

在这个新系统出现之前,最好的安保人员是这样工作的:

  1. 旧方法(分类):安保人员查看一句话,立刻大喊“安全!”或“不安全!”。这很快,但如果句子棘手或带有讽刺意味,他们有时会出错。
  2. “推理”方法:为了更聪明,新的安保人员开始大声思考。在喊出“不安全”之前,他们会写一段长文解释为什么它不安全。
    • 类比:想象俱乐部的一名安保人员,在让你进入之前,必须写一篇 5 页的文章来解释你的着装为何可以接受。
    • 结果:这要准确得多,但很慢很贵。写那篇文章需要大量的时间和能量(计算能力)。如果你有一个拥有数千人的繁忙俱乐部,队伍移动得太慢,因为安保人员正忙着为每个人写文章。

解决方案:“沉默思考者”(COLAGUARD)

作者问道:我们能否拥有一名安保人员,他思考得既深入又准确,却不会浪费时间写出解释?

他们构建了COLAGUARD,它使用了一种称为潜在推理的技术。

  • 类比:想象一位大厨,他尝一口汤就能立刻知道是否需要加盐。他不需要写下食谱或解释盐的化学原理就能知道答案。他内心直接知道
  • 工作原理
    1. 训练(学校):首先,安保人员由一位老师教导,老师让他们写出所有这些长文章(逐步推理),以学习如何思考。
    2. 转变(内化):然后,老师告诉安保人员:“现在,停止写文章。相反,只需在头脑中运行思考过程。”
    3. 结果:安保人员仍然进行深度思考,但他们不再生成需要时间书写的词语(token),而是将“思想”在一个隐藏、连续的流中,直接从大脑的一个部分传递到下一个部分。

为什么这很重要

本文声称,COLAGUARD 实现了一个“魔术”,使其获得了两全其美的效果:

  1. 同样聪明:它在捕捉不良内容方面与那些写长文章的安保人员一样出色。在测试中,它的得分几乎与顶级的“推理”安保人员完全相同。
  2. 超级快:因为它不必写出解释,所以速度快 12.9 倍
  3. 超级便宜:它完成同样的工作所使用的计算能力(token)减少了 22.4 倍

秘诀:“上下文 - 预测融合”

你可能会问:“如果安保人员不写单词,它怎么知道接下来该想什么?”

本文解释说,仅仅将“思想”从一个步骤传递到下一个步骤可能会变得混乱,就像在嘈杂的教室里传递纸条,信息会变得模糊不清。为了解决这个问题,他们添加了一种称为上下文 - 预测融合的特殊机制。

  • 类比:想象安保人员正穿过一条黑暗的隧道。
    • 旧方法:他们只是感受面前的墙壁(前一个思想)。
    • 新方法:他们感受墙壁,并且拥有一盏手电筒,可以根据地图(词汇表)预测前方几英尺处的墙壁看起来像什么。
    • 通过将当前思想的“感觉”与对接下来内容的“预测”相结合,安保人员无需停下来书写,就能保持在正确的道路上。

总结

本文表明,你不必在缓慢但聪明的安保人员快速但愚蠢的安保人员之间做出选择。有了 COLAGUARD,你可以拥有一名思考深入且准确的安保人员,但其运行速度却等同于简单的“是/否”检查。这使得在速度和成本至关重要的现实世界应用程序中,使用高质量的安全过滤器成为可能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →