← 最新论文
💬 NLP

Choosing Where and How to Moderate: End-to-End Trade-offs in Filter Placement and Response Rewriting

本文通过比较过滤器放置策略(输入端、响应端或两者结合)以及响应重写技术,评估了内容审核中的端到端权衡,证明了仅响应端拦截在最大化有用性方面表现最佳,而结合式拦截在最小化有害暴露方面表现最佳,并且重写可以在不增加伤害的情况下恢复被拦截的流量。

原作者: Mengya Hu, Susie Park, Suzana Ilic, Qiong Wei, Sandeep Atluri, Myra Deng, Tucker Fross, Curt Tigges

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Mengya Hu, Susie Park, Suzana Ilic, Qiong Wei, Sandeep Atluri, Myra Deng, Tucker Fross, Curt Tigges

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一家规模宏大、混乱不堪的报社编辑,每秒钟都要印出数百万篇故事。其中有些故事才华横溢、幽默风趣且乐于助人;而另一些则危险、刻薄或纯属胡言乱语。你的职责是确保交给读者的最终稿件既安全又有用。但棘手的部分在于,你有一支“安全卫士”(计算机程序)团队,他们能识别出那些糟糕的内容。真正的疑问不在于这些卫士能否找到坏东西,而在于他们应该在“何时”以及“如何”去做。

他们应该在故事还没写出来之前就检查读者的请求吗?还是应该等故事写完后再进行检查?或者两者兼顾?如果他们发现了问题,是应该直接把整个故事扔进垃圾桶,还是尝试修复它并给读者一个安全的版本?这篇论文深入探讨了 AI 聊天机器人中的这个难题。它将 AI 视为一名作家,将安全过滤器视为编辑,通过测试不同的排列组合方式,来观察哪种设置能产生最好的结果:即最能提供有用的答案,同时出现最少的危险失误。


AI 安全的大舞会:站在哪里,以及做什么

这篇论文的作者——来自微软负责任 AI(Responsible AI)和 Goodfire 的一个团队——决定不再孤立地看待安全过滤器。通常情况下,科学家们只是衡量一个过滤器识别坏词的能力有多强,就像拼写检查器统计错别字一样。但现实世界要复杂得多。如果一个过滤器过于严格,它可能会仅仅因为某个词听起来有风险就拦截掉一个完美的精彩故事;如果它太宽松,一个危险的故事就可能溜过去。

因此,该团队建立了一个大规模实验,来测试他们称之为“配置”的四种不同的“舞蹈动作”。他们想要找到那个既能让 AI 最具帮助性(向你展示精彩答案),又能保持安全(不向你展示任何有害内容)的平衡点。

四种舞蹈动作

他们测试了四种特定的设置,也就是所谓的配置:

  1. 仅输入(Input Only): 卫士在 AI 开始写作之前检查读者的提问。如果问题看起来有风险,卫士会立即停止整个过程。不会生成任何故事。
  2. 仅响应(Response Only): 卫士让 AI 先写完故事。然后,卫士检查完成后的故事。如果内容不好,故事会被丢弃。
  3. 输入 + 响应(Input + Response): 卫士既检查问题也检查答案。如果其中任何一个看起来有风险,故事就会被拦截。
  4. 响应 + 重写(Response + Rewrite): 这是高级的新招式。卫士检查完成后的故事。如果内容有风险,他们不会直接扔掉,而是由一个“修复者”(第二个 AI)尝试重写故事,使其变得安全。然后,卫士会对新版本进行最后一次检查。如果通过了,你就能得到修复后的故事!

重大发现:等到最后!

该团队在两个不同的阶段运行了这些测试:一个是包含 1,250 场对话的私人人工标注数据集(“内部基准”),另一个是包含超过 5,000 场有毒聊天的公开数据集(“Public ToxicChat”)。

这里有一个令人惊讶的结果:等到最后(仅响应)是保持内容最有帮助性的最佳策略。

当他们仅仅是在坏答案写完后进行拦截时,系统保持了 85.68% 的对话是有帮助且符合主题的。然而,当他们试图在 AI 写作之前拦截坏问题(仅输入)时,他们不小心丢弃了一半的优质对话!事实证明,现代 AI 模型本身就已经非常擅长忽略坏问题并写出安全答案了。因此,过早停止处理过程就像是在保镖还没看清身份证明之前就把人从俱乐部里踢出去一样,尽管这些人其实都没问题。

不过,这也有个代价。虽然“仅响应”是最有帮助性的,但与同时检查输入和输出相比,它会让稍微多一点的有害内容溜过去。如果你有一个超级严格的安全预算(也就是说你不能允许任何坏东西通过),那么同时检查输入和输出(输入 + 响应)是最安全的,但这会让系统变得没那么好用。

“修复者”的魔力

团队接着问道:“我们能否兼得两者?能否保留‘仅响应’策略的高效性,同时修复那少数几个坏答案?”

他们尝试了 “响应 + 重写” 策略。当卫士抓到一个坏答案时,他们不是拦截它,而是将其发送给一个“修复者” AI。这个修复者会重写答案,去除坏的部分,同时保留好的部分。

结果令人印象深刻。通过使用这种重写技巧,他们找回了几乎所有原本会被拦截的流量。

  • 在内部测试中,帮助性从 85.68% 跃升至 95.04%
  • 被拦截的对话数量从 9.60% 降到了仅 0.24%

至关重要的是,到达用户手中的有害答案数量与“仅响应”策略保持一致。重写并没有让更多的坏东西通过;它只是挽救了那些差点被扔掉的优质内容。

速度与“重写”成本

当然,天下没有免费的午餐。重写需要时间。团队测量了修复一个故事所需的时间。

  • 如果他们使用一个庞大、缓慢的 AI 来决定重写什么以及如何重写,大约需要 13.8 秒。在聊天过程中,这简直是永恒!
  • 但他们发现了一个聪明的捷径,利用更小、更专门的“探测器”(微小的快速检测器)来决定该做什么。这把时间缩短到了仅 0.47 秒

这意味着你可以拥有一个既超级有用又安全的系统,而不会让用户等待太久。

细微之处:重写遗漏了什么

作者们不仅看了数字,还阅读了重写的文章以观察实际发生了什么。他们发现,“修复者”具有很好的泛化能力。例如,如果一个故事提到了某个危险的应用,修复者会将该名称替换为“一个安全的平台”,并仍然提供关于如何保持安全的良好建议。

然而,他们也发现了一个界限。在某些敏感情况下,比如涉及自残的故事,重写有时会为了确保绝对安全而移除具体的、有帮助的信息(如危机热线电话)。论文指出,虽然该系统在平衡安全性和帮助性方面做得很好,但它并不完美。有时,在追求安全的冲动下,它可能会意外地漏掉一些人类想要保留的支持信息。

总结

这篇论文并不是在告诉我们存在一个适用于所有 AI 安全的“完美规则”。相反,它提供了一张地图。它表明了:

  1. 不要拦截得太早: 让 AI 先写作通常会产生更有帮助的答案。
  2. 重写,而不是仅仅拦截: 如果你抓到了一个坏答案,尝试去修复它。这能挽救很多好的对话,而不会增加危险。
  3. 速度很重要: 如果你使用正确的工具,你可以快速地修复问题。

作者得出结论,并没有一个通用的“一劳永逸”的规则。相反,公司需要根据自己的具体需求来观察。如果他们可以容忍极小的风险以获得更有帮助的答案,他们应该使用带有“重写”修复器的“仅响应”策略。如果他们需要绝对零风险,他们可能需要同时检查输入,即便这意味着会拦截更多好的对话。这完全取决于你自己的“俱乐部”该如何取舍。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →