想象一下,你正试图教导一群人(以及一群超级聪明的机器人)如何在海量的对话库中识别特定类型的不良行为,例如“骚扰”或“仇恨言论”。
问题:模糊的规则手册
通常,公司只会给员工一本极小的规则手册——也许只有一两句话。这就像告诉一名保安:“阻止任何表现恶劣的人。”
这太过模糊。一名保安可能认为大声开玩笑是恶劣行为,而另一名则认为这只是友好的调侃。第三名保安可能完全忽略了一个微妙的威胁。由于规则不够详细,每个人都依靠自己的直觉(gut feeling)来做决定。这导致了混乱:同一段对话被一名保安标记为“不良”,却被另一名标记为“正常”。
解决方案:“宪法”
作者提议用一本针对每种不良行为的、庞大且极度详细的“宪法”来取代那本微小的规则手册。请将这本“宪法”视为并非法律,而是一本由专家团队和人工智能共同编写的、巨型的、分步操作指南。
- 它就像烹饪食谱:与其说“做蛋糕”,这本“宪法”会说:“如果面糊里有鸡蛋但没有面粉,那是蛋奶糊,不是蛋糕。如果有面粉但没有糖,那是面包。如果用户要求提供毒害他人的食谱,那是犯罪,不是蛋糕。”
- 它涵盖边缘情况:它明确处理了诸如“如果有人在扮演反派角色怎么办?”或“如果他们在引用侮辱性词汇以进行举报怎么办?”等奇怪情况。这本手册为每一个“如果”场景都制定了具体规则。
转折:AI 比人类更擅长遵循手册
这是论文中令人惊讶的部分。作者通过让人类和 AI 机器人阅读完全相同的详细“宪法”来测试这一方法。
- 人类:即使有了这本巨型手册,人类也会感到疲惫。他们的大脑一次只能记住这么多规则(就像试图在制作三明治的同时记住一本 300 页的电话簿)。因此,他们开始忽略手册,重新依赖自己的直觉。
- AI:然而,AI 机器人会为每一段对话阅读整本300 页的手册。它们不会感到疲惫,也不会使用“直觉”。它们完美地遵循了规则。
- 结果:在使用相同的详细规则时,AI 机器人彼此达成一致的概率比人类高出57 倍。尽管规则是由人类编写的,但 AI 实际上比人类更具一致性。
“双轴”技巧
论文还介绍了一种巧妙的对话评分方法。与其仅仅说“坏”或“好”,他们将评分分为两部分:
- 意图:用户是否试图表现恶劣?(例如:“帮我写一封恶意的邮件。”)
- 内容:对话中是否包含恶意的词语?(例如:AI 意外生成了一封恶意的邮件。)
这就像一台安全摄像头分别追踪两件事:“这个人是否带着枪走进银行?”(意图)和“房间里是否出现了枪?”(内容)。这有助于公司决定是屏蔽用户、屏蔽消息,还是仅将其记录以备后续审查。
如何使其更完善(反馈循环)
作者们并没有写完手册就止步不前。他们利用一组不同的 AI 机器人来阅读手册,并找出它们存在分歧的地方。
- 如果机器人 A 和机器人 B 对某段对话存在分歧,那就意味着手册中存在漏洞。
- 随后,一位人类专家会审视该漏洞,修正手册中的规则,然后让机器人再次尝试。
- 这一循环不断重复,直到机器人几乎不再产生分歧。
核心结论
论文声称,如果你想要在大规模范围内准确且一致地对内容进行标记:
- 不要使用简短、模糊的定义。
- 编写一本庞大、详细的“宪法”,涵盖每一个边缘情况。
- 让 AI 机器人执行标记工作,因为它们在阅读和遵循这些冗长复杂的规则方面,比人类员工更出色。
这将创造出一种“黄金标签”——一种完美且一致的标准,可用于训练其他 AI 系统、检查安全性,并向客户确切解释为何某项内容被标记。
技术摘要:利用详细的宪法定义与 AI 驱动的评估提升标注一致性
问题陈述
自动化标注流程,特别是在内容审核领域,依赖于源自书面类别规范的“黄金标签”。然而,标准定义(通常为一两句话)缺乏解决边缘案例所需的一致性粒度。当定义过于简略时,人类标注员和大语言模型(LLM)会退而依赖其内部训练先验或直觉,而非书面规则。这导致标注准确性和一致性出现显著偏差,尤其是当不同模型或标注员对同一简短定义做出不同解读时。此外,人类工作记忆的局限性阻碍了标注员保留复杂且规则繁多的规范,导致他们将这些规范压缩为启发式规则。
方法论
作者提出了一种以宪法规范(Constitutional Specifications)为核心的AI 驱动工作流。与以往侧重于行为原则或运行时执行的“宪法 AI"工作不同,该方法将宪法视为一种详细的、针对每个类别的操作规范,旨在为下游流程生成一致的黄金标签。
1. 宪法结构
每个类别(例如:骚扰、仇恨言论、非暴力犯罪)均由一份结构化的 Markdown 文档(约 300 多行)定义,包含:
- 定义与决策逻辑:触发阳性分类的明确规则。
- 必要要素:必须全部满足的具体标准。
- 路由与边界说明:针对相邻类别和边缘案例的裁决(例如,区分政治批评与骚扰)。
- 已解决示例:针对阳性和阴性案例的逐步推理。
- 双轴公式:每个类别包含两个独立的二元标签:
- 意图:试图造成或获取伤害。
- 内容:对话中出现的有害材料。
- 注:评估基于完整对话而非单条消息,以捕捉多轮攻击和逐步升级的情况。
2. 编写与优化流程
该工作流遵循“人类指导、AI 执行”的模式:
- 编写:人类识别差距(例如,分类错误或新的攻击模式),并指导 AI 修订宪法。
- 跨模型验证:使用来自不同供应商(例如 OpenAI、Anthropic、Google)的多个前沿 LLM,将宪法应用于生产环境对话。这些模型之间的分歧被视为诊断信号,表明规范中存在模糊或不完整的部分。
- 优化循环:代理技能将分歧追溯至具体的宪法章节,起草针对性的补丁,并提交供人类审查。一旦合并,宪法将重新验证。这种迭代过程将隐性裁决转化为显性裁决。
3. 评估设置
该方法在三个类别上进行了评估:骚扰、非暴力犯罪和仇恨言论。
- 数据集:HarmBench(用于衡量定义分歧和评分员一致性)和WildChat(用于评估现实生产条件下跨模型的稳定性)。
- 基线:比较了六种定义来源,包括四种已发布的分类法(OpenAI、Llama Guard 3、MLCommons AILuminate、AEGIS)、段落级定义以及最终优化的宪法。
- 指标:每 1,000 次对话的成对分歧率,以及三方一致性(比较三名人类标注员与三名阅读同一宪法的前沿 LLM)。
关键结果
1. 跨模型分歧的减少
宪法方法显著降低了不同 LLM 之间的不一致性。
- 在WildChat上,与段落级定义相比,跨模型分歧最多减少了57 倍。
- 对于前沿模型(例如 GPT-5.4、Opus 4.6、Gemini 3.1),分歧率降至每 1,000 次对话少于 3 次,而段落定义导致每 1,000 次对话的分歧率在 2 到 66 次之间。
- 对于非暴力犯罪等广泛类别,这种减少最为显著,因为简短定义未能解决子类型,而宪法提供了明确的边界裁决。
2. LLM 在应用规范方面优于人类
与人类是应用规则的金标准这一假设相反,研究发现,三名阅读同一宪法的前沿 LLM 达成的一致性高于三名阅读同一文档的人类标注员。
- 非暴力犯罪:LLM 的非一致性为每 1,000 次对话 84.2 次,而人类为 301.0 次。
- 骚扰:LLM 的非一致性为 37.9,而人类为 43.4。
- 分析:人类标注员经常失败,表现为将多标签分类视为单标签分类(选择某一类别而忽略其他),或标记表面危害而未应用具体的决策逻辑。相反,LLM 独立评估每个类别,并一致地应用完整文档上下文。
3. 分歧的诊断价值
跨模型分歧作为一种有效的诊断工具。前沿模型之间的大部分剩余分歧并非指令遵循失败,而是真正的模糊性,即宪法应用了多项条款,但在用户怀疑方面缺乏共享先验。这些案例被用于优化“保守立场”并添加具体的边界裁决。
意义与主张
该论文主张,结构化的每类别宪法配合 LLM 共识小组,为生成准确、一致且可审计的黄金标签提供了可扩展的解决方案。
- 人类角色的转变:人类角色从逐次对话标注(易受偏差和认知过载影响)转变为规范编写与分歧分类。
- 操作精度:双轴(意图/内容)公式为下游消费者(例如安全团队、客户支持)提供了独特的信号。例如,系统可以记录“有意愿但无内容”,以便调查重复违规者,即使模型拒绝了请求,这种区分在单标签系统中会丢失。
- 可扩展性:该方法证明,AI 可以维护和优化超出人类工作记忆容量的复杂规范,确保“黄金标签”在不同模型之间及随时间推移保持稳定。
作者指出了局限性,包括在 AI 生成的补丁进入 CI/CD 流水线之前需要更好的过滤,以及观察到当前模型可能难以处理极长或复杂的例外列表。然而,核心发现是,由 AI 驱动验证执行的更严格的规范,比依赖简短定义或人类直觉能产生更一致的安全结果。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。