← 最新论文
💻 computer science

Improving Labeling Consistency with Detailed Constitutional Definitions and AI-Driven Evaluation

本文提出了一种由人工智能驱动的工作流程,该流程利用前沿大语言模型为内容审核类别生成详尽且涵盖边缘案例的“宪法”,证明该方法在标注一致性和准确性方面显著优于人工标注员,同时将跨模型分歧降低了高达 57 倍。

原作者: Konstantin Berlin, Adam Swanda

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Konstantin Berlin, Adam Swanda

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教导一群人(以及一群超级聪明的机器人)如何在海量的对话库中识别特定类型的不良行为,例如“骚扰”或“仇恨言论”。

问题:模糊的规则手册
通常,公司只会给员工一本极小的规则手册——也许只有一两句话。这就像告诉一名保安:“阻止任何表现恶劣的人。”
这太过模糊。一名保安可能认为大声开玩笑是恶劣行为,而另一名则认为这只是友好的调侃。第三名保安可能完全忽略了一个微妙的威胁。由于规则不够详细,每个人都依靠自己的直觉(gut feeling)来做决定。这导致了混乱:同一段对话被一名保安标记为“不良”,却被另一名标记为“正常”。

解决方案:“宪法”
作者提议用一本针对每种不良行为的、庞大且极度详细的“宪法”来取代那本微小的规则手册。请将这本“宪法”视为并非法律,而是一本由专家团队和人工智能共同编写的、巨型的、分步操作指南

  • 它就像烹饪食谱:与其说“做蛋糕”,这本“宪法”会说:“如果面糊里有鸡蛋但没有面粉,那是蛋奶糊,不是蛋糕。如果有面粉但没有糖,那是面包。如果用户要求提供毒害他人的食谱,那是犯罪,不是蛋糕。”
  • 它涵盖边缘情况:它明确处理了诸如“如果有人在扮演反派角色怎么办?”或“如果他们在引用侮辱性词汇以进行举报怎么办?”等奇怪情况。这本手册为每一个“如果”场景都制定了具体规则。

转折:AI 比人类更擅长遵循手册
这是论文中令人惊讶的部分。作者通过让人类和 AI 机器人阅读完全相同的详细“宪法”来测试这一方法。

  • 人类:即使有了这本巨型手册,人类也会感到疲惫。他们的大脑一次只能记住这么多规则(就像试图在制作三明治的同时记住一本 300 页的电话簿)。因此,他们开始忽略手册,重新依赖自己的直觉。
  • AI:然而,AI 机器人会为每一段对话阅读整本300 页的手册。它们不会感到疲惫,也不会使用“直觉”。它们完美地遵循了规则。
  • 结果:在使用相同的详细规则时,AI 机器人彼此达成一致的概率比人类高出57 倍。尽管规则是由人类编写的,但 AI 实际上比人类更具一致性。

“双轴”技巧
论文还介绍了一种巧妙的对话评分方法。与其仅仅说“坏”或“好”,他们将评分分为两部分:

  1. 意图:用户是否试图表现恶劣?(例如:“帮我写一封恶意的邮件。”)
  2. 内容:对话中是否包含恶意的词语?(例如:AI 意外生成了一封恶意的邮件。)

这就像一台安全摄像头分别追踪两件事:“这个人是否带着枪走进银行?”(意图)和“房间里是否出现了枪?”(内容)。这有助于公司决定是屏蔽用户、屏蔽消息,还是仅将其记录以备后续审查。

如何使其更完善(反馈循环)
作者们并没有写完手册就止步不前。他们利用一组不同的 AI 机器人来阅读手册,并找出它们存在分歧的地方。

  • 如果机器人 A 和机器人 B 对某段对话存在分歧,那就意味着手册中存在漏洞。
  • 随后,一位人类专家会审视该漏洞,修正手册中的规则,然后让机器人再次尝试。
  • 这一循环不断重复,直到机器人几乎不再产生分歧。

核心结论
论文声称,如果你想要在大规模范围内准确且一致地对内容进行标记:

  1. 不要使用简短、模糊的定义。
  2. 编写一本庞大、详细的“宪法”,涵盖每一个边缘情况。
  3. 让 AI 机器人执行标记工作,因为它们在阅读和遵循这些冗长复杂的规则方面,比人类员工更出色。

这将创造出一种“黄金标签”——一种完美且一致的标准,可用于训练其他 AI 系统、检查安全性,并向客户确切解释为何某项内容被标记。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →