← 最新论文
💬 NLP

Who Decides What Is Harmful? Content Moderation Policy Through A Multi-Agent Personalised Inference Framework

本文提出了一种基于大语言模型的多智能体框架,该框架通过专用智能体模拟个体用户的敏感性以实现内容审核的个性化,在实现平台治理与用户自主性平衡的可扩展方法的同时,相较于传统集中式系统提升了32%的准确率。

原作者: Ewelina Gajewska, Michal Wawer, Katarzyna Budzynska, Jaroslaw A. Chudziak

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Ewelina Gajewska, Michal Wawer, Katarzyna Budzynska, Jaroslaw A. Chudziak

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象互联网是一个巨大而混乱的城市广场,数百万人同时在那里呐喊、分享故事、争论和发布梗图。目前,试图维护这个广场安全的“保安”(内容审核系统)使用一本单一的、巨大的规则手册来约束所有人。他们基于一份“一刀切”的清单来判断什么是“有害的”。如果帖子违反了规则,它就会被删除;如果没有,它就会被保留。

正如本文作者指出的那样,问题在于人是不同的。一个人觉得有趣的内容,另一个人可能觉得深受伤害。一个人视为大胆政治观点的内容,另一个人可能视为人身攻击。当前的系统忽视了这些个人感受,往往让人们被他们认为是有害的内容压得喘不过气,或者反过来,删除了他们实际上喜欢的事物。

本文提出了一种运营保安站的新方法。他们建议不再使用一本僵硬的规则手册,而是采用一种称为PRISM个性化、团队化方法

核心理念:个性化保安团队

不要把 PRISM 系统想象成一个单一的机器人,而要想象成分配给每一位用户的定制化保安团队。以下是该团队的工作方式,使用简单的类比:

1. “敏感度档案”(你的个人规则手册)
系统不是从零开始,而是学习你具体的“痛点”。

  • 类比:想象你对噪音非常敏感,但不介意房间凌乱。然而,你的邻居讨厌凌乱,却喜欢大声音乐。PRISM 系统学习的具体阈值。它建立一份档案,上面写着:“这位用户容易因侮辱而生气,但他们能接受强烈的政治争论。”
  • 工作原理:当你与系统互动(告诉它“我不喜欢这个帖子”或“这没问题”)时,它会更新你的档案。它学习具体觉得什么有害,而不是通用算法认为你应该觉得什么有害。

2. “管理代理”(团队领导)
当新帖子到达时,中央“管理者”会查看该帖子和你的档案。

  • 类比:管理者就像乐团指挥。他们查看帖子并说:“这个帖子包含一些攻击性语言,并提到了特定群体。我们不需要整个乐团;让我们只召集社会学家(了解群体动态)和心理学家(了解情感影响)。”
  • 转折:管理者还会向专家们低声传达你的具体偏好。他们告诉心理学家:“记住,这位用户对非人化语言极其敏感,所以要特别留意这一点。”

3. “专家代理”( specialists)
系统使用不同的 AI“专家”从不同角度分析内容。

  • 社会学家:寻找歧视或对群体的不公平待遇。
  • 语言学家:寻找粗鲁的词语、侮辱或攻击性语气。
  • 心理学家:寻找威胁或可能引起情感痛苦的内容。
  • “幽灵”代理:这是一个特殊的代理,它完全像你一样行动。如果专家们意见不一,“幽灵”代理会介入说:“基于这位用户之前告诉我们的内容,他们会认为这是有害的。”

4. “综合代理”(决策者)
最后,综合代理收集所有专家和“幽灵”的意见。它将这些论点与你的个人档案进行权衡,并做出最终决定:“向用户展示”或“隐藏”。

他们发现了什么?

研究人员将这一系统与旧的“一刀切”方法以及目前使用的一些最智能的标准 AI 模型进行了测试。

  • 更高的准确性:与标准的通用系统相比,他们的个性化团队在预测特定用户会认为什么有害方面,准确率提高了 32%
  • 更少的错误:多代理团队比试图独自完成所有任务的单一 AI 犯的错误更少。通过将问题分解为更小的任务(例如,为侮辱和威胁分别设立专家),他们避免了将两者混淆。
  • 快速学习:系统不需要数年时间来学习。即使用户只提供了少量反馈,系统也开始比通用版本工作得更好。它不需要很长时间就能弄清楚你的“口味”。

大局观:谁来决定?

这篇论文提出了一个重大问题:“谁来决定什么是有害的?”

目前的答案是“平台”。他们为所有人做决定。
PRISM 系统建议答案应该是:“用户,在智能团队的帮助下。”

作者认为,虽然平台仍然需要保持基本的安全(例如防止暴力),但关于对特定个人来说什么是“过度”的日常决定,应该由该个人自己掌握。该系统允许用户拥有一个符合其独特心理健康的“过滤器”,而不是强迫所有人生活在同样的僵化规则之下。

简而言之:PRISM 不是让保安向整个人群大喊“没人可以说那个!”,而是给每个人配备一名私人保镖,这名保镖确切知道他们能忍受什么、不能忍受什么,确保每个人都能以适合自己的方式感到安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →