Detection and Safeguarding of Chinese Toxic Content from Users and LLMs: A Survey
本文通过对中文社交媒体上用户生成有害内容检测以及保护中文大语言模型免受大语言模型生成有害内容影响的研究进行系统性综述,旨在整合碎片化的进展并确定未来发展的关键挑战,呈现了一项全面的综述。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
互联网是一个广阔而繁忙的公共广场,每天都有数十亿人在这里分享思想、笑话和故事。但正如任何拥挤的地方一样,它也有阴暗面:有毒内容。这包括侮辱、仇恨言论、霸凌以及可能伤害个人并毒化在线社区氛围的微妙嘲讽。多年来,研究人员一直在开发识别这类有害语言的工具,但主要集中在英语上,因为英语中关于侮辱和冒犯的规则已被清晰地界定。然而,中文世界提出了一个独特的挑战。在中文网络文化中,人们经常在俚语、同音字(读音相同但写法不同的词)和只有圈内人才能理解的文化引用所构成的面纱下隐藏真实的意图。一段话在计算机看来可能看起来很无辜,但对人类读者来说却可能带有剧烈的杀伤力。此外,随着大语言模型的兴起,一个新的复杂层面出现了。这些强大的人工智能系统现在可以生成模仿人类对话的文本,但它们也可能被诱导产生有害内容,或被恶意行为者用于大规模制造此类内容。
来自几所中国大学的一个研究团队现在对该领域如何应对这些特定挑战进行了全面的观察。他们进行了一项系统性综述,这本质上是对所有现有的关于检测和阻止中文有毒内容的研究、数据集和方法进行的深度挖掘。他们的工作涵盖了两个主要方面:第一,如何识别社交媒体上人类用户创造的有害内容;第二,如何保护大语言模型免受生成或被操纵产生此类内容的威胁。研究人员发现,尽管已经取得了进展,但该领域仍然处于碎片化状态。目前还没有一种统一的方法来定义什么在中文语境下算是有毒的,而且现有的工具往往难以应对动态变化的、不断演变的在线俚语以及人们表达敌意的微妙且隐晦的方式。
研究人员首先梳理了数据的版图。为了教会计算机识别毒性,科学家需要海量的示例集合。他们发现,研究人员已经从微博和知乎等主要的中文平台收集了数据,创建的数据集涵盖了从直接侮辱到更复杂的仇恨言论和讽刺形式的所有内容。然而,他们指出一个显著的问题:将某事标记为有毒的标准往往是不一致的。一项研究可能将一条评论标记为无害的玩笑,而另一项研究则根据文化背景或特定的目标群体将其标记为仇恨言论。这种缺乏共识的情况使得很难比较不同的工具,或建立一个能在不同情境下可靠运行的系统。该综述还强调,虽然有很多针对文本的数据集,但对于包含图像、视频和表情包(memes)的资源的需求正在增长,因为毒性往往隐藏在文字与视觉效果的结合之中。
在技术层面,该团队考察了研究人员试图解决这些检测问题的尝试。早期的算法依赖于简单的关键词匹配,但当用户使用同音字替换字符或使用网络俚语来绕过过滤器时,这些方法就会失效。为了应对这一问题,较新的方法试图理解信息的深层含义和文化背景。一些方法使用“知识增强”,即向计算机输入有关文化引用或地域俚语的额外信息,以帮助其理解隐藏的意图。另一些方法则使用“多模态”技术,允许系统同时查看文本及其配对的图像或视频,以捕捉完整的侮辱全貌。研究人员还回顾了这些系统的训练方式,指出结合不同任务(例如,在学习检测讽刺的同时学习检测仇恨言论)可以帮助模型变得更加稳健。然而,他们发现许多这些先进的方法在面对全新的攻击类型或快速变化的俚语时仍然显得力不从心。
综述的后半部分聚焦于新的前沿领域:保护大语言模型。这些人工智能系统旨在提供帮助,但它们可能会被“越狱”——即通过巧妙设计的提示词被诱导忽略其安全规则,从而生成有毒内容。研究人员调查了人们测试这些模型的各种方式,从简单的提问到旨在消耗人工智能防御能力的复杂、多轮对话。他们发现,虽然一些模型在拒绝有害请求方面做得更好,但它们并不完美。一个主要问题是“过度敏感”,即人工智能会因为误认为某些话题危险而拒绝回答无害问题,例如拒绝讨论某些历史人物或文化话题。综述还指出,用于训练这些模型使其保持安全的手段通常是一个“黑箱”;我们知道它们在某种程度上有效,但我们并不完全理解它们为何会在特定案例中失败,也不清楚如何在不破坏其他能力的情况下进行修复。
作者总结道,尽管该领域已经向前迈进,但仍面临重大障碍。最紧迫的挑战是中文互联网文化的动态特性;一旦检测工具学会了识别某种特定类型的侮辱,用户就会发明一种新的表达方式。研究人员建议,未来的工作需要专注于为什么是“有毒”建立更一致的标准,开发能够快速学习并适应新俚语的系统,并提高这些工具的公平性,以免不公平地审查特定群体或方言。他们还强调,需要更好的工具来理解文本、图像和视频之间复杂的相互作用。最终,目标是建立能够保护在线空间而不抑制自由表达的系统,这种平衡需要对技术及其服务的文化进行深刻理解。该综述提供了一份路线图,展示了现有工具的不足之处,并指明了通往更具韧性和文化意识的解决方案的方向。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。