← 最新论文
🤖 AI

Obfuscation Rules for Detecting and Detoxifying Korean Toxicity

本文介绍了 KOTOX,这是首个专为同时检测与净化混淆的有害内容而设计的韩语数据集及开放转换框架,该框架通过分类基于语言学的混淆模式,并训练模型在不损害标准文本处理性能的前提下应对伪装表达。

原作者: Yejin Lee, Su-Hyeon Kim, Hyundong Jin, Dayoung Kim, Yeonsoo Kim, Yo-Sub Han

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Yejin Lee, Su-Hyeon Kim, Hyundong Jin, Dayoung Kim, Yeonsoo Kim, Yo-Sub Han

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和日常类比对论文《检测与净化韩语毒性的混淆规则》的解释。

问题:毒性的“秘密暗号”

想象一个操场,一个恶霸试图说些难听的话来让某个孩子惹上麻烦。但操场有一条严格规定:“禁止说难听的话。”于是,恶霸稍微改动一下措辞,以此蒙混过关,躲过老师的检查。他们不说“你真蠢”,而是说“你 st00p!d"或者"s-t-u-p-i-d"。

在数字世界中,这被称为混淆。人们故意拼写错误、用符号替换字母(如用 @ 代替 a),或重新排列词语,以隐藏毒性(有害/冒犯性)内容,使其避开自动过滤器。

该论文指出了一个大问题:大多数旨在捕捉不良语言的计算机程序都是在“干净”文本上训练的。它们就像只懂得识别戴红帽子的人的保安。如果恶霸戴的是带红条纹的蓝帽子,保安就会漏掉他们。这在韩语中尤其棘手,因为韩语是像乐高积木一样构建的(黏着语)。你可以轻松地交换、添加或重新排列这些积木而不改变含义,这使得计算机很难识破隐藏的侮辱。

解决方案:KOTOX(“训练健身房”)

延世大学的研究人员开发了一种新工具,名为KOTOX。你可以把 KOTOX 想象成专为 AI 模型设计的训练健身房

KOTOX 不只是向 AI 展示普通句子,而是提供成对的“训练”:

  1. 原始句:一个中性句子和一个毒性句子。
  2. 伪装句:同样的句子,但以特定方式进行了“混淆”(被改动)。

研究人员并非凭空猜测人们如何隐藏坏词;他们研究了互联网上的真实案例,并根据韩语的运作方式,创建了五个具体的“伪装”类别

  1. 语音类(音似):将字母改为发音相同但外观不同的形式(例如,用发音相似的辅音替换原辅音)。类比:将"cat"改为"kat"。
  2. 字形类(形似):用外观相似的符号替换字符(例如,用数字 3 代替 E,或使用不同文字体系的字符)。类比:写"H@te"而不是"Hate"。
  3. 转写类(跨语言):混入发音相同的其他语言字母(如英文或汉字)。类比:用"Gongbu"(学习)代替韩语单词。
  4. 句法类(结构扭曲):打乱空格或音节的顺序。类比:写"st up id"而不是"stupid"。
  5. 语用类(表情符号干扰):添加表情符号或奇怪符号以分散计算机的注意力。类比:在难听的词旁边加一个爱心表情符号 来迷惑过滤器。

构建过程

团队从现有的韩语句子数据集(包含一些友善和恶意的句子)开始。他们像严格的编辑一样操作:

  • 他们清除了不良示例(例如包含个人姓名或语法混乱的句子)。
  • 他们应用新的“伪装规则”,生成了数千个新配对。
  • 最终结果是一个庞大的数据集,其中每个句子都同时拥有“干净”版本和“伪装”版本。

结果:训练 AI

研究人员在多个 AI 模型上测试了这个新健身房(KOTOX)。以下是发生的情况:

  • 训练前:AI 模型在识别伪装过的毒性文本方面表现极差。如果文本被改动过,它们就认为它是安全的。
  • 训练后:当模型在 KOTOX 上进行训练后,它们在以下两方面变得更强:
    1. 去混淆:它们能够查看杂乱、伪装的文本,并“撤销”这些改动以还原原始含义。
    2. 去毒性:它们能够将伪装过的毒性文本改写为礼貌、安全的版本。

关键发现:在这种特定的“伪装”数据上进行训练,不仅帮助模型处理杂乱文本,实际上还使它们在识别普通、干净的毒性文本方面也变得更出色。这就像一名保安,经过训练学会识别躲在灌木丛中的人后,即使对方没有躲藏,也能更好地识别任何行为可疑的人。

为何重要

这是首个专门针对韩语的此类数据集。它表明,要阻止毒性内容,我们不能仅仅教 AI 识别“坏词”;我们必须教它们识别“伪装后的坏词”。通过理解韩语使用者隐藏毒性的具体方式,我们可以构建更智能、更稳健的过滤器,使其不会被简单的拼写把戏所欺骗。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →