💬 NLP
When Hate Meets Facts: LLMs-in-the-Loop for Check-worthiness Detection in Hate Speech
该论文发布了首个结合仇恨言论与可核查性信息的 WSF-ARG+ 数据集,提出了一种基于大语言模型的辅助标注框架以减轻人工负担,并证实了引入可核查性标签能显著提升仇恨言论检测的准确率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文就像是在处理一场**“披着事实外衣的恶意攻击”**。
想象一下,互联网上的仇恨言论(比如种族歧视、人身攻击)通常有两种形式:
- 赤裸裸的骂人:直接说脏话、侮辱人。这很容易识别,就像看到一个人拿着棍子打人,大家一眼就能看出来。
- 披着“事实”外衣的谎言:这是这篇论文关注的重点。坏人不再直接骂人,而是编造一些听起来像“新闻”或“数据”的假话(或者歪曲真话),用来煽动仇恨。比如:“某族群的人天生就喜欢犯罪,这是科学证明的。”
这就好比:
以前的坏人是在街上扔石头(直接骂人),现在的坏人是在往井里投毒(散布看似有理的假新闻)。投毒更隐蔽,危害更大,而且更难处理,因为你需要先判断“这水到底有没有毒”(事实核查),才能决定要不要封井。
这篇论文主要做了三件事:
1. 造了一个新“训练场” (WSF-ARG+ 数据集)
以前的研究要么只研究“骂人”,要么只研究“假新闻”,很少把这两者结合起来。
- 比喻:这就好比以前的驾校,要么只练“怎么停车”,要么只练“怎么超车”,但没人练“在暴雨中一边超车一边停车”。
- 做法:作者收集了大量来自白人至上主义论坛的真实帖子,把它们分成了两类:
- 仇恨帖:带有恶意的。
- 非仇恨帖:没有恶意的。
- 关键点:他们把每个帖子里的“事实主张”(Claims)都拆出来,标记了哪些是**“值得核查的”**(Check-worthy)。
- 结果:他们发现,那些带有“值得核查”的假话的仇恨帖,往往比直接骂人的帖更让人讨厌,骚扰性更强。 就像投毒的井比扔石头的路更让人恐惧。
2. 发明了一个“人机协作”的新流程 (LLM-in-the-loop)
给这些帖子做标记(告诉电脑哪句话是假话、哪句话值得核查)非常累,需要很多专家花大量时间。如果全让人做,太慢太贵;如果全让 AI 做,AI 容易犯错或产生幻觉。
- 比喻:这就像**“老中医带徒弟”**。
- 传统做法:要么全是老中医(专家)看病,太慢;要么全是实习生(AI)看病,容易误诊。
- 新做法(LLM-in-the-loop):
- 让 AI(实习生)先快速看一遍,给出一个初步诊断。
- 让人(专家)也看一遍。
- 如果两人意见一致,那就直接通过,省事了。
- 如果两人意见不一致,或者 AI 自己前后矛盾,就请一位“老院长”(法官/高级专家)来最终拍板。
- 效果:这种方法既保留了人类专家的准确性(黄金标准),又大大减少了人类需要亲自处理的案例数量,就像给专家配了个超级高效的助手。
3. 验证了“假话”对识别仇恨很有用
作者测试了各种大模型(LLM),发现了一个有趣的现象:
- 比喻:如果你只给 AI 看一段骂人的话,它可能有点懵。但如果你告诉 AI:“注意,这段话里包含一个需要核查的假事实",AI 就能立刻反应过来:“哦!原来这是利用假新闻在煽动仇恨!”
- 结果:当把“是否值得核查”这个标签告诉大模型时,大模型识别仇恨言论的能力显著提升(特别是那些大模型,准确率提高了很多)。
总结与启示
这篇论文告诉我们:
- 仇恨言论进化了:现在的仇恨言论喜欢伪装成“事实”,这比直接骂人更危险,因为它更难被察觉,且更容易让人信以为真。
- AI 是帮手,不是替代者:在复杂的任务中(比如判断一句话是否值得核查),最好的办法不是完全依赖 AI,而是让 AI 和人类**“结对子”**。AI 负责初筛和减少工作量,人类负责把关和解决争议。
- 未来的方向:如果我们能更好地识别这些“披着事实外衣的仇恨”,就能更精准地进行**“反制”**(比如用事实去反驳假新闻,而不是简单粗暴地删帖),从而更有效地维护网络环境的健康。
简单来说,这就是一份**“教 AI 和人类如何联手,揪出那些披着科学外衣的坏蛋”**的操作指南。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。