← 最新论文
💬 NLP

UCSC NLP at SemEval-2026 Task 10: Boundary-Aware Span Extraction and RoBERTa Classification for Conspiracy Detection

UCSC NLP 团队针对 SemEval-2026 Task 10 (PsyCoMark) 开发的系统采用了具有硬负采样(hard-negative sampling)的边界感知跨度提取技术以及基于 RoBERTa 的分类方法,用于检测阴谋论标记和文档,并分别取得了第 7 名和第 11 名的排名,同时强调了对类实体角色(entity-like roles)的稳健检测能力与对抽象角色边界敏感性的对比。

原作者: Dom Marhoefer, Milos Suvakovic, Glenn Grant-Richards, Aidan Pinero, Ryan King

发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Dom Marhoefer, Milos Suvakovic, Glenn Grant-Richards, Aidan Pinero, Ryan King

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在试图破解谜团的侦探,但你寻找的不是指纹,而是让一个故事听起来像阴谋论的特定“成分”。这篇论文描述了加州大学圣克鲁兹分校的一个团队如何构建一个计算机程序来精确完成这项任务,以参加名为 SemEval-2026 的竞赛。

以下是他们工作的详细分解,使用了简单的类比:

两个主要任务

这次竞赛有两个截然不同的挑战,该团队利用两个独立的“侦探特工”(AI 模型)来应对这些挑战。

1. 成分猎人(子任务 1)

  • 目标: 找出句子中扮演阴谋故事角色的特定部分。这些角色包括:
    • 行动者(The Actor): 谁在做坏事?
    • 受害者(The Victim): 谁受到了伤害?
    • 行为(The Action): 做了什么坏事?
    • 证据(The Evidence): 提供了什么“证据”?
    • 后果(The Effect): 产生了什么可怕的结果?
  • 挑战: 仅仅找到“杰弗里”这个词是不够的。计算机必须精确知道这个短语从哪里开始,到哪里结束。例如,是“泄露了内幕”这一动作,还是整个短语句“向摩萨德行动泄露了内幕”?
  • 诀窍: 团队教会了计算机成为一名“边界完美主义者”。他们告诉它:“如果你猜错的短语起始或结束位置哪怕只有一点点偏差,都不算数。”他们还使用了一种叫做**难负采样(Hard-Negative Mining)*的技术。想象一下,老师给学生看一张猫的照片并说:“那是猫。”然后,老师展示了一张看起来很像猫的、非常毛茸茸的狗的照片,并说:“这不是*猫。”这有助于学生学习两者之间的细微差别。计算机学会了识别真正的阴谋标记与那些看起来很像但并不完全符合定义的短语之间的区别。

2. 故事法官(子任务 2)

  • 目标: 阅读整篇文档并做出判断:这是一个阴谋论吗?它肯定不是吗?还是无法判断?
  • 诀窍: 这个模型并不观察第一个侦探发现的具体成分。相反,它像人类读者一样阅读整个故事,寻找整体的“氛围”或语调。它学会了区分批评性的新闻报道(虽然可能提到行动者和受害者,但并不是阴谋论)与真正的阴谋叙事(虽然使用了相同的角色,但带有可疑且隐秘的语调)。

他们是如何做到的

该团队使用了名为 RoBERTa 的强大 AI 大脑。你可以把它想象成一位博学多才的图书管理员,他读过几乎所有的互联网内容,并且理解词语是如何组合在一起的。

  • 对于成分猎人: 他们没有只是要求图书管理员逐一标注单词。相反,他们要求图书管理员查看每一个可能的文本块(长度不超过 32 个单词),并询问:“这个块是否符合‘证据’的定义?”他们训练图书管理员对这些块的起始和结束日期变得极其挑剔。
  • 对于故事法官: 他们将整个故事交给图书管理员,并要求给出一个简单的判决:是、否,或可能。

结果

当团队将他们的侦探投入正式比赛时:

  • 成分猎人 在所有队伍中排名 第 7。它非常擅长寻找“行动者”和“受害者”(如人的姓名),但有时在处理更抽象的部分(如“行为”或“后果”)时会遇到困难,因为这些短语的边界更加模糊。
  • 故事法官 排名 第 12。它相当擅长区分阴谋故事和普通新闻故事。

他们学到了什么(“顿悟”时刻)

  • 精准度很难: 计算机犯下的最大错误是把短语的起始或结束位置弄错了一点点。如果“证据”是单词“报告”,计算机有时会猜成“一份报告”或“根据一份报告”。竞赛规则非常严格:如果你没有得到完全一致的词汇,你就得零分。
  • 两个头脑单独工作比在一起更好: 团队决定让两个侦探在工作时互相交流。他们认为:“如果第一个侦探犯了错,我们不希望第二个侦探被这个错误所干扰。”他们保持了各自独立,只在最后才合并他们的答案。
  • “无法判断”的问题: 竞赛设有第三个选项,即“无法判断”。然而,最终的评分规则忽略了这个类别。这意味着计算机在测试当天的表现与它在练习期间的表现看起来略有不同,仅仅是因为规则在终点线前发生了微调。

总结

加州大学圣克鲁兹分校的团队构建了一个既像精密的编辑又像敏锐观察者的系统。他们证明了虽然计算机在识别阴谋论的“成分”方面做得越来越好,但在处理这些成分的精确“边界”方面仍然存在困难。然而,它们在感知故事的整体“情绪”以判断其是否为阴谋方面表现出色。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →