YEZE at SemEval-2026 Task 9: Detecting Multilingual, Multicultural and Multievent Online Polarization via Heterogeneous Ensembling
本文介绍了 YEZE,这是一个面向 SemEval-2026 第 9 项任务的系统,它通过采用 XLM-RoBERTa-large 与 mDeBERTa-v3-base 模型的异构集成来检测 22 种语言的在线极化现象,其中独立任务建模结合类别加权被证明是处理严重标签不平衡最有效的方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象互联网是一个巨大的全球广场,来自 22 个不同国家的人们同时在大声喊叫、低语和争论。有时,这些争论会变得激烈,演变成“极化”——人们不再倾听彼此,只听从自己一方。
你分享的这篇论文描述了一个名为 YEZE 的研究团队,他们构建了一套特殊的“数字耳朵”来倾听这个广场,并试图弄清楚三件事:
- 这场争论是否激烈?(二元检测)
- 他们在争论谁或什么?(目标分类:政治、种族、宗教等)
- 他们是如何争论的?(表现形式:他们是否在使用侮辱、刻板印象或非人化语言?)
以下是他们如何做到的简单解释:
1. 问题:嘈杂且不平衡的人群
研究人员面临两大障碍:
- 语言障碍:他们必须理解 22 种不同的语言,从英语和西班牙语到阿姆哈拉语和缅甸语。这就像试图理解一场每个人都说不同方言的对话。
- “稀有事件”问题:在数据中,大多数帖子是平静的。只有少数帖子实际上是极化的。这就像试图在一桶白色弹珠中找到一颗红色弹珠。如果你每次都猜“白色”,你大多数时候都会是对的,但你会错过红色的那些。这被称为“标签不平衡”。
2. 解决方案:一个“双人侦探团队”
团队没有构建一个包揽一切的巨大大脑,而是建立了一个异构集成模型。这就像雇佣两名不同类型的侦探来解决同一个案件:
- 侦探 A(XLM-RoBERTa):一位几乎读过世界上所有东西的老手。他们擅长理解任何语言中句子的整体氛围和语境。
- 侦探 B(mDeBERTa):一位专家,非常关注词语的具体排列以及它们之间的相互关系。
他们如何协作:
他们并没有简单地让他们投票,而是赋予了加权分数。如果侦探 A 有 70% 的把握,而侦探 B 有 30% 的把握,最终答案会 heavily 倾向于侦探 A。这种组合使系统更加稳健,就像有了安全网。
3. 策略:单独处理每个线索
团队意识到,试图同时解决所有三个谜团(是否极化?关于谁?如何表达?)就像试图在骑独轮车时玩杂耍。关于“谁”和“如何”的线索如此稀有,以至于它们在“是否极化”这一线索的噪音中迷失了。
因此,他们决定拆分任务:
- 他们为每个具体问题训练了单独的模型。
- 对于稀有线索(如特定类型的仇恨言论),他们使用了一种称为加权交叉熵的特殊技巧。想象一位老师批改试卷。如果学生答对了一道稀有且困难的问题,老师会给他们额外的分数。如果答对了一道常见问题,则获得正常分数。这迫使人工智能格外关注那些它通常忽略的稀有且重要的案例。
4. 他们的发现
- 分离有效:试图一次性完成所有事情(多任务学习)实际上使系统变得更糟,因为稀有线索混淆了常见线索。将任务分开是制胜之举。
- “翻译”陷阱:他们尝试将帖子翻译成其他语言以创建更多练习数据(数据增强),但这并没有太大帮助。这就像翻译一个笑话;词语可能正确,但文化幽默和细微差别丢失了,导致人工智能感到困惑。
- 结果:他们的系统在 22 种语言中都非常擅长识别“红色弹珠”(极化内容)。在许多语言中,他们在所有参赛团队中排名前 10。然而,他们在最具体、最稀有的侮辱类型(“表现形式”)上仍有些吃力,这表明即使是最优秀的人工智能,在缺乏足够学习样本的情况下,也很难识别最微妙的仇恨形式。
简而言之
这篇论文是关于为社交媒体构建一个智能的、多语言的安全系统。他们没有使用一个巨大而困惑的大脑,而是利用了一个由两个专用 AI 模型组成的团队协同工作。他们教导这些模型更关注那些稀有且危险的帖子,而不是无聊的帖子。虽然他们并没有解决所有问题(尤其是非常罕见的仇恨言论类型),但他们证明了拆分任务并结合不同类型的 AI 大脑是应对混乱、多语言世界的最佳方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。