PSK at SemEval-2026 Task 9: Multilingual Polarization Detection Using Ensemble Gemma Models with Synthetic Data Augmentation
PSK 团队在 SemEval-2026 第 9 项任务中,通过采用经 GPT-4o-mini 生成合成数据增强和按语言阈值调优的 LoRA 微调 Gemma 3 模型集成,取得了 0.811 的平均宏观 F1 分数,获得总排名第 2 位,同时凸显了泛化能力的关键重要性,超越了那些在开发集上表现良好却在测试集上失效的架构。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一组 22 名不同的学生(代表 22 种不同的语言)如何在社交媒体帖子中识别“激烈争论”与“冷静对话”。这就是 SemEval-2026 第 9 项任务面临的挑战,而 PSK 团队(由独立研究人员 Srikar Kashyap Pulipaka 领导)构建了一个系统来解决它。
以下是他们如何做到的简单解释:
1. 目标:识别“热度”
任务是在 22 种语言(从英语到阿姆哈拉语)中阅读社交媒体帖子,并判断:这篇帖子是否极化(充满刻板印象、仇恨或不容忍)?还是中立的?
- 挑战:某些语言可供学习的示例非常少,而且“极化”在每种文化中表现不同。这就像试图教一个人识别“风暴”,而他们只在一个国家见过“雨”。
2. 教师:"Gemma"模型
团队没有为所有人雇佣一位庞大的“老师”,而是为每种语言聘请了两名特定的“导师”:
- 12B 导师:一个聪明且高效的模型(120 亿参数)。
- 27B 导师:一个更聪明、更强大的模型(270 亿参数)。
他们使用了一种称为LoRA的技术,这就像给这些导师提供一份小型的、专门的“作弊小抄”,让他们学习特定语言,而无需重写整个大脑。
3. 学习伙伴:合成数据
团队意识到一些学生没有足够的练习题。因此,他们使用人工智能(GPT-4o-mini)来编写虚假的练习题(合成数据)。
- 直接生成:人工智能从头开始编写新的、虚假的争论。
- 改写:人工智能将真实示例用不同的措辞重写(就像学生重新表述一道作业题)。
- 对比对:人工智能创建“成对”示例——一个极化,一个冷静——以便模型能看到确切的区别。
- 过滤器:他们并没有随意将这些虚假数据堆砌在一起。他们通过严格的“质量控制”过滤器来运行这些数据,以去除重复项和无意义内容,确保学生只学习高质量的材料。
4. 策略:调节“音量旋钮”
训练后,模型必须做出最终决定。通常,如果 AI 的把握超过 50%,它就会说“是”。但团队发现,对于某些语言,50% 太高或太低。
- 修正:他们将决策阈值视为一个音量旋钮。对于某些语言,他们将旋钮调低至 30%(以捕捉更多争论),而对于其他语言,则调高至 70%(以避免误报)。这一简单的调整在没有额外训练的情况下将他们的得分提高了 2–4%。
5. “集成”:法官小组
对于最终决定,他们并没有只听一位导师的意见。他们使用了集成方法:
- 他们让 12B 和 27B 两位导师都投票。
- 有时他们取投票的平均值;其他时候,他们给予更聪明的导师更多权重。
- 对于每种语言,他们选择在练习测试中表现最佳的投票策略。
6. 结果:谁赢了?
- 获胜者:该团队在 60 支队伍中总排名第2。
- 得分:他们取得了0.811的得分(衡量准确性的指标)。他们在 3 种语言中排名第1,在另外 8 种语言中进入前 3。
- 意外:他们尝试使用其他著名的人工智能模型(XLM-RoBERTa 和 Qwen3)。这些模型在练习测试中表现很好,但在真实测试中崩溃了,准确率下降了 30–50%。
- 教训:拥有一个能泛化(学习极化的概念)的模型,比一个仅仅死记硬背练习答案的模型更好。Gemma 模型是唯一那些在考试开始时没有“遗忘”的模型。
7. 唯一的弱点:意大利语的“缺失章节”
该系统在意大利语方面表现最为吃力。为什么?
- 意大利语的训练数据缺失了整类主题(如“政治”或“其他”问题)。
- 然而,最终测试包含了大量关于这些缺失主题的问题。
- 这就像只复习了加法来准备数学考试,但期末考试却包含了一个巨大的除法部分。该模型从未见过这些特定类型的争论,因此无法正确猜测。
总结
该团队构建了一个系统,利用专门的 AI 导师、AI 生成的练习题和自定义调整的决策规则来识别 22 种语言中的在线争论。他们的秘诀不仅仅在于使用最大的 AI,而在于使用那个能够真正学习极化概念而不只是死记硬背答案的模型,然后针对每种特定语言微调规则。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。