← 最新论文
💬 NLP

Lingo_Research_Group at SemEval-2026 Task 9: Evaluating Prompt Variants for Polarization Detection

Lingo_Research_Group 的论文通过使用 Gemma3-27B 模型对 SemEval-2026 任务 9 中的十二种提示词变体进行了系统性评估,证明了虽然基于提示词的方法能有效检测 22 种语言中的粗粒度极化现象,但在细粒度和多标签社会语言学分类方面面临着日益严峻的挑战。

原作者: Pritam Kadasi, Anuj Tiwari, Mayank Singh

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Pritam Kadasi, Anuj Tiwari, Mayank Singh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名正在试图破解一个发生在 22 种不同语言中的谜题的侦探。这个谜题并不是关于失窃的珠宝,而是关于一个被称为“极化”(polarization)的东西。简单来说,极化是指人们在社交媒体上开始互相争吵,在“我们”和“他们”之间划出清晰的界限,并拒绝倾听另一方的声音。

这个研究团队——Lingo Research Group,参加了一场全球竞赛 (Sem увем-2026),旨在观察能否教会一台超级聪明的计算机(AI)去识别这种争吵、弄清楚他们在为什么而吵架,以及他们是如何吵架的。

以下是他们完成这项工作的过程,通过一些日常类比来解释:

谜题的三个等级

这次竞赛共有三个难度等级,就像电子游戏一样:

  1. 第一级(“是否正在发生?”检查): AI 只需要回答“是”或“否”。这条帖子是在愤怒地制造分歧,还是仅仅是一条普通的帖子?
    • 类比: 就像烟雾报警器。它只需要回答:“有烟吗?”
  2. 第二级(“是在针对谁?”检查): 如果这条帖子具有极化性,他们在为什么而吵?是政治家?特定的种族?宗教?还是性别?
    • 类比: 就像侦探在问:“嫌疑人是谁?”AI 需要从一排嫌疑人中选出一位或多位。
  3. 第三级(“如何吵架?”检查): 这是最难的一级。仇恨是如何表达出来的?他们是在使用刻板印象吗?是在辱骂他人吗?还是表现得不在乎他人的感受?
    • 类比: 就像分析争吵的“风格”。他们是用刀、钝器,还是仅仅在喊叫?这需要识别微妙且棘手的行为。

工具:将“提示词”视为“食谱”

该团队并不是通过向计算机展示数千个例子来教它(这就像强迫学生背诵教科书),而是使用了提示词(prompts)。把提示词想象成给一位非常有才华但过于死板的厨师(AI)提供的食谱一套指令

该团队尝试了 12 种不同的食谱

  • 有些食谱非常简短:“这很愤怒吗?”
  • 有些食谱则非常详细:“寻找将人群分隔开的词汇。如果你看到讽刺,请检查它是否带有恶意。这里有三个关于这种情况的例子……”

他们在两个不同的“厨师”(AI 模型)上测试了这些食谱:aya-101Gemma3-27B。他们发现 Gemma3-27B 是更优秀的厨师,因此在最终竞赛中使用了它。

结果:擅长基础,但在细微之处挣扎

该团队的结果既有成功也有挫折,这讲述了一个有趣的故事:

  • 第一级(烟雾探测器): AI 在这方面表现得非常好。它平均有 76% 的概率能正确识别出极化帖子。这就像一个很少漏掉火灾的烟雾报警器。
  • 第二级(嫌疑人): 分数下降到了约 59%。要精准定位到底是谁受到了攻击变得更加困难。
  • 第三级(吵架风格): 分数进一步下降到约 44%。这是最难的部分。

为什么会变得越来越难?
作者解释说,随着任务变得更加具体,AI 会感到困惑。

  • “保守派厨师”问题: AI 被训练得非常谨慎。只有当证据极其明显(比如有人大喊脏话)时,它才会说“是的,这是极化的”。
  • “讽刺陷阱”: 在英语中,人们经常使用讽刺、反讽或巧妙的文字游戏来争吵(例如,“噢,太棒了,耶稣之名下又来了一个社会主义者”)。由于 AI 太过字面化,它错过了这些,因为它捕捉不到明显的“战斗词汇”。它认为:“没有直接的侮辱?那么它一定是安全的。”
  • “直接与间接”的差距: 在许多其他语言(如印地语或中文)中,人们在争论时往往更加直接。AI 非常擅长识别那些直接的打击,但在处理英语中微妙、间接的争论时却显得力不从心。

语言之谜

AI 在不同语言中的表现并不相同。

  • 尼泊尔语和中文对 AI 来说相对容易,因为其中的极化现象通常非常明确且直接(例如“A 组 vs B 组”)。
  • 英语则出人意料地困难。因为英语使用者使用大量的讽刺、文化缩写和巧妙的表达,AI 不断错过这些争吵。这就像试图用一种你并不完全精通的语言去理解一个笑话:你听到了单词,但你错过了笑点。

核心结论

论文总结道:AI 擅长识别“大声”的争吵(第一级),但在处理“安静”或“聪明”的争吵时表现挣扎(第二级和第三级)。

该团队学到,你不能仅仅给 AI 一个简单的指令,就期望它能理解跨越 22 种不同文化的复杂人类情感。当你要求它分析更多的“细微差别”(即“如何”和“谁”)时,它往往会错过那些微妙的迹象,尤其是在人们使用讽刺或间接表达方式的时候。

简而言之: AI 是一个擅长处理显而易见罪行的侦探,但它需要更多的训练,才能理解网络上那些微妙、狡猾且充满讽刺的争论方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →