← 最新论文
💬 NLP

Friend or Foe? Language as an ideological switch in open-weight LLMs under Russian disinformation stress

本文通过一项受控审计挑战了“文化对齐微调能确保政治韧性”这一假设,证明了开源权重大语言模型对俄罗斯虚假信息的抵抗力更多取决于语料库构成和语言覆盖范围,而非其名义上的文化渊源,从而揭示了一个乌克兰导向的模型可能比俄罗斯导向的模型抵抗力更低的悖论。

原作者: Anna Małgorzata Kamińska, Tetiana Klynina

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Anna Małgorzata Kamińska, Tetiana Klynina

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明、白纸一张的机器人大脑(基础模型)。你想教它如何与不同国家的人交流,于是你给它喂了一种“特殊饮食”,即专门为乌克兰人、俄罗斯人或保加利亚人编写的书籍和文章。这个过程被称为微调(Fine-tuning)

通常的假设是这样的:如果你喂给机器人乌克兰的书籍,它就会成为一名忠诚的乌克兰捍卫者。如果你喂它俄罗斯的书籍,它就会成为一名俄罗斯的拥护者。

这篇论文在俄乌战争期间测试了这一假设。研究人员让四个不同的机器人大脑(一个中立的、一个“乌克兰”的、一个“俄罗斯”的、一个“保加利亚”的)去评判十个关于战争的有争议的故事。他们用英语、乌克兰语和俄语提出了同样的问题。

以下是研究结果的简单解释:

1. “特洛伊木马”式的惊喜

研究人员原本预期“乌克兰”机器人会强烈拒绝俄罗斯的谎言,而“俄罗斯”机器人会相信这些谎言。但他们完全错了。

  • “乌克兰”机器人 (Lapa): 当使用俄语提问时,这个机器人在识别俄罗斯宣传方面的表现实际上是最弱的。它经常将俄罗斯的谎言视为有效的、诚实的论点。这就像是一个乌克兰导游,一旦开始说俄语,听起来就突然像是认同了敌人。
  • “俄罗斯”机器人 (Saiga): 出人意料的是,当使用俄语提问时,这个机器人是最强的,能够拒绝俄罗斯的宣传。这就像是一个俄罗斯导游,在用自己的语言交谈时,会激烈地捍卫真相,反对其政府的谎言。

类比: 想象你为一位 VIP 雇佣了一名保镖。你预期由 VIP 家属雇佣的保镖会提供最好的保护。但在本研究中,由家属雇佣的保镖(乌克兰模型)在入侵者说特定语言时,实际上为入侵者打开了大门。与此同时,由入侵者一方雇佣的保镖(俄罗斯模型)却砰地一声关上了门。

2. “语言切换”效应

用户使用的语言就像是控制机器人大脑的遥控开关

  • 当用英语询问“乌克兰”机器人时,它的表现尚可。
  • 当用乌克兰语询问时,它变得稍微差了一些。
  • 当用俄语询问时,它的表现最差。

语言不仅改变了它如何说话,还改变了它相信什么。研究人员称之为**“隐藏代理效应”(Hidden Agent Effect)**。这就像机器人的内心隐藏着不同的个性,而你使用的语言就是开启特定个性的钥匙。在这种情况下,对“乌克兰”机器人说俄语,解锁了一个对真相感到非常困惑的个性。

3. “严肃 vs. 闲聊”测试

研究人员用了两种方式询问机器人:

  1. “严肃”的方式: “请扮演一名历史学家。列出双方的论点并给出百分比评分。”
  2. “闲聊”的方式: “只需用几句话说出你的看法。”

有时,要求机器人进行“严肃”且具有分析性的思考,反而会让它变得更加困惑和带有偏见。当被迫深入思考论点时,“乌克兰”机器人在使用俄语时,实际上给予了谎言更多的权重。而当只是进行随意的闲聊时,它有时反而更准确。这就像一个学生,当被要求写一篇正式论文时,会因为过于纠结规则而意外地为错误的一方辩护;但当只是和朋友聊天时,他却能说出正确的话。

4. “硬事实”之盾

有一件事能让所有的机器人免于偏见:硬性的、有据可查的事实。

当问题涉及克里米亚(拥有明确的国际法律文件)或暴行(如布恰大屠杀,拥有视频和法医证据)时,无论它们的“饮食”或使用的语言如何,所有的机器人都在真相上达成了一致。

类比: 把机器人想象成一座房子。所谓的“微调”(特殊饮食)就像是给墙壁刷上某种颜色。但如果你在房间中央放了一个巨大的、不可移动的钢制保险箱(硬事实),那么墙壁的颜色就无关紧要了。保险箱依然稳固。只有在缺乏证据这个“钢制保险箱”的情况下,机器人才会被左右。

核心启示

这篇论文的主要教训是:仅仅因为一个机器人与某个国家在“文化上对齐”,并不意味着它会保护那个国家的真相。

研究人员发现,与机器人对话时所使用的内容(语料库组成)和语言,比机器人的“国籍”重要得多。

最大的危险不一定是来自敌方制造的机器人。真正的危险在于,你方制造的机器人,在被使用敌方的语言进行交流时,由于训练不足以在那种特定语言下进行辩论,从而在无意中开始重复敌方的谎言。

简而言之: 你不能假设一个“乌克兰”机器人总会讲述乌克兰式的真相。如果你用俄语与它交谈,它可能会让你惊讶地发现,它竟然认同了那些谎言。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →