← 最新论文
💻 computer science

Artificial Intelligence in America and China: Investigating prompt response between Human rights and geopolitical questions

这项研究表明,虽然美国和中国的语言大模型在回答有关美国的问题时表现出极小的偏见,但在涉及中国时却呈现出显著的分歧模式,其中 Claude 的得分始终较低,DeepSeek 较高,而 ChatGPT 与群体平均水平相比则保持相对中立。

原作者: Zian Ding

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Zian Ding

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在过去的几年里,一种新型的计算机程序已成为日常生活中常见的一部分。这些被称为“大语言模型”的程序能够以令人惊讶的流利度阅读和书写人类语言。它们通过学习来自互联网的海量文本进行训练,学习如何预测句子中下一个应该出现的词汇。由于它们非常擅长模仿人类对话,许多人现在转向它们来获取关于历史、科学和时事方面的答案。然而,由于这些程序是向其喂入的数据进行学习的,它们也可能吸收隐藏在这些数据中的观点、偏见和盲点。这为任何依赖这些工具获取信息的人提出了一个关键问题:这些数字助手看待世界的方式与我们相同吗,还是它们带有自己的隐藏偏见?

最近的一项研究试图通过将人工智能视为实验对象来回答这个问题。研究人员丁子安(Zian Ding)想要观察不同的计算机模型在被问及人权和国际政治等敏感话题时,是否会给出不同的答案。为此,该研究聚焦于当时最流行的三个模型:两个来自美国公司,一个来自中国公司。目标并非与机器进行长篇对话,而是向它们提出一组特定的问题,并观察它们如何对这些情境进行评分。研究人员要求每个模型对十六个不同的情境进行评分,涵盖了十个关于人权的问题和六个关于中美地缘政治竞争的问题。对于每个问题,模型必须给出一个一到十分的分数,其中低分代表负面看法,高分代表正面看法。

实验的设计非常谨慎。为了确保结果公平,研究人员在每一个新的聊天会话中提出问题,以确保计算机不会记住之前的答案或被过去的对话所干扰。研究人员还关闭了美国模型中允许记住用户细节的功能,从而确保每个答案仅基于所提出的特定问题。通过比较三个不同模型的评分,该研究寻找其中的模式。如果三个模型给出的分数相似,则表明它们拥有共同的中立观点。如果它们给出的分数差异很大,则表明每个模型都有其独特的视角,这种视角很可能是由其训练数据所塑造的。

当研究人员询问关于美国的问题时,结果基本一致,尽管存在细微的变化。对于大多数关于美国人权和地缘政治地位的问题,这三个计算机程序给出的分数都非常相似。然而,也有例外;例如,Claude 模型在 6G 通信问题上的评分比平均值低 1.89 分,显示出与其他两个模型的显著偏差。无论是关于种族正义还是国际竞争的话题,美国和中国的模型通常都相互一致,尽管具体问题揭示了它们评估中的微小差异。这表明,在描述自己的国家或盟友时,这些人工智能系统往往基于一套广泛共享的事实和价值观进行运作,这很可能是因为它们都接受了大量的西方数据训练。

当问题转向中国时,故事发生了彻底的变化。在这里,三个模型出现了明显的分歧,揭示了截然不同的偏见。中国的模型 DeepSeek 始终给出最高分,描绘了一幅非常积极的中国的人权记录和全球竞争前景的图景。它经常引用许多不同的来源来支持其高评分,尽管它有时最初会对某些敏感问题表现出犹豫。另一方面,来自美国公司的美国模型 Claude 则给出了最低分。它经常拒绝回答关于少数群体权利的问题,声称一个简单的数字无法捕捉这一问题的复杂性。当它回答时,其分数明显低于平均水平,表明其持有更为批判性的观点。

第三个模型是一个美国的程序,它处于中间位置。它的评分非常接近三个模型的平均值,表明相对于另外两个模型,它保持了相对的中立。这种中间立场表明,这个特定的模型可能是在更平衡的数据组合上训练的,或者也许是为了避免在这些特定问题上采取强硬立场而进行了更新。研究人员还检查了该美国模型的记忆功能是否改变了其答案,发现开启或关闭该功能对最终得分几乎没有影响。

研究结果表明,虽然这些人工智能工具功能强大,但它们并不是中立的观察者。它们反映了构建它们的数据以及创造者为其设定的规则。当被问及美国时,它们通常达成共识,尽管存在一些特定的例外。当被问及中国时,它们讲述了三个不同的故事。这一点至关重要,因为包括许多青少年在内的数百万人在利用这些工具了解世界。如果一个年轻人向计算机询问不同国家的人权情况,他们得到的答案完全取决于他们询问的是哪台计算机。研究结论指出,用户需要意识到这些机器拥有自己的视角,并且它们提供的信息并不总是客观真理,而是其代码中内置偏见的体现。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →