Every Token Counts: Exact Likert-Scale Distributions for Measuring LLM Attitudes and Biases
本文引入了一种分析精确的框架,该框架将全交叉因子实验与标记级概率分析相结合,以精确测量大语言模型的态度与偏见,从而克服了传统非结构化基准测试中的因果歧义。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图弄清楚一个巨大的、隐形的机器人是如何看待这个世界的。这不是那种制造汽车或折叠衣服的机器人;它是一个“大语言模型”(LLM),一个在几乎所有人类写过的文字上进行过训练的超级智能计算机程序。这些模型正变得如此擅长交谈,以至于公司开始让它们充当独立的智能体(agents),自主做出决策并与人互动。但问题在于:我们并不真正了解它们“相信”什么。它们是否有隐藏的偏见?它们是否更青睐某些国家或特定的人群?为了找出答案,科学家通常会对机器人进行成千上万个随机问题的测试,并观察其回答。这有点像通过向一个陌生人提问无数个不同的问题来猜测其性格。问题在于,当你问太多随机问题时,你无法分辨机器人的回答究竟是源于一种根深蒂固的信念,还是仅仅因为问题的措辞有些奇怪。这就像试图通过询问一个人关于披萨的问题,同时也询问他们的爱好颜色、鞋码和天气,来理解他们对披萨的热爱。你会得到很多数据,但你无法将对披萨的热爱与鞋码的大小区分开来。
这正是新论文发挥作用、清理混乱的地方。研究人员 Davood Wadi、Mohsen Ghodrat 和 Matthew Philp 决定停止这种随机提问,转而进行一场受控的科学实验。他们不再靠猜测,而是将机器人视为心理学课堂上的实验对象。他们使用了一种特殊的数学方法,在机器人开口说话之前就观察其“思想”。普通的测试会等待机器人打出答案(这会产生大量噪声和随机性),而这个团队直接观察机器人的内部概率得分——即它选择每一个可能单词的精确数学概率。通过这种方式,他们可以精准地测量机器人的“态度”,而不会受到随机猜测的干扰。他们针对一个特定的主题进行了测试:“消费者民族主义”(consumer ethnocentrism),这基本上是指一个人(或机器人)对本国的热爱以及对外国的排斥程度。他们想看看不同国家制造的机器人是否真的拥有不同的国家偏见,以及这些偏见是真实的,还是仅仅由糟糕的测试方法造成的幻觉。
伟大的机器人性格测试
把传统的 AI 测试想象成一场混乱的“给驴贴尾巴”游戏。你旋转着机器人,递给它一大袋随机问题,然后看它说什么。如果机器人说了带有偏见的话,你知道它有偏见,但你完全不知道“为什么”。是因为机器人讨厌女性吗?是因为问题涉及了领导力吗?还是仅仅是一个偶然?旧的方法将所有这些原因混杂在一起,使得无法区分机器人的核心人格与对某个困惑提示的临时反应。
论文作者说:“别再转那个驴了!”相反,他们建立了一个完美有序的网格,就像一个巨大的数独谜题,其中的每个方格都是一项特定的测试。他们像对待食谱一样对待实验:他们测试了“哪个机器人?”与“正在询问哪个国家?”的所有可能组合。他们使用了五个不同的机器人(分别来自美国、中国、加拿大和法国),并询问了四个不同的国家。这种“全交叉”(fully crossed)设计意味着他们可以通过数学手段精确分离出到底是什么导致了偏见。是机器人本身?是正在讨论的国家?还是两者的某种奇特结合?
读取机器人的大脑(无需噪声)
这是他们妙招中最酷的部分。通常,当我们向 AI 提问时,它会挑选一个词,然后再选下一个,就像掷骰子来决定下一步说什么一样。这种“掷骰子”(称为采样)增加了大量的噪声。如果你用同样的问题问它十次,你可能会得到十个略有不同的答案,很难知道哪一个是“真实”的答案。
这篇论文完全跳过了掷骰子的过程。研究人员没有等待机器人说话,而是观察了机器人的内部“概率图”(称为概率质量函数,或 PMF)。想象一下,机器人有一个秘密仪表盘,显示了它在评分量表中说出“1”、“2”、“3”直到“7”的精确百分比概率。研究人员没有等待机器人做出选择,而是同时观察了整个仪表盘。这就像是在掷骰子之前,就已经确切知道这个骰子是如何加重的。通过分析这个精确的图谱,他们消除了所有的随机噪声。他们能看到机器人的真实“观点”是一条平滑、完美的曲线,而不是一条锯齿状、混乱的线条。
研究结果:机器人拥有国家身份(某种程度上)
当他们将这种超精确的方法应用于“热爱祖国”这一主题时,他们发现了一些旧有的、混乱的方法会错失的有趣现象。
首先,他们发现有些机器人非常一致,而有些则有些混乱。例如,名为“Ministral”(来自法国)的机器人很难坚持规则,经常给出杂乱无章的答案。但来自美国(Llama 和 Gemma)和中国(Qwen)的机器人则非常专注且一致。
其次,他们发现机器人确实似乎拥有“国家偏见”,但情况很复杂。美国制造的机器人(Llama 和 Gemma)表现出对北美国家(美国和加拿大)的明显偏好以及对中国的厌恶。这就是你所说的“内群体偏好”。然而,这并不是一个简单的“我爱我的国家”的故事。加拿大的机器人(Aya)和中国的机器人(Qwen)并没有表现出同等强烈的“热爱本国”的偏见。事实上,中国的机器人在这次测试中对其本国几乎没有表现出特定的偏见,其交互效应接近于零。
不过,最重要的发现是旧的方法是如何误导我们的。如果你只是简单地取所有答案的平均值(旧方法),你会认为每个机器人都讨厌法国和中国。但当研究人员使用这种新的“精确数学”方法时,他们发现这是错误的。法国的机器人(Ministral)实际上是喜欢法国的!加拿大的机器人(Aya)实际上是喜欢中国的!旧方法因为将其他机器人的负面情绪混在一起,从而掩盖了这些特定的正面感受。新方法剥开了层层外壳,展示出偏见并非一成不变;它完全取决于你在测试哪个机器人以及你具体在问什么。
为什么这很重要
论文还表明,旧的测试方式是极其不可靠的。由于随机的“掷骰子”现象,旧方法经常会搞错偏见的方向。有时,仅仅因为随机噪声,它们会误以为机器人是积极的,而实际上它是消极的。作者计算出,使用旧方法时,你很有可能仅仅因为偶然就会得到反向的偏见符号。而他们的新方法通过观察机器人内部的精确数学,永远不会犯这种错误。
简而言之,这篇论文认为,如果我们想要了解这些强大的 AI 智能体真正如何思考,我们就不能再把它们当作只会吐出随机文本的“黑箱”。我们需要把它们当作科学仪器来对待,通过观察它们的内部数学逻辑来了解它们的真实价值观。通过这样做,我们终于可以把机器人的真实人格从测试的噪声中分离出来,确保当我们把这些智能体部署到现实世界时,我们确切地知道它们携带了什么样的偏见。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。