ConsistencyAI: A Benchmark to Assess LLMs' Factual Consistency When Responding to Different Demographic Groups
该论文介绍了 ConsistencyAI,这是一个独立的基准测试,用于评估 19 个大型语言模型在不同人口统计学人格下的事实一致性,结果显示一致性得分因模型提供商和主题而异,其平均基准阈值为 0.8656。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代信息时代,我们越来越多地转向人工智能来回答我们的问题,从牛奶的价格到复杂的历史细节。这些被称为大语言模型的系统,旨在理解人类语言并生成具有对话感的文本。它们已成为人们获取事实的主要方式,往往取代了传统的搜索引擎来提供快速答案。然而,一个根本性的问题仍然存在:这些机器是如何运作的——它们是对每个人都讲述同样的故事,还是会根据提问者的身份而改变事实?如果一个计算机程序知道你是一名年轻的学生,它呈现给你的真理集是否会与呈现给一位年长的高管不同?这种可能性引发了对公平性和信息完整性的担忧。如果事实本身会根据一个人的背景(如年龄、性别或职业)而发生变化,这表明该系统不仅仅是在回答问题,而是在根据特定的受众量身定制现实。这种现象如果属实,可能会微妙地塑造不同群体理解世界的方式,从而可能加深分歧而非弥合分歧。
为了调查这一现象,杜克大学和北卡罗来纳大学的研究人员创建了一个名为 ConsistencyAI 的新测试。他们的目标是观察大语言模型是否会对不同的人讲述不同的事实。他们并没有要求模型检查信息是否真实;相反,他们询问模型是否会对一名 25 岁的教师和一名 60 岁的建筑工人提供相同的一套事实。该团队构建了一个系统,模拟了一群来自美国的多元化人群,代表了广泛的年龄、职业和背景。随后,他们要求 25 个不同的人工智能模型针对 15 个不同的话题(如住房成本、贸易逆差和政治冲突)提供五项事实。每个问题都会在变换用户身份的情况下向每个模型提问一百次,其中身份是通过从一个具有代表性的数据集里抽取的 100 个角色(personas)进行变化的。通过比较答案,研究人员可以衡量当角色改变时,内容发生了多大的变化。
结果显示,虽然许多模型通常是连贯一致的,但并非完美无缺。研究人员发现,模型确实会根据它们认为正在与之交谈的对象来改变所呈现的事实。在涉及 100 个角色的大规模测试中,模型的连贯性得分范围从 0.9137 到 0.6719 不等,平均得分为 0.8555。这个平均值成为了这项研究的基准。表现最稳定的模型是 xAI 的 Grok-4,无论用户是谁,它在事实方面都保持得非常稳定。处于另一端的则是几个较轻量级和中层级的模型,它们表现出了最大的差异。研究表明,讨论的主题与模型本身一样重要。例如,当被问及美国贸易逆差(一个拥有清晰、标准化政府数据的课题)时,模型的连向性非常高。然而,当被问及住房成本(一个拥有复杂且多样化数据源的课题)时,模型给不同人的答案差异很大。
研究人员还发现,模型不仅改变了语气或风格,它们实际上还选择了不同的事实。当角色改变时,响应中提到的具体细节、组织和数字往往会发生变化。例如,在关于边境安全的课题上,一个模型倾向于向年长用户提供侧重于执法部门的答案,而向年轻用户提供的则是侧重于地理方面的答案。另一个模型则向未成年人提供简化、多类比的响应,而向成年人提供直接、事实性的响应。这表明模型对人口统计学线索很敏感,并据此调整其信息。研究还指出,成为更先进或更具“推理能力”的模型并不保证更好的连贯性。一些规模较小、较旧的模型表现得比最新、最复杂的系统更好,这表明连贯性并不简单地是模型规模或智能的副产品。
研究的大部分重点在于争议性话题。巴以冲突在答案的变化上表现最为剧烈,一些模型提供非常一致的事实,而另一些模型则给出截然不同的事实。在这一话题上,一些模型甚至拒绝回答或返回错误,特别是当用户被识别为儿童时。这表明模型可能内置了过滤器,导致它们根据感知的用户身份而回避敏感话题。研究还发现,政治敏感性本身并不能预测不连贯性。虽然某些政治话题具有高度的不连贯性,但其他政治话题则不然,甚至像住房成本这样的非政治话题也显示出低连贯性。这表明,寻找单一、稳定的叙述内容的难度是一个主要因素。如果关于某个话题的信息是混乱或有争议的,模型就更有可能向不同的人呈现不同的事实。
作者强调,他们的工作并不是判定事实是否真实,而是判断事实是否稳定。他们认为,即使信息是正确的,向不同的人呈现不同的事实也可能是有害的。这可能导致确认偏误,即人们只能听到符合其现有信念的版本,或者这会强化刻板印象。研究表明,对于人工智能要实现真正的可靠,它必须无论谁在提问都能提供一套稳定的事实。研究人员已经发布了他们的测试工具和一个交互式网站,以便记者、开发人员和公众可以亲眼观察不同模型的行为。他们希望这种透明度能鼓励公司构建不易根据用户量身定制真相的系统,确保我们所依赖的信息保持一致且值得信赖。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。