The CitizenQuery Benchmark: A Novel Dataset and Evaluation Pipeline for Measuring LLM Performance in Citizen Query Tasks
本文介绍了 CitizenQuery-UK,这是一个基于英国政府信息的、包含 22,000 条合成生成的公民查询的新型基准数据集,并对 11 个大语言模型在真实性、弃权和冗余度方面进行了评估,以强调关键的可靠性挑战以及在公共部门应用中承认人工智能局限性的必要性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一个普通人,正试图弄清楚一条令人困惑的政府规则,比如如何领取一项福利或填写一份税务表格。在过去,你可能会拨打帮助热线或搜索政府网站。今天,你可能会询问一个超级聪明的 AI 聊天机器人。
这篇论文是关于构建一个巨大的“成绩单”,来测试这些 AI 聊天机器人在处理这些特定的英国政府规则问题时表现如何。作者们将这个成绩单称为 CitizenQuery-UK。
以下是他们做了什么以及发现了什么,使用了简单的类比:
1. 问题所在:“相信我”陷阱
想象一下,你向一个非常自信、说话很快的 AI 请教关于税务的建议。它给了你一个详细的长篇回答。但如果它编造了一个并不存在的规则呢?在普通的聊天中,这只是一个有趣的错误。但在涉及政府规则时,一个编造的事实可能会让你损失金钱、让你陷入法律麻烦或毁掉你的生活。
作者们说:“我们不能仅仅因为 AI 听起来很聪明就信任它。我们需要证据证明它说的是真话。”
2. 解决方案:构建“考试”(数据集)
要测试 AI,你需要一场测试。但你不能随便编造问题;它们必须是真实的。
- 来源: 他们从 gov.uk(英国政府官方网站)中提取了数千页内容,这就像是政府规则的“圣经”。
- 问题: 他们没有只写一些机械化的问题。他们使用了来自 Reddit 的真实案例,即人们寻求建议时的提问方式,使问题听起来像真实人类说话的样子(杂乱、具体,有时还带着困惑)。
- 角色: 他们为问题创建了“人格”(Personas)。例如,一个关于育儿的问题会被分配给一个“家长”人格,而不是“孩子”。这确保了测试 AI 是否理解提问者的语境。
- 结果: 他们构建了一个包含 22,000 个问答对 的数据集。可以把它看作是一场规模宏大的、拥有 22,000 道题目的期末考试,而“正确答案”已经预先写在政府官方文本中了。
3. 评分系统:他们是如何检查工作的
他们不仅仅是问“AI 是否答对了?”他们使用了一个三步评分过程,以确保极其精确:
- 第一步:“沉默处理”检查(弃权/Abstention): 当 AI 不确定时,它是会说“我不知道”吗?还是直接瞎猜?作者想看看 AI 是否有足够的勇气承认自己不知道,还是过于急于表达。
- 第二步:拆解(原子化/Atomization): 想象一下 AI 写了一个长段落。评分者将这个段落拆解成微小的、独立的每一个事实(就像把一座乐高城堡拆解成单个积木块)。
- 第三步:“真相匹配”(验证/Verification): 他们将 AI 说的每一个“积木块”(事实)与官方政府答案中的“积木块”进行对比。
- 得分 (F1@K): 他们根据两点给 AI 打分:它是否包含了正确的细节?以及它是否仅包含了正确的细节(没有添加太多多余的废话)?
4. 结果:成绩单说了什么
他们测试了 11 种不同的 AI 模型(例如来自 OpenAI、Google、Meta 等公司的模型),并发现了一些有趣的事情:
- “话痨”问题: 几乎所有的 AI 都说得太多了。它们就像是一个在被问及简单问题时却写了一篇长篇大论的学生。它们添加了官方政府文本中并不存在的额外事实。这被称为冗余性(Verbosity)。
- “沉默”问题: AI 几乎从不说“我不知道”。即使在出错时,它们也在不停地说话。它们很少“弃权”而不回答。
- “长尾”错误: 大多数情况下,AI 能抓住重点。但当它们出错时,错得非常严重。这就像一个在简单问题上拿 A,但在难题上彻底不及格的学生。这使得结果变得不可预测。
- 开放 vs 封闭: 一些“开放式”模型(代码公开的模型)的表现与昂贵的“封闭式”模型一样好。你不一定需要最昂贵的 AI 也能获得良好的结果。
5. 核心启示
论文总结道,虽然 AI 正在变得更好,但对于高风险的政府建议而言,目前的 AI 过于渴望表达,且过于害怕承认错误。
如果 AI 要成为你的政府规则指南,它需要学会两件事:
- 保持简洁: 紧扣政府网站上的事实;不要编造额外的故事。
- 保持谦逊: 如果它不知道答案,它应该说“我不知道”,而不是瞎猜。
作者们构建了这个“考试”(CitizenQuery-UK),以便政府和科技公司可以持续测试 AI,确保它变得足够安全可靠,从而真正帮助人们解决现实生活中的问题。他们并不是说 AI 已经准备好取代人类咨询人员了;他们是在说:“这是衡量我们距离准备就绪还有多远的尺子。”
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。