Can LLMs Refuse Questions They Do Not Know? Measuring Knowledge-Aware Refusal in Factual Tasks
本文提出了一种基于拒答概率与错误概率相关性的新指标——拒答指数(RI),以有效衡量并揭示大语言模型在事实性任务中往往不可靠的知识感知拒答能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用通俗易懂的语言和生动的类比对论文《大语言模型能否拒绝回答它们不知道的问题?》的解释。
核心难题:过度自信的学生
想象一下,一个学生正在参加一场非常困难的历史考试。一个真正聪明的学生知道何时自己不知道答案,并会举手说:“这个我不确定。”然而,大型语言模型(LLMs)往往像是一个过度自信的学生。即使他们完全不知道答案,也会自信地编造一个故事(即“幻觉”),而不是承认自己不知道。
这很危险,因为如果你向人工智能寻求医疗或法律建议,当它不确定时,你需要它说“我不知道”,而不是自信地提供错误信息。
旧有的衡量方式:数错别字
此前,研究人员试图通过观察两个简单的数字来衡量人工智能在这方面的表现:
- 它拒绝回答的频率。
- 它回答正确的频率。
论文指出,这些方法存在缺陷。这就像只通过学生举多少次手说“我不知道”来评判一个学生。
- 如果你告诉学生:“请对所有问题都说‘我不知道’",他们会 100% 地举手。但这并不意味着他们聪明,只是说明他们在服从指令。
- 如果你告诉他们:“无论发生什么,都要回答所有问题”,他们可能会答对更多问题,但也会自信地给出错误答案。
旧的指标无法区分一个明智地拒绝难题的学生,和一个只是随机拒绝或回答的学生。
新方案:“拒绝指数”(RI)
作者们创造了一个名为拒绝指数(Refusal Index, RI)的新分数。你可以将其视为一个“诚实度评分”。
拒绝指数不再仅仅计算人工智能说了多少次“我不知道”,而是问:“当问题很难时,人工智能是否 specifically 说了‘我不知道’?当问题很简单时,它是否给出了答案?”
- 高 RI: 人工智能表现得像一位明智的图书管理员。它拒绝那些生僻、不可能的问题,但愉快地回答简单的问题。它懂得区分。
- 低 RI: 人工智能表现得像一个困惑的机器人。它可能会拒绝它本可以回答的简单问题,或者自信地回答那些不可能的问题。它的“拒绝”行为是随机的或失效的。
他们如何测量: “两遍法”技巧
为了在不了解人工智能内部“想法”(这是我们要看不见的)的情况下计算这个分数,研究人员使用了一个巧妙的**“两遍法”技巧**:
- 第一遍(诚实测试): 他们向人工智能提出一系列问题,让它自行决定:“你是想回答,还是想说‘我不知道’?”他们记录下它拒绝了哪些问题。
- 第二遍(强制回答): 他们只选取人工智能在第一轮中拒绝的问题。他们回去说:“好吧,你现在必须回答这些问题,不允许跳过。”他们观察如果人工智能尝试了,它是否实际上能答对这些题。
通过比较这两轮结果,他们可以看出人工智能是否足够聪明,能够拒绝那些它无法回答的问题。如果人工智能在第一遍中拒绝了难题,但在第二遍中答错了,那么它就拥有高拒绝指数。
他们的发现
研究人员测试了 16 种不同的人工智能模型(如 GPT-4、Claude、Llama 等),并发现了一些令人惊讶的事情:
- 准确率不能保证智慧: 仅仅因为人工智能非常擅长回答问题(高准确率),并不意味着它知道何时该停止。一些非常聪明的模型仍然会在它们不知道的事情上自信地猜测。
- “家族”最重要: 决定人工智能是否知道何时拒绝的最重要因素,不是它有多大,也不是它答对了多少问题。而是它是由哪家公司制造的。某些人工智能“家族”(如 Claude 和 Qwen)无论规模大小,始终比其他家族(如 Gemini 或 GPT-4.1)表现得更加明智。
- 上下文是关键: 如果你给人工智能一份文档阅读,然后问一个文档中没有的问题,人工智能就会感到困惑。它往往无法拒绝,而是试图根据自己的训练数据进行猜测,而不是坚持依据文档。
结论
该论文得出结论,我们需要一种新的方式来评判人工智能。我们不应该只问:“你答对了多少问题?”我们还需要问:“你是否知道何时该停下来并说‘我不知道’?”
拒绝指数就是衡量这一点的标尺。它帮助我们找到那些不仅聪明,而且谦逊且可靠、足以承认自身局限性的人工智能模型。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。