Unconditional Truthfulness: Learning Unconditional Uncertainty of Large Language Models
本文提出了一种量化大语言模型不确定性的新方法,通过在注意力图、词元概率和递归计算的不确定性评分上训练回归模型,从而在多个数据集和模型上有效检测幻觉并改进选择性生成。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在听一个非常聪明、语速极快的机器人给你讲故事。这个机器人擅长编造句子,但有时它会对实际上错误的事情表现得非常自信(这些被称为“幻觉”)。
问题在于,机器人并不知道自己在撒谎。它只是不停地讲述,如果它在早期犯了错,随着它基于这个错误构建故事的其余部分,它会变得更加自信。这就像“传话”游戏:第一个人 whispered 了一个错误的事实,而其他人则带着越来越强的自信重复它。
问题:机器人的盲点
目前检查机器人是否在撒谎的方法,通常会查看机器人对每个所说单词的“置信度分数”。但这很棘手。如果机器人说“天空是绿色的”,它可能仍然对下一个词“草”感到非常自信,因为它只是在遵循自己的逻辑。它没有意识到整个句子是建立在一个谎言之上的。
这篇论文的作者将这种现象称为“条件依赖”问题。机器人对下一个单词的置信度完全取决于前一个单词,即使前一个单词本身就是一个错误。
解决方案:TAD(基于可训练注意力的依赖)
研究人员开发了一种名为TAD的新工具。你可以把 TAD 想象成一位超级智能的编辑,坐在机器人旁边,看着它逐个单词地写作。
以下是这位编辑如何工作,使用几个简单的类比:
- “注视”(注意力): 当机器人说话时,它会“注视”之前的单词来决定接下来要说什么。研究人员发现,当机器人在讲述事实时,它的“注视”(注意力)是稳定且专注的。但当它开始产生幻觉时,它的注视就会变得不稳定或混乱。TAD 会密切观察这种注视。
- “连锁反应”(递归): 这位编辑不仅仅查看当前的单词。它会记住之前单词的不确定性。如果机器人在第 1 个单词上 stumbled(出错),编辑会将第 2、3、4 个单词标记为可疑,即使机器人对这些单词听起来很自信。这就像一位老师知道,如果学生在数学题的第一步就错了,那么最终答案很可能也是错的,无论学生把答案写得多么工整。
- “两阶段训练”: 为了训练这位编辑,研究人员使用了一个两步过程。
- 步骤 1: 他们教导编辑仅利用机器人的原始置信度来识别错误。
- 步骤 2: 他们让编辑利用步骤 1 中形成的“直觉”来帮助自己学得更好。这就像练习一项运动:首先你学习基本动作,然后你练习进行完整的比赛,在比赛中你需要对自己之前的动作做出反应。
他们如何测试它
他们在十种不同类型的任务上测试了这位编辑,从总结新闻文章到回答棘手的常识问题,使用了三种不同版本的机器人(LLaMA、Gemma 和 Qwen)。
- 结果: TAD 在捕捉机器人的谎言方面,比他们尝试过的任何其他方法都要好得多。它特别擅长发现长篇故事何时偏离了正轨。
- 效率: 与其他需要机器人“思考”答案五次的方法(这既慢又昂贵)不同,TAD 非常快速。它仅给机器人的思考过程增加了约5% 的额外时间。这就像多快速瞥一眼,而不是要求机器人重写整个故事。
核心结论
该论文声称,通过教导计算机模型关注机器人如何注视其自身的先前单词,并记住句子早期犯下的错误,我们可以为人工智能构建一个更好的“测谎仪”。这使得人工智能更安全、更可靠,特别是对于长答案而言,而不会过度拖慢速度。
该论文未声称的内容
- 它不声称这适用于所有类型的人工智能在所有情况下的表现(它是在特定模型和任务上测试的)。
- 它不声称这是一种医疗工具或法律法官。
- 它不声称人工智能将永远不会再犯错误;它只是声称这个工具更擅长发现错误,以便将它们过滤掉。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。