Token-Level Density-Based Uncertainty Quantification Methods for Eliciting Truthfulness of Large Language Models
本文提出了一种针对大语言模型的新型监督不确定性量化方法,该方法将马氏距离适配于跨多层级的词元级嵌入,在序列生成和事实核查任务中,其用于激发真实性的表现优于现有方法,展现出更优的准确性和泛化能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个非常聪明、博览群书的机器人(大型语言模型,或称 LLM),它能写故事、回答问题并总结新闻。问题是,这个机器人有时会“幻觉”——它会自信地编造事实或撒谎,就像一个在考试中猜答案但实际答错的学生。
这篇论文的作者希望为这个机器人构建一个“测谎仪”。他们想要一种方法,在我们信任机器人的回答之前,就能判断机器人是真的不确定,还是仅仅在虚张声势。
以下是他们做法的简单解释:
旧方法的问题
此前,科学家尝试过两种主要方法来捕捉机器人的谎言:
- “再问一次”法:让机器人回答同一个问题 10 次。如果它给出了 10 个不同的答案,那它很可能很困惑。缺点:这既慢又昂贵,就像为了看朋友是否会改口而把同一个问题问 10 遍。
- “置信度分数”法:观察机器人听起来有多自信。缺点:机器人即使完全错误,也擅长表现得非常自信。
新想法:“词元级密度”侦探
作者意识到,机器人的“大脑”(其内部层)中藏着关于其不确定性的线索。他们决定使用一种名为**马氏距离(Mahalanobis Distance, MD)**的数学工具。
类比:“正常人群”与“离群点”
想象机器人拥有一本在训练期间学到的“良好、正确答案”的心理图书馆。
- 旧方法(序列级):当机器人完成整个句子时,旧方法将整个句子视为一个大块,并询问:“这个整块看起来像‘好’答案吗?”问题在于,一个句子可能包含一个奇怪的词而毁掉整体,但这个“块”看起来可能仍然不错。
- 新方法(词元级):作者决定逐个查看机器人写的每一个词(token)。
- 他们问:“这个特定的词看起来像机器人‘好’图书馆中的词吗?”
- 如果机器人写了一个非常奇怪、与其正确词库相距甚远的词,该词就会获得高“怀疑分数”。
- 他们对句子中的每个词都这样做,然后平均这些分数,从而得到整个答案的最终“不确定性分数”。
他们是如何构建的(配方)
- 收集“好”样本:他们收集了一批问题和机器人的回答。他们筛选这些回答,只保留那些肯定正确的(就像老师批改试卷,只保留 A+ 的试卷)。
- 绘制“好”词图谱:他们查看了那些 A+ 试卷中词语的内部数学表示(嵌入),为机器人“大脑”的每一层创建一张“正确”样貌的地图。
- “怀疑”测试:当机器人生成新答案时,系统会将每个词与那张“正确”地图进行比对。
- 如果一个词远离“正确”地图,它获得高距离分数(高不确定性)。
- 如果它靠近,则获得低分数(低不确定性)。
- “教练”(线性回归):由于查看机器人“大脑”的每一层很复杂,他们训练了一个简单的“教练”(线性回归模型)。这位教练查看所有不同层的怀疑分数以及机器人自身的置信度,然后说:“基于所有这些线索,这个答案为真的可能性有多大?”
他们的发现
他们在 11 项不同任务上测试了这种新的“词元级侦探”,从总结新闻文章到回答棘手的科学问题。
- 更快:与“再问一次”法不同,这种方法不需要机器人多次运行。它几乎和机器人正常写出答案一样快。
- 更智能:它捕捉谎言的能力远超以往方法。在许多测试中,它是可用的最佳方法。
- 适用于新内容:即使他们在机器人训练期间未曾见过的主题上测试它(例如从总结新闻切换到回答医学问题),该方法仍然表现良好。
- “混合”提升:他们发现,将他们的新方法与机器人自身的置信度分数相结合(一种“混合”方法),使其在识破谎言方面更加出色。
核心结论
该论文声称,通过查看机器人写的每一个词,并检查其与机器人训练相比有多“奇怪”,我们可以创建一种非常快速、准确且廉价的方法,来判断机器人是在说真话还是在编造。这就像给机器人一面镜子,让它能在说出奇怪内容之前,就发现自己即将说出奇怪内容。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。