Kernel Token Contradiction: a Fast and Principled Approach for LLM Claim Uncertainty Quantification
本文介绍了核令牌矛盾(Kernel Token Contradiction, KTC),这是一种轻量级且对 CPU 效率高的通过利用基于核的令牌表示和维基百科频率统计来量化大语言模型输出中断言级不确定性的方法,在保持高准确度(尤其是在高精度机制下)的同时,实现了相对于现有方法的显著加速。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大语言模型已成为现代生活中熟悉的一部分,能够撰写故事、回答问题并总结复杂话题,其流利程度往往让人感觉像是人类。然而,在这种平滑的外表之下,隐藏着一个持久的问题:这些系统有时会生成听起来很有信心但实际上却是错误的陈述。这种现象被称为“幻觉”,即模型捏造事实或混淆细节,这为任何依赖其输出获取准确信息的人带来了风险。为了解决这个问题,研究人员开发了衡量模型对其所言内容确定程度的方法。其目标并非阻止模型说话,而是标记出它正在“猜测”的具体时刻,让用户能够信任答案中可靠的部分,同时对那些不稳固的部分保持警惕。挑战在于,如何找到一种既快速又准确的方法,且不会降低系统速度或需要庞大的计算能力。
来自法国实验室 LIX 的一个研究小组推出了一种名为“核标记矛盾”(Kernel Token Contradiction,简称 KTC)的新方法,旨在解决这一速度与准确性的两难困境。他们的工作专注于一种特定类型的确定性:模型在两个不能同时成立的信息之间犹豫不决的时刻。想象一下模型试图陈述某种产品的价格。如果它不确定,它可能会为两个不同的数字分配高概率,例如 699 美元和 499 美元。这两个数字是相互矛盾的;如果其中一个是正确的,另一个必然是错误的。研究人员意识到,检测这种内部冲突是判断模型是否产生幻觉的强有力信号。与以往依赖于理解语言逻辑的沉重且缓慢的软件的方法不同,KTC 使用了一种更轻量级的方法,该方法基于单词在海量人类写作文本中通常如何出现在彼此身边的规律。
该过程始于观察模型在任何给定步骤中所考虑的候选下一个词的列表。研究人员通过分析维基百科语料库(一个巨大的数字图书馆)构建了这些可能性的地图。他们统计了在现实世界的文本中,特定单词出现在彼此附近的频率。如果两个作为下一步候选词的单词具有非常相似的邻近词,系统就会将它们视为可能存在矛盾。例如,如果模型正在两个不同的价格之间做决定,这些价格数字在维基百科中很可能出现在相似的语境中,从而发出冲突信号。如果模型是在两个不同的词(如“the”和“a”)之间做决定,那么这些词具有完全不同的邻近词,表明它们并非处于冲突之中,而只是表达同一想法的不同方式。这种统计检查取代了需要专门且缓慢的语言模型来判断矛盾的需求,使得整个过程极其迅速。
一旦系统识别出哪些候选词处于冲突之中,它会将此信息与模型自身的置信度相结合。它创建了一个数学表示,将每个词的可能性与它们之间的矛盾程度进行加权。研究人员随后应用了一种被称为“熵”的无序度量。如果模型很自信且选项之间不存在冲突,则不确定性得分保持较低。然而,如果模型在两个相互矛盾的事实之间徘徊,得分就会飙升,从而提醒用户该答案的特定部分是不可靠的。这种计算是在单个单词层面进行的,使得系统能够精准定位长段落中哪一个具体的断言存在问题,而不是仅仅将整个回答标记为可疑。
该方法的测试结果在效率和精度方面都令人瞩目。研究人员在 16 个不同的语言模型以及四种欧洲语言(英语、法语、德语和西班牙语)中对 KTC 进行了评估。他们将其与目前最先进的方法进行了对比,后者的运行依赖于在强大图形处理器上运行的专门语言模型。研究发现,仅在标准中央处理器(CPU)上运行的 K-TC 比这些竞争对手的 CPU 版本快 65 倍以上,比加速后的 GPU 版本快 8 倍以上,同时其性能与之持平甚至更优。至关重要的是,在需要高精度的场景下(即系统在标记错误前必须非常确定),KTC 的表现优于所有其他方法。尽管使用的计算能力远低于现有工具,它仍能以更高的准确率成功识别错误陈述。
这项工作表明,监控大语言模型可以在不产生以往使此类监控在许多应用中变得不切实际的沉重计算成本的情况下,实现实时监测。通过用简单的、快速的针对大规模人类写作数据库的检查,取代复杂的、缓慢的语言模型,研究人员创造了一个可以直接集成到生产系统中的工具。该方法不需要停止或重新训练模型;它只是观察模型的内部选择,并根据矛盾模式计算错误风险。虽然目前的研究局限于四种语言和特定的基准测试,但这种方法为使人工智能在日常使用中更加可靠和值得信赖提供了一条充满前景的路径,确保当模型说话时,我们明确知道何时该倾听,以及何时该进行复核。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。