← 最新论文
💻 computer science

Token Probability Beats Verbalized Condence for Error Detection in Small Open-Weight Language Models: A Medical and Psychiatric Benchmark Study

这项初步研究表明,对于应用于医学和精神医学任务的小型开源权重语言模型(1.2B–9.2B 参数)而言,提取内部标记概率(internal token probabilities)是比依赖模型口头表达的置信度更可靠的错误检测方法,尤其是在那些口头表达置信度表现仅处于随机水平的最小型模型中。

原作者: Kunal Dhanda

发布于 2026-09-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Kunal Dhanda

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,人们日益渴望使用强大的计算机程序来协助医生和精神科医生做出艰难的决策。这些被称为大语言模型的程序可以阅读海量的医学文献并回答有关人类健康的复杂问题。然而,一个关键问题仍然存在:医生如何知道何时该信任计算机?如果机器声称某个诊断是确定的,但实际上是错误的,其后果可能会非常严重。多年来,研究人员一直试图通过要求计算机直接告诉他们自己有多确定来解决这个问题。他们要求模型为其答案附上一个百分比分数,即一种关于置信度的口头报告。人们曾希望,如果计算机说它只有百分之五十的把握,人类就可以介入并复核工作。但近期的研究表明,这些自我报告的分数往往并不可靠,有时甚至并不比随机猜测更好。

这种不确定性对于那些较小、较廉价的计算机程序版本来说尤为紧迫,因为这些版本可以在单台办公电脑上运行,而不是依赖庞大且昂贵的数据中心。这些小型模型最有可能被用于私人诊所,因为在这些地方,患者数据必须保持安全,且成本必须维持在较低水平。来自印度理工学院卡拉格布尔分校的 Kunal Dhanda 进行的一项新研究调查了这些小型模型是否可以被信任去识别自身的错误。该研究比较了两种衡量确定性的不同方法。第一种是口头置信度,即要求模型说出它有多确定。第二种是被称为“标记概率”(token probability)的隐藏信号。为了理解这一点,请想象计算机正在逐字逐句地编写答案。在每一步,它都会计算选择下一个特定字母或单词的数学可能性。标记概率仅仅是计算机在选择最终选定的那个确切答案时,内部计算出的概率值。这项研究提出了一个直接的问题:这种隐藏的数学计算是否比模型自身的言语表达是更好的真相指标?

研究人员测试了四种不同规模的小型计算机模型,其规模从非常紧凑到中等强大不等。他们利用这些模型来回答从标准考试中抽取的 1,600 个医学和精神科问题。对于每一个问题,团队都记录了模型的口头置信度分数及其内部的标记概率。随后,他们将答案与正确答案进行对比,以观察哪种信号能更好地预测错误。结果清晰且一致,涵盖了所有四种模型。在所有案例中,内部的标记概率都是预测答案正确与否的远优于口头置信度的指标。这种差异并非微不足道;对于最小的模型而言,内部信号的准确性显著更高,而口头置信度则表现得如此糟糕,以至于与抛硬币的结果无异。

研究还观察了这些信号在现实世界的安全系统中将如何运作——在这样的系统中,如果置信度过低,医生可能会决定忽略计算机的答案。当研究人员使用标记概率来过滤掉那些最不确定的答案时,剩余答案的准确率在所有四个模型中都稳步提升。然而,当他们使用口头置信度分数来过滤答案时,结果却停滞不前,甚至产生了负面影响。对于最小的模型,依赖口头置信度实际上降低了系统的准确性,因为该模型在“自信地错误”方面与“自信地正确”的频率相当。这一发现解释了早期实验中观察到的某种奇怪行为,即最小的模型在被要求承认其不知道答案时表现得更差。研究人员认为,该模型当时并不是真的“知道”自己不确定,它只是在报告一个没有任何实际信息的置信度分数,而有用的信号仍然隐藏在其自身的计算之中。

这项工作的意义对于任何在医疗环境中部署这些工具的人来说都是务实且直接的。如果本地计算机系统能够揭示其内部的概率分数,那么应当使用这些数据来决定哪些答案需要人工审核。依赖模型通过言语表达其置信度不仅效果较差,而且对于那些较小的模型来说,还会制造一种虚假的安全感。研究结论指出,虽然口头置信度对于某些较大、更先进的模型来说或许尚可接受,但对于在诊所中日益普及的小型、注重隐私的系统而言,它是一个危险的工具。检测这些系统错误的更可靠方法,是观察计算机已经在计算但从未说出口的那些数字。这种方法为实现更安全、更准确的医疗人工智能提供了一条真正的路径,且无需昂贵的硬件或复杂的全新软件。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →