The strength of clinical evidence is recoverable from language model representations but not from their stated grades
尽管大型语言模型的内部表示中编码了可恢复的临床证据强度信号,但它们始终无法明确陈述这一信息,导致尽管存在潜在信号,其声明的证据等级仍不可靠。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一群非常聪明、博学多才的图书管理员(即 AI 模型)。他们的工作不仅是告诉你一个医学事实是什么,还要告诉你我们对这个事实的“确定程度”有多高。这究竟是拥有数千项研究支持的铁证如山,还是仅仅来自一位医生的直觉?
这篇论文提出了一个简单的问题:这些图书管理员是否真的知道自己有多确定,即便他们没有把这种确定性说出口?
以下是研究人员的发现,通过简单的概念进行了拆解:
1. 图书管理员体内的“秘密电台”
研究人员发现,他们测试过的每一个 AI 模型,其大脑(内部计算机代码)中都存在一个“秘密电台”信号。如果你知道如何调频,你就能听到 AI 对任何陈述所持证据强度的确切程度。
- 症结所在: 这些图书管理员非常不擅长使用这种语言。当你直接问他们,“这个证据有多强?”时,他们其实是在随机猜测。他们可能会对一个微弱的直觉说“信心很高”,而对一个铁证如山的实事说“信心很低”。
- 类比: 想象一位天气预报员,他的脑子里有一个完美的、高科技的雷达,能精准地知道风暴何时到来。但当他在电台里和你交流时,他却只是在瞎猜“也许晴天,也许下雨”,没有任何规律。真相就在他脑子里,但他并没有把它表达出来。
2. 规模并不代表更好(令人惊讶)
通常,我们认为规模更大、更昂贵的 AI 模型会更聪明。研究人员原本预期最大的模型会拥有最清晰的“秘密电台”信号。
- 发现: 结果恰恰相反。最小的模型反而拥有最清晰的信号。那些规模更大或专门经过“推理”训练的模型,其信号反而更难读取。
- 类比: 这就像拥有一个小型、简单的对讲机,信号清晰透明;而对比一个庞大、高科技的卫星电话,由于过于复杂,信号反而变得混乱不堪。机器越复杂,就越难“读取”其内在的信心水平。
3. 信号主要源于“词汇选择”
研究人员进一步挖掘,想看看这个“秘密电台”到底在听什么。他们发现,这个信号并不是一种对“证据”的深层哲学理解。
- 发现: AI 主要是通过句子中的“词汇”来捕捉信号。某些短语(如“研究表明”或“专家意见”)就像是旗帜,告诉 AI:“嘿,这是一个强有力的陈述”或者“嘿,这是一个微弱的陈述”。
- 类比: 这就像一只狗知道“散步”这个词意味着“去外面”,而“洗澡”意味着“留在室内”。这只狗并不是在思考散步或洗澡的概念,它只是在对特定的声音做出反应。AI 也是在对词汇做出反应,而不是理解这些词背后的深层真理。
4. “真相”与“证据”的混淆
在现实世界中,一个说法可能是“得到有力支持的”,但后来却被证明是错误的(比如某种曾经流行多年但后来被证明错误的医疗实践)。
- 发现: 研究人员构建了一个特殊的测试,旨在将“这是真的吗?”与“这是否有充分支持?”区分开来。他们发现,AI 用于表示“支持程度”的信号,与用于表示“是否为真”的信号是不同的。
- 类比: 请想象一个法庭。所谓的“证据信号”就像陪审团对证词“质量”的信心。而“真相信号”则是实际的判决——“有罪”或“无罪”。AI 可以告诉你证词很不可靠(低证据),即便被告确实犯了罪(真相)。这两者是不同的,AI 在其大脑中将它们分得很开,即使它并不告诉外界。
5. 实际应用价值
由于 AI 不会主动告诉你它的证据有多强,因此你不能信任它口头表达的信心水平。然而,既然这种信号确实存在于机器内部,那么一个独立的、简单的计算机程序就可以通过“监听” AI 的大脑,来标记出那些需要人类核查的薄弱主张。
- 警告: 你不能指望 AI 来给自己的作业打分。但是,你可以构建一个简单的工具,通过读取 AI 的“内部笔记”,在错误传递给医生或患者之前将其拦截。
总结
该论文的结论是,目前的医疗 AI 模型就像是沉默的专家。它们知道事实与直觉之间的区别,但拒绝将其说出口。此外,它们大多只是在对特定词汇做出反应,而非理解证据背后的深层逻辑。在人类能够让它们开口说话,或者开发出能读取它们“沉默想法”的工具之前,我们不应信任它们声称的信心水平。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。