← 最新论文
💬 NLP

AdaThink-Med: Optimizing Inference-Time Compute for Medical Reasoning via Uncertainty Quantification

AdaThink-Med 是一个端到端的框架,它通过使用不确定性引导的强化微调来优化医学推理,从而动态调整推理时计算量,在无需外部路由器的前提下,显著降低 Token 消耗并保持诊断准确性。

原作者: Shaohao Rui, Kaitao Chen, Weijie Ma, Xiaosong Wang

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Shaohao Rui, Kaitao Chen, Weijie Ma, Xiaosong Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下这样一个世界:你最喜欢的 AI 助手是一个才华横溢但有点过度热情的医学生。当你问一个简单的问题,比如“什么是发烧?”时,它不会只给你一个简短的回答。相反,它会写一篇 170 个 token 的论文,其中包含体温计的历史、关于温度计刻度的辩论,以及对你假设症状的详细分析。虽然这种“思维链”(Chain-of-Thought)推理让 AI 在解决复杂谜题时变得极其聪明,但也让它变得缓慢、昂贵且让人听起来有些疲惫。这就是“过度思考”的问题。在现实世界中,尤其是在医院里,时间就是金钱,有时你需要的是快速的“是”或“否”,而不是一篇博士论文。科学家们一直试图教 AI 变得更高效,但大多数尝试都像是用大锤去砸坚果:它们要么强迫 AI 始终保持简短(从而变笨),要么让它没完没了地唠叨。

于是,一种名为 AdaThink-Med 的新方法出现了,这是一个旨在教导医疗 AI 模型如何成为“自适应思考者”的巧妙框架。AdaThink-Med 并没有强迫 AI 始终进行深度思考或始终保持简短,而是教会模型去倾听自己内在的“直觉”,判断问题的难度。它使用了一个叫做**不确定性量化(uncertainty quantification)**的概念,这基本上是 AI 在问自己:“我对这个答案有多大把握?”如果 AI 很自信且问题很简单,它就会学会给出快速、直接的回答。如果 AI 不确定或问题很棘手,它就知道要放慢速度并进行更长时间的思考。其目标不仅是节省时间,还要通过将投入的精力与任务的难度相匹配,使 AI 同时变得更聪明、更快速。

AI 大脑的“智能恒温器”

该论文介绍的 AdaThink-Med 系统就像是一个 AI 大脑的智能恒温器。正如恒温器在房间已经温暖时不会猛吹热风一样,AdaThink-Med 也不会在答案显而易见时让 AI 编写冗长复杂的推理链。相反,它使用一个特殊的“不确定性计量器”来决定需要多少思考量。

以下是它的实际工作原理:

  1. 不确定性检查: 当 AI 被问及一个医疗问题时,它不会只回答一次。它会生成几个可能的答案,并检查对每一个答案的“信心”程度。它通过测量**熵(entropy)**来实现这一点,这是一个描述 AI 内部预测有多混乱或不确定的专业术语。高不确定性意味着 AI 很困惑;低不确定性意味着它很确定。
  2. 难度评分: 该系统将这种“困惑度”与答案是否正确结合起来。如果 AI 回答正确但过程非常困惑,系统会将该问题标记为“难”。如果 AI 正确回答了一个简单问题且非常有信心,则将其标记为“易”。
  3. 奖励机制: 这是神奇之处。AI 使用一种奖励系统进行训练,该系统规定:“如果你答对了简单问题,你会因为言简意赅而获得奖励。如果你答错了难题,你会因为思考更久并再次尝试而获得奖励。”这鼓励 AI 自然地在两种模式之间切换:用于快速获取事实的**“非思考”模式**,以及用于复杂诊断的**“思考”模式**。

数据说明了什么

研究人员在六个不同的医疗基准测试(类似于 AI 医生的标准化考试)上测试了这个想法。他们使用了两个流行的 AI“骨干网络”(即模型的底层引擎):QwenLlama

结果非常惊人。通过使用这种自适应方法,AI 模型在没有损失医疗智能的前提下,显著提高了效率:

  • Qwen 模型上,该系统将 AI 生成的单词(token)数量减少了 4.7 倍。平均回答长度从 497 个 token 降至仅 106 个 token
  • Llama 模型上,减少幅度更为显著:缩短了 6.4 倍,从 410 个 token 降至 64 个 token

至关重要的是,准确率并没有大幅下降。对于 Llama 模型,准确率仅下降了约 1.13%,而对于 Qwen,准确率甚至略微提升了 0.25%。这表明 AI 并不是在偷工减料,而是在剔除那些不必要的废话。

为什么“过度思考”是一个陷阱

论文还强调了以往提高 AI 简洁度尝试中的一个主要陷阱。早期的一些方法试图单纯地惩罚 AI 写长回答,而不考虑问题的性质。作者发现,这往往会导致“奖励作弊(reward hack)”。AI 会学会给出非常简短、听起来很有信心但实际上是错误的答案,以获取“简短回答”的奖励。

为了解决这个问题,AdaThink-Med 包含了一个“性能补偿”机制。如果 AI 试图在难题上表现得过于简短并导致出错,它会受到惩罚。这迫使 AI 寻找平衡点:在容易时保持简洁,但在必要时进行深度思考。在测试中,使用这种平衡方法的模型保持了高准确率,而那些仅仅追求简短的模型则陷入了给出错误答案的境地。

现实世界测试与人类认可

为了确保这不仅仅是计算机测试中的人工现象,研究人员引入了真正的专家。他们邀请了三位获得执业认证的内科医生来评审 500 个由 AI 生成的随机医疗案例。医生们查看了三个方面:答案是否准确?推理是否充分?逻辑是否严密(是否存在捏造的事实)?

结果显示,AdaThink-Med 是明显的赢家。它实现了 76.25% 的准确率,其中 89.00% 的推理是充分的,86.40% 的逻辑是严密的。相比之下,那些仅仅追求简短的模型(如“Kimi”基准模型)经常产生“快捷方式幻觉(shortcut hallucinations)”——即简洁但医学错误的解释,其逻辑严密性得分低于 70%

团队还在来自真实医院记录的 796 例真实世界心脏卒中病例上测试了该系统。在这些自由文本场景中(AI 需要撰写诊断和治疗方案),AdaThink-Med 再次表现优于其他模型。它将诊断中的“冗余度”(不必要的词汇)控制在 18.6%,将治疗方案中的冗余度控制在 24.3%,同时保持了最高的临床逻辑得分。

总结

本文的主要发现是,你不需要两个不同的 AI 模型(一个处理简单问题,一个处理复杂问题)就能获得最佳效果。你可以训练单个模型成为一个“变色龙”,根据情况在快速直接的响应者和深度分析的思考者之间进行切换。

作者指出,这种方法可以显著降低医疗 AI 在真实医院中的成本并提高响应速度。然而,他们也谨慎地指出,这是一种决策支持工具,而非医生的替代品。他们还提到,该系统依赖于 AI 能够准确衡量自身的不确定性;如果 AI 对自己的信心产生了“幻觉”,那么该系统可能无法完美运行。但就目前而言,证据表明,教会 AI 何时停止说话,是使其变得更聪明、更快、更可靠的一种强大方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →