Large Language Models Lack Temporal Awareness of Medical Knowledge
本文介绍了 TempoMed-Bench,这是首个用于评估大语言模型在医学领域时间感知能力的基准测试,结果表明当前模型在处理历史知识时存在困难,其性能呈现渐进式衰减而非骤降,且即使辅以搜索工具,仍无法保持时间一致性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是论文《大型语言模型缺乏对医学知识的时序感知》的解读,将其拆解为简单概念并辅以生动的类比。
核心理念:“时间旅行”难题
想象你雇佣了一位才华横溢的医学生来回答健康相关问题。这位学生读过所有已出版的医学教科书。然而,有一个关键问题:他们不知道现在是哪一年。
如果你问他们:“治疗肥胖症的最佳药物是什么?”他们可能会给你 2018 年教科书里的答案,即使 2024 年已经批准了一种全新且更优的药物。或者,如果你让他们解释 2015 年的治疗方案,他们可能会不小心告诉你当前2024 年的方案,因为他们忘记了过去的规则。
这篇论文认为,当前的大型语言模型(LLMs)就像这位学生。他们非常擅长掌握事实,但在判断这些事实何时成立方面却表现糟糕。
工具:"TempoMed-Bench"(时间旅行考试)
为了证明这一点,研究人员构建了一项名为TempoMed-Bench的特殊测试。
将医学指南(医生遵循的官方规则)想象成一款每隔几年就会更新一次的视频游戏:
- 版本 1(2018 年): 游戏规定“使用红色宝剑对抗 Boss"。
- 版本 2(2022 年): 游戏更新,提示“红色宝剑已损坏;现在请使用蓝色盾牌”。
- 版本 3(2024 年): 游戏再次更新:“蓝色盾牌太重;请使用激光枪”。
研究人员从真实的医学机构中提取了数千条这样的“游戏更新”。他们设计了一份测验,向 AI 提问:
- "2024 年的规则说了什么?”(测试他们是否了解新内容)。
- "2018 年的规则说了什么?”(测试他们是否记得旧内容)。
- "2020 年的规则说了什么?”(测试他们能否在不同版本间正确切换)。
研究发现:AI 错在哪里
研究人员在超过 10 种不同的 AI 模型上进行了这项考试。以下是他们的发现,同样采用简单的类比:
1. “记忆衰退”效应(并非硬性截止)
误区: 人们认为 AI 模型拥有“知识截止日期”。想象一个在特定日期后停止添加书籍的图书馆。你会认为 AI 对该日期之前的所有知识都掌握得完美无缺,而对该日期之后的知识则一无所知。
现实: AI 并没有硬性停止。相反,随着时间推移,它对新医学事实的记忆会逐渐淡化。
- 类比: 这不像是一个会突然关闭的开关。它更像是一个无线电波信号,随着你离发射塔越来越远,信号变得越来越弱。AI 对最新新闻的掌握能力是逐渐变差,而非突然丧失。
2. 对旧规则的“失忆”
发现: AI 非常擅长了解当前的规则,但在记住规则过去的样子方面表现极差。
- 类比: 想象一位时装设计师,他们确切知道当下什么最流行。但如果你问他们:"2015 年人们穿什么?”他们可能会不小心告诉你今天人们穿什么。
- 数据: 当被问及历史医学知识时,AI 的准确率仅为被问及当前知识时的25% 到 50%。这似乎表明,在训练过程中,它“遗忘”了规则的旧版本。
3. “困惑的时间旅行者”(不一致性)
发现: 当你询问不同年份的情况时,AI 的回答杂乱无章。
- 类比: 想象一个时间旅行者,当被问及 2020 年时,他说“是的,那发生了”。但当你问 2021 年时,他却说“不,那没发生”,尽管这两件事在逻辑上是连贯的。
- 结果: AI 的脑海中并没有一条平滑、逻辑连贯的时间线。它来回跳跃,有时赞同旧规则,有时赞同新规则,而不管你所问的年份是什么。它缺乏关于医学如何演变的连贯“故事”。
4. “搜索引擎”并未提供太大帮助
发现: 研究人员尝试通过给 AI 配备“搜索引擎”(称为代理 RAG)来解决这个问题,使其能够实时查阅规则,而不是依赖记忆。
- 结果: 这只有微小的帮助,远远不够。
- 类比: 想象给那位困惑的医学生一张图书馆借书卡。他能找到 2024 年的书,但同时也找到了 2018 年和 2022 年的书。因为这位学生太困惑该相信哪本书,他感到不知所措,最终仍然给出了错误的答案。搜索工具实际上引入了太多相互冲突的信息,在某些情况下甚至让 AI 的表现变得更差。
结论
该论文得出结论:大型语言模型尚未准备好被信任用于处理对时间敏感的医疗决策。
他们就像一位读过所有书籍却完全没有日历概念的博学家医生。他们可能会给你今天正确的答案,但也可能会给你一个来自五年前的危险答案,或者对去年什么是对的感到困惑。在我们教会他们像理解事实那样清晰地理解时间之前,我们不能完全依赖他们提供随时间变化的医疗建议。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。