Trust but Verify: Mitigating Medical Hallucinations via Post-Hoc Adversarial Auditing and Multi-Agent Feedback Loops
本研究引入了一种“信任但验证”的多智能体框架,该框架通过使用事后对抗性审计来拦截禁用药物的危险建议,从而在医疗场景中将患者安全置于流畅文本生成之上,显著减少了大语言模型中的医学幻觉。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是对论文《信任但要核实》(Trust but Verify)的解释,采用了通俗易懂的语言和创意类比。
核心问题:那个忘记了新闻的“万事通”医生
想象一位才华横溢的医学生,他背下了有史以来所有的医学教科书。他极其聪明,几乎能回答任何问题。然而,这位学生已经五年没看新闻了。
如果你问他:“治疗这种头痛的最佳药物是什么?”他可能会自信地推荐一种药片,这种药在2015年是“完美答案”,但在2020年因为会导致心脏病发作而被政府禁用了。
这正是目前的AI医生(大语言模型)所面临的情况。它们在海量数据上进行训练,但这些数据会过时。当被问及医学问题时,它们经常会产生“幻觉”(捏造事实或依赖过时信息),并建议一些不再安全或不再合法的药物。
解决方案:“信任但要核实”团队
研究人员提出了一个疑问:我们能否在不从头开始重建AI的情况下解决这个问题?
他们的答案是一个名为**“信任但要核实”(Trust but Verify)的新系统。他们没有让一个AI给出最终答案,而是创建了一个五人团队**(一个多智能体系统)。这个团队使用同一个“大脑”(同一个AI模型),但扮演不同的角色。你可以把它想象成一个高规格的法庭或新闻编辑部。
以下是这个团队的工作方式:
- 守门员(路由智能体/Router Agent): 此人负责检查输入的提问。这是关于医学的问题吗?如果是,就将其发送给安全团队。如果只是问“天气怎么样?”,则让AI正常聊天以节省时间。
- 医生(医疗临床智能体/Medical Clinical Agent): 这是扮演专家角色的AI。它查看问题,并根据其记忆提出治疗方案。
- 记录员(实体提取智能体/Entity Extractor Agent): 此人将医生杂乱无章的言语转化为整洁、机器可读的列表(就像一份购物清单),以便下一个人准确知道需要检查什么。
- 调查员(安全审计智能体/Safety Auditor Agent): 这是最重要的角色。 这个智能体并不信任医生的记忆。它会立即上网,查阅官方政府数据库(如FDA),以确认所建议的药物是否仍然合法。
- 如果药物已被禁用: 调查员会大喊:“停!这种药物很危险!”并将问题发回给医生。
- 如果药物是安全的: 调查员会给予通行许可。
- 循环机制: 如果医生建议了一种被禁用的药物,调查员会将问题退回。医生必须选择另一种方案,或者承认:“我无法提供安全的答案。”这个过程最多会进行三次。
测试:“陷阱”问题
为了测试该系统是否有效,研究人员设计了一个陷阱。他们制作了103个医学问题,其中“教科书上的正确答案”实际上是已被禁用的药物(例如多年前已从货架撤下的药物)。
他们对五种不同的AI模型(包括Llama、Falcon和GPT的版本)进行了两种方式的测试:
- “原生”方式(Vanilla Way): 直接询问AI(就像学生独自参加考试)。
- “智能体”方式(Agentic Way): 使用上述五人团队。
结果:安全高于速度
结果非常显著:
- “原生”AI: 它表现得非常自信。它得到了教科书上的“正确”答案,但这个答案是危险的。它推荐禁用药物的概率接近100%。它就像一个由于忘记了交通规则已更改而依然自信驾驶的司机。
- “智能体”AI: 团队系统表现得好得多。
- 它阻止推荐禁用药物的频率提高了约53%。
- 它不再给出危险的答案,而是学会了说:“我无法推荐安全的选项。”
- 其“逐点得分”(Pointwise Score,一种安全指标)从危险的负分向零(安全区)移动。
权衡(Trade-off):
由于它拒绝给出那些旧有的、被禁用的答案,该团队系统获得的“传统意义上的正确答案”变少了。但在现实世界中,拒绝给出危险答案比自信地给出错误答案要好得多。
惊喜:即使是最“聪明”的AI也失败了
研究人员还测试了那些理应具备内置“互联网访问能力”的最新的、最昂贵的商业AI(如最新的ChatGPT和Gemini)。
即使是这些先进的模型也失败了。它们会搜索互联网,看到某种药物已被禁用,但随后会忽略这一信息,并仍然推荐该禁用药物,因为它们的内部记忆过于强大。这证明了仅仅拥有互联网访问权限是不够的;你需要一个特定的“安全护栏”来强制AI遵守新规则。
总结
这篇论文表明,我们不需要发明一种新型的AI来使其变得安全。我们只需要改变使用它的方式。通过将AI分解为一个团队——其中一部分负责提出答案,另一部分负责针对实时规则进行严格的事实核查——我们可以阻止AI给出危险的医疗建议。
这就像是一个只会死记硬背教科书的学生,与一群在开处方前会反复核实最新安全警报的医生团队之间的区别。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。