← 最新论文
💻 computer science

Retrieval-Augmented Generation for Reducing Hallucinations in Drug-Related Question Answering Systems

本文提出了一种检索增强生成(RAG)流水线,通过将大语言模型(LLM)的响应锚定在经过策划的医药知识库中,显著减少了幻觉并提高了药物相关问答的事实准确性,从而降低了关键的患者安全风险。

原作者: Pratik Kumar, Rajat Verma

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Pratik Kumar, Rajat Verma

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明、极其健谈的机器人,它读过几乎所有被写出来的书。它可以给你讲故事、写诗,并在几秒钟内解释复杂的概念。这个机器人就是一个“大语言模型”(LLM)。但问题在于:这个机器人就像一个才华横溢的讲故事的人,有时为了让故事听起来更精彩而编造事实。在医学领域,关于药物的一个错误事实可能会伤害到某人,这种“编造内容”的行为被称为幻觉(hallucination)。这并不是一种神奇的视觉幻象;它只是机器人在自信地陈述一些并非真实的事实。为了解决这个问题,科学家们正尝试给这个机器人一份“参考表”或一个图书馆,让它在开口说话前进行查阅。这种方法被称为检索增强生成(Retrieval-Augmented Generation,简称 RAG)。与其仅凭记忆去猜测,不如让机器人先从一本可靠的书中查找答案,然后再告诉你它找到了什么。这篇论文提出了一个简单但关乎生命的问题:如果我们给医疗机器人一个药物事实库,它是否会停止犯下危险的错误?

这篇论文的作者 Pratik Kumar 和 Rajat Verma 决定专门针对药物相关问题来测试这个想法。他们构建了一个系统,让一个机器人(使用名为 Llama 3.2 的模型)必须回答关于华法林(warfarin)或布洛芬(ibuprofen)等药物的问题。但在回答之前,它必须跑向一个数字图书馆,找到关于该药物的准确页面并阅读它们。他们将这个“阅读图书馆的机器人”与一个“仅凭记忆的机器人”进行了对比,后者仅仅根据其训练期间学到的知识进行猜测。

对于任何担心 AI 安全的人来说,研究结果都令人倍感宽慰。那个仅凭记忆的机器人有点像个“捣蛋鬼”:它有 47.8% 的概率会编造危险的事实。这意味着在近一半的情况下,它是自信地犯错。然而,一旦加入了图书馆(即 RAG 系统),机器人的错误率大幅下降,仅为 12.3%。这意味着错误减少了 74.3%。机器人不仅仅是变得稍微好了一点,而是变得更加可靠了。当它出错时,通常是因为它在图书馆里找不到答案(这是一种安全的错误类型),而不是编造了一个假事实(这是一种危险的错误类型)。

为了证明这不仅仅是偶然现象,研究人员针对十种常见药物的 150 个不同问题进行了测试,涵盖了从心脏病药物到止痛药的所有内容。他们发现,这个阅读图书馆的机器人更加准确且诚实。例如,当被问及是否可以将华法林(一种抗凝血药物)与布洛芬(一种止痛药)混合服用时,那个仅凭记忆的机器人给出了一个危险的“是”,说每天服用两次、每次 400 毫克是安全的。这可能会导致致命的出血。然而,阅读图书馆的机器人检查了它的来源,并正确地回答道:“不,这是危险的,会导致严重出血”,并引用了官方的药物标签。

论文表明,虽然阅读图书馆的系统回答时间稍长(约 3.2 秒,而非 1.1 秒),但这种权衡是值得的,因为它阻止了机器人对药物撒谎。研究人员承认他们的系统目前还不完美——它仍然会犯一些错误,尤其是在处理非常罕见的药物组合时,而且它目前仅适用于英文文本。但他们的工作证明了,给 AI 一个可靠的来源来核实事实,是阻止其产生幻觉的一种强有力的方法,这使得对于可能向其寻求帮助的患者来说,它变得更加安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →