← 最新论文
💬 NLP

A knowledge-guided agentic framework for mitigating patient-context ambiguity in health queries

本文介绍了一种知识引导的智能体框架,该框架通过利用知识图谱来识别缺失信息并提出针对性的追问,从而缓解了健康查询中的患者上下文歧义,与直接回答相比,显著提高了下游语言模型在诊断检索和饮食安全分类方面的准确性。

原作者: Mahyar Abbasian, Saba A. Farahani, Arshia Ilaty, Hung Cao, Ramesh Jain, Amir M. Rahmani

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Mahyar Abbasian, Saba A. Farahani, Arshia Ilaty, Hung Cao, Ramesh Jain, Amir M. Rahmani

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在个人的担忧与医生的建议之间,存在着一个静谧的空间,而一种新型的对话正在那里发生。多年来,人们一直转向数字助手和聊天机器人来询问健康问题,输入诸如“头痛该吃什么药?”或“这种食物对我安全吗?”之类的简短问题。这些工具建立在庞大的医学知识库之上,能够背诵有关疾病和治疗的各种事实。然而,一个根本性的差距依然存在。计算机可以了解关于头痛的一切,但它无法了解提问者的具体情况。它不知道这个人是否怀孕,是否在服用抗凝剂,或者是否患有肝脏疾病。没有这些隐藏的细节,最符合医学事实的答案对于那个特定个体来说也可能是错误的。这并非计算机记忆力的失败,而是只有患者才掌握的一块缺失的拼图。

研究人员早已意识到语言可能含糊不清,但这项研究关注的是另一种类型的困惑。问题不在于词汇难以理解,而在于故事是不完整的。想象一下,一名侦探试图仅凭一半的线索来破案。侦探可能会进行猜测,但这种猜测可能是危险的。在医疗保健领域,猜测是冒险的。由 Mahyar Abbasian 及其同事领导的研究团队致力于研究:计算机是否可以学会先提出正确的问题,然后再尝试给出答案。他们想知道,通过一个中间步骤——即系统主动寻求缺失的个人细节——是否可以在不需要重新训练那些生成文本的强大计算机的情况下,使最终的建议更加安全和准确。

为了测试这一点,研究人员构建了一个框架,该框架位于提问者与提供答案的大型语言模型之间。可以将这个框架想象成一名熟练的分诊护士,她倾听最初的查询,然后查阅一份结构化的医学知识图谱。这张被称为“知识图谱”的地图有助于系统理解缺失了哪些信息。如果一名患者询问关于头痛的问题,系统会查看其地图,并意识到答案取决于怀孕或用药情况等因素。系统不会进行猜测,而是会提出针对性的后续问题:“您目前怀孕了吗?”或“您是否在服用抗凝药物?”一旦患者回答,系统会将这些新信息与原始问题结合起来,并将这个完整、清晰的故事传递给语言模型。随后,模型将基于一个完整的图景,而非局部图景来生成回复。

团队使用两种不同的场景测试了这种方法:根据症状列表诊断疾病,以及判断特定食物对于具有特定健康状况的人是否安全。他们创建了数千个测试案例,在这些案例中,关键信息被刻意从初始问题中隐去。在诊断测试中,他们使用了 1,034 份合成患者记录,其中大约一半的症状被隐藏了。在食物安全测试中,他们使用了 487 个遗漏了患者健康状况的查询。他们比较了三种方法:让计算机直接回答不完整的提问,让计算机在不添加新事实的情况下重述问题,以及使用他们的新系统先询问缺失的细节。

结果令人震惊。当计算机尝试直接回答这些不完整的问题时,往往会出错。对于诊断任务,即使使用最先进的模型,直接处理的方法获得完全正确答案的概率也不到 12%。当研究人员使用他们的澄清系统时,准确率大幅提升。在五种不同的语言模型中,该系统将精确诊断率至少提高了 57 个百分点。在某些情况下,这种提升甚至更大,将准确率从接近零提升到了 70% 以上。系统不仅能得出大致的类别,还能更可靠地识别出具体的疾病。同样,对于食物安全任务,澄清系统帮助模型正确识别了不安全食物,同时避免了不必要的限制,在测试的五个模型中有四个实现了安全性与准确性的最高平衡。

除了获得正确答案之外,研究还发现这种方法使计算机变得更加一致。当同一个问题被反复询问时,直接处理的方法往往会给出不同的答案,有时一会儿建议某种食物是安全的,一会儿又说是不安全的。然而,一旦收集到了缺失的背景信息,澄清系统每次都会产生相同的决策。这种稳定性在医疗保健领域至关重要,因为用户需要信任其建议不会随机发生变化。研究人员还观察到,该系统在不同类型的语言模型上都表现良好,这表明其益处来自于获取信息的过程,而非仅仅来自于用于生成文本的具体计算机程序。

研究人员谨慎地指出了他们工作的局限性。测试是使用合成数据和模拟答案进行的,而非与真实患者进行的真实对话。在现实世界中,人们可能会误解问题、给出模糊的答案,或者忘记提到某个关键细节。研究表明,当缺失的信息可以被可靠地找回时,该方法是有效的,但它尚未解决人类对话中的复杂混乱问题。此外,该系统依赖于患者能够报告自己的症状或状况;它目前还无法自动从可穿戴设备或医疗记录中提取数据。

尽管存在这些局限性,研究结果仍提供了一条清晰的前行路径。研究表明,计算机提供准确健康建议的最大障碍不是缺乏医学知识,而是缺乏背景信息。通过将“澄清”视为收集缺失事实的必要步骤,而非仅仅是一种重述文字的方式,这些系统可以变得更加可靠。研究证明,一个作为填补患者故事空白之桥梁的中间代理人,可以将一个潜在危险的猜测转变为一个有据可依的建议。这种方法不需要改变底层语言模型的技术本身;它只是改变了它们被要求思考的方式,确保在开口说话之前,它们已经掌握了完整的故事。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →