Hallucination Detection-Guided Preference Optimization for Clinical Summarization
本文提出了一种推理时方法及其相应的偏好学习框架,利用幻觉检测器迭代优化和微调大语言模型,在保持流畅性和连贯性的同时显著减少临床摘要中的事实性幻觉。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位非常聪明、博览群书的图书管理员(即人工智能),其职责是阅读患者冗长且杂乱的医疗档案,并为其撰写一份简短易懂的摘要。问题在于,这位图书管理员有时会过于富有创造力。他们可能会编造患者从未做过的检查,或者声称医生说了某些并未说过的话。在医疗领域,这些捏造的事实被称为“幻觉”,它们非常危险,因为可能会混淆患者或导致错误的决策。
本文介绍了一个两步系统,旨在教导这位图书管理员如何严格遵循事实,同时不丧失其优秀的写作能力。
问题所在:“过度想象”的图书管理员
即使是最好的 AI 模型,也像是那些渴望取悦老师的学生。当被要求总结医疗记录时,它们有时会填补空白,加入一些听起来合理但实际上并不在文件中的内容。例如,如果文件写着“患者摔倒了”,AI 可能会补充道,“并且患者摔断了腿”,即使文件中从未提及腿骨折。
解决方案:双部分训练系统
作者提出了一种名为HDSR(幻觉检测引导的自我优化)和HDSR-PL(偏好学习)的方法。你可以将其想象为一个严格的编辑过程。
第一部分:“事实核查员”编辑(HDSR)
想象图书管理员写出了摘要的初稿。在交给患者之前,这份草稿会被转交给一位专门的事实核查员(即幻觉检测器)。
- 工作原理:事实核查员将草稿与原始医疗文件进行比对。如果草稿写道“患者服用了药物 X",但文件中并未提及,事实核查员就会用红色高亮标出该句子。
- 修订:随后,图书管理员会收到指示:“你标出了这一部分。请回去,仅依据原始文件进行修正。”
- 循环:这一过程反复进行。图书管理员修订,事实核查员再次检查,如此循环,直到没有红色高亮残留。这就是HDSR方法。这就像学生根据严格的评分标准反复修改文章,直到每一个主张都有证据支持。
第二部分:“品味塑造者”导师(HDSR-PL)
虽然“事实核查员”循环效果很好,但它速度很慢,因为每次都需要图书管理员停下来重写。作者希望教导图书管理员能够自动做到事实准确,而无需事实核查员时刻在他们肩头监督。
- 课程:他们收集了图书管理员在“事实核查员”循环期间撰写的所有草稿,并制作了一种“选择你自己的冒险”风格的课程:
- 选项 A:包含捏造事实的原始草稿(“坏”选择)。
- 选项 B:修正了事实的修订版草稿(“好”选择)。
- 训练:他们向图书管理员展示了成千上万对这样的“坏 vs 好”配对,并教导他们:“永远选择选项 B。”
- 结果:这就是HDSR-PL。现在,当图书管理员撰写摘要时,他们的大脑已被训练成自然地避开“坏”选择并挑选“好”选择。他们不再需要事实核查员;他们已经内化了坚守事实的规则。
他们发现了什么?
研究人员在来自大型医院数据库(MIMIC-IV)的真实医疗笔记上测试了该方法。
- “之前”状态:在没有帮助的情况下,AI 产生了约 29 个事实错误。如果他们尝试正常地“微调”它(即仅向其展示更多示例),错误数量实际上增加到了 57 个!这就像给图书管理员更多的书去读,但他们却开始编造更多的故事。
- “之后”状态:
- 使用事实核查员循环(HDSR),错误数量降至 22 个。
- 使用品味塑造者训练(HDSR-PL),错误数量进一步降至仅 15 个。
- 质量检查:至关重要的是,摘要并没有变得机械或枯燥。人类专家和其他 AI 评估者确认,这些摘要依然易于阅读、行文流畅且内容相关。AI 学会了在保持其风格的同时做到准确。
核心结论
本文表明,通过采用“检测并修正”系统,可以显著提高 AI 在医疗保健领域的可靠性。首先,你使用一种工具来发现谎言并强制 AI 进行修正。然后,你利用这些修正来训练 AI,使其学会独立地陈述事实。这使得 AI 对医生和患者来说更加安全,确保摘要反映的是实际发生的情况,而不是 AI 想象发生的情况。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。