Same Question, Different Source, Different Answer: Auditing Source-Dependence in Medical Multi-Source RAG
本文提出了一种针对多源检索增强生成(RAG)系统的新颖评估框架,将关注点从答案正确性转向对源依赖性的审计,并通过移植患者教育基准测试证明机构间分歧远比先前估计的更为普遍,同时提出了 HERO-QA 和结构化评判者等工具,以系统性地衡量和管理这些源间关系。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一位刚接受心脏移植手术的患者。你有一个问题:“我什么时候可以再次进行国际旅行?”你将这个问题输入到一个智能医疗聊天机器人中。
在构建这些聊天机器人的旧有方式中,系统会找到一个“完美”的答案,并满怀信心地将其提供给你。但本文指出,在现实世界中,并不存在单一的完美答案。相反,你得到的答案完全取决于聊天机器人碰巧选取了哪家医院的规则手册。
如果机器人选取了 A 医院的规则手册,它可能会说:“等待 3 个月。”如果它选取了 B 医院的规则手册,它可能会说:“等待 12 个月。”这两个答案都写得信心满满,引用也都正确,但它们彼此矛盾。旧有的测试这些机器人的方法无法发现这个问题,因为它们只寻找单一的“黄金标准”答案。
本文介绍了一种审计这些系统的新方法,以移植患者教育系统作为测试案例。以下是他们如何做到的,解释如下:
1. “食谱书”收集(TransplantQA)
研究人员收集了来自美国 23 个主要移植中心的 102 份不同的患者手册。可以将这些手册想象成同一道菜(移植后护理)的 102 种不同食谱。有些厨师(医院)说“加盐”,有些说“不加盐”,还有些根本未提及盐。
他们还收集了 1,115 个真实患者在论坛上提出的实际问题。这些并非虚构,而是真实人们的真实担忧。
2. “智能图书管理员”(HERO-QA)
为了测试该系统,他们构建了一个名为 HERO-QA 的特殊检索引擎。想象一位图书管理员正试图在庞大的图书馆中找到正确的页面。
- 如果书籍较短,图书管理员会阅读整本书,以确保没有遗漏任何内容。
- 如果书籍巨大,图书管理员会使用智能地图找到特定章节,然后定位到特定段落,甚至检查相邻段落以获取完整语境。
随后,这位图书管理员会要求一个强大的 AI(“生成器”)仅根据它找到的页面来撰写答案。他们对每一个问题针对每一本手册都进行了此操作。这导致针对同一问题产生了超过 48,000 个不同的答案。
3. “严苛的法官”(结构化输出)
现在到了最关键的部分。他们需要一种方法来比较这 48,000 个答案,以观察它们有何不同。他们不只是问:“它们是相同还是不同?”他们使用了一个专门的 AI“法官”,其作用如同一位严格的编辑。
该法官不仅仅给出一个分数,而是为每一对比较的答案撰写一份简短报告。它将答案归入五个类别:
- 缺失(Absent): 其中一本书甚至未提及该主题。
- 一致(Consistent): 两本书说的完全一样。
- 互补(Complementary): 它们在主要观点上达成一致,但添加了不同的细节(例如,一本说“健康饮食”,另一本补充“并锻炼”)。
- 分歧(Divergent): 它们给出了不同的建议(例如,“等待 6 周”与“等待 12 周”)。
- 矛盾(Contradictory): 它们说了相反的话(例如,“你可以这样做”与“永远不要这样做”)。
至关重要的是,该法官还解释了它们为何不同以及差异的严重程度。
4. 重大发现
当他们运行数据时,发现了一些令人惊讶的事情。
- “缺失”问题: 在约 79% 的案例中,其中一本手册根本没有答案。旧有的测试方法忽略了这一点,因为它假设每本书都有答案。
- “隐藏”的分歧: 当他们改进检索系统(使图书管理员更聪明)时,他们发现了更多的分歧,而不是更少。
- 类比: 想象你在字典中寻找一个特定的单词。如果你只看第一页,你可能会认为大家对定义的看法一致。但如果你阅读整本字典,你会意识到不同版本的定义各不相同。
- 该研究发现,之前的估计低估了医院之间分歧的频率。并非分歧本身更强烈,而是旧系统对许多医院根本没有答案这一事实视而不见,从而掩盖了差异的真实程度。
5. 为何这在医学之外也至关重要
作者表示,这不仅仅关乎心脏移植。他们指出,任何从多个来源提取答案的系统(例如法律系统,其中各州法律不同;或学校系统,其中各学区的课程标准不同)都存在同样的盲点。
如果学生向聊天机器人询问历史问题,答案可能会根据机器人阅读的是纽约的教科书还是德克萨斯州的教科书而改变。本文提供了一套工具来衡量这种“来源依赖性”,以便我们停止假装总是存在唯一的正确答案。
总结: 本文构建了一个大规模测试,以表明当 AI 基于多个来源回答问题时,答案往往取决于它选取了哪个来源。他们创造了一种衡量这些差异的新方法,证明我们需要停止寻找单一的“正确”答案,转而审计不同来源之间的相互关系。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。