← 最新论文
💬 NLP

MedFabric and EtHER: A Data-Centric Framework for Word-Level Fabrication Generation and Detection in Medical LLMs

本文介绍了 MedFabric,这是一个以数据为中心的管道,用于生成逼真的单词级医疗虚构内容;同时介绍了 ETHER,这是一个模块化检测器,利用该数据集在识别医疗大语言模型输出中微妙的偏差方面显著优于现有的最先进方法。

原作者: Tung Sum Thomas Kwok, Qian Qian, Xiaofeng Lin, Dongxu Zhang, Jun Han, Zhichao Yang, Davin Hill, Tamer Soliman, Sanjit Singh Batra, Robert Tillman, Guang Cheng

发布于 2026-05-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Tung Sum Thomas Kwok, Qian Qian, Xiaofeng Lin, Dongxu Zhang, Jun Han, Zhichao Yang, Davin Hill, Tamer Soliman, Sanjit Singh Batra, Robert Tillman, Guang Cheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一个非常聪明、博览群书的机器人助手,它可以撰写医疗建议。它擅长表现得自信满满,并使用恰当的大词。但有时,它会自信地编造内容。在医疗领域,这是危险的。如果机器人声称某种药物能治愈某种疾病,而实际上不能,这就是一种“捏造”。

本文介绍了一个新系统,用于捕捉这些特定类型的谎言,称为EtHER,以及一个用于训练它如何识别这些谎言的新训练场,称为MedFabric

以下是他们构建该系统的故事,以简单的方式解释:

问题:“风格”陷阱

作者注意到,以往捕捉机器人谎言的尝试存在一个重大缺陷。它们就像只查看一个人衣着、而不查看其身份证的保安。

  • 旧方法: 当研究人员制造虚假医疗答案以测试检测器时,他们往往过度改变了写作风格。虚假答案听起来机械且笨拙,而真实答案则听起来像人类。
  • 错误: 检测器学会识别的是“机械风格”,而非实际的谎言。它们仅仅因为答案听起来怪异就将其标记为虚假,但却会漏掉那些听起来完美无缺的虚假答案。
  • 结果: 当机器人写出的谎言在句子结构和语气上与人类完全一致时,检测器就会感到困惑并失效。

解决方案第一部分:MedFabric(“完美伪造者”)

为了解决这个问题,作者构建了一个名为MedFabric的新训练数据集。这就像间谍电影中的大伪造师

  1. 第一步:风格转换: 他们选取真实的人类撰写的医疗事实,并让 AI 对其进行重写。目标不是改变含义,而是让人类文本听起来与 AI 的自然写作风格完全一致。现在,“真实”答案和“虚假”答案在风格上看起来完全相同。
  2. 第二步:微妙的谎言: 接下来,他们要求 AI 基于重写后的文本制造一个谎言。但这里的诀窍是:谎言必须微小。它不是整个新故事,而只是更改了一两个词。
    • 真实: “这种药物对小鼠有效。”
    • 虚假: “这种药物对大鼠有效。”
  3. 第三步:质量检查: 他们使用严格的过滤器,确保虚假答案与真实答案如此相似,以至于人类可能甚至无法立即察觉差异。

结果就是MedFabric:一个医疗句子集合,其中的“真相”和“谎言”如同双胞胎。它们看起来、听起来、感觉起来都一样,除了一个微小的事实错误。

解决方案第二部分:EtHER(“单词级侦探”)

既然他们拥有了这些棘手的“双胞胎”句子,就需要一个不会被风格迷惑的侦探。他们构建了EtHER(EvaluaTe Hallucination with TablE decomposition and woRd masking,即基于表格分解和单词掩码的幻觉评估)。

EtHER 不像阅读整段文字然后猜测那样,而是像一位法务会计师一样,将问题分解为三个步骤:

  1. Text2Table(整理者):
    想象医疗文本是一堆杂乱的文件。EtHER 将这堆文件整理成一张整洁的电子表格(表格)。它提取具体事实(如“药物 X"和“对小鼠有效”),并将它们放入各自的框中。这防止了侦探被华丽的句子结构分散注意力。

  2. 单词掩码与填充(拼图):
    EtHER 利用这些整齐的框玩一个“填空”游戏。它遮盖住一个词(如“小鼠”),并要求 AI 根据可信的医疗数据库猜测那里应该是什么词。

    • 如果原句说的是“大鼠”(谎言),但数据库说是“小鼠”,AI 就会尝试用“小鼠”来填空。
    • 当 EtHER 将原始谎言(“大鼠”)与填充后的真相(“小鼠”)进行比较时,不匹配之处显而易见。
  3. 混合评估(双重检查):
    最后,EtHER 使用两种工具做出最终决定:

    • 数学工具: 它使用数学(嵌入)测量单词之间的距离,以查看它们是否不同。
    • 大脑工具: 它要求一个智能 AI 对差异进行推理。
      通过结合这两者,EtHER 避免了仅向 AI 提问一次时发生的“随机猜测”。

结果:为何重要

作者使用他们新的“双胞胎”数据集(MedFabric)测试了 EtHER 与其他顶级检测器的表现。

  • 旧检测器: 当谎言很微妙(高相似度)时,旧检测器彻底失败,准确率降至 50% 以下(基本上是在猜测)。它们仍然在查看“衣着”(风格),而不是“身份证”(事实)。
  • EtHER: 因为 EtHER 关注具体的单词和事实,它保持了强劲表现。它比现有的最佳检测器高出15% 以上

简而言之: 本文认为,要抓住一个聪明的说谎者,不能只看他们如何说话。你必须构建一个系统,将他们的句子分解为单个单词,并逐一对照事实进行检查。EtHER 正是这样做的,它使用了一个名为 MedFabric 的数据集,迫使系统学习这项技能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →