← 最新论文
🤖 machine learning

Eliciting associations between clinical variables from LLMs via comparison questions across populations

本文提出了一种方法,该方法利用结构化的患者比较三元组问题和统计建模,从大语言模型中提取稳定且具临床可解释性的相关性,从而在不访问模型内部的情况下,通过不变因果预测识别跨不同患者亚群的保守候选因果链接。

原作者: Fabian Kabus, Kian Kordtomeikel, Thomas Brox, Heinz Wiendl, Daiana Stolz, Harald Binder

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Fabian Kabus, Kian Kordtomeikel, Thomas Brox, Heinz Wiendl, Daiana Stolz, Harald Binder

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位读过几乎所有医学书籍、研究和论文的超级聪明图书管理员。你想知道两个特定健康因素之间是如何关联的——例如,“吸烟越多是否通常意味着肺部功能更弱?”

如果你直接问图书管理员:“吸烟与肺部功能弱之间的关联有多强?”他们可能会给出一个数字。但这里有个问题:图书管理员可能是在猜测,只记得某一本特定的书,甚至为了取悦你而说出他们认为你想听的话。他们也可能不擅长数学,给出的数字听起来合理,但实际上并非他们“内心”所知的内容。

本文提出了一种巧妙、间接的提问方式,用以探知图书管理员对这些关联的“真实”认知,而无需查看他们的内部笔记或大脑。

“相似性游戏”(三元组问题)

研究人员不直接索要数字,而是玩一种“哪一个更相似?”的游戏。

想象你向图书管理员展示三个虚构的患者:

  1. 患者 A:每天吸烟 10 支,肺功能处于平均水平。
  2. 患者 B:每天吸烟 10 支,肺功能极差
  3. 患者 C:每天吸烟 20 支,肺功能未知

你问:“患者 C 与患者 A 更相似,还是与患者 B 更相似?”

  • 如果图书管理员回答“患者 A",说明他们忽略了患者 C 的大量吸烟行为。
  • 如果图书管理员回答“患者 B",说明他们意识到,由于患者 C 吸烟很多,其肺部状况可能更差,正如患者 B 一样。

通过略微调整数值(例如,让患者 C 分别吸烟 15 支、25 支、30 支),并观察图书管理员的选择如何从 A 翻转到 B,研究人员可以绘制出一条“决策线”。这条线揭示了图书管理员将吸烟与肺部健康关联的强度。这就像测试需要往秤上放多少重量才能打破平衡。

“不同社区”技巧(提示环境)

研究人员意识到,图书管理员可能会根据上下文表现出不同的“观点”。因此,他们在问题中构建了不同的“社区”或场景。

  • 场景 1:“想象一群生活在烟雾弥漫城市中的重度吸烟者患者。”
  • 场景 2:“想象一群不吸烟但生活在严重污染地区的人群。”
  • 场景 3:“想象一群不吸烟且生活在清洁乡村空气中的人群。”

他们在上述三个场景中分别进行了“相似性游戏”。如果图书管理员的“决策线”(即他们如何关联变量)无论处于哪个“社区”都保持一致,这就表明存在强因果关联。这就像在说:“无论你去哪里,重度吸烟总是导致肺部功能变差。”

如果这条线在不同“社区”之间剧烈变化,则表明这种关联很弱,或者仅仅是巧合(即“虚假相关”)。

他们的发现

研究人员在两个真实的医学领域测试了这种方法:慢性阻塞性肺病(COPD)(一种肺部疾病)和多发性硬化症(MS)(一种神经疾病)。

  1. 比直接提问更有效:当他们直接向图书管理员索要数字时,答案杂乱无章、前后不一。但当他们玩“相似性游戏”时,答案变得平滑、稳定,且具有医学意义。
  2. COPD 结果:该方法发现了强而合乎逻辑的关联。例如,它证实了吸烟史与肺弥散功能降低(肺部交换氧气的能力)相关,而空气污染与肺总量相关。
  3. MS 结果:关联较弱且更难发现,作者指出这可能是因为关于多发性硬化症的医学文献比慢性阻塞性肺病更为分散或复杂。
  4. 发现“真实”原因:通过使用“不同社区”技巧,他们能够过滤掉噪音。他们识别出了一小份非常可靠的关联清单,这些关联似乎是真正的因果关系(例如吸烟导致肺损伤),而不仅仅是随机关联。

核心结论

这篇论文并未声称发现了新的医学事实,而是展示了一种用于向 AI 模型提问的新工具

可以这样理解:如果你想了解一个人真正的信念,不要直接问“你怎么想?”(他们可能会撒谎或猜测)。相反,让他们在不同情境下对选项做出选择。通过观察他们如何选择,你就可以推断出他们真实的潜在信念。

作者表明,通过使用这种“基于选择”的方法,我们可以在无需窥探 AI 内部运作机制、也不受 AI 试图取悦我们的误导的情况下,安全地从 AI 模型中提取有意义的医学模式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →