← 最新论文
💬 NLP

Benchmarking LLMs for Pairwise Causal Discovery in Biomedical and Multi-Domain Contexts

该研究构建了一个包含 12 个数据集的统一评估框架,对 13 个开源大语言模型在生物医学及多领域上下文中的成对因果发现能力进行了基准测试,结果显示当前模型在因果检测与提取任务上表现普遍不佳,尤其在处理隐含关系、跨句关联及多对因果等复杂场景时性能显著下降。

原作者: Sydney Anuyah, Sneha Shajee-Mohan, Ankit-Singh Chauhan, Sunandan Chakraborty

发布于 2026-03-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Sydney Anuyah, Sneha Shajee-Mohan, Ankit-Singh Chauhan, Sunandan Chakraborty

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是一份**“大语言模型(LLM)的因果推理能力体检报告”**。

想象一下,你请了 13 位不同性格的“超级 AI 助手”(比如 DeepSeek, Llama, Qwen 等),给它们布置了一项任务:阅读一段文字,找出其中的“因果关系”

在医学和科学领域,搞清楚“因为 A,所以发生了 B"(比如“因为吃了药,所以发烧退了”)是救命的关键。如果 AI 分不清“相关性”(一起发生)和“因果性”(一个导致另一个),它给出的医疗建议可能会出大乱子。

这篇论文就是看看这些 AI 到底能不能胜任这个工作。

1. 核心任务:两个关卡

研究人员给 AI 出了两道关,就像闯关游戏:

  • 第一关:火眼金睛(检测)
    • 任务:给 AI 看一句话,问它:“这句话里有没有因果关系?”
    • 比喻:就像让 AI 当安检员,看一段文字里有没有藏着“因果炸弹”。
  • 第二关:精准提取(抽取)
    • 任务:如果真的有因果关系,AI 必须把“原因”和“结果”这两个词原封不动地摘出来。
    • 比喻:就像让 AI 当外科医生,不仅要发现病灶,还要精准地把“病因”和“症状”从文本里切出来,不能多也不能少。

2. 测试环境:从“幼儿园”到“大学”

为了测试 AI 的深浅,研究人员设计了 12 种不同难度的题目,涵盖了从简单到极难的场景:

  • 简单题(幼儿园水平)
    • 特征:句子很短,有明确的“因为”、“所以”、“导致”等词。
    • 例子:“因为下雨,所以地湿了。”
    • AI 表现:大部分 AI 都能轻松答对。
  • 困难题(大学水平)
    • 特征:没有明显的连接词,或者因果关系跨越了多个句子,甚至一句话里藏着好几个因果对。
    • 例子(隐式):“他昨晚没睡好。今天开会时睡着了。”(虽然没有“因为”,但逻辑上是因果)。
    • 例子(跨句):“病人服用了新药。第二天,他的皮疹消失了。”(需要把两句话连起来想)。
    • AI 表现:在这里,AI 们集体“翻车”了。

3. 主要发现:AI 还很“笨拙”

论文的结果让人有点失望,但也很有价值:

  • 总体分数不高:即使是表现最好的模型,在“检测”任务上的平均分也只有 49.57%(相当于不及格),在“提取”任务上更是只有 47.12%
    • 比喻:这就像让一个大学生做小学一年级的数学题,结果只考了 50 分。
  • 依赖“关键词”:AI 非常依赖像“因为”、“导致”这样的显性词汇。一旦这些词消失,或者因果关系藏在复杂的医学描述中,AI 就晕头转向了。
  • 擅长“单句”,不擅长“长文”:AI 能搞定一句话里的简单因果,但一旦因果关系像蜘蛛网一样跨越了多个句子(这在病历和论文中很常见),AI 就找不到北了。
  • 模型之间差异大
    • DeepSeek-R1 系列在“检测”(判断有没有)上比较强,但在“提取”(把词摘出来)上经常出错。
    • Qwen2.5-Coder 系列在“提取”上表现最好,但也不是完美的。
    • 有些小模型(比如 3B 参数的)几乎完全不会做,而经过“指令微调”的大模型(比如 70B 参数)表现会好很多。

4. 为什么这很重要?(医学背景)

想象一下,医生正在用 AI 分析病人的病历。

  • 理想情况:AI 读到“病人吃了阿司匹林,随后出血停止”,能立刻明白“阿司匹林”是原因,“出血停止”是结果。
  • 现实情况:病历里可能写着“病人有高血压病史。昨天开始服用新药。今天血压正常了。”
    • 如果 AI 分不清这是“巧合”还是“因果”,它可能会错误地推荐药物,或者漏掉真正的副作用。
    • 这篇论文告诉我们:目前的 AI 还不足以完全信任地用于这种高风险的医疗决策,它们还需要更多的训练。

5. 总结与未来

这篇论文就像是一个**“警钟”**。它告诉我们要想让人工智能真正进入医院、辅助医生做决策,我们还有很长的路要走。

  • 现状:AI 目前只能处理简单的、明面上的因果关系。
  • 挑战:面对复杂的、隐晦的、跨句子的医学逻辑,AI 还像个刚学走路的孩子。
  • 未来:研究人员呼吁,未来的模型需要专门针对“因果推理”进行训练,不能只靠通用的语言训练。我们需要让 AI 学会像医生一样思考,而不仅仅是像搜索引擎一样匹配关键词。

一句话总结
这篇论文给 13 个 AI 模型做了一次“因果推理”考试,发现它们目前还不够聪明,特别是在处理复杂的医学文本时容易“断片”。要想让 AI 安全地进入医疗领域,我们得先帮它们把“逻辑脑”练得更结实才行。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →