A Benchmark for End-to-End Zero-Shot Biomedical Relation Extraction with LLMs: Experiments with OpenAI Models
本文介绍了一个用于评估使用 OpenAI 模型进行端到端零样本生物医学关系抽取的基准测试,并证明了尽管这些大语言模型在某些数据集上接近监督学习的性能,但在处理涉及多种关系的复杂输入时仍然面临困难。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,医学研究的世界就像一座巨大且不断增长的图书馆。每天,成千上万本新书(科学论文)被添加到书架上。这些书中包含了至关重要的事实:哪些药物可以协同作用,哪些基因会导致疾病,以及化学物质如何与蛋白质相互作用。
问题在于,这座图书馆过于庞大,人类无法通过手动阅读和组织来进行管理。我们需要一种能够自动提取这些事实并将其放入整齐、结构化列表(如电子表格)中的方法,以便计算机可以使用它们。这个过程被称为关系抽取 (Relation Extraction, RE)。
传统上,为了教会计算机完成这项工作,我们必须聘请专家来阅读数千篇论文,标出事实并进行标注。这就像是为学生每学习一个新学科都要聘请一名导师一样。这既缓慢、昂贵又令人精疲力竭。
核心问题:我们能跳过导师吗?
随着“大语言模型”(LLMs)——即你可能使用过的那些超级智能的 AI 聊天机器人——的兴起,研究人员提出了疑问:我们能否直接让 AI 完成这项工作,而不需要预先进行教学? 这被称为零样本 (Zero-Shot) 学习。我们不再通过示例来训练 AI,而是仅仅给它一个提示(指令),看看它能否在没有预先训练的情况下即时理解。
这篇论文是一个基准测试 (benchmark test)。作者建立了一个包含七种不同类型医学谜题的“健身房”,以观察这些 AI 模型是否可以在没有任何预先训练的情况下解决这些问题。
实验:AI 对决图书馆
研究人员在七个不同的数据集上测试了三种不同的 AI 模型(GPT-4、OpenAI 的 “o1” 以及一个名为 GPT-OSS 的开源模型)。可以将这些数据集想象成电子游戏中的不同难度等级:
- 简单关卡: 一些谜题非常简单。它们涉及短句,只需寻找一到两种类型的事实(例如“药物 A 会导致副作用 B”)。
- 困难关卡: 其他谜题则非常混乱。它们涉及长段落,其中包含数十个事实、复杂的科学名称以及许多混合在一起的不同类型的关系。
AI 的任务是阅读文本并输出一个结构化的事实列表,例如:{药物: 阿司匹林, 效果: 减轻疼痛}。
他们的发现
结果呈现出“不错”与“仍需改进”并存的状态。
- 简单内容: 当文本较短且事实显而易见时,AI 模型的表现出奇地好。它们几乎与那些经过大量训练的传统系统一样出色。这就像 AI 可以轻松地从一篮水果中识别出一颗红苹果。
- 复杂内容: 当文本变得冗长且混乱时,AI 开始陷入困境。
- 遗漏部分: 如果一个段落有 10 个事实,AI 通常只能找到 3 或 4 个。这就像读了一个长篇故事,却只记得开头和结尾,忘记了中间的内容。
- 边界错误: 有时 AI 理解了正确的意思,但用词错误。如果文本说“剧烈头痛 (severe headache)”,AI 可能只提取出“头痛 (headache)”。在医学科学中,这种微小的差异至关重要。
- 混淆: 在最难的数据集上(包含 8 种不同类型的关系),AI 会感到非常困惑,经常搞混哪种药物对哪种疾病产生了什么影响。
“金标准”问题
论文中最有趣的观点之一是关于我们如何给 AI 打分。
- 严格的评分员: 如果 AI 写的是 “hypertension (高血压)”,而教科书上写的是 “high blood pressure (血压高)”,严格的计算机程序会判定为“错误!”,尽管人类会认为“这其实是同一回事”。
- 人类的现实情况: 作者发现,有时 AI 发现的事实甚至连人类专家在原始教科书中也遗漏了。这表明,这些测试中的“正确”答案本身也未必完美。
结论
论文得出结论:零样本 AI 正趋于实用,但尚未准备好取代人类专家。
- 对于简单任务: 它是一个伟大的工具。你可以要求它从短句中提取事实,它很可能会做得正确。
- 对于复杂任务: 它仍然很吃力。它容易在长文档中遗漏事实,并会被复杂的科学术语所困扰。
作者还警告说,我们并不确切知道这些 AI 模型是用什么数据训练的。有可能因为这些论文都在网上,它们已经“背诵”了一些答案。然而,由于 AI 在最难的数据集上表现如此糟糕,因此不太可能是仅仅靠背诵答案,它实际上是在尝试理解文本。
简而言之
可以将这些 AI 模型想象成聪明但缺乏经验的实习生。
- 如果你给他们一份简短、清晰的备忘录,他们可以完美地进行总结。
- 如果你给他们一份包含冲突细节的 50 页复杂报告,他们可能会遗漏最重要的点,或者在细节上出现轻微偏差。
论文并不是说我们应该停止使用这些工具,而是说我们需要保持谨慎。我们还不能完全放手让它们独自运行整个医学数据库;我们仍然需要检查它们的工作,尤其是在信息复杂的情况下。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。