← 最新论文
🤖 machine learning

Self Driving Datasets: From 20 Million Papers to Nuanced Biomedical Knowledge at Scale

本文介绍了“Starling”,这是一个多智能体深度研究系统,能够自主将整个PubMed语料库转化为大规模、高精度且富含细微差别的数据集,在规模和数据质量上均超越了传统人工策划的数据库。

原作者: Haydn Jones, Yimeng Zeng, Alden Rose, Li S. Yifei, Yining Huang, Kaiwen Wu, Jiaming Liang, Maggie Ziyu Huan, Yoseph Barash, Cesar de la Fuente-Nunez, Osbert Bastani, Zachary Ives, Mark Yatskar, Jacob
发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Haydn Jones, Yimeng Zeng, Alden Rose, Li S. Yifei, Yining Huang, Kaiwen Wu, Jiaming Liang, Maggie Ziyu Huan, Yoseph Barash, Cesar de la Fuente-Nunez, Osbert Bastani, Zachary Ives, Mark Yatskar, Jacob R. Gardner

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,生物医学研究的世界就像一座庞大而混乱的图书馆,里面藏有 2250 万本书(科学论文)。几十年来,试图构建人工智能以发现新药的科学家们,一直试图从一本由少数图书管理员手工编写的、微小、昂贵且略显过时的“作弊条”中学习。这本“作弊条”(现有数据库)固然很好,但它缺失了页面,更新缓慢,而且管理员们往往遗漏了关于实验如何实际进行的杂乱细节。

本文介绍了Starling,这是一个新系统,它像一位超级强大、不知疲倦的图书管理员,能够阅读整个包含 2250 万本书的图书馆,即时理解上下文,并将“作弊条”重写得更庞大、更准确,并充满那些缺失的细节。

以下是 Starling 的工作原理,分解为简单的步骤:

1. 问题:“作弊条”存在缺陷

将现有的药物数据库想象成一个电子表格,上面写着:“药物 X 有效。”

  • 它不完整:它遗漏了自该电子表格上次更新以来发布的数千项新研究。
  • 它缺乏细微差别:它没有告诉你药物 X何时有效。也许只有在患者未进食时才有效,或者只有在与某种特定药物联用时才有效。电子表格丢弃了这些至关重要的上下文。
  • 它存在错误:论文发现,旧的“作弊条”有 7% 到 16% 的情况是错误的。

2. 解决方案:Starling(自动驾驶图书管理员)

与其雇佣更多的人类图书管理员去阅读书籍(这需要数年时间且耗资巨大),作者们构建了Starling,一个能够自行完成工作的 AI 系统。

步骤 A:标签系统(索引)
首先,Starling 阅读每一篇论文,并在上面贴上便签。它在 19 个不同类别中标注了 45 亿个具体事物(如药物名称、基因、疾病和蛋白质)。这就像拥有一个图书馆,其中的每一本书都能根据书中的每一个角色和情节要点被即时索引。

步骤 B:搜索(侦探)
当研究人员提出诸如“找出任何人曾谈论过的药物如何进入大脑的所有情况”这样的问题时,Starling 不会仅仅猜测。它使用“混合搜索”(结合关键词匹配与理解句子含义),在 2250 万本书中找到确切的相关页面。

步骤 C:提取(抄写员)
这是神奇的部分。Starling 利用一组 AI 代理来:

  1. 设计表单:它确定哪些信息是重要的(例如,“患者是否禁食?”)。
  2. 阅读与书写:它阅读特定的段落,提取数据,并填写结构化记录。
  3. 法官:最终的 AI“法官”检查工作。它会问:“你真的是在论文中找到了这个吗?药物名称正确吗?你编造了一个数字吗?”如果答案是否定的,它就会丢弃该记录。

3. 结果:更好的图书馆

论文在六项不同任务上测试了 Starling,例如查明某种化学物质的毒性或药物穿透血脑屏障的效果。

  • 规模:Starling 生成了约630 万条记录。对于某些任务而言,这比最佳的人工数据库大 20 到 30 倍。
  • 准确性:令人惊讶的是,Starling 的记录比人工策划的记录更准确。虽然旧数据库的错误率为 7% 到 16%,但 Starling 的错误率仅为0.6% 到 7.7%
  • 细微差别:这是最大的胜利。Starling 不仅仅说“药物 X 的生物利用度为 60%"。它说:“药物 X 的生物利用度为 60%,前提是空腹服用,但如果与高脂餐同服,则仅为 20%。”它捕捉到了数字背后的“故事”,而之前的数据库则将其丢弃了。

4. 成本

论文指出,整个过程的成本约为每条记录一美分。相比之下,人工策划这些数据库耗资巨大且需要数年时间。

总结

论文声称,通过使用 AI 自主阅读原始科学文献,我们可以构建出比人类此前手动策划的任何数据集都更大、更便宜、更准确且细节更丰富的数据集。他们已发布代码和数据集,以便其他人能够利用这种“自动驾驶”方法从文献中构建自己的知识库。

论文并未声称的内容:

  • 它并未声称这些数据集已经治愈了疾病或导致了新药获批。
  • 它并未声称 AI 是完美的,或者它像人类医生一样理解生物学(它仍然需要被检查)。
  • 它并未声称该系统能够阅读论文中的图像或图表(它目前仅能阅读文本和表格)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →