Frontier LLM-based agents can overcome the ontology curation bottleneck for natural phenotypes
本研究证明,配备特定本体论和标注指南的前沿大语言模型智能体能够克服自然表型标注的可扩展性瓶颈,其表现水平可与训练有素的人类生物策展人相媲美,并显著超越传统自然语言处理工具。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你拥有一座庞大的古老生物学书籍图书馆。在这些书中,科学家们写下了成千上万条关于不同动物外貌的描述——诸如“下颌具有一枚弯曲的牙齿”或“翅膀短而宽”之类的内容。这些描述以通俗的英语写成,如同故事一般。
问题在于,计算机难以轻松阅读这些故事并将其与其他动物进行比较。为了使它们对科学有用,人类必须将这些故事翻译成一种严格、编码化的语言,称为本体论(ontology)。这就像将一部小说翻译成电子表格,其中每一个单词都必须与一个特定的、预先批准的代码相匹配。
旧瓶颈:“人类翻译员”问题
多年来,这项翻译工作一直由受过高度训练的人类专家(生物策展人)完成。这项工作缓慢、昂贵且难以扩展。这就像试图逐本手工翻译整座图书馆。
2018 年,研究人员尝试构建一个计算机程序(称为 Semantic CharaParser)来完成这项工作。但这台计算机就像一个笨拙的学徒:它犯了太多错误,无法达到人类专家的质量水平。人类与机器之间的差距巨大。
新实验:"AI 实习生”
八年之后,本文的作者决定再次尝试,但这次使用的是前沿大语言模型(Frontier LLMs,即当今最先进的 AI 模型,例如来自 Anthropic 和 OpenAI 的模型)。
他们并非仅仅让 AI“猜测”代码,而是为 AI 设立了一个特殊的工作空间,就像一个数字化办公室。在这个办公室内,AI 拥有:
- 源书籍:科学论文的原始 PDF 文件。
- 规则手册:一份详细的翻译指南(与人类使用的指南相同)。
- 词典:四份庞大的已批准代码(本体论)列表,供其查阅。
- 编辑程序:一个脚本,在 AI 提交工作前检查错误。
AI 不仅仅是在阅读;它像一个智能体(agent)那样行动。它阅读文本、查阅代码、构建复杂句子、自行进行质量检查,并在编辑程序标记错误时修正其失误。
结果:AI 与人类与旧计算机的对比
研究人员将五种不同的顶级 AI 模型与“黄金标准”(由人类专家团队创建的完美、公认的答案)进行了测试。
以下是发生的情况:
- 旧计算机(Semantic CharaParser):它仍然挣扎不前,表现远逊于人类。
- AI 智能体:它们带来了革命性变化。每一个 AI 模型的表现都落在人类专家的能力范围内。
- 想象三位人类专家参加一场考试。由于他们是不同的人,他们的分数略有差异。AI 的分数恰好落在这个差异范围的中间。
- 表现最佳的 AI 模型几乎与最优秀的人类专家一样出色,尽管它们尚未完全超越顶尖人类。
- AI 模型彻底碾压了旧计算机程序,在准确性上的得分大约是旧程序的两倍。
局限与未来
研究人员还尝试在各自的笔记本电脑上运行较小、免费的 AI 模型。这些模型惨败,经常编造虚假代码,或在半途放弃。看来,要出色地完成这项工作,你需要最先进、托管式 AI 模型的“大脑”。
核心结论:
本文证明,我们不再需要完全依赖缓慢的人工翻译,将生物学故事转化为计算机可读的数据。借助合适的工具和一个充当策展人的“智能”AI 智能体,我们现在可以以前所未有的规模自动化这一过程,使得为未来的科学发现整理整个动物描述图书馆成为可能。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。