AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis
AskChem 是一项全新的基础设施,它通过将检索对象从整篇文档转向携带溯源信息的原子级断言,实现了化学文献合成方式的变革,从而能够进行更准确、可验证且面向 AI 的跨论文搜索与发现。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,科学的世界就像一座巨大且混乱的图书馆,每一本书都是一篇研究论文。几十年来,如果你想寻找一个特定的事实——比如“什么温度能让这种化学物质发生反应?”——你必须在整本书中搜寻,希望偶然撞见正确的段落。这就是传统搜索引擎的工作方式:它们递给你一份文档列表,而你,作为读者,必须承担繁重的体力活,去打开它们、扫描页面,并将来自不同来源的答案缝合在一起。这就像是在玩拼图,但你得到的只是几堆贴着“拼图”标签的盒子,而不是一个个独立的拼图碎片。
但科学正在发生变化。我们现在拥有被称为 AI 智能体(AI agents)的超级聪明的计算机程序,它们可以阅读、规划甚至进行实验。然而,这些数字助手仍受困于旧有的图书馆系统。它们得到的是论文列表,而不是论文内部真正的核心事实。这导致了一个令人沮方面的问题:AI 可能会猜测答案,或者编造一个虚假的引用(即“幻觉”),因为它无法轻松验证隐藏在文档深处的具体证据。大问题在于:我们如何升级这座图书馆,使得人类和 AI 都能瞬间获取他们所需的精确、经过验证的事实,而无需阅读整本书?
于是有了 AskChem,一个彻底改变我们检索化学文献方式的新系统。AskChem 不再将整篇研究论文视为最小的信息单位,而是将每篇论文拆解为微小的、原子的“断言”(claims)。把一个“断言”想象成一张经过验证的事实卡片——比如一个特定的实验步骤或一个测量结果——它自带自己的 ID 标签、指向原始页面的直接链接,以及一段证明其真实性的引文。
研究人员构建了一个包含 240 万个此类事实卡片的庞大数据库,这些卡片提取自 14.7 万篇不同的论文。他们并没有只是将它们堆在一起,而是通过三种巧妙的结构对其进行了组织,使其易于查找:
- 分面分类法(Faceted Taxonomy): 想象一个巨大的、智能的文件柜,你可以根据事实的主题(如“催化剂”)、测量方式或发现时间来进行分类。这让你能够瞬间浏览并对相似的发现进行分组。
- 证据图谱(Evidence Graph): 这就像是一个连接的网络。它将事实联系在一起,向你展示哪些发现相互支持,哪些相互矛盾,以及一个发现是如何跨越不同论文引导出另一个发现的。
- 动态分类法(Living Taxonomy): 这是一个探索性地图,将事实归类于宏大的科学概念和原理之下,帮助你理解现象背后的“为什么”。
团队使用一个名为 AskChem-Bench 的工具测试了该系统,提出了需要从多篇不同论文中提取信息的高难度复杂问题。结果令人瞩目。当 AI 在没有帮助的情况下尝试回答这些问题时,它经常编造引用,其中只有 88.3% 的链接实际上是有效的。但当同一个 AI 被“锚定”在 AskChem 的验证断言数据库中时,100% 的链接都是真实且可解析的。此外,该 AI 提供的答案具有更高的“引用密度”,这意味着它能比其他系统提供更多具体的、经过验证的证据来支撑其观点。
作者认为,这种以“断言”为中心的方法是未来化学研究的一个实用基础。它并不取代在做出关键决策时阅读原始论文的需求,但它充当了一个强大且经过验证的快捷方式。通过将图书馆从书籍的集合转变为经过验证、相互连接的事实卡片集合,AskChem 帮助科学家和 AI 智能体更快、更准确地找到真相。该系统已经上线,并向所有人开放探索,它表明未来的科学搜索不在于找到更多的文档,而在于找到正确的事实。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。