Mapping the Web of Science, a large-scale graph and text-based dataset with LLM embeddings
本文展示了将大语言模型(LLM)嵌入模型与基于图的分析相结合,以绘制包含约 5600 万篇科学文献的 Web of Science 数据集语义图谱的实用性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,整个科学研究的世界就像一座巨大的、混乱的图书馆,里面存放着超过 5600 万本书(科学论文)。长期以来,图书管理员们一直试图通过观察“脚注”和“引用”来组织这座图书馆——本质上是看谁引用了谁。如果论文 A 引用了论文 B,那么它们就是邻居。这就像是通过观察哪些书经常被一起借阅来整理图书馆。这是一个很有用的地图,但它只显示了书与书之间的联系,却没有显示这些书究竟是关于什么的。
这篇论文介绍了一种用“超级聪明的读者”(一种被称为大语言模型或 LLM 的人工智能)来绘制这座图书馆地图的新方法。这个读者不再仅仅看脚注,而是通过阅读论文的摘要(摘要即总结)来理解其含义。
以下是使用简单类比对他们方法的拆解:
1. 绘制世界的两种方式
作者认为,我们需要结合两种理解科学的方式:
- 图谱(连接的网络): 这是旧的方法。它观察结构:“谁引用了谁?”这就像是根据连接城市的道路来绘制地图。
- 文本(含义): 这是新的方法。它利用人工智能来阅读内容并理解其中的思想。这就像是根据每个城市所使用的语言来绘制地图。
论文指出,虽然“道路地图”(引用)很有用,但“语言地图”(AI 阅读)可以揭示景观的真实形状,向我们展示思想是如何根据它们实际表达的内容自然地聚集在一起的。
2. 将文字转化为坐标
为了实现这一点,研究人员使用了一种工具,将每一句话转化为一组数字(向量)。
- 类比: 想象每一篇科学论文都是一滴水。AI 将每一滴水投入一个巨大的、无形的 3D(甚至 1,000 维)地球仪中。
- 结果: 关于同一主题(如“量子物理学”)的论文会自然地漂浮在一起,形成一个集群。而关于“古代历史”的论文则会漂浮在远处。
- 形状: 作者将此描述为一种“点云”,看起来就像地球仪上的大陆。如果你绘制这些“大陆”的地图,你会看到代表自然科学、社会科学和人文科学的截然不同的陆块。
3. 测试地图
团队不仅是凭空猜测;他们测试了这种新的“含义地图”是否与旧的“引用地图”相匹配。
- 相关性: 他们发现两者之间存在正向联系。通常情况下,如果两篇论文经常被一起引用(在“道路地图”上距离很近),那么它们谈论的内容也会相似(在“语言地图”上距离很近)。
- 惊喜之处: 然而,这种联系并不完美(相关性约为 33% 到 45%)。这其实是个好消息!这意味着两张地图观察到的事物是不同的。
- 跨学科论文: 一些论文涉及两个非常不同的主题。在“道路地图”上,它们可能由于不共享许多引用而显得距离很远。但在“语言地图”上,AI 因为阅读了文字而看到了其中的联系。
- 混合方法: 作者提出,最好的地图是两者的结合。通过同时使用“道路”数据和“语言”数据,我们可以得到更准确的图景。
4. “软”边界
他们最有趣的发现之一是,你无法在科学领域之间画出硬性的界限。
- 类比: 想象我们地球仪上的大陆并没有像政治地图那样的清晰边界。相反,它们有模糊的边缘,陆地在那里慢慢变成海洋。
- 现实情况: 一篇论文可能是 60% 的“生物学”和 40% 的“化学”。作者发现,由于科学家经常混合主题,因此对论文进行分类的最佳方式不是说“这是生物学”,而是说“这主要是生物学,但也包含一些化学”。
总结
简而言之,这篇论文关于构建一张全新的、巨大的知识地图。他们不再仅仅计算科学家之间互相引用的次数,而是利用人工智能阅读了 5600 万篇论文的实际文本。他们发现,这创造了一个美丽的、自组织的景观,思想在这里自然地聚集在一起。他们证明了,将这种“阅读”地图与传统的“引用”地图相结合,可以为我们提供一个更清晰、更细致的视角,去观察科学是如何构成的。
注: 本论文严格专注于创建和分析这张现有的科学数据地图。它并不声称将其用于预测未来的医疗方案、临床治疗或除了分析数据本身之外的特定现实世界应用。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。