← 最新论文
💻 computer science

The Reciprocal Impact of Science and Software: A Cross-Corpus Analysis of How Research Shapes Software and Software Enables Research

本研究构建了一个连接科学文献与软件仓库的大规模跨语料库图谱,以揭示尽管科学与软件通过不同且互补的影响层进行协同演化,但目前的测量方法仍然稀缺且对方法论的选择较为敏感,从而阻碍了对其相互影响做出确定性结论。

原作者: Audris Mockus

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Audris Mockus

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

请想象科学发现的世界是一座繁忙、喧闹的大都市。长期以来,这座城市一直被分割成两个几乎互不往来的独立区:

  1. 图书馆区(The Library District): 这里是科学家发表论文的地方。衡量标准是人们借阅书籍(引用量)的数量以及作者的名气。
  2. 工作坊区(The Workshop District): 这里是构建实际工具、代码和软件的地方。其衡量标准是 GitHub 上有多少人为项目“点赞”(stars)或有多少人进行“分叉”(forks)。

问题在于,这两个区使用的是不同的地图。一位科学家可能在工作坊里制造了一个革命性的工具,但图书馆却对此一无所知。反之,一篇在图书馆里声名显赫的论文,可能依赖于一个在工作坊里微小且隐形的工具,却从未被提及。

Audris Mockus 的这篇论文试图在两个区之间架起一座桥梁,以创建一个统一的、完整的地图,来展示科学究竟是如何运作的。作者称之为**“科学-软件供应链”(Science-Software Supply Chain)**。

以下是该研究结果的解释,通过简单的类比呈现:

1. 双向街道

研究人员连接了两个巨大的数据库:一个包含几乎所有的公开软件代码(World of Code),另一个是科学论文数据库(Semantic Scholar/OpenAlex)。他们从两个方向观察了这种联系:

  • 方向 A(科学 \rightarrow 软件):哪些科学论文实际上塑造了科学家使用的工具?

    • 令人惊讶的发现: 并不是那些拥有最高引用量的最著名论文在起作用。相反,被采用最多的工具是那些帮助科学家打包和组织其工作的工具(例如 “nf-core” 或 “Nextflow”)。
    • 类比: 这就像一个建筑工地。最著名的建筑师(高引用的论文)可能会设计出一座美丽的建筑,但被每一支施工队使用的工具通常是脚手架和起重机(打包工具)。论文统计的是建筑师的名望,而软件统计的是脚手架的实用性。
  • 方向 B(软件 \rightarrow 科学):哪些软件工具实际上促成了新的科学发现?

    • 令人惊讶的发现: 那些促成最多科学发现的工具通常是隐形的。它们是像 PyTorch(用于人工智能)或数据可视化工具这样的“隐藏基础设施”。它们很少出现在论文标题中,但成千上万的其他项目都依赖于它们。
    • 类比: 想象一座巨大的城市,每个人都在公路上行驶。你在新闻报道中只会看到汽车,而不会看到道路。但如果道路消失了,汽车也会停止行驶。这些软件工具就是道路。它们至关重要,但因为无处不在,所以没人会专门写篇论文说:“我今天用了一段路。”

2. “点赞”评分陷阱

在软件世界中,人们经常通过 GitHub 上的“点赞”(stars)数量来判断一个工具的重要性。研究发现,点赞数并不能很好地预测其实际用途。

  • 类比: 想象一家餐厅。一个在社交媒体应用上有 500 个“赞”的地方,可能是一个人们为了拍照而去打卡的网红店。但一个只有 10 个“赞”的地方,可能是每天为 10,000 家其他餐厅供应面包的当地面包房。
  • 研究结果: 研究发现,“点赞数”与“依赖关系”(即有多少其他项目实际使用了该代码)之间的联系非常微弱。一个拥有 150 个赞的工具可能被 9,000 个其他项目使用,而一个拥有 50,000 个赞的工具可能实际被极少使用。受欢迎程度并不等于实用性。

3. “隐形”的差距

研究人员尝试统计论文提及软件的频率。他们发现了一个巨大的鸿沟。

  • 问题所在: 当科学家撰写论文时,他们通常在正文中间(“方法”部分)提到软件,而不是在正式的参考文献列表中。自动化工具往往会遗漏这些提及。
  • 结果: 论文与所使用的软件之间的联系是“稀疏”且“嘈杂”的。这就像试图仅通过人们在聚会上大喊的名字,而不是通过查看实际的出生证明,来绘制一份家谱。由于数据如此不完整,研究人员无法给出一个单一、完美的数字来衡量软件对科学的影响程度。相反,他们展示了不同的测量方式会得出不同的答案,我们不能仅仅依赖于某一个数字。

4. 新型劳动者:AI 代理

研究还观察了一种新现象:AI 编码代理(编写代码的机器人)。

  • 研究结果: 这些 AI 代理开始出现在科学软件项目中。它们目前还没有取代人类,但正在加入劳动力队伍。
  • 谁在使用它们? 这与科学的类型(如生物学对比物理学)无关。相反,AI 代理被用于快速迭代、活跃度高的项目。如果一个项目很年轻,且开发者正在疯狂编写代码,他们更有可能使用 AI 助手。这就像一家正在快速发展的初创公司,比起成熟稳健的工厂,更倾向于使用新的科技产品。

核心启示

这篇论文认为,我们应该停止将科学和软件视为两个独立的事物。

  • 旧观点: 科学是论文;软件只是工具。
  • 新观点: 科学是一个供应链。论文和软件是平等的产出

要真正理解科学的进步,我们不能只计算引用量或“点赞”数。我们需要看到依赖关系——即支撑一切的隐形代码网络。正如一座城市需要了解其水管和电网,而不仅仅是著名的建筑一样,科学界也需要重视那些让发现成为可能的“隐形英雄”式的软件,即使没有人会专门为此写一篇论文。

简而言之: 在科学领域,最重要的工具往往是你从未听闻过的,而最受欢迎的工具往往是你并不真正需要的。为了解决这个问题,我们需要一张能将“图书馆”与“工作坊”连接起来的更好地图。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →