← 最新论文
💬 NLP

Computational conceptual history of scientific concepts: From early digital methods to LLMs

本文通过追溯从早期数字方法到现代大语言模型的演进过程,将大语言模型置于科学史、科学哲学及科学社会学中计算概念分析的宏大历史背景之下,同时批判性地考察了这些技术如何继承长期的方法论挑战,并为研究科学概念提供新的机遇。

原作者: Michael Zichert, Arno Simons

发布于 2026-06-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Michael Zichert, Arno Simons

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图理解一个特定词汇(如“原子”或“理论”)在过去 200 年间的科学世界中是如何演变的。在过去,历史学家必须手动阅读成千上万本书籍和论文,并记录下这些词汇在不同年代的使用方式。这就像是通过亲自走遍每一条小径来绘制一幅森林地图。

这篇论文是为那些希望利用计算机进行更快速、更大规模“绘图”的历史学家准备的指南。它对比了“旧方法”(使用现代 AI 之前)与“新方法”(使用大型语言模型,即 LLM,如 ChatGPT 背后的技术)。

以下是他们研究历程的拆解,使用了简单的类比:

1. 旧方法: “静态地图”(前 LLM 时代)

在现代 AI 出现之前,研究人员使用的数字工具就像是静态的黑白地图

  • 运作方式: 他们观察词汇如何共同出现(例如,发现“引力”和“苹果”经常出现在同一个句子中),或者科学家如何引用相同的论文。
  • 问题所在: 这些工具将一个词视为在同一时间内只有一个单一含义。想象一本字典说“bank”这个词只能指存放金钱的地方,它忘记了“bank”也可以指河流的岸边。
  • 结果: 如果一个科学概念具有多种含义(它们通常确实如此),计算机就会把它们全部揉成一个模糊的平均值。由于工具过于僵化,很难观察到细微的意义变化。

2. 新方法: “智能、具备上下文感知能力的向导”(LLM 时代)

现在,研究人员正在使用大型语言模型(LLM)。不要把它们看作静态的地图,而要看作是智能、具备上下文感知能力的向导,它们能够阅读句子并瞬间理解其中的细微差别。

  • 上下文是关键: 与旧工具不同,LLM 知道在关于钓鱼的句子和关于金融的句子中,“bank”的含义是不同的。在科学领域,这意味着计算机可以分辨出物理学家使用“particle”(粒子/颗粒)一词时,是指微小的物质颗粒,还是在进行隐喻使用。
  • 两种类型的向导:
    • 分析师(编码器模型/Encoder Models): 它们就像一位超级快速的图书管理员,可以扫描整个图书馆并立即告诉你:“在 20 世纪 50 年代,这个词有 80% 的概率表示 X,但在 20 世纪 90 年代,它转向了 Y。”它们非常擅长衡量变化。
    • 作家(解码器模型/Decoder Models): 它们就像一位创意助手。你可以要求它们:“写一个句子,展示这个词在 1920 年是如何使用的,”或者“总结一下科学家在 1980 年代是如何定义这个概念的。”它们有助于生成示例,或填补历史数据缺失的部分。

3. 重大挑战:它并非魔法

作者们谨慎地指出,尽管我们拥有这些强大的新工具,但研究工作的难度并未消失。事实上,出现了新的问题:

  • “垃圾进,垃圾出”原则: 如果计算机训练所用的书籍收藏存在偏差或不完整,它的地图就会出错。如果数字档案只包含过去 50 年的书籍,计算机就无法讲述前 100 年的故事。
  • “黑箱”之谜: 使用旧工具时,你可以清楚地看到数学是如何运作的。而对于 LLM,其过程通常是一个“黑箱”。我们知道输入和输出,但很难看出为什么 AI 做出了特定的决定。这使得在没有进行复核的情况下,很难信任其结果。
  • 词汇 vs. 现实生活: 论文强调,科学概念不仅仅是文字;它们与现实世界的工具、实验和图表紧密相连。阅读文本的计算机可能会忽略这样一个事实:一个概念之所以发生变化,是因为发明了新的显微镜,即便该词本身并没有改变。计算机看到了文本,但它看不见实验室里的设备。

4. 结论:一套多功能工具包

论文的主要结论是,LLM 是历史学家工具箱中的强大补充,但它们不能取代历史学家。

  • 不要依赖单一工具: 你不应该仅仅询问 AI“这个概念是什么意思?”,然后就将其答案视为绝对真理。
  • 混合方法: 最好的方法是利用 AI 来扫描成千上万份文件并发现有趣的模式(就像金属探测器发现埋藏的硬币),然后由人类历史学家去挖掘硬币、仔细检查并解释其历史意义。
  • 未来: 作者们希望未来能有更好的工具,不仅能看文字,还能看图片和图表,从而更全面地描绘科学运作的全貌。

简而言之: LLM 让历史学家能够从宏观视角观察科学语言的“森林”,以以往无法实现的方式发现趋势和意义的变化。然而,历史学家仍需是那个解读“树木”的人,确保计算机不会在森林中迷失方向,或误解了地图。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →