← 最新论文
💬 NLP

Em-ergence of the em-dash: a population-level rise in em-dash frequency in medRxiv preprints at the dawn of the large-language-model era

这项预注册研究分析了超过69,000篇medRxiv预印本,揭示了在大语言模型问世后,讨论部分中破折号的使用量呈现出显著且渐进的人口层面增长,表明在21世纪20年代初期科学写作中发生了明显的风格转变。

原作者: Przemysław Czuma

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Przemysław Czuma

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名侦探,正试图查明一个庞大的医学笔记库是否被一只新的、隐形的“手”触碰过。你寻找的不是指纹或 DNA,而是一个特定的、微小的标点符号:破折号(—)。

以下是纸面上发现的故事,用简单的语言娓娓道来。

谜团:并非“笔误”的“错误”

多年来,科学家们一直在耳语一个传闻:“大语言模型”(如 ChatGPT)非常喜欢使用破折号。相比之下,人类通常觉得它们很麻烦或难以输入,因此使用得非常克制。这就像人类可能会用逗号来写句子,但机器人可能会用一个戏剧性的破折号来让语气显得更“专业”。

但直到现在,这还仅仅是一个传闻。还没有人真正统计过成千上万篇真实科学论文中的破折号数量,以验证这个传闻是否属实。

调查:在文字海洋中计数破折号

研究人员 Przemysław Czuma 决定进行一场大规模的侦探行动。他没有观察那些经过“修饰”的出版书籍(因为编辑会对其进行清理并改变原始标点),而是观察了 medRxiv——这是一个科学家在论文正式发表前发布原始、未经编辑的草稿(预印本)的服务器。

  • 目标: 他将注意力集中在这些论文的“讨论”(Discussion)部分。这是科学家讲述故事、解释对结果的看法并试图说服读者的部分。这是论文中最具“人性”的部分。
  • 工具: 他使用了一个计算机程序来扫描超过 69,000 份草稿,专门寻找破折号字符(—)。
  • 时间线: 他将数据分为两个时代:
    1. ChatGPT 出现之前(2022 年 11 月之前)。
    2. ChatGPT 出现之后(2022 年 11 月之后)。

发现:是缓慢燃烧,而非瞬间爆发

结果非常显著,但它们并非像开关切换那样在一夜之间发生。

  • 在 AI 热潮之前: 在其“讨论”部分,只有约 4% 的论文包含至少一个破ellen破折号。这非常罕见。
  • 在 AI 热潮之后: 这个数字跃升至 11.5%
  • 趋势: 这种变化在 2023 年并没有立即发生。数字保持在低位,然后在 2024 年开始爬升,到了 2025 年,它竟然飙升到了 20%

类比: 想象一场安静的派对,几乎没有人戴红帽子。然后,一种新的时尚潮流开始了。起初,只有少数人尝试这种打扮。接着,慢慢地,更多的人加入了进来。到第二年,派对上几乎每五个人中就有一个戴着红帽子。这就是破折号所发生的情况。

证据:排除其他嫌疑人

一名优秀的侦探会检查是否存在其他解释。研究人员运行了几个“测谎仪”测试,以确保破折号的增加并非仅仅是随机趋势或网站格式的变化。

  1. “枯燥章节”测试: 他检查了论文中的“致谢”(Acknowledgments)和“数据可用性”(Data Availability)等枯燥的标准部分。如果整个网站的格式发生了变化,这些章节也会出现更多的破折号。但事实并非如此。增加的现象仅出现在那些具有叙事性的部分。
  2. “虚假日期”测试: 他查看了 ChatGPT 出现之前的某个随机时间点,并假定那是“开始”时间。结果发现没有任何变化。这证明了这种增长并非只是随时间推移而产生的自然缓慢漂移。
  3. “词汇选择”测试: 他还寻找了 AI 模型钟爱的特定词汇(如“delve”、“groundbreaking”或“leverage”)。这些词汇的上升时间与破折号的上升时间完全一致。

这意味着什么(以及不意味着什么)

这篇论文对其主张非常谨慎。

  • 它确实显示了: 在 2022 年至 2025 年间,科学论文的写作方式发生了巨大的变化。写作风格发生了偏移,这种偏移与 AI 工具的兴起相吻合。破折号是一个“群体层面”的信号,就像注意到人群的平均身高增加了,而不是说每一个个体都长高了。
  • 它并没有显示: 你不能仅仅通过看到一篇带有破折号的论文就断定“这是由机器人写的”。人类也可能非常喜欢使用破折号。同样,你也无法通过一篇没有破折号的论文就断定“这百分之百是人类写的”。
  • 结论: 这项研究证实了 AI 写作的“指纹”正在科学文献中变得清晰可见。它并非瞬间发生,而是随着科学家们开始慢慢信任并使用这些新工具来润色和讲述他们的故事。

简而言之,破折号就像是“烟雾”,暗示着科学写作的厨房里已经燃起了火(AI 的使用),尽管我们无法指出每一口锅具体是用了哪个炉灶。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →