← 最新论文
💬 NLP

Invisible to humans, visible to machines: a preregistered audit of Unicode fidelity across four biomedical bibliographic APIs

这项预注册审计显示,四种主要的生物医学文献 API 在与 PubMed Central 的 JATS XML 真值进行对比时,表现出显著且未被记录的字符级保真度损失——尤其是在排版标点和特殊空白字符方面——这为文本挖掘、语料库构建以及大语言模型训练带来了风险。

原作者: Przemysław Czuma

发布于 2026-06-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Przemysław Czuma

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位图书管理员,正试图建立一个庞大且完美的数字医学研究图书馆。你有四辆不同的送货卡车(API)为你运送论文摘要。你假设当一辆卡车交付一个箱子时,里面的内容与作者写下的完全一致。

这篇论文是一项审计报告,旨在检查这些卡车是否真的在交付完全相同的内容,或者它们是否在把箱子交给你们之前,悄悄地更换了其中的特定物品。

以下是研究结果的拆解,使用了简单的类比:

设置: “完美复制”测试

研究人员从一个主来源(PubMed Central)中提取了 4,000 篇医学论文,并要求四个主要的交付服务机构——PubMed、Crossref、OpenAlex 和 Semantic Scholar——发送它们的摘要。随后,他们将交付的文本与原始的“金标准”文件进行了逐字符的比对。

他们寻找的不是缺失的单词或整句,而是寻找微小的、肉眼难以察觉的细节:特殊的标点符号(如花式破折号或弯引号)、科学符号(如希腊字母或正负号)以及特殊类型的空格。

重大发现:“对人类隐形,对机器可见”

最重要的发现是:人类察觉不到差异,但计算机可以。

  • 人类视角: 如果你阅读一篇来自 PubMed 的论文和一篇来自 Crossref 的论文,它们看起来是完全一样的。一个破折号看起来就是一个破折号,一个空格看起来就是一个空格。
  • 机器视角: 对于一个计算机程序(如 AI 或搜索引擎)来说,“花式破达号”和“普通破折号”是完全不同的东西。一个是特殊的代码,另一个是基础的代码。如果交付卡车更换了它们,计算机就会认为这是一个完全不同的词。

两种主要的“泄漏”情况

研究发现,其中两辆卡车存在系统性地丢失或更改特定物品的情况:

1. PubMed 卡车:“纯文本”政策

  • 发生了什么: PubMed 对原始文本进行了激进的“扁平化”处理。如果作者使用了花式的弯引号(')或特殊的长破折号(),PubMed 会将其替换为基础的、普通的版本('-)。
  • 类比: 想象你寄出一封带有火漆封口的信。交付服务(PubMed)熔掉了火漆封口,并换上了一个普通的贴纸。对于人类读者来说,信件的内容没变。但对于一个通过“统计火漆封口数量”来获取信号的机器来说,封口消失了。
  • 结果: 在几乎所有包含这些特殊字符的摘要中,PubMed 都进行了替换。只有 0.6% 的情况下,特殊字符得以幸存。

2. OpenAlex 卡车:“不可见空格”问题

  • 发生了什么: OpenAlex 存储摘要的方式仅保留单词及其顺序,丢弃了它们之间的特定“空格”。如果作者使用了“不换行空格”(一种能让两个单词粘在一起的特殊空格),OpenAlex 会将其变为普通空格。
  • 类比: 想象一个由单词组成的拼图。OpenAlex 把拼图拆开,把单词放进袋子里,然后用标准间距重新倒出来。它并不记得有两个特定的碎片原本是用某种特殊胶水粘在一起的。
  • 结果: 0% 的特殊空格幸存了下来。它们全部被转化成了普通空格。

好消息:“安全”的物品

并非所有东西都丢失了。研究发现其他两辆卡车(Crossref 和 Semantic Scholar)对“重要”内容非常小心。

  • 科学符号与希腊字母: 四辆卡车都完美地交付了这些内容。如果论文提到了“Beta”(β)或“正负号”(±),每一辆卡车都准确无误地交付了该符号。
  • 为什么这很重要: 这意味着科学的“含义”是安全的,但其“风格”和“格式”却不是。

“丢失的箱子”问题 (Crossref)

研究还发现了另一个主要问题,但这与修改文本无关,而是关于完全丢失箱子

  • 问题所在: Crossref 的卡车没有为大约 25% 的论文带来摘要。
  • 原因: 这并不是因为 Crossref 弄丢了文本,而是因为一些大型出版商(如 Elsevier 和美国化学学会)根本没有向 Crossref 提供这些摘要。
  • 类比: 这就像是一个只接受特定社区包裹的快递服务。如果你居住在一个他们不服务的社区,你根本收不到包裹。

你为什么应该关心?

这篇论文认为,这之所以重要,是因为我们正越来越多地通过机器,而非仅仅通过人类来阅读书籍。

  • AI 与研究: 如果一个 AI 正试图通过统计作者使用特定“花式破折号”的频率来检测其是否使用了 AI 写作工具,而交付卡车(PubMed)已经把那个破折号换成了普通破折号,那么 AI 就会得到错误的计数。它可能会认为作者没有使用该工具,而实际上作者确实使用了。
  • 搜索与重复: 如果计算机试图通过比较精确的文本来查找重复论文,如果一个版本有花式破折号而另一个版本有普通破折号,它可能会错过这些重复项。对我们来说它们看起来一样,但计算机认为它们是不同的。

核心结论

你读到的医学摘要中的文本,完全取决于你使用哪个网站或工具来获取它

  • 如果你使用 PubMed,你会得到一个被“清理过”的版本,其中的特殊标点被扁平化了。
  • 如果你使用 OpenAlex,你会得到一个特殊间距丢失的版本。
  • 如果你使用 Crossref,如果出版商没有发送,你可能根本拿不到摘要。
  • 如果你使用 Semantic Scholar,你通常会得到原汁原味的文本。

论文总结道,虽然这些变化对人类肉眼是隐形的,但对于那些正在承担大量阅读、分析和组织科学文献工作的机器来说,这些是巨大的、系统性的错误。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →