Born Flawed? Publication-Time Citation Topology Improves Retraction Early-Warning
本研究表明,分析论文发表时的参考文献结构特征——具体包括自引率、参考文献年份的分布以及引用文献的新近度——可以在任何发表后证据出现之前,显著提高对未来撤稿风险的早期检测能力。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,科学的世界就像一座巨大且繁忙的图书馆,每一本新书都是一篇研究论文。为了让这座图书馆运转起来,作者必须在旧书的基础上编写新故事,并引用那些启发了他们的书籍。这创造了一个庞大且无形的连接网络,每一本新书都与它所立足的旧书相连。但有时,某本书会被证明是一本“僵尸书”——它包含了虚假的事实或窃取的创意,而图书馆必须将其从书架上撤下,并标注为“撤稿(Retracted)”。可怕的是,即使书被撤下了,人们仍会在多年间继续引用它,无意中将这些错误的观点传播到新的故事中。这就像是一个图书馆,一张损坏的地图不断地被复制到新的指南书中,导致旅行者在图书管理员试图修复问题很久之后,依然误入歧途。科学家们一直试图建立一个系统,在这些“僵尸书”上架之前就识别出它们,但目前大多数警报只有在书已经出版并且人们开始阅读之后才会响起。
陈浩(Chenhao Zhang)的一项新研究提出了一个聪明的疑问:我们能否仅仅通过观察作者在撰写故事之前所引用的其他书籍清单,就识别出一本“坏”书?该论文指出,作者选择参考文献的方式可能会留下一种隐藏的麻烦“指纹”。通过分析参考文献列表的结构——例如作者引用自己以往作品的次数、所引书籍的新旧程度,以及这些书籍在时间上的分布情况——这项研究发现了一种预测哪些论文可能被撤稿的方法。这是一个重大突破,因为这意味着我们可能在提交阶段就能标记出有风险的研究,在“僵尸”传播开始之前就将其拦截,而不是在多年后才去清理残局。
“生而有瑕疵?”的发现
在这项研究中,作者将这个问题视作一场侦探游戏。目标是观察一篇论文参考文献的“邻里关系”(即它所引用的其他论文)是否可以作为一个早期预警系统。研究人员使用了一个名为 OpenAlex 的大规模科学论文数据库,并将其与已知撤稿论文的列表进行交叉比对。为了确保测试的公平性,他们将每篇撤稿论文与同年发表但未被撤稿的“对照”论文进行匹配,从而创建了一个包含 219 篇撤稿论文和 184 篇对照论文的样本。
这里最核心的创新在于仅关注在“出版时刻”即可获取的信息。研究人员专注于三个特定的“防泄露(leakage-safe)”特征,这意味着他们没有使用任何在论文发表后才会存在的数据(例如该论文后来被引用的次数)。这三个特征分别是:
- 自引率: 作者引用其先前作品的频率。
- 参考文献年份离散度: 被引用论文的出版日期分布得有多广(是引用了一个狭窄的时间段,还是一个广泛的时间范围?)。
- 参考文献近期差距: 与新论文相比,所引文献的“新鲜度”如何。
当研究人员将这些特征与基础元数据(如作者人数或论文语言)一起输入计算机模型时,结果非常清晰。模型区分撤稿论文与正常论文的能力显著提升。具体而言,当模型在未来数据上进行测试(即“跨时间分割”,模拟基于过去预测未来)时,准确度得分(AUC)从 0.49(基本等同于随机猜测)跃升至 0.66。这是一个 0.176 的增益,研究人员对此非常有信心,因为在进行了 2,000 次不同的模拟(自助法/bootstraps)以排除运气成分后,这种提升从未降至零。
此外,论文还明确排除了一个“作弊”特征,以证明其论点。研究人员测试了第四个特征:已被撤稿的参考文献所占的比例。这个特征极大地提升了模型的准确度(增益达 0.308),但研究人员将其从主要结果中剔除了。为什么呢?因为要了解某条参考文献是否已被撤稿,你需要知道该参考文献在撰写新论文时的未来状态。既然你无法预知未来,这个特征就是“泄露”的,对于现实世界的早期预警毫无用处。通过排除这一特征,研究证明了信号来自于参考文献的“结构”,而非通过预知哪些文献后来被禁用了。
研究结论认为,注定被撤稿的论文在撰写时确实占据着不同的“结构化邻里空间”。它们并非仅仅是运气不好,而是在引用他人时表现出了可检测出的模式。虽然样本量规模较小(仅数百篇论文),且绝对准确度数值目前尚不完美,但趋势是明确的。作者建议,这可以成为编辑和诚信团队的筛选工具,帮助他们对提交的论文进行分流处理,并将注意力集中在那些可能“生而有瑕疵”的论文上,而无需等待损害在科学文献中扩散。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。