You Have Been LaTeXpOsEd: A Systematic Analysis of Information Leakage in Preprint Archives Using Large Language Models
本文提出了"LaTeXpOsEd",这是一个对超过 10 万篇 arXiv 投稿进行的系统性大规模安全审计,该审计通过利用一个融合模式匹配与大语言模型的新颖框架,揭示了源文件和注释中普遍存在的信息泄露现象,包括敏感凭证、个人身份信息以及机密通信。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在向一家享有盛誉的图书馆(如 arXiv)提交手稿,以分享你最新的科学发现。你递交了最终定稿、经过润色的书籍(PDF 文件),供所有人阅读。但是,为了确保你的工作诚实且可复现,图书馆还要求你交出整个工作室:包括草稿、墙上的便利贴、未完成的草图,以及你在大声思考时写在页边空白处的笔记。
论文《You Have Been LaTeXpOsEd》是对这个工作室进行的一次大规模安全审计。研究人员发现,虽然科学家们对放入最终书籍的内容非常谨慎,但在交出书籍之前,他们往往忘记清理自己的工作室。
以下是他们发现内容的简明分解,使用了日常类比:
1. “数字阁楼”问题
当科学家上传论文时,他们上传的不仅仅是最终的 PDF 文件,还包括LaTeX 源文件。可以将这些源文件想象成一个数字阁楼或车库。
- 错误所在:作者经常在这个阁楼里留下“便利贴”(代码中的注释)或“旧箱子”(未使用的文件)。
- 风险:这些笔记可能写着诸如:“嘿,我们内部服务器的密码是'Password123'"或者“我们和审稿人发生了激烈的争吵,这里是愤怒的邮件。”
- 现实情况:由于阁楼是公开的,任何人都可以走进去阅读这些笔记。研究人员将此视为一种“被动”审计——他们只是查看已经存在的内容,就像保安在开放日穿过房屋一样,并没有尝试闯入或测试门锁是否真的有效。
2. 侦探工具:正则表达式 vs. “超级读者”
为了寻找这些秘密,研究人员使用了两种类型的侦探:
- 模式匹配器(正则表达式):这就像一个只寻找特定形状的机器人。它可以轻松找到看起来像电子邮件地址(
name@domain.com)或 IP 地址(192.168.1.1)的内容。它擅长发现明显的线索,但不擅长理解上下文。 - “超级读者”(大型语言模型 - LLM):这就像一位高智商的人类侦探,能够阅读句子并理解其含义。
- 示例:模式匹配器可能会漏掉这样一句话:“我正在使用密钥'SecretKey99'登录实验室。”因为它看起来不像标准的密码格式。
- 然而,LLM 会阅读整句话,理解"SecretKey99"是一个秘密,并将其标记出来。
研究人员测试了 25 种不同的“超级读者”(AI 模型),以查看哪一个是最好的侦探。他们发现,开源模型(如 Qwen-2.5)几乎与昂贵且专有的模型一样出色,但成本却只是其零头。
3. 他们在阁楼里发现了什么?
在扫描了10 万篇论文(约 1.2 TB 数据,相当于一个巨大的图书馆)后,他们发现了数千个“泄露”。以下是被遗留下来的内容:
- “敞开大门”的钥匙:数百个实际密码、API 密钥和登录凭证的实例。这就像有人把家门钥匙贴在 front door 上,并附了一张纸条写着:“这把钥匙能打开后门。”
- “私人聊天”泄露:指向私人 Google Drive 或 Dropbox 文件夹的链接,这些链接被设置为“任何拥有链接的人都可以编辑”。这意味着机密的同行评审、合著者之间的内部争论以及未发表的数据对全世界可见。
- “便利贴”争论:作者们关于研究质量争论或抱怨审稿人的注释。这些本应仅供内部人员查看,却公开发布给所有人阅读。
- “隐藏的照片”:上传到论文中的图片通常包含 EXIF 数据(数字元数据)。这就像一张建筑物的照片,却秘密地包含了摄影师家的 GPS 坐标以及拍摄照片的确切时间。
4. 调查的成本
最令人惊讶的发现之一是,进行这项调查的成本非常低。
- 研究人员总共只花费了约90 美元来扫描 10 万篇论文。
- 这包括了下载数据的费用以及支付 AI 阅读注释的费用。
- 类比:这就像雇佣一个安全团队,只需花费几美元就能检查 10 万所房屋。这意味着即使是“低资源”的恶意行为者(预算有限的人)也很容易这样做,以窃取秘密或造成声誉损害。
5. “推诿游戏”(谁该负责?)
论文指出了一个棘手的法律状况。
- 图书馆的规定:当你向 arXiv 提交时,你签署了一份合同,声明“我授予图书馆永久分发我作品的权利”。图书馆也表示:“确保你不包含私人信息是你的责任。”
- 问题所在:作者们经常认为:“我把秘密放在了代码注释里;没人会读代码,大家只看 PDF。”他们没有意识到,“代码注释”也是永久公共记录的一部分。
- 裁决:研究人员认为,虽然作者在技术上负有清理的责任,但系统存在缺陷,因为意外留下秘密太容易了,而且图书馆也不会自动清除它们。
6. 解决方案:清理工作室
论文提出了两个主要的补救措施:
- 对于作者:在点击“提交”之前,运行一个“清理”工具(像数字吸尘器一样),自动删除所有注释、未使用的文件和隐藏的元数据。不要把便利贴留在阁楼里!
- 对于图书馆(arXiv):他们应该增加一个安全网。在论文上线之前,系统应自动扫描密码和私人链接,并警告作者:“嘿,你在笔记里留下了一个密码。你真的要发布这个吗?”
总结
这篇论文是一个警钟。它表明,在急于快速分享科学的进程中,研究人员无意中将自己的“数字垃圾”(秘密、密码和私人争论)暴露在光天化日之下。由于现代 AI 非常擅长阅读和理解这些杂乱的笔记,现在任何人都可以极其容易地找到它们。研究人员敦促科学界在发布前开始清理源文件,就像他们在向公众开放实体实验室之前会进行清理一样。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。