← 最新论文
💬 NLP

When Writing Style Drifts: Benchmarking Authorship Verification under Distribution Shifts in Genre, Time and the AI-Era

本文介绍了 AVShift,这是首个用于系统性评估在体裁、时间及 AI 时代分布偏移下作者身份验证情况的德语基准测试,研究揭示了经过微调的大语言模型在不同体裁间泛化能力最强,而时间漂移会显著降低性能,尽管未检测到可衡量的 AI 时代偏移。

原作者: Lotta Kiefer, Brisca Balthes, Christoph Leiter, Yamen Ajjour, Elena Schmidt, Steffen Eger

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Lotta Kiefer, Brisca Balthes, Christoph Leiter, Yamen Ajjour, Elena Schmidt, Steffen Eger

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

每个人在写作方式中都留下了独特的习惯痕迹。正如指纹是识别身体的物理标记一样,作者的“语体特征”(idiolect)是一系列语言习惯的集合——他们如何使用标点符号、句子的长短以及他们偏好哪些词汇——这些习惯识别着他们的思想。几十年来,文学和法律领域的专家一直依靠这些模式来解决谜团,从抓捕抄袭者到识别匿名威胁信的作者。其核心理念很简单:虽然我们可能会根据是在写情书还是商业报告而改变词汇,但我们写作中深层的、潜在的节奏仍然足够稳定,足以被识别出来。

然而,这一假设在现代世界面临着严峻的挑战。写作并非发生在真空之中;它会随着体裁、时代以及我们使用的工具而变化。一个人可能在早上写一段简短、非正式的论坛帖子,而在晚上写一篇长篇、精炼的故事。他们今天写作的方式可能与二十年前不同。此外,近年来辅助人类写作的人工智能工具的爆发式增长提出了一个新的问题:使用计算机辅助起草句子,是否会改变作者独特的“指纹”,从而足以隐藏其身份?为了回答这些问题,研究人员需要一种方法来测试这些数字“指纹”在语境变化时是否依然有效。

纽伦堡工业大学的一个研究小组通过创建一个名为 AVShift 的大规模新测试集解决了这个问题。研究人员没有只观察单一类型的写作,而是从一个专门用于同人小说、评论和论坛讨论的德国网站中收集了超过 15 万对文本。该集合跨越了二十一年,从 2004 年到 2025 年,捕捉了现代 AI 写作助手公开发布前后的写作情况。研究人员利用这些数据来观察计算机程序是否仍能正确识别出两篇不同的文本是由同一个人创作的,即使这些文本来自不同的体裁、写于不同的年份,或者是在 AI 辅助时代创作的。

该团队测试了三种不同类型的计算机方法来破解这个谜题。第一类依赖于手工设计的规则,即专家手动选择特定的写作特征供计算机计数。第二类使用了数学模型,这些模型学习将文本压缩成稠密的数字摘要。第三种也是最新的类型使用了大语言模型——即那些可以编写论文和代码的强大 AI 系统——这些模型经过专门训练,旨在回答这样一个问题:“这两篇文本是否出自同一人之手?”

结果显示,写作类型至关重要。当计算机尝试匹配相同体裁的文本(例如两篇论坛帖子)时,表现得非常好。然而,当任务要求将论坛帖子与故事或评论进行匹配时,大多数方法的性能显著下降。最成功的方法是经过混合三种写作风格训练的大语言模型。通过让计算机接触广泛多样的写作声音,它学会了忽略体裁之间的表象差异,转而关注作者更深层、更一致的习惯。这种模型即使在比较故事与论坛帖子时也能达到很高的成功率,证明了多样化的训练方案能使系统更加稳健。

然而,时间被证明是比体裁更强大的障碍。研究人员发现,随着两篇文本之间的时间间隔增大,验证作者身份的能力会稳步下降。一个人在写下两件作品之间等待的时间越长,计算机就越难将它们联系起来。这种下降在仅仅一年后就变得明显,这表明我们的写作风格不是一个静态的指纹,而是一个不断演变的生命体。这种准确性的下降足以影响高风险场景,例如在法律调查中,如果不对文档进行特殊调整就直接对比多年间撰写的文档,很可能会导致错误。

令人惊讶的是,人工智能的到来并未引发许多人担心的那种破坏。研究人员仔细观察了在广泛采用 AI 写作工具之前和之后撰写的文本,以查看“AI 时代”是否创造了一个新的、令人困惑的写作风格分布。他们没有发现证据表明这些工具的使用造成了系统性的转变,从而使验证变得不可能。虽然不同时期之间的表现有所差异,但这些变化并没有遵循可以归咎于 AI 辅助的模式。这种变化似乎源于其他因素,例如特定主题或文本长度,而非仅仅因为 AI 工具的存在。

研究还检查了构成作者风格的具体习惯。他们发现,虽然某些特征(如常用虚词的使用)在不同体裁之间保持稳定,但另一些特征则会根据写作类型发生剧烈变化。不存在一套适用于所有情况的“神奇”特征;相反,最可靠的指标取决于正在进行比较的哪些体裁。这表明,要构建一个真正可靠的系统,必须理解风格是灵活的,且识别作者的规则取决于具体的语境。

最终,这项工作表明,尽管写作风格是流动的,并随时间与体裁而变化,但它们并非无法追踪。成功的关键不在于寻找单一不变的规则,而在于训练系统去识别跨越广泛条件的作者声音。通过使用多样化的训练数据并承认时间会侵蚀这些信号,研究人员可以构建出在现实应用中更为可靠的工具。研究结果提供了一条清晰的前行路径:要在复杂的世界上验证作者身份,我们必须教导我们的工具去预见变化,而不是假设作者的风格会冻结在时间中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →