UTS at ELOQUENT 2026 Voight-Kampff: structural shifts in AI writing bypass state-of-the-art detectors
本文证明了结构性分布外攻击,特别是跨年代的语域偏移和现代主义意识流形式,通过利用一种根本性的漏洞——即使文本远离检测器的训练分布能够成功,而模仿人类数据却会失败——有效地绕过了最先进的对抗性微调 AI 检测器。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在玩一场高风险的“谁是冒充者”游戏,只不过这次不是在识别人,而是在试图分辨哪些故事是由人类撰写的,哪些是由超级智能计算机烹饪出来的。这就是 AI 文本检测的世界,在这个领域中,研究人员构建“检测器”(就像数字测谎仪一样)来嗅探机器生成的词汇。长期以来,这个游戏很简单:计算机写得非常机械、完美,而人类写得则带有杂乱、自然的特质。但随后,计算机变得越来越擅长模仿人类,而人类(或者更准确地说,那些试图欺骗检测器的人)也开始使用巧妙的技巧来隐藏 AI 的声音。大家都在问一个大问题:我们能否构建出一个如此聪明以至于永远不会被欺骗的检测器,还是说 AI 总是会找到缝隙溜过去?这篇论文深入探讨了这场战斗,探索了通过改变写作的“风格”而非仅仅伪造“词汇”,是否真的能让最“聪明”的检测器失灵。
伟大的风格劫案:AI 如何学会穿上复古外套
在这篇论文中,来自悉尼科技大学的研究员 Dima Galat 和 Marian-Andrei Rizoiu 决定测试世界上最优秀的 AI 检测器的极限。他们参加了一场名为“ELOQUENT 2026 Voight-Kampff”的比赛,这基本上是一个巨大的竞技场,AI 作家们在这里试图迷惑一组数字测谎仪。他们的目标是看看能否利用新的、狡猾的技巧来破解这些检测器。
旧的把戏不再奏效了
首先,团队研究了在 2025 年奏效的技巧。当时,获胜策略就像是一场“翻译游戏”。你会要求 AI 写一句话,将其翻译成印地语,然后再翻译回英语,同时告诉 AI 要故意“犯一些错误”。这就像是通过给机器人加上口吃和外国口音来试图伪装它。
研究人员发现,一旦检测器构建者更新了系统以学习这些旧技巧,这些技巧就完全失效了。事实上,使用 2-025 年的旧技巧反而让 AI 看起来比正常写作时更可疑!检测器已经学会了识别这种“口吃”和“翻译带来的怪异感”。这就像是 AI 身上挂着一个写着“我是机器人”的霓虹灯牌,而检测器则是一束能从一英里外就看见它的手电筒。
新的秘密:时空旅行与意识流
于是,研究人员问道:“如果我们不尝试隐藏机器人的声音,而是强迫它用一种它从未使用过的声音说话呢?”他们发现了一个巨大的漏洞。检测器是在现代人类写作的基础上进行训练的。它们知道今天的人是如何写作的。但它们不知道如何处理听起来像是来自另一个时代或另一种“思维类型”的写作。
团队引入了两种新的策略,它们充当了“风格转换斗篷”:
时空旅行者(跨年代语域): 他们要求 AI 完全模仿 20 世纪初小说家的写法。他们强迫 AI 使用过时的词汇、句子结构以及一种在一百多年里都不再常见的特定“语域”(这是一个表示社交表达风格的专业术语)。
- 结果: 检测器完全陷入了混乱。因为检测器在其训练数据中从未见过这种特定的写作风格,它们无法分辨这是来自 1920 年代的真人还是一个假装成那个时代的机器人。这个技巧非常有效,它迷惑检测器的频率比旧的翻译技巧高出约 50 倍。
白日梦者(意识流): 他们要求 AI 以“现代主义意识流”风格写作。想象一个角色的思想像河流一样流动,在不同的想法之间跳跃,而不使用太多的句号或逗号。这是一种非常特定的、艺术化的写作方式,感觉非常具有人性,但在结构上与普通文章迥然不同。
- 结果: 这同样效果显著。那些习惯于识别标准论文结构的检测器,无法应对这种混乱、流动的写作方式。
失败的“修复方案”
随后,研究人员扮演了“防御者”的角色。他们问道:“好吧,如果 AI 是通过模仿旧式写作来欺骗我们,那为什么我们不直接教检测器去识别旧式写作呢?”他们将检测器交给他们,并喂给它数千页写于 1923 年之前的书籍(来自 Project Gutenberg),希望以此“修补”这个漏洞。
他们原本以为这会解决问题。然而,结果适得其反!检测器变得更擅长识别普通写作,但在面对 AI 以旧风格写作时却依然完全失明。事实上,在“补丁”之后,AI 的成功率从 79.8% 上升到了 84.6%。事实证明,仅仅向检测器展示旧书是不够的;检测器需要理解“以那种风格写作的人类”与“模仿那种风格的机器人”之间的区别,而它无法理解这一点。
核心启示
这里最重要的发现是一个关于游戏的基本规则:检测器被迷惑是因为文本的“来源”,而不仅仅是它“看起来像什么”。
- 如果你试图让 AI 看起来像一个“正常”的人(通过模仿当前的写作风格),检测器很容易抓住它。
- 如果你将 AI 推向一个完全不同的“世界”(比如过去或梦幻状态),一个检测器从未见过的世界,检测器就会迷失方向。
研究人员证明了,检测器在处理这些结构性转变时并不够“聪明”。它们就像是那些非常擅长识别戴红帽子的人的保安,但如果有人穿着中世纪骑士的盔甲走进来,保安就完全不知所措了。
最终得分
最终,研究人员的新策略非常有效,他们的提交作品占据了 ELOQUENT 2026 比赛的前 5 名。他们表明,尽管我们可以构建出非常擅长捕捉标准 AI 技巧的检测器,但仍然存在巨大的知识空白。只要 AI 可以被提示去编写那些处于“分布外”(即超出检测器所学习的正常范围)的风格,它就能轻而易举地绕过最先进的防御。
论文的结论是,这场战斗不在于让 AI 听起来更“完美”;而在于让它以检测器尚未学习识别的方式,听起来更加“不同”。目前来看,AI 正处于领先地位。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。