Algospeak, Hiding in the Open: The Trade-off Between Legible Meaning and Detection Avoidance
本文引入一个形式化框架和数据集,以分析"Algospeak"规避策略中可检测性与可理解性之间的权衡,并定义“多数可理解调制”阈值,以量化语言改动对人类理解和 AI 检测的影响。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象互联网是一个巨大、繁忙的城镇广场。在这个广场上,主要有两类人:报信人(试图传播消息的人或机器人)和城镇守卫(旨在阻止有害谎言、诈骗或有毒言论的算法)。
很长一段时间里,报信人只是大声喊出他们的消息。但城镇守卫变聪明了;它们学会了识别意味着“危险”的特定词汇和模式。于是,报信人开始玩起了一场与词汇的“捉迷藏”游戏。他们开始用"vaxx"替换"vaccine"(疫苗),用"k!ll"替换"kill"(杀),或者用表情符号来代替单词。这种新的、经过修改的说话方式被称为算法语(Algospeak)。
这篇论文就像是对这场游戏的科学研究。研究人员想要了解这场躲藏游戏的“金发姑娘区”(Goldilocks Zone,即恰到好处、不过分也不不足的区间):你究竟能多大程度地修改你的词汇来愚弄守卫,同时又不至于让你试图触达的人群感到困惑?
以下是他们研究发现的简要说明,使用了简单的类比:
1. “过多、过早”的问题(权衡)
研究人员发现了一种微妙的平衡。
- 如果你修改的词汇太少:城镇守卫会立刻抓住你。
- 如果你修改的词汇太多:城镇守卫可能会漏掉你,但现在你的朋友(人类受众)也无法理解你了。你把你的信息变成了一种只有少数人知道的秘密代码,这违背了向大众传播信息的初衷。
他们将完美的中间点称为**“多数人可理解的调制”(Majority Understandable Modulation, MUM)**。这就像调节收音机的音量。如果你只调大一点点,杂音(守卫)会淹没音乐。如果你调得太大,音乐会变得如此扭曲,以至于你的朋友甚至无法分辨这是什么歌。MUM 就是那个精确的音量旋钮设置:音乐清晰到足以让朋友们听到,但杂音又刚好大到足以迷惑机器。
2. 实验:“假新闻”实验室
为了测试这一点,研究人员没有使用真实的人类。相反,他们建立了一个数字实验室,使用**AI 机器人(大型语言模型)**来扮演报信人和城镇守卫的角色。
- 设置:他们选取了 20 个关于 COVID-19 错误信息的常见句子(例如“喝漂白剂可以治愈病毒”)。
- 扭曲:他们为这些句子创建了 700 个版本。有些只改变了几封信(如"c0vid"),有些使用了缩写,有些使用了表情符号,还有些使用了完全生造的词汇。
- 测试:他们向不同的 AI 模型提出了两个问题:
- 守卫测试:“这是一个谎言吗?”(AI 能否检测到错误信息?)
- 朋友测试:“这句话原本是什么意思?”(AI 能否重构原始含义?)
3. 他们的发现
结果显示出一种清晰的模式,就像滑滑梯一样:
- 随着词汇变得更加“混乱”(调制程度增加):AI“守卫”识别谎言的能力变差了。
- 与此同时:AI“朋友”理解这些混乱词汇含义的能力也变差了。
令人惊讶的反转:
研究人员发现,不同类型的“混乱”产生的效果不同。
- “暗语”策略:用一个秘密代码替换一个单词(例如用“柠檬”指代“病毒”)非常擅长愚弄守卫,但它会让信息迅速变得难以理解。
- “拼写改变”策略:仅仅将字母改为数字(如"v1rus")很容易被守卫识破,因为这是它们已经熟知的常见把戏。
- “语音”策略:按发音拼写单词(如"Kovit")对 AI 来说出奇地难以理解,尽管对人类来说看起来很简单。
4. “红队”警告
作者非常谨慎地表示,他们并不是在教坏人如何获胜。相反,他们充当的是**“红队成员”**(就像试图攻破银行金库以便银行能修复锁具的安全测试人员)。
他们是在说:“我们精确地找到了锁的薄弱环节。如果你正在构建一个安全系统(内容审核器),你需要知道,如果人们开始使用‘暗语’,你当前的系统将失效。但如果你让系统过于严格,你可能会意外地阻止那些只是试图交谈的普通人。”
总结
这篇论文是“大摇大摆地躲藏”游戏的地图。它证明,在失去人类受众之前,你为了愚弄计算机而扭曲语言的程度是有一个具体限度的。它提供了一种方法来衡量这一限度,以便我们能够构建更好的工具来识别不良行为者,同时又不让正常的对话失声。
重要提示:这项研究是一个使用 AI 和合成(伪造)示例的“概念验证”。它没有测试真实的人类或现实世界的社交媒体平台,因此这些是理解该问题的第一步,而非最终解决方案。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。