DeepInvert: Semi-Supervised Embedding Inversion Against Obfuscated Language Models
本文介绍了 DeepInvert,这是一种半监督嵌入反转攻击,它利用了混淆语言模型表示中保留的语义结构,以显著高于先前方法的方法来恢复原始标记,从而揭示了当前的混淆防御措施往往无法在隐私保护与任务效用之间取得平衡。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在给一位住在巨大高科技图书馆里的朋友写一封秘密信件。为了不让图书管理员读到你的信,你决定用一种秘密代码来编写。也许你把每个单词都替换成一个无意义的词,或者把句子和随机的乱码混合在一起,或者在页面上添加一层静态噪声。这就是在人工智能领域中“混淆”(obfuscation)的基本概念。今天,许多人使用基于云端的 AI 服务来撰写故事、分析医疗记录或解决复杂问题。但由于他们并不拥有运行这些 AI 大脑的计算机,因此必须信任提供服务的公司,将私密数据交给对方。为了保护自己,用户尝试在发送消息前对其进行“打乱”,希望 AI 仍能理解打乱后的版本以完成工作,同时又能对窥探之眼隐藏原始含义。
有一段时间,这些打乱技巧看起来像是一面坚实的盾牌。研究人员提出了各种混合单词或添加噪声的方法,认为一旦消息被打乱,如果没有密钥就无法还原。这就像是把信息放进一个锁着的盒子里并扔掉钥匙,假设这个盒子足够坚固,无法被破解。但如果这个盒子并没有大家想象中那么坚固呢?如果有一种聪明的办法可以窥视内部,不是通过撬锁,而是通过观察打乱过程留下的微弱模式呢?这正是研究人员试图回答的问题,他们正在探索这些“打消乱”的消息是否真的安全,还是仅仅在等待被解码。
于是,DeepInvert 诞生了——这是由蚂蚁集团的研究人员开发的一种新型数字侦探工具。把 DeepInvert 想象成一位顶尖的解谜高手,它不需要原始密钥就能弄清楚打乱的盒子里面有什么。它不是靠瞎猜,而是采用了一种巧妙的两步策略。首先,它在堆积如山的“影子”谜题上进行练习——这些谜题是它已知答案的,它通过自己打乱这些谜题来学习打乱是如何运作的。但神奇之处在于:它还会观察那些它试图破解的真实打乱消息,尽管它并不知道这些消息的内容。它使用了一种叫做“半监督学习”的技术,这就像一个学生既学习教科书(影子数据),又通过观察现实世界中的模式(无标签数据)来填补知识空白。
研究人员发现,DeepInvert 的工作效率极高。当他们针对一些最流行的打乱防御手段进行测试时,结果令人震惊。例如,面对一种名为 ObfusLM 的顶级防御手段,之前的最佳尝试只能正确猜测出原始单词约 26.2% 的概率。然而,DeepInvert 却成功恢复了 73.5% 的正确单词。在一次使用大规模 AI 模型的医疗问答测试中,恢复率跃升至 80.4%,而对于一个更大的模型,该比例达到了 85.2%。论文指出,这些打乱防御手段远没有人们想象中那样安全。研究人员发现了一个令人沮丧的权衡:如果打乱程度足够弱,以便让 AI 能够很好地完成任务,那么 DeepInvert 就能轻易地将其还原;如果打乱程度足够强,足以阻止 DeepInvert,那么 AI 往往会变得非常困惑,以至于无法完成任务。
这篇论文不仅展示了这些防御手段是如何被破解的,还解释了它们为什么会失败。打乱方法通常会留下一个“语义骨架”——一种在噪声中幸存下来的隐藏意义结构。DeepInvert 正是为寻找这个骨架而设计的。它使用了一个“教师-学生”系统,其中一个稳定的“教师”模型引导一个“学生”模型,帮助后者从混乱、打乱的数据中学习而不至于产生困惑。研究人员还表明,即使攻击者没有与受害者完全相同的“打乱配方”,只要他们能够模拟出一个类似的配方,这种攻击依然有效。
然而,论文谨慎地指出,这并不意味着所有的隐私都消失了。它提到,对于一些简单的任务,比如判断一个句子是高兴还是悲伤,某些防御手段可能仍然能保持一定的效力。但对于需要理解特定单词的复杂任务,如医疗诊断或生成新文本,目前的打乱方法似乎提供了一种虚假的安全感。作者总结道,我们可能需要重新思考如何在云端保护数据。与其依赖这些轻量级的打乱技巧,我们可能需要转向更重型、更复杂的解决方案,例如高级密码学,虽然它们更难破解,但使用起来也更慢且成本更高。目前,DeepInvert 就像是一个响亮的警钟:如果你正在通过打乱数据来向 AI 隐藏信息,你可能需要仔细检查一下你的锁,因为有人刚刚找到了一种非常有效的开锁方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。