← 最新论文
💬 NLP

LBA: Textual Hard-Label Adversarial Attack under Low Query Budgets

该论文提出了 LBA,一种基于采样的算法,通过迭代整合先验与后验知识来构建高质量对抗样本的近似分布,从而在低查询预算下,在生成语义保持的硬标签对抗文本方面显著优于现有的贪婪方法。

原作者: Shixin Guo, Ming Zhong, Xuhong Zhang, Dandan Zhao, Zhe Wang, Bo Zhang, Shouling Ji, Hao Peng

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Shixin Guo, Ming Zhong, Xuhong Zhang, Dandan Zhao, Zhe Wang, Bo Zhang, Shouling Ji, Hao Peng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在玩一场“传声筒”游戏,对手是一个读过几乎所有书籍的超级聪明机器人。你向它低声说出一个句子,它会准确地告诉你这个句子的含义——无论是一篇开心的电影评论还是一则悲伤的新闻报道。这个机器人是一种被称为“深度神经网络”的人工智能,它非常擅长理解语言。但就像任何聪明的生物一样,它也有一个秘密弱点:它会被欺骗。如果你只改变句子中的几个词,机器人可能会突然认为一部开心的电影是一部悲剧。这被称为“对抗性攻击”(adversarial attack)。

棘手之处在于,在现实世界中,你不能直接问机器人:“你的确定度有多高?”你只能问:“你认为这是什么?”然后得到一个简单的“是”或“否”的回答。这被称为“硬标签”(hard-label)场景。为了在不问太多问题(否则可能会被发现或耗费太多成本)的情况下欺骗机器人,你必须非常聪明。大多数人尝试一次只修改一个词来调整句子,就像园丁修剪灌木枝条一样。但这种方法往往无法找到骗过机器人所需的完美组合,从而浪费大量的时间(或提问次数)。

这篇论文介绍了一种名为 LBA(低查询预算硬标签攻击,Low-query Budget hard-label Attack)的新方法,它通过彻底改变游戏规则解决了这个问题。与其修剪灌木的一根枝条,作者将这个问题视为一场使用魔法地图进行的寻宝游戏。

旧方法:盲目的园丁

想象一下,你试图寻找完美的食材组合来制作出一种特定口味的蛋糕,但你只能在烘焙完成后品尝一次结果。旧的方法就像一个盲目的园丁,摘下一朵花,剪掉它,然后观察花园看起来是否变得更好。如果变好了,他们就保留这次修剪;如果没变好,他们就把花放回去,尝试下一朵。他们从不一次性观察整个花园。这种“贪婪”的方法经常陷入局部的小片花丛中,错过了那种需要同时改变多朵花才能实现的完美排列。这浪费了大量的时间(或“查询次数”)去寻找正确的位置。

新方法:魔法地图 (LBA)

作者意识到,与其一次猜一朵花,不如建立一张地图,显示哪里更有可能找到“最佳”的改动。他们称之为“基于采样的法”。

以下是他们的地图如何运作的:

  1. 先验知识(初始地图): 在开始之前,他们根据已知的规则画出一张粗略的地图,比如“不要改变太多单词”以及“保持句子听起来自然”。
  2. 后验知识(更新地图): 随着他们测试不同的句子并询问机器人的答案,他们从结果中学习。如果改变某个特定的词经常能骗过机器人,他们就会在地图上将该位置标记为“高价值”。如果某种改动让句子听起来很奇怪,他们就会将其标记为“低价值”。
  3. 采样(寻宝游戏): 他们不是一步步行走,而是利用这张地图来“采样”或挑选有希望的单词改动组合。这就像向标靶投掷飞镖,而靶心是最有可能找到获胜技巧的地方。随着投掷的飞镖越来越多,地图变得越来越清晰,引导他们更快地找到更好的位置。

他们的发现

研究人员将这种新方法与六种不同类型的语言机器人进行了测试,涵盖了从小型模型到像 GPT-4o 这样庞大的模型。他们使用了四种不同的数据集,包括电影评论和新闻文章。

结果令人印象深刻。在只能向机器人提问有限次数(“低查询预算”)的世界里,LBA 始终比旧方法找到了更好的技巧。

  • 质量更好: LBA 创建的句子听起来更加自然。它们改变的单词更少,并且比其他方法更好地保持了原句的意思。
  • 效率更高: 对于长文本(如长篇电影评论),旧方法很难找到正确的改动组合。然而,LBA 在处理这些复杂的场景时,在寻找完美的单词替换组合方面表现出色。
  • 人类认可: 当研究人员要求人类阅读被欺骗后的句子时,人类无法分辨出原始句子和被欺骗后的版本之间的区别。他们还请一位超先进的 AI(GPT-4o)来评判这些句子,而 GPT-4o 也同意 LBA 的技巧是最聪明且最不明显的。

这为什么重要

这篇论文表明,通过使用这种“基于地图”的采样方法,我们可以更高效地欺骗 AI 模型。这并不意味着 AI 坏掉了;相反,它表明旧的尝试欺骗 AI 的方式(一次一个词)是低效的。通过理解最好的技巧往往涉及特定的改动组合,而非单一的改动,LBA 为测试我们的 AI 系统到底有多稳健打开了一扇新的大门。它证明了,通过更聪明的策略,你可以在不需要向机器人询问一百万个问题的条件下,实现高质量的结果。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →