← 最新论文
💻 computer science

Adversarial Robustness in Smishing Detection: A Comparative Analysis of Adversarial Fragility in Classical vs. Transformer-Based Detection Systems

本研究表明,虽然与传统的词汇模型相比,基于 Transformer 的模型在应对短信欺诈检测中的混淆和结构性扰动时表现出显著更强的对抗鲁棒性,但洁净文本性能并不能可靠地预测其韧性,这凸显了针对不断演变的攻击向量建立特定架构防御机制的必要性。

原作者: Denzel Chiuseni, Athanase Bahizire, Silva Hama, Jema David Ndibwile

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Denzel Chiuseni, Athanase Bahizire, Silva Hama, Jema David Ndibwile

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教会一台计算机识别一条虚假的短信,比如骗子冒充你的银行。这就是“短信钓鱼”(smishing)检测的世界——这是网络安全的一个分支,算法在这里扮演着数字保安的角色,检查短信是友好的还是危险的。长期以来,科学家们使用干净、完美的文本来训练这些保安,假设骗子总是会用纯正的英语或斯瓦希里语书写,而不会试图欺骗系统。但在现实世界中,骗子非常聪明。他们使用“对抗性攻击”(adversarial attacks),这就像是戴上伪装来绕过保安。他们可能会把一个字母换成看起来相似的符号(例如用 'α' 代替 'a'),或者添加奇怪的不可见空格来打断单词,或者在一个句子中混合两种语言来迷惑保安。研究人员一直在追问的一个大问题是:如果我们建立了一个超级聪明的保安,他们是真的能更有效地抵御这些伪装,还是仅仅变得更擅长识别那些显而易见的东西?

这篇论文通过让两种不同类型的“保安”对抗一群狡猾且带有伪装的文本信息,深入探讨了这个问题。一方面,你拥有“经典型”保安(如随机森林和 XGBoost),它们像是老派的侦探,通过记忆特定的关键词和模式进行工作。另一方面,你拥有“Transformer型”保安(如 mBERT 和 XLM-RoBERTa),它们像是现代的、具备上下文感知能力的侦探,能够理解单词在句子中是如何组合在一起的。研究人员使用了一个包含超过 27,000 条文本消息的数据集,并让这两类保安经历了三种不同类型的“伪装”:字符混淆(将字母替换为相似符号)、结构扰动(破坏空格和标点)以及语码转换(混合语言)。他们使用一个被称为“鲁棒性退化率”(RDR)的分数来衡量每种保安性能下降的程度,其中 0 表示保安保持完美,1 表示他们完全失败。

结果揭示了排名中的剧烈分化。经典型保安尽管在识别干净消息方面表现出色,但在面对伪装时几乎瞬间崩溃。当骗子使用字符替换或破坏空格时,经典模型遭受了近乎彻底的崩溃,其性能下降高达 98.8%(RDR 为 0.988)。这就像是侦探在嫌疑人改变字体的那一刻就忘记了如何阅读。相比之下,Transformer 型保安则要强韧得多。他们守住了阵地,性能下降的最大幅度仅为 35.1%(RDR 为 0.351)。然而,他们并非无懈可击;他们最大的弱点被发现是结构扰动,即通过破坏空格来干扰他们的内部分词机制。

故事中最令人惊讶的转折在于,在常规测试中表现得更“聪明”并不意味着在战斗中更安全。研究人员发现,在干净文本上得分最高的 Transformer 模型(XLM-RoBERTa)在受到攻击时,其崩溃程度竟然比它那个准确率稍低的兄弟模型(mBERT)还要严重。这证明了高标准的常规测试分数是一种虚假的安全感;它并不能预测一个系统在处理现实世界的诡计时表现如何。这项研究得出结论:虽然现代人工智能比旧方法有了巨大的进步,但我们不能仅仅依赖准确率数值。我们需要构建专门针对处理这些“伪装”进行训练的系统,因为在短信钓鱼的世界里,坏人总是在试图改变外表,以便溜过保安的视线。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →