Assessing AI-Generated vs. Human-Authored Spear Phishing SMS Attacks: An Empirical Study
这项初步研究表明,GPT-4 生成的个性化短信钓鱼(smishing)信息在说服力上与新手人类编写的信息相当,其中与工作相关的内涵被证明最为有效,这表明尽管参与者无法区分人工智能与人类的创作,但易于获取的 AI 工具可能会显著扩大社会工程学威胁的规模。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:评估 AI 生成与人类创作的针对性网络钓鱼短信攻击
问题陈述
个性化钓鱼(针对性钓鱼)仍然是一种关键的网络安全威胁,因为这些信息可以根据目标的特定工作、兴趣和社交背景进行定制,从而使其极具说服力。虽然大语言模型(LLM)有望实现大规模、低成本地自动化创建此类针对性内容,但目前在实证文献中仍存在显著空白:即当 AI 生成的消息与人类创作的消息针对同一目标进行定制时,AI 生成的消息是否真的比人类创作的更具说服力。此外,目前尚不清楚目标能否可靠地区分 AI 与人类来源,或者文本本身是否保留了可检测其来源的信号。本研究通过将 GPT-4 生成的针对性钓鱼短信(smishing)与针对相同 25 个目标的初学者人类作者编写的消息进行对比,旨在解决这些空白。
研究方法
本研究采用了一种试点设计,包含 25 名参与者作为目标。研究利用了一个名为 TRAPD(用于个性化欺骗的阈值排名法,Threshold Ranking Approach for Personalized Deception)的拟议评估框架,该框架旨在实现对个性化欺骗内容的受控、伦理对比,而不必部署真实的攻击。
实验设计
- 目标招募: 41 名个人完成了调查,提供了个人数据(姓名、职业、爱好、近期社交媒体动态等)。其中 25 名参与者返回参加评估阶段。
- 消息生成:
- AI 条件: 使用 GPT-4(通过 OpenAI API,温度系数 0.7),基于共享的提示词结构并结合目标数据生成消息。
- 人类条件: 99 名新手学生作者(本科网络安全/荣誉课程学生)在时间限制下(约 15 分钟)使用相同的提示词结构编写消息。
- 主题: 为每个目标生成三个特定情境下的消息:工作相关、爱好相关和社交媒体相关。
- 容量: 每个目标总共收到 12 条消息(6 条 AI 生成,6 条人类创作;每个主题各 2 条)。
- 评估程序 (TRAPD):
- 排名: 参与者将 12 条消息按诱导点击的可能性从高到低进行物理排序。
- 阈值设定: 参与者在排序列表中标记一个阈值,表示在该点之上,他们会有意向点击。
- 定性解释: 参与者解释了其排名和阈值的推理过程。
- 来源归属: 参与者识别他们认为是由 AI 生成的消息,并解释其判断标准。
- 计算分析: 使用语义嵌入(text-embedding-3-small)训练了一个逻辑回归分类器,以区分两组消息。此分析包括敏感性测试,即通过标准化明显的表面特征(URL、表情符号、长度、标点符号)来测试分类器是否依赖于更深层的文本模式。
核心贡献
- 受控对比: 提供了 GPT-4 生成的与人类创作的个性化 smishing 消息之间的直接、针对同一目标的对比,填补了现有文献主要关注电子邮件或大规模钓鱼的空白。
- 来源归属评估: 记录了人类目标在区分 AI 与人类来源方面的准确性,并分析了他们依赖的具体线索(或缺乏线索)。
- 特征分析: 识别了参与者在衡量“说服力”或“怀疑度”时所关联的消息特征(相关性、发送者身份、URL 结构、风格、紧迫性)。
- 计算可区分性: 证明了尽管人类无法区分来源,但研究特定的消息集在经过处理后在计算上仍是可区分的。
- TRAPD 框架: 引入了 TRAPD 框架,并记录了其在受控、针对目标的个性化欺骗内容比较中的可行性与局限性——即通过牺牲一定的生态现实性,换取严谨的针对目标控制和丰富的定性数据。
结果
说服力 (RQ1 & RQ2)
- AI vs. 人类: GPT-4 生成的消息引发点击意向的比例为 28.0%,而人类创作的消息为 21.3%。然而,这一差异在统计学上并不显著(95% 置信区间:-2.9 至 16.3 个百分点;p = 0.147)。研究并未证明 AI 优于人类,也未能证明两者是等效的。
- 主题影响: 工作相关消息比爱好或社交媒体消息更具说服力。38% 的工作相关消息超过了预期的点击阈值,而爱好类为 19%,社交媒体类为 17%。在经过 Holm 校正后,工作类消息产生预期点击的几率显著高于其他两类 (p < 0.05)。
- 定性驱动因素: 参与者将个人相关性 (76%)、发送者身份 (68%) 和 URL 特征 (64%) 列为主要因素。准确的个性化增加了可信度,而偏差(例如:错误的同事、无关的主题)则会引起怀疑。
来源归属 (RQ3 & RQ4)
- 人类准确度: 参与者正确识别来源(AI vs. 人类)的准确率仅为 52.0%,这并不优于随机猜测 (p = 0.597)。
- 使用的线索: 尽管准确度较低,但参与者依赖于一些不一致的线索,如“风格”(正式程度、通用语气)、“词汇选择”(流行语 vs. 俚语)、“语法”(完美 vs. 错误)以及“表情符号”。许多参与者表达了不确定性,更多是依赖“直觉”而非具体的标准。
计算来源归属 (RQ5)
- 机器可区分性: 与人类的表现相反,计算分类器即使在严格标准化(移除 URL、表情符号、统一长度/大小写)后,仍能高精度地识别消息集。
- 性能: 在最严格的条件下(长度相等、文本标准化),分类器实现了 88.7% 的平衡准确率 (Balanced Accuracy) 和 0.954 的 ROC AUC,应用于未见过的目标。这表明,研究特定的消息集包含了人类无法察觉、但机器可检测到的细微且分布式的文本模式。
重要性与主张
本文声称,易于获取的 AI 辅助个性化可能会增加社会工程学威胁的实际规模,即便单个 AI 消息目前并不比人类消息更具说服力。核心发现是,通过简单的提示词即可生成与经过筛选的初学者人类作者编写的消息同样具有说服力的个性化消息(基于本试点研究的不确定性)。
研究强调,职场借口在 smishing 中特别有效,值得在培训和防御中予以特别关注。它还强调了一个关键的脱节:虽然人类无法可靠地检测 AI 作者身份,但文本保留了可计算的信号。然而,作者提醒,这些计算结果是针对本研究条件的(单一模型、单一提示词、新手作者),不应将其视为通用的 AI 检测器,因为攻击者可以通过修改文本来规避检测。
最后,本文将 TRAPD 定位为一个有价值且符合伦理的框架,它允许进行受控的对比和详细的推理分析,而这在无法进行实时钓鱼实验的情况下是无法实现的,同时也承认了其在生态效度和普适性方面的局限性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。