← 最新论文
🤖 AI

Taming Data Challenges in ML-based Security Tasks Using Generative AI

本文表明,通过利用生成式人工智能生成的合成数据(包括一种名为Nimai的新方法)来扩充训练数据集,可以显著提升基于机器学习的分类器的性能与适应性,尤其是在数据受限的场景中,同时也能识别出可能阻碍此类提升的特定数据特征。

原作者: Shravya Kanchi, Neal Mangaokar, Aravind Cheruvu, Sifat Muhammad Abdullah, Shirin Nilizadeh, Atul Prakash, Bimal Viswanath

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Shravya Kanchi, Neal Mangaokar, Aravind Cheruvu, Sifat Muhammad Abdullah, Shirin Nilizadeh, Atul Prakash, Bimal Viswanath

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一名保安(一个计算机程序)如何在拥挤的城市中识别小偷。通常,教导这名保安的最佳方式是向他展示成千上万张真实小偷和真实市民的照片。但在网络安全的世界里,存在一个大问题:我们缺乏足够的小偷照片。

小偷很罕见,他们善于隐藏,而且有时我们拥有的照片要么模糊不清,要么标签错误。这使得保安难以胜任工作。

这篇论文提出了一个简单的问题:我们能否利用“生成式人工智能”(GenAI)来伪造小偷的照片,以帮助训练这名保安?

以下是他们研究发现的分解,使用了简单的类比:

1. 问题:“空相册”

研究人员审查了 35 项不同的网络安全研究,发现几乎所有研究都面临相同的数据问题:

  • 样本不足:与正常活动相比,攻击示例非常少。
  • 视角偏差:我们拥有的少数攻击示例可能仅展示了一种特定类型的小偷,而遗漏了其他类型。
  • 照片噪点:有时标签是错误的(例如,将市民的照片标记为小偷)。
  • 面孔变化:小偷会随时间改变其外观(这被称为“概念漂移”),因此保安的旧训练变得无用。

2. 解决方案:“AI 艺术家”

该团队尝试使用先进的人工智能工具(GenAI)来扮演艺术家的角色。他们不只是向保安展示真实照片,而是让 AI 基于它见过的少量真实照片,绘制出新的、看起来逼真的“小偷照片”。随后,他们将这些伪造的照片添加到训练相册中,以观察保安是否变得更聪明。

他们在7 项不同的安全任务上测试了这种方法,范围从检测恶意软件(计算机病毒)到识别被劫持的互联网路由。

3. 结果:当艺术家闪耀时

结果混合了“哇!”和“且慢”。

成功案例(“哇!”时刻):

  • “超级训练”效应:在数据稀缺的任务中(例如 BGP 劫持任务,仅有约 180 个训练样本),AI 生成的数据成为了游戏规则的改变者。他们发明的一种特定方法称为Nimai,将保安的准确率提高了32.6%。这就像让一名原本能抓住 10 个小偷中 6 个的保安,变成了能抓住 9 个的保安。
  • 修复“模糊”照片:他们发现,AI 不仅仅是复制粘贴;它实际上有助于平滑数据中的“噪点”。它使小偷的模式更加清晰,帮助保安更好地进行泛化。
  • “变形者”问题:当小偷改变战术(概念漂移)时,AI 可以快速生成代表新战术的新的“伪造”示例。这使得安全系统能够在极少新的人工标注下几乎立即适应。

失败案例(“且慢”时刻):

  • “拥挤的房间”:在某些任务中,“小偷”和“市民”看起来过于相似(数据重叠),以至于 AI 无法区分。它只是制造了更多令人困惑的照片,保安并没有变得更好。
  • “太大无法容纳”问题:一些现有的 AI 工具就像试图驶入狭窄小巷的巨型卡车。它们对于特定的安全数据来说过于复杂,导致崩溃或无法训练。
  • “噪点标签”陷阱:如果原始数据包含太多错误(例如,将好文件标记为坏文件),AI 就会学会制造更多错误。它无法修复一个破碎的基础。

4. 新工具:"Nimai"

研究人员意识到,现有的 AI 工具有点像蒙着眼睛的画家——它们只能根据广泛的类别进行创作(例如,“画一个小偷”)。它们无法说:“画一个小偷,要完全像我手里拿着的这个特定的人。”

因此,他们构建了一个名为Nimai的新工具。

  • 类比:想象一位雕塑家,他不仅仅制作一个普通的人像雕像。相反,他观察一个真实的人,然后创作一尊非常相似但带有轻微、受控变化的新雕像。这使得保安能够看到威胁的每一个细微差别。
  • 结果:Nimai 是最成功的工具,特别是在最困难、数据最匮乏的情况下。

5. 主要结论

该论文得出结论:生成式人工智能是网络安全的一个强大工具,但它并非魔法。

  • 当数据极少或数据不平衡时,它效果惊人。它可以填补空白,帮助系统更快地学习。
  • 当数据过于混乱、类别重叠过多,或 AI 工具对于该任务过于笨重时,它会遇到困难

作者建议,未来的安全工具需要更聪明地如何生成数据,使用像 Nimai 这样的受控方法,而不是仅仅随意生成伪造数据。他们还指出,这种方法可以帮助安全系统在黑客改变战术时迅速适应,而无需雇佣大量人类来标注新数据。

简而言之:他们通过让 AI 绘制新的小偷照片来训练保安。当照片稀缺时,这种方法效果极佳;但当坏人和好人看起来太相似时,它就会感到困惑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →