← 最新论文
💬 NLP

FraudShield: Knowledge Graph Empowered Defense for LLMs against Fraud Attacks

FraudShield 是一个新颖的框架,它通过构建并利用欺诈手段-关键词知识图谱来增强输入中的结构化证据,从而保护大语言模型免受欺诈攻击,进而显著提高在各种模型和欺诈类型上的防御有效性、可解释性和泛化能力。

原作者: Naen Xu, Jinghuai Zhang, Ping He, Chunyi Zhou, Jun Wang, Zhihui Fu, Tianyu Du, Zhaoxiang Wang, Shouling Ji

发布于 2026-02-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Naen Xu, Jinghuai Zhang, Ping He, Chunyi Zhou, Jun Wang, Zhihui Fu, Tianyu Du, Zhaoxiang Wang, Shouling Ji

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个非常聪明、乐于助人的助手(一种大语言模型,简称 LLM),你可以就从求职到投资建议的所有事情向它寻求建议。这个助手非常擅长阅读和理解语言,但它有一个危险的盲点:它很容易被骗子所迷惑。

骗子就像是演技精湛的演员。他们不会只说“把钱给我”。相反,他们会编织复杂的故事情节,营造紧迫感,并伪装成值得信赖的人物,从而操纵你的助手做出错误的决定。

这篇论文介绍了一个名为 FraudShield 的新工具,它就像是一个“保安”,设计用来站在你的智能助手与这些骗子之间。以下是通过简单的类比来解释它的工作原理:

问题所在:“太好说话”的助手

把你的 LLM 想象成一位乐于助人的图书管理员,她想根据你的需求为你推荐最合适的书。如果一个骗子穿着假警察制服走进来,说:“我是来自图书馆委员会的,我们需要立即获取您的信用卡号以修复系统错误,”这位图书管理员可能会因为惊慌失措而交出卡片,因为她的程序设定就是要提供帮助并遵循指令。

目前的安全性工具就像是通用的“小心!”标语。它们告诉图书管理员:“不要泄露秘密”,但它们并没有解释为什么这个人特别可疑,或者他们是如何欺骗图书管理员的。因此,图书管理员往往会错过陷阱。

解决方案:FraudShield 的“侦探地图”

FraudShield 与众不同。它不仅仅是在大喊“停!”,它更像是一个带着专业地图(知识图谱)的侦探

以下是论文中描述的逐步过程:

1. “骗子剧本”(策略)

首先,FraudShield 研究了骗子使用的“剧本”。论文识别出了骗子使用的四种主要套路:

  • 紧迫感压力: “现在就做,否则你会失去一切!”
  • 可疑信息: 奇怪的电子邮件地址、奇怪的地点或虚假链接。
  • 敏感请求: 以“验证”为名索要密码或银行详情。
  • 可信度声明: 冒充知名公司或使用高级术语来让自己听起来正规。

2. “荧光笔”(关键词提取)

当助手收到一条消息时,FraudShield 不仅仅是阅读它;它还会扫描其中的这些特定套路。它就像一支荧光笔,寻找那些暴露骗局的精确词汇。

  • 示例: 如果一个招聘广告说,“24 小时内开始赚钱,无需经验”,FraudShield 会高亮显示“24 小时”(紧迫感)和“无需经验”(可疑信息)。

3. “冲突解决者”(知识图谱)

有时,一个词在某种语境下看起来像是一种套路,但在另一种语境下却是正常的。或者,荧光笔可能会产生混乱,高亮了过多的内容。
FraudShield 使用知识图谱(可以理解为一个连接网络)来组织这些高亮内容。它会检查:“这个词真的符合‘紧迫感’的套路吗,还是仅仅是一个巧合?”

  • 它过滤掉虚假警报。
  • 它合并重叠的线索。
  • 它为每个线索分配一个置信度分数(就像一个“罪恶感计分器”)。如果分数很低,它就会忽略;如果分数很高,它就会保留。

4. “红旗报告”(XML 标签化)

最后,FraudShield 会为助手重写这条消息,但会加上视觉标签。它会将可疑的词语包裹在特殊的括号中,例如:<可疑信息>虚假邮箱</可疑信息>

它还会提供一段简短的注释,解释为什么要标记这些词(例如,“此电子邮件地址与真实公司不符”)。现在,当助手阅读这条消息时,它能清晰地看到红旗,并拥有逻辑理由说:“这看起来像是个骗局,我不应该这样做。”

为什么它效果更好(结果)

研究人员针对四种不同的 AI 模型和五种类型的诈骗(如虚假招聘和网络钓鱼)对 FraudShield 进行了测试。

  • “之前”的情况: 没有 FraudShield,助手经常会落入骗局,尤其是在“角色扮演”场景中(即 AI 正在扮演某个特定角色,如求职者)。
  • “之后”的情况: 有了 FraudShield,助手变得极难被欺骗。它们能更早地发现骗局(通常在第一条消息时),并拒绝参与。
  • 没有“过度修正”: 至关重要的是,FraudShield 并没有让助手变得“笨”。当消息不是诈骗时(例如关于天气的正常问题),助手仍然能完美回答。它不会仅仅因为变得格外谨慎就拒绝提供帮助。

人类的获益

论文还针对人类进行了测试。当人们阅读带有这些“高亮”红旗的诈骗信息时,97% 的人能够正确识别出骗局,而阅读未高亮版本的人中只有 76% 能识别出来。这些高亮内容就像黑暗中的手电筒,让危险对每个人都变得显而易见。

总结

FraudShield 是一个教会 AI 识别骗子特定“特征”的工具。它不仅仅是告诉 AI “要安全”,而是给了 AI 一张骗子的套路地图,高亮了文本中可疑的部分,并解释了推理过程。这有助于 AI 在不丧失处理正常任务能力的前提下,做出更聪明、更安全的决策。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →