FraudSMSWalker: Benchmarking Agentic Large Language Models for SMS-to-Webpage Fraud Detection
本文介绍了 FraudSMSWalker,这是一个旨在评估智能体大语言模型检测短信到网页欺诈能力的受控基准测试,通过 URL 掩码和包含模仿诈骗流程的具有挑战性的良性案例,强制进行基于证据的判断。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名在非常繁忙且高风险的大楼里工作的保安。你的工作是决定谁可以进入,以及谁是骗子。
通常,骗子会给你发一条短信(即“SMS”),内容是:“您的包裹延迟了!点击此处进行处理。”这条信息包含一个链接。如果你点击它,你会进入一个看起来像是快递公司网站的网页。
当前安全保安(AI 模型)的问题
目前,大多数 AI 安全保安都有些偷懒。当他们看到一条可疑的短信时,他们并不会真正去查看链接指向的网页,而是仅仅瞥一眼地址栏(URL)或者检查一个已知的恶意网站“黑名单”。如果该网站在黑名单上,他们就会大喊“诈骗!”;如果是一个著名的、受信任的名字,他们就会说“一切正常”。
这篇论文认为这是一种作弊行为。真正的骗子正在变得越来越聪明;他们使用的网站看起来与真实的网站一模一样,但却托管在隐蔽且不为人知的地址上。如果你的 AI 保安只检查地址,就会被这种诡计蒙蔽。
新的测试:FraudSMSWalker
研究人员创建了一个新的训练场,叫做 FraudSMSWalker。你可以把它看作是对 AI 安全保安进行的一次“蒙眼”测试。
- 设置: AI 会收到一条短信和一个链接。
- 转折点: AI 不允许看到实际的网站地址、域名或任何信誉评分。这就像保安戴着一个遮住了路牌的眼罩。
- 任务: AI 必须仅通过观察文本信息和网页的实际内容(它说了什么、有哪些按钮)来做出判断:“这是诈骗,还是合法的服务?”
数据集:“硬性良性”(Hard Benign)陷阱
为了让测试既公平又具有挑战性,研究人员加入了一组特殊的“无辜”网站。这些是看起来完全像诈骗网站的真实、合法的网站(例如银行或政府门户网站)。它们拥有登录框、支付表单和验证步骤。
- 陷阱: 一个偷懒的 AI 看到一个登录框就会立即大喊“诈骗!”,因为骗子也喜欢使用登录框。
- 目标: 一个聪明的 AI 需要意识到:“等等,这是一个要求输入密码的银行。对于银行来说,这很正常。这是安全的。”
测试 AI 时发生了什么?
研究人员在这次蒙眼测试中测试了九个不同的先进 AI “智能体”(智能程序)。他们发现了以下结果:
- “偏执”问题: AI 模型非常擅长识别诈骗,但它们非常不擅长信任无辜的人。由于太害怕被骗,它们几乎把几乎所有东西都标记成了诈骗。
- 类比: 想象一个保安,他拦截进入大楼的每一个人,甚至包括 CEO,因为“每个人看起来都很可疑”。他们抓住了所有的坏人,但也把 70% 的好人赶走了。
- “靠运气猜对”问题: 即使 AI 得出了正确的答案(比如说“是的,这是一个诈骗”),它们也往往无法根据它们实际看到的内容来解释“为什么”。
- 类比: 这就像一个学生做对了数学题,但没有展示解题过程。他们可能只是猜对了。研究人员发现,许多 AI 都在编造理由,或者依赖直觉,而不是基于网页上的确凿证据。
- “眼罩”效应: 当研究人员允许 AI 看到网站地址(摘掉眼罩)时,AI 识别诈骗的能力变强了,但它对信任无辜网站的能力变得更差了。它过度依赖地址,而忽略了实际内容。
底线
论文得出结论,目前的 AI 安全保安过于激进。它们非常擅长发现“坏事”,但非常不擅长区分“诈骗”与“看起来很吓人的合法服务”。
为了解决这个问题,我们需要停止让 AI 通过检查网站地址来“作弊”,并开始教它们如何观察文本和网页共同讲述的“故事”。新的基准测试 FraudSMSWalker 正是为了迫使 AI 学习这项技能:在不依赖捷径的情况下,做出基于证据的安全决策。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。